Ga naar hoofdinhoud

Motif 3 lokaal draaien met DS4 en ’m omtoveren tot codingagent

Draai de geoptimaliseerde Motif-3 Quant op een NVIDIA H200 met de ds4-runtime, serveer ’m via een OpenAI-compatibele API en koppel ’m aan een Pi-codingagent.
Bijgewerkt 21 sep 2026  · 8 min lezen

Verkennen met AI

ChatGPTClaudePerplexity

Motif-3 is een mixture-of-experts-model met 314 miljard parameters, volledig from scratch gebouwd door Motif Technologies, een team van zo’n 30 mensen in Zuid-Korea, als onderdeel van het door de overheid geleide Dokpamo-programma voor soevereine AI. Het verscheen in augustus 2026 onder de MIT-licentie en is daarmee een van de weinige open-weight modellen op frontier-schaal die buiten de VS en China zijn ontwikkeld.

In deze gids gebruik ik de Baekpica/Motif-3-Mixed-Quant-GGUF, een onafhankelijke mixed-gequantiseerde versie die de volledige architectuur van het model behoudt, maar de omvang terugbrengt tot ongeveer 94 GB. Ik draai ’m op een Hyperbolic NVIDIA H200 met 141 GB VRAM, wat genoeg geheugen biedt om het gequantiseerde model in het GPU-geheugen te houden en toch ruimte over te laten voor inferentie, runtime en de KV-cache.

In deze gids leer je:

  1. Een H200 GPU-server opzetten om Motif-3 te draaien.
  2. De Motif-3 Mixed Quant GGUF-bestanden downloaden van Hugging Face.
  3. De GGUF-shards samenvoegen tot één modelfile.
  4. De ds4-runtime compileren en configureren voor de H200.
  5. Motif-3 op de GPU laden en een OpenAI-compatibele API-server starten.
  6. Het model testen met eenvoudige curl-requests.
  7. Motif-3 koppelen aan de Pi-codingagent.
  8. Motif-3 als autonome codingagent gebruiken om een kleine Python-app te bouwen en te testen.

Wat is Motif 3?

Motif-3 is een grootschalig Mixture-of-Experts (MoE)-model van Motif Technologies, gebouwd met in totaal 314B parameters terwijl slechts 13,2B parameters per token worden geactiveerd. 

Het bevat 384 gerouteerde experts, een contextvenster van 256K en is getraind op ongeveer 12,5 biljoen tokens met code, wiskunde, STEM, meertalige data en andere domeinen. 

Het is vooral geschikt voor reasoning-, coding- en agentic-workloads. Op de Artificial Analysis Intelligence Index behaalt het een score van 47, wat het plaatst tussen Qwen3.8-27B en MiniMax-M3, die we in een vergelijkbare setup hebben getest.

Artificial Analysis Index van de Motif3

Bron: AI Model & API Providers Analysis | Artificial Analysis 

Wat is de Mixed Quant GGUF?

Voor deze gids gebruiken we Baekpica/Motif-3-Mixed-Quant-GGUF, een onafhankelijk gemaakte gequantiseerde versie van Motif-3. In plaats van één nauwkeurigheidsniveau voor het hele model te gebruiken, past het mixed quantization toe: hogere precisie voor belangrijke componenten en veel lagere precisie voor de enorme expertlagen.

Zo gebruiken belangrijke attention- en altijd-actieve componenten Q8_0, terwijl veel van de gerouteerde expertgewichten IQ2_XXS en Q2_K gebruiken. Het model behoudt nog steeds alle 384 experts en alle 53 lagen, dus er wordt niets weggesnoeid of verwijderd. Dit reduceert het model tot ongeveer 94 GB, vergeleken met grofweg 335 GB voor de Q8_0 GGUF, waardoor het klein genoeg is om volledig op een H200 met 141 GB te draaien, met extra VRAM voor de runtime en KV-cache.

Voor meer achtergrond raad ik aan onze gidsen over quantization voor LLMs en het GGUF-formaat te lezen.

1. Huur en stel een H200 GPU-server in

Motif-3 Mixed Quant is ongeveer 94 GB, dus je hebt een GPU nodig met genoeg VRAM om het model te laden en ruimte over te laten voor inferentie. Ik raad aan om een enkele NVIDIA H200 met 141 GB VRAM te huren bij een GPU-cloudprovider zoals Hyperbolic, RunPod of Vast.ai.

de H200 GPU starten in Hyperbolic

Zodra je instance draait, maak je verbinding vanaf je terminal of via VS Code Remote SSH. Je provider geeft je het IP-adres. Het commando ziet er ongeveer zo uit:

ssh root@<SERVER_IP> -L 8080:localhost:8080

De optie -L 8080:localhost:8080 forwardt ook de Motif-3 API-poort naar je lokale pc, zodat je ’m later kunt benaderen op http://127.0.0.1:8080.

Bereid nu de server voor:

apt update
apt install -y git cmake build-essential python3-pip

pip install -U huggingface_hub

mkdir -p /workspace/motif3
cd /workspace/motif3

Controleer tot slot of de H200 beschikbaar is:

nvidia-smi

H200 GPU-overzicht

Je zou een NVIDIA H200 met ongeveer 141 GB VRAM moeten zien.

2. Download de Motif-3 Mixed Quant GGUF

Download vervolgens het Baekpica/Motif-3-Mixed-Quant-GGUF-model van Hugging Face. We gebruiken de MQ87-88-FIT-variant, die is opgesplitst in 11 GGUF-bestanden met een gezamenlijke grootte van zo’n 94 GB.

Voer vanuit de /workspace/motif3-map het volgende uit:

hf download Baekpica/Motif-3-Mixed-Quant-GGUF \
  --include "Motif-3-MQ87-88-FIT-*.gguf" \
  --include MQ87-88-FIT-SHA256SUMS \ 
  --local-dir model

Download de Motif-3 Mixed Quant GGUF

Afhankelijk van je verbinding kan het downloaden van alle 94 GB even duren. Controleer na afloop of alle shards beschikbaar zijn:

ls -lh model

Controleer de shards voordat je gaat mergen. Het mergen is een eenmalige operatie op 94 GB, dus het is de moeite waard om een slechte download nu te onderscheppen:

cd model && sha256sum -c MQ87-88-FIT-SHA256SUMS && cd ..

3. Merge de GGUF-shards

De ds4-runtime verwacht het model als één GGUF-bestand, dus we moeten eerst de 11 gedownloade shards samenvoegen.

Clone llama.cpp en bouw de GGUF-utility:

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git

cmake -S llama.cpp -B llama.cpp/build -DLLAMA_CURL=OFF

cmake --build llama.cpp/build \
  --target llama-gguf-split \
  -j$(nproc)

Voeg nu alle 11 shards samen tot één bestand:

./llama.cpp/build/bin/llama-gguf-split --merge \
  model/Motif-3-MQ87-88-FIT-00001-of-00011.gguf \
  motif3.gguf

Controleer het samengevoegde model:

ls -lh motif3.gguf

Je zou een groot motif3.gguf-bestand moeten zien. 

4. Installeer de Motif-3-runtime

We hebben de ds4-runtime nodig om Motif-3 efficiënt te laden en te serven op de NVIDIA H200.

Clone de dfm-branch:

git clone --branch dfm https://github.com/Baekpica/ds4.git
cd ds4

Compileer ’m met CUDA-ondersteuning voor de H200 (Hopper, sm_90). Let op: het primaire doel van ds4 is de DGX Spark/GB10, en H200-ondersteuning komt uit het bring-up-werk van het project, niet uit het hoofdpad voor serving:

make cuda CUDA_ARCH=sm_90 -j$(nproc)

Controleer of de binaries succesvol zijn aangemaakt:

ls -lh ds4*

Je zou binaries moeten zien zoals ds4-server en ds4_weight_server.

5. Laad Motif-3 op de GPU

De weight-server laadt en beheert de modelgewichten op de GPU, zodat de API-server ze kan gebruiken voor inferentie.

Maak eerst mappen aan voor de runtime-bestanden en de KV-cache:

mkdir -p /workspace/motif3/run
mkdir -p /workspace/motif3/kv

Draai eerst de preflight om te controleren of het model past voordat je een volledige load start:

./ds4_weight_server \
  --base /workspace/motif3/motif3.gguf \
  --manifest /workspace/motif3/run/weights.manifest \
  --backend vmm \
  --scope base \
  --reserve-gb 24 \
  --no-repack-q8-aligned \
  --dry-run

Als dat slaagt, draai je hetzelfde commando nogmaals zonder --dry-run:

./ds4_weight_server \
  --base /workspace/motif3/motif3.gguf \
  --manifest /workspace/motif3/run/weights.manifest \
  --backend vmm \
  --scope base \
  --reserve-gb 24 \
  --no-repack-q8-aligned

Laad Motif-3 op de GPU

Laat deze terminal actief. De weight-server moet actief blijven terwijl je Motif-3 draait.

6. Start en test de Motif-3 API-server

We starten nu de ds4 API-server, die Motif-3 blootstelt via een OpenAI-compatibele endpoint die je vanaf je lokale computer kunt benaderen.

Open een andere terminal en maak verbinding met de server, ga daarna naar de ds4-map:

cd /workspace/motif3/ds4

Stel de vereiste omgevingsvariabelen in:

export DS4_CUDA_WEIGHT_IPC_MANIFEST=/workspace/motif3/run/weights.manifest
export DS4_CUDA_WEIGHT_IPC_SCOPE=base
export DS4_SERVER_COALESCE_MAX=2
export DS4_SERVER_COALESCE_MAX_TOKENS=4096
export DS4_MOTIF3_PREFILL_CHUNK=4096

Start de API-server met een contextvenster van 125K. Op H200 is de runtime gevalideerd tot 128K, met 256K dat alleen gedeeltelijke prefill haalt, dus 125K valt net binnen wat getest is:

./ds4-server \
  -m /workspace/motif3/motif3.gguf \
  --cuda \
  -c 125000 \
  --host 0.0.0.0 \
  --port 8080 \
  --no-spec \
  --kv-disk-dir /workspace/motif3/kv \
  --kv-disk-space-mb 32768

Start de Motif-3 API-server

Laat deze terminal actief.

Omdat we poort 8080 eerder over SSH hebben geforward, kun je nu een terminal openen op je lokale pc en de API checken:

curl http://127.0.0.1:8080/v1/models

Test de Motif-3 API-server

Je zou motif-3 als model moeten zien met een contextlengte van 125000.

Stuur nu je eerste prompt:

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "motif-3",
    "messages": [
      {
        "role": "user",
        "content": "Explain mixture-of-experts models in simple terms."
      }
    ],
    "max_tokens": 256,
    "temperature": 0
  }'

Test de Motif-3 API-server

Als alles werkt, zal Motif-3 rechtstreeks vanaf je H200 een antwoord genereren. In mijn test behaalde het model deze metrics:

  • Generatiesnelheid: 23,7 tokens/seconde
  • Prefill-snelheid: 189,3 tokens/seconde
  • Time to first token (TTFT): circa 90 ms

Je kunt het GPU-geheugengebruik op de server ook checken:

nvidia-smi

GPU-overzicht nadat het Motif-3-model volledig is geladen

In mijn setup gebruikte Motif-3 ongeveer 101 GB van de 141 GB gerapporteerd GPU-geheugen van de H200, met extra VRAM beschikbaar voor inferentie en de KV-cache.

7. Koppel Motif-3 aan de Pi-codingagent

We koppelen nu de lokale Motif-3 API aan Pi, zodat het model kan werken als codingagent die bestanden kan maken, commando’s kan uitvoeren en itereren op een project.

Zorg dat Motif-3 nog steeds beschikbaar is op:

http://127.0.0.1:8080/v1

Installeer Pi met de officiële installer:

curl -fsSL https://pi.dev/install.sh | sh

Herstart je terminal en bevestig de installatie:

pi --version

Pi ondersteunt aangepaste OpenAI-compatibele modellen via ~/.pi/agent/models.json. Maak de configuratie aan:

mkdir -p ~/.pi/agent

cat > ~/.pi/agent/models.json <<'EOF'
{
  "providers": {
    "motif-local": {
      "baseUrl": "http://127.0.0.1:8080/v1",
      "api": "openai-completions",
      "apiKey": "none",
      "models": [
        {
          "id": "motif-3",
          "name": "Motif-3",
          "reasoning": true,
          "input": ["text"],
          "contextWindow": 125000,
          "maxTokens": 125000
        }
      ]
    }
  }
}
EOF

8. Test Motif-3 als codingagent

Nu kunnen we Motif-3 een echte codingtaak geven en kijken of het autonoom een applicatie kan bouwen, draaien en verbeteren.

Maak een testproject en start Pi:

mkdir -p ~/motif-test
cd ~/motif-test
pi

pi-codingagent, geïntegreerd met lokaal draaiend Motif3-model

Een eenvoudige to-do-app maken met Motif-3

Laten we het model testen. Eerst vragen we het om een eenvoudige to-do-app te bouwen.

Create a simple Python CLI to-do app that can add, list, complete, and delete tasks, save them locally to a JSON file, then run and test it.

Binnen enkele minuten maakte Motif-3 een werkende CLI-applicatie en testte die succesvol. De functionaliteit werkte goed, maar de eerste interface was erg basic.

Het Motif3-model testen als codingagent in Pi

Vervolgens vroeg ik de agent om de applicatie interactiever en kleurrijker te maken, de lay-out te verbeteren en de terminalervaring te verfijnen. Motif-3 paste het bestaande project aan in plaats van opnieuw te beginnen, en de verbeterde versie was aanzienlijk meer gepolijst.

CLI TODO-app gegenereerd door Motif3 en Pi

Een website bouwen met Motif-3

Tot slot wilde ik zien hoe Motif-3 presteerde op een meer visuele webdevelopmenttaak, waarbij het genereren van een werkende website maar een deel van de uitdaging is.

image4.png

De eerste applicatie werkte, maar er waren verschillende UI-details die ik niet mooi vond. In plaats van het model één enorme redesign-prompt te geven, vroeg ik het om de issues één voor één op te lossen en afzonderlijke onderdelen van de interface te verbeteren terwijl ik ze testte.

Dit werkte verrassend goed. Motif-3 kon het bestaande project inspecteren, gerichte wijzigingen aanbrengen en de UI herhaaldelijk verfijnen terwijl de applicatie functioneel bleef. 

Al met al was ik onder de indruk van zowel de codeerprestaties als het vermogen om via Pi op een bestaand project te itereren.

image9.png

Tot slot

Mijn ervaring was over het geheel genomen wat gemengd. Motif-3 is indrukwekkend, maar voor de meeste mensen zijn er betere en minder geheugenintensieve modellen om te draaien. 

Zelfs met mixed quantization, wat de omvang flink reduceert, heb je nog steeds ongeveer 100 GB of meer aan GPU- of gecombineerd geheugen nodig om het comfortabel te draaien. Daardoor zijn er veel kleinere modellen die veel eenvoudiger te draaien zijn, zoals Qwen3.8-27B en andere op coding gerichte modellen.

Dat gezegd hebbende: als je iets wilt dat dichter in de buurt komt van de DeepSeek Flash-klasse van modellen, is Motif-3 nog steeds erg interessant. Hij is snel op een H200, de codekwaliteit is goed en er valt waarschijnlijk meer performance uit te halen met betere tuning. 

Het grootste probleem dat ik had, zat bij de Pi-codingagent: de generatie stopte soms of werd onderbroken. Ik heb enkele outputlimieten verhoogd en dat hielp, maar het loste het niet volledig op. Dit is ook mijn eerste keer met de DS4-runtime, dus er valt waarschijnlijk nog het een en ander te optimaliseren.

Toch, als je specifiek op zoek bent naar een in Korea ontwikkeld model, of een alternatief voor in China ontwikkelde modellen, is dit momenteel een van de interessantere opties. Het is ook mooi om te zien dat meer landen hun eigen AI-modellen en ecosystemen bouwen in plaats van te leunen op slechts een paar grote aanbieders.

Motif-3 Veelgestelde vragen

Wat is Motif 3?

Motif 3 is een mixture-of-experts-taalmodel met 314 miljard parameters van Motif Technologies, een Zuid-Koreaans bedrijf. Het activeert 13,2 miljard parameters per token over 384 gerouteerde experts met top-8-routing, en is voorgetraind op ongeveer 12,5 biljoen tokens.

Is Motif 3 gratis commercieel te gebruiken?

Ja. De definitieve Motif 3-gewichten zijn uitgebracht onder de MIT-licentie, die commercieel gebruik, fine-tuning en herdistributie toestaat. Let op dat de eerdere Motif-3-Beta-preview een niet-commerciële beperking had, dus zorg dat je de definitieve checkpoint gebruikt.

Welke hardware heb ik nodig om Motif 3 lokaal te draaien?

Op volledige precisie: veel meer dan de meesten hebben. Met de mixed-quant GGUF uit deze gids komt het model neer op ongeveer 94 GB, wat past op een enkele H200 met 141 GB of een DGX Spark met 128 GB, met ruimte voor de runtime en de KV-cache.

Wat is het contextvenster van Motif 3?

262.144 tokens, oftewel 256K. In de praktijk hangt je bruikbare context af van de runtime en het beschikbare geheugen. Op H200 is het ds4-pad gevalideerd tot 128K, met 256K dat alleen gedeeltelijke prefill haalt.

Waar is Motif 3 goed in?

Het is getraind met een sterke nadruk op code, wiskunde en STEM-data, en presteert bijzonder goed op agentic- en tool-use-benchmarks. Het is ook sterk in het Koreaans, wat gezien de oorsprong niet verrassend is.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Als gecertificeerd data scientist haal ik met passie het maximale uit de nieuwste technologie om innovatieve machinelearning-toepassingen te bouwen. Met een sterke achtergrond in spraakherkenning, data-analyse en -rapportage, MLOps, conversationele AI en NLP heb ik mijn vaardigheden aangescherpt in het ontwikkelen van intelligente systemen die echt impact maken. Naast mijn technische expertise ben ik ook een sterke communicator met een talent om complexe concepten terug te brengen tot heldere, beknopte taal. Daardoor ben ik uitgegroeid tot een veelgelezen blogger over data science, waar ik mijn inzichten en ervaringen deel met een groeiende community van data-professionals. Op dit moment richt ik me op contentcreatie en redactie, waarbij ik met large language models werk aan krachtige en aansprekende content die zowel bedrijven als individuen helpt het beste uit hun data te halen.

Onderwerpen
AI Agents
Kunstmatige intelligentie

Leer AI met DataCamp!

Leerpad

Associate AI Engineer voor ontwikkelaars

26 Hr
Leer hoe je AI in softwareapplicaties kunt integreren met behulp van API's en open-sourcebibliotheken. Begin vandaag nog aan je reis om AI-ingenieur te worden!
Bekijk detailsRight Arrow
Begin Met De Cursus
Meer zienRight Arrow