Lewati ke konten utama

Cara Menjalankan Motif 3 Secara Lokal dengan DS4 dan Mengubahnya Menjadi Agen Koding

Jalankan Motif-3 Quant yang dioptimalkan pada NVIDIA H200 menggunakan runtime ds4, layani melalui API yang kompatibel dengan OpenAI, dan integrasikan dengan agen koding Pi.
Diperbarui 21 Sep 2026  · 8 mnt baca

Jelajahi dengan AI

ChatGPTClaudePerplexity

Motif-3 adalah model mixture-of-experts dengan 314B parameter yang dibangun sepenuhnya dari nol oleh Motif Technologies, sebuah tim sekitar 30 orang di Korea Selatan, sebagai bagian dari program AI kedaulatan Dokpamo yang dijalankan pemerintah. Model ini diluncurkan pada Agustus 2026 dengan lisensi MIT, menjadikannya salah satu dari sedikit model open-weight berskala frontier yang dikembangkan di luar AS dan Tiongkok.

Dalam panduan ini, saya menggunakan Baekpica/Motif-3-Mixed-Quant-GGUF, versi mixed-quantized independen yang mempertahankan arsitektur penuh model sambil mengurangi ukurannya menjadi sekitar 94GB. Saya menjalankannya pada Hyperbolic NVIDIA H200 dengan VRAM 141GB, yang menyediakan memori cukup untuk menyimpan model terkuantisasi di memori GPU sambil menyisakan ruang tambahan untuk inferensi, runtime, dan KV cache.

Dalam panduan ini, kita akan mempelajari cara:

  1. Menyiapkan server GPU H200 untuk menjalankan Motif-3.
  2. Mengunduh file Motif-3 Mixed Quant GGUF dari Hugging Face.
  3. Menggabungkan shard GGUF menjadi satu berkas model.
  4. Mengompilasi dan mengonfigurasi runtime ds4 untuk H200.
  5. Memuat Motif-3 ke GPU dan memulai server API yang kompatibel dengan OpenAI.
  6. Menguji model menggunakan permintaan curl sederhana.
  7. Menghubungkan Motif-3 ke agen koding Pi.
  8. Menggunakan Motif-3 sebagai agen koding otonom untuk membangun dan menguji aplikasi Python kecil.

Apa itu Motif 3?

Motif-3 adalah model berskala besar Mixture-of-Experts (MoE) dari Motif Technologies, dibangun dengan total 314B parameter sambil hanya mengaktifkan 13.2B parameter per token. 

Model ini memiliki 384 ahli terarah (routed experts), context window 256K, dan dilatih pada sekitar 12,5 triliun token yang mencakup kode, matematika, STEM, data multibahasa, dan domain lainnya. 

Model ini sangat cocok untuk tugas penalaran, pengodean, dan beban kerja agen. Pada Artificial Analysis Intelligence Index, model ini meraih skor 47, yang menempatkannya di antara Qwen3.8-27B dan MiniMax-M3, yang kami uji dalam setup serupa.

Artificial Analysis Index of the Motif3

Sumber: AI Model & API Providers Analysis | Artificial Analysis 

Apa itu Mixed Quant GGUF?

Untuk panduan ini, kami menggunakan Baekpica/Motif-3-Mixed-Quant-GGUF, versi terkuantisasi Motif-3 yang dibuat secara independen. Alih-alih menggunakan satu tingkat presisi untuk seluruh model, model ini menggunakan mixed quantization, menerapkan presisi lebih tinggi pada komponen penting dan presisi jauh lebih rendah pada lapisan expert yang sangat besar.

Sebagai contoh, komponen atensi penting dan komponen yang selalu aktif menggunakan Q8_0, sementara banyak bobot expert terarah menggunakan IQ2_XXS dan Q2_K. Model ini tetap mempertahankan semua 384 expert dan seluruh 53 layer, jadi tidak ada yang dipangkas atau dihapus. Ini mengurangi ukuran model menjadi sekitar 94GB, dibandingkan sekitar 335GB untuk GGUF Q8_0, sehingga cukup kecil untuk dijalankan sepenuhnya pada H200 141GB dengan VRAM tambahan untuk runtime dan KV cache.

Untuk latar belakang lebih lanjut, saya merekomendasikan membaca panduan kami tentang kuantisasi untuk LLM dan format GGUF.

1. Sewa dan Siapkan Server GPU H200

Motif-3 Mixed Quant berukuran sekitar 94GB, jadi Anda memerlukan GPU dengan VRAM yang cukup untuk memuat model dan menyisakan ruang untuk inferensi. Saya merekomendasikan menyewa satu NVIDIA H200 dengan VRAM 141GB dari penyedia cloud GPU seperti Hyperbolic, RunPod, atau Vast.ai.

meluncurkan GPU H200 di Hyperbolic

Setelah instance Anda berjalan, sambungkan ke instance tersebut dari terminal atau melalui VS Code Remote SSH. Penyedia akan memberikan alamat IP. Perintahnya akan terlihat seperti:

ssh root@<SERVER_IP> -L 8080:localhost:8080

Opsi -L 8080:localhost:8080 juga meneruskan port API Motif-3 ke PC lokal Anda, sehingga nanti Anda dapat mengaksesnya di http://127.0.0.1:8080.

Sekarang siapkan server:

apt update
apt install -y git cmake build-essential python3-pip

pip install -U huggingface_hub

mkdir -p /workspace/motif3
cd /workspace/motif3

Terakhir, periksa bahwa H200 tersedia:

nvidia-smi

Ringkasan GPU H200

Anda seharusnya melihat NVIDIA H200 dengan sekitar 141GB VRAM.

2. Unduh Motif-3 Mixed Quant GGUF

Selanjutnya, unduh model Baekpica/Motif-3-Mixed-Quant-GGUF dari Hugging Face. Kami menggunakan varian MQ87-88-FIT, yang dibagi menjadi 11 berkas GGUF dengan total ukuran sekitar 94GB.

Dari direktori /workspace/motif3, jalankan:

hf download Baekpica/Motif-3-Mixed-Quant-GGUF \
  --include "Motif-3-MQ87-88-FIT-*.gguf" \
  --include MQ87-88-FIT-SHA256SUMS \ 
  --local-dir model

Unduh Motif-3 Mixed Quant GGUF

Bergantung pada koneksi Anda, mengunduh semua 94GB mungkin memerlukan waktu. Setelah selesai, periksa bahwa semua shard tersedia:

ls -lh model

Sebelum menggabungkan, verifikasi shard. Proses merge adalah operasi sekali jalan pada 94GB, jadi sebaiknya deteksi unduhan yang buruk sekarang:

cd model && sha256sum -c MQ87-88-FIT-SHA256SUMS && cd ..

3. Gabungkan Shard GGUF

Runtime ds4 mengharapkan model sebagai satu berkas GGUF, jadi kita perlu menggabungkan 11 shard yang diunduh.

Kloning llama.cpp dan bangun utilitas GGUF-nya:

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git

cmake -S llama.cpp -B llama.cpp/build -DLLAMA_CURL=OFF

cmake --build llama.cpp/build \
  --target llama-gguf-split \
  -j$(nproc)

Sekarang gabungkan semua 11 shard menjadi satu berkas:

./llama.cpp/build/bin/llama-gguf-split --merge \
  model/Motif-3-MQ87-88-FIT-00001-of-00011.gguf \
  motif3.gguf

Periksa model yang sudah digabung:

ls -lh motif3.gguf

Anda seharusnya melihat sebuah berkas motif3.gguf berukuran besar. 

4. Instal Runtime Motif-3

Kita memerlukan runtime ds4 untuk memuat dan melayani Motif-3 secara efisien pada NVIDIA H200.

Kloning branch dfm:

git clone --branch dfm https://github.com/Baekpica/ds4.git
cd ds4

Kompilasi dengan dukungan CUDA untuk H200 (Hopper, sm_90). Perhatikan bahwa target utama ds4 adalah DGX Spark/GB10, dan dukungan H200 berasal dari pekerjaan bring-up proyek, bukan jalur serving utamanya:

make cuda CUDA_ARCH=sm_90 -j$(nproc)

Periksa bahwa biner berhasil dibuat:

ls -lh ds4*

Anda seharusnya melihat biner seperti ds4-server dan ds4_weight_server.

5. Muat Motif-3 ke GPU

Weight server memuat dan mengelola bobot model di GPU sehingga server API dapat menggunakannya untuk inferensi.

Pertama, buat direktori untuk berkas runtime dan KV cache:

mkdir -p /workspace/motif3/run
mkdir -p /workspace/motif3/kv

Jalankan preflight terlebih dahulu untuk memeriksa apakah model akan muat sebelum melakukan pemuatan penuh:

./ds4_weight_server \
  --base /workspace/motif3/motif3.gguf \
  --manifest /workspace/motif3/run/weights.manifest \
  --backend vmm \
  --scope base \
  --reserve-gb 24 \
  --no-repack-q8-aligned \
  --dry-run

Jika lolos, jalankan perintah yang sama lagi tanpa --dry-run:

./ds4_weight_server \
  --base /workspace/motif3/motif3.gguf \
  --manifest /workspace/motif3/run/weights.manifest \
  --backend vmm \
  --scope base \
  --reserve-gb 24 \
  --no-repack-q8-aligned

Muat Motif-3 ke GPU

Biarkan terminal ini tetap berjalan. Weight server harus tetap aktif saat Anda menjalankan Motif-3.

6. Mulai dan Uji Server API Motif-3

Sekarang kita akan memulai server API ds4, yang mengekspos Motif-3 melalui endpoint yang kompatibel dengan OpenAI dan dapat Anda akses dari komputer lokal.

Buka terminal lain dan sambungkan ke server, lalu masuk ke direktori ds4:

cd /workspace/motif3/ds4

Atur variabel lingkungan yang diperlukan:

export DS4_CUDA_WEIGHT_IPC_MANIFEST=/workspace/motif3/run/weights.manifest
export DS4_CUDA_WEIGHT_IPC_SCOPE=base
export DS4_SERVER_COALESCE_MAX=2
export DS4_SERVER_COALESCE_MAX_TOKENS=4096
export DS4_MOTIF3_PREFILL_CHUNK=4096

Mulai server API dengan context window 125K. Pada H200, runtime tervalidasi hingga 128K, dengan 256K hanya mencapai prefill parsial, jadi 125K berada tepat di dalam batas yang telah diuji:

./ds4-server \
  -m /workspace/motif3/motif3.gguf \
  --cuda \
  -c 125000 \
  --host 0.0.0.0 \
  --port 8080 \
  --no-spec \
  --kv-disk-dir /workspace/motif3/kv \
  --kv-disk-space-mb 32768

Mulai Server API Motif-3

Biarkan terminal ini tetap berjalan.

Karena kita telah meneruskan port 8080 melalui SSH sebelumnya, sekarang Anda dapat membuka terminal di PC lokal Anda dan memeriksa API:

curl http://127.0.0.1:8080/v1/models

Uji Server API Motif-3

Anda seharusnya melihat motif-3 terdaftar sebagai model dengan panjang konteks 125000.

Sekarang kirim prompt pertama Anda:

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "motif-3",
    "messages": [
      {
        "role": "user",
        "content": "Explain mixture-of-experts models in simple terms."
      }
    ],
    "max_tokens": 256,
    "temperature": 0
  }'

Uji Server API Motif-3

Jika semuanya berfungsi, Motif-3 akan menghasilkan respons langsung dari H200 Anda. Dalam pengujian saya, model mencapai metrik berikut:

  • Kecepatan generasi: 23,7 token/detik
  • Kecepatan prefill: 189,3 token/detik
  • Waktu ke token pertama (TTFT): sekitar 90 ms

Anda juga dapat memeriksa penggunaan memori GPU di server:

nvidia-smi

Ringkasan GPU setelah model Motif-3 sepenuhnya dimuat

Dalam setup saya, Motif-3 menggunakan sekitar 101GB dari 141GB memori GPU H200, menyisakan VRAM tambahan untuk inferensi dan KV cache.

7. Hubungkan Motif-3 ke Agen Koding Pi

Sekarang kita akan menghubungkan API Motif-3 lokal ke Pi, memungkinkan model bekerja sebagai agen koding yang dapat membuat berkas, menjalankan perintah, dan melakukan iterasi pada sebuah proyek.

Pastikan Motif-3 masih tersedia di:

http://127.0.0.1:8080/v1

Instal Pi menggunakan penginstal resmi:

curl -fsSL https://pi.dev/install.sh | sh

Restart terminal Anda, lalu konfirmasikan instalasi:

pi --version

Pi mendukung model kustom yang kompatibel dengan OpenAI melalui ~/.pi/agent/models.json. Buat konfigurasinya:

mkdir -p ~/.pi/agent

cat > ~/.pi/agent/models.json <<'EOF'
{
  "providers": {
    "motif-local": {
      "baseUrl": "http://127.0.0.1:8080/v1",
      "api": "openai-completions",
      "apiKey": "none",
      "models": [
        {
          "id": "motif-3",
          "name": "Motif-3",
          "reasoning": true,
          "input": ["text"],
          "contextWindow": 125000,
          "maxTokens": 125000
        }
      ]
    }
  }
}
EOF

8. Uji Motif-3 sebagai Agen Koding

Sekarang kita dapat memberi Motif-3 tugas koding nyata dan melihat apakah model dapat membangun, menjalankan, dan meningkatkan sebuah aplikasi secara otonom.

Buat proyek uji dan mulai Pi:

mkdir -p ~/motif-test
cd ~/motif-test
pi

agen koding pi terintegrasi dengan model Motif3 yang dijalankan lokal

Membuat aplikasi to-do sederhana dengan Motif-3

Mari uji modelnya. Pertama, kita akan memintanya membangun aplikasi to-do sederhana.

Create a simple Python CLI to-do app that can add, list, complete, and delete tasks, save them locally to a JSON file, then run and test it.

Dalam beberapa menit, Motif-3 membuat aplikasi CLI yang berfungsi dan mengujinya dengan sukses. Fungsionalitasnya berjalan baik, tetapi antarmuka awalnya sangat dasar.

Menguji model Motif3 sebagai agen koding di Pi

Saya kemudian meminta agen untuk membuat aplikasi lebih interaktif dan berwarna, memperbaiki tata letak, dan meningkatkan pengalaman terminal. Motif-3 memodifikasi proyek yang ada alih-alih memulai dari awal, dan versi yang ditingkatkan menjadi jauh lebih rapi.

Aplikasi CLI TODO dibuat oleh Motif3 dan Pi

Membangun situs web dengan Motif-3

Terakhir, saya ingin melihat bagaimana performa Motif-3 pada tugas pengembangan web yang lebih visual, di mana menghasilkan situs web yang berfungsi hanya sebagian dari tantangan.

image4.png

Aplikasi awalnya berfungsi, tetapi ada beberapa detail UI yang tidak saya sukai. Alih-alih memberikan satu prompt redesign besar, saya memintanya memperbaiki masalah satu per satu, meningkatkan bagian antarmuka secara individual sambil saya uji.

Ini bekerja dengan cukup baik. Motif-3 mampu memeriksa proyek yang ada, melakukan perubahan yang terarah, dan berulang kali menyempurnakan UI sambil menjaga aplikasi tetap fungsional. 

Secara keseluruhan, saya terkesan dengan performa pengodeannya dan kemampuannya beriterasi pada proyek yang ada melalui Pi.

image9.png

Pemikiran Akhir

Secara keseluruhan, pengalaman saya agak campuran. Motif-3 mengesankan, tetapi ada model lain yang lebih baik dan lebih ringan memori untuk dijalankan bagi kebanyakan orang. 

Bahkan dengan mixed quantization, yang sangat mengurangi ukuran, Anda tetap memerlukan sekitar 100GB atau lebih memori GPU atau gabungan untuk menjalankannya dengan nyaman. Karena itu, ada banyak model yang lebih kecil dan jauh lebih mudah dijalankan, seperti Qwen3.8-27B dan model lain yang berfokus pada koding.

Meski begitu, jika Anda menginginkan sesuatu yang mendekati kelas DeepSeek Flash dari model, Motif-3 tetap sangat menarik. Model ini cepat pada H200, kualitas pengodeannya bagus, dan kemungkinan masih ada performa tambahan yang bisa didapat dengan penyetelan yang lebih baik. 

Masalah utama yang saya alami ada pada agen koding Pi, di mana generasi terkadang berhenti atau terputus. Saya meningkatkan beberapa batas keluaran, dan itu membantu, tetapi tidak sepenuhnya memperbaiki masalah. Ini juga pertama kalinya saya menggunakan runtime DS4, jadi mungkin masih ada yang bisa saya optimalkan ke depannya.

Tetap saja, jika Anda secara khusus mencari model yang dikembangkan di Korea, atau menginginkan alternatif untuk model yang dikembangkan di Tiongkok, ini adalah salah satu opsi yang lebih menarik saat ini. Menyenangkan juga melihat semakin banyak negara membangun model AI dan ekosistem mereka sendiri alih-alih bergantung pada beberapa penyedia besar saja.

FAQ Motif-3

Apa itu Motif 3?

Motif 3 adalah model bahasa mixture-of-experts dengan 314B parameter dari Motif Technologies, perusahaan asal Korea Selatan. Model ini mengaktifkan 13,2B parameter per token di 384 expert terarah dengan top-8 routing, dan telah dipra-latih pada sekitar 12,5 triliun token.

Apakah Motif 3 gratis untuk penggunaan komersial?

Ya. Bobot akhir Motif 3 dirilis di bawah lisensi MIT, yang memungkinkan penggunaan komersial, fine-tuning, dan redistribusi. Perhatikan bahwa pratinjau awal Motif-3-Beta memiliki pembatasan non-komersial, jadi pastikan Anda menggunakan checkpoint final.

Perangkat keras apa yang saya perlukan untuk menjalankan Motif 3 secara lokal?

Pada presisi penuh, jauh lebih besar dari yang dimiliki kebanyakan orang. Dengan mixed-quant GGUF yang digunakan dalam panduan ini, ukuran model turun menjadi sekitar 94GB, yang muat pada satu H200 141GB atau DGX Spark 128GB dengan ruang untuk runtime dan KV cache.

Berapa context window Motif 3?

262.144 token, atau 256K. Dalam praktiknya, konteks yang dapat digunakan bergantung pada runtime dan memori yang tersedia. Pada H200, jalur ds4 tervalidasi hingga 128K, dengan 256K hanya mencapai prefill parsial.

Apa keunggulan Motif 3?

Model ini dilatih dengan penekanan kuat pada kode, matematika, dan data STEM, dan berkinerja sangat baik pada tolok ukur agen dan penggunaan alat. Model ini juga kuat dalam bahasa Korea, yang tidak mengherankan mengingat asalnya.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Sebagai data scientist tersertifikasi, saya bersemangat memanfaatkan teknologi mutakhir untuk menciptakan aplikasi machine learning yang inovatif. Dengan latar belakang kuat di pengenalan ucapan, analisis dan pelaporan data, MLOps, conversational AI, dan NLP, saya mengasah keterampilan dalam mengembangkan sistem cerdas yang berdampak nyata. Selain keahlian teknis, saya juga komunikator andal yang mampu menyederhanakan konsep kompleks menjadi bahasa yang jelas dan ringkas. Karena itu, saya menjadi blogger yang dicari di bidang data science, membagikan wawasan dan pengalaman kepada komunitas profesional data yang terus berkembang. Saat ini, saya berfokus pada pembuatan dan penyuntingan konten, bekerja dengan large language model untuk mengembangkan konten yang kuat dan menarik agar membantu bisnis dan individu memaksimalkan data mereka.

Topik
Agen AI
Kecerdasan Buatan

Belajar AI dengan DataCamp!

Program

Insinyur Kecerdasan Buatan (AI) untuk Pengembang

26 Hr
Pelajari cara mengintegrasikan kecerdasan buatan (AI) ke dalam aplikasi perangkat lunak menggunakan antarmuka pemrograman aplikasi (API) dan perpustakaan sumber terbuka. Mulailah perjalanan Anda untuk menjadi seorang Insinyur Kecerdasan Buatan (AI) hari ini!
Lihat DetailRight Arrow
Mulai Kursus
Lihat Lebih BanyakRight Arrow