मुख्य सामग्री पर जाएं

Motif 3 को लोकल रूप से DS4 के साथ कैसे चलाएँ और उसे कोडिंग एजेंट में बदलें

ds4 रनटाइम का उपयोग करके NVIDIA H200 पर अनुकूलित Motif-3 Quant चलाएँ, उसे OpenAI-संगत API के जरिए सर्व करें, और Pi कोडिंग एजेंट के साथ एकीकृत करें।
अद्यतन 21 सित॰ 2026  · 8 मि॰ पढ़ना

AI के साथ खोजें

ChatGPTClaudePerplexity

Motif-3 एक 314B-पैरामीटर मिश्रण-विशेषज्ञ (mixture-of-experts) मॉडल है जिसे पूरी तरह से Motif Technologies ने दक्षिण कोरिया में लगभग 30-सदस्यीय टीम द्वारा शून्य से बनाया है, जो देश के सरकारी Dokpamo स्वायत्त AI कार्यक्रम का हिस्सा है। यह अगस्त 2026 में MIT लाइसेंस के तहत जारी किया गया, जिससे यह US और चीन के बाहर विकसित कुछ फ्रंटियर-स्केल ओपन-वेट मॉडलों में से एक बन गया।

इस गाइड में, मैं Baekpica/Motif-3-Mixed-Quant-GGUF का उपयोग कर रहा हूँ—यह एक स्वतंत्र मिश्रित-क्वांटाइज़्ड संस्करण है जो मॉडल की पूरी आर्किटेक्चर को संरक्षित रखते हुए उसका आकार घटाकर लगभग 94GB कर देता है। मैं इसे Hyperbolic NVIDIA H200 (141GB VRAM) पर चला रहा हूँ, जो क्वांटाइज़्ड मॉडल को GPU मेमोरी में रखने के लिए पर्याप्त है और इन्फरेंस, रनटाइम और KV कैश के लिए अतिरिक्त स्पेस भी छोड़ता है।

इस गाइड में, हम सीखेंगे कि कैसे:

  1. Motif-3 चलाने के लिए H200 GPU सर्वर सेटअप करें।
  2. Hugging Face से Motif-3 Mixed Quant GGUF फाइलें डाउनलोड करें।
  3. GGUF शार्ड्स को मर्ज करके एकल मॉडल फाइल बनाएँ।
  4. H200 के लिए ds4 रनटाइम को कॉम्पाइल और कॉन्फ़िगर करें।
  5. Motif-3 को GPU पर लोड करें और OpenAI-संगत API सर्वर शुरू करें।
  6. सरल curl अनुरोधों से मॉडल का परीक्षण करें।
  7. Motif-3 को Pi कोडिंग एजेंट से कनेक्ट करें।
  8. Motif-3 को एक स्वायत्त कोडिंग एजेंट की तरह उपयोग करके एक छोटा Python अनुप्रयोग बनाएँ और टेस्ट करें।

Motif 3 क्या है?

Motif-3 एक बड़े पैमाने का Mixture-of-Experts (MoE) मॉडल है जो Motif Technologies का है, जिसमें कुल 314B पैरामीटर हैं जबकि प्रति टोकन केवल 13.2B पैरामीटर सक्रिय होते हैं। 

इसमें 384 रूटेड एक्सपर्ट्स, 256K का कॉन्टेक्स्ट विंडो है, और इसे लगभग 12.5 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जिनमें कोड, गणित, STEM, बहुभाषी डेटा और अन्य डोमेन शामिल हैं। 

यह विशेष रूप से रीजनिंग, कोडिंग और एजेंटिक वर्कलोड्स के लिए उपयुक्त है। Artificial Analysis Intelligence Index पर, यह 47 का स्कोर प्राप्त करता है, जो इसे Qwen3.8-27B और MiniMax-M3, जिसे हमने समान सेटअप में परखा, के बीच रखता है।

Motif3 का Artificial Analysis Index

स्रोत: AI Model & API Providers Analysis | Artificial Analysis 

Mixed Quant GGUF क्या है?

इस गाइड में हम Baekpica/Motif-3-Mixed-Quant-GGUF का उपयोग कर रहे हैं, जो Motif-3 का स्वतंत्र रूप से बनाया गया क्वांटाइज़्ड संस्करण है। पूरे मॉडल के लिए एक ही प्रिसीजन स्तर उपयोग करने के बजाय, यह मिश्रित क्वांटाइज़ेशन अपनाता है—महत्वपूर्ण कंपोनेंट्स के लिए उच्च प्रिसीजन और विशाल एक्सपर्ट लेयर्स के लिए बहुत कम प्रिसीजन।

उदाहरण के लिए, महत्वपूर्ण अटेंशन और हमेशा-सक्रिय कंपोनेंट्स Q8_0 का उपयोग करते हैं, जबकि अधिकांश रूटेड एक्सपर्ट वेट्स IQ2_XXS और Q2_K का उपयोग करते हैं। मॉडल अभी भी सभी 384 एक्सपर्ट्स और सभी 53 लेयर्स रखता है, इसलिए कुछ भी प्रून या हटाया नहीं गया है। यह मॉडल को लगभग 94GB तक घटा देता है, जबकि Q8_0 GGUF के लिए यह लगभग 335GB होता, जिससे यह 141GB H200 पर पूरी तरह चलाने के लिए पर्याप्त छोटा हो जाता है और रनटाइम व KV कैश के लिए अतिरिक्त VRAM बचती है।

अधिक पृष्ठभूमि के लिए, हमारे LLMs के लिए क्वांटाइज़ेशन और GGUF फ़ॉर्मेट पर गाइड पढ़ने की सलाह देता हूँ।

1. H200 GPU सर्वर किराए पर लें और सेटअप करें

Motif-3 Mixed Quant लगभग 94GB का है, इसलिए आपको ऐसा GPU चाहिए जिसमें मॉडल लोड करने और इन्फरेंस के लिए स्पेस बचाने लायक VRAM हो। मैं Hyperbolic, RunPod, या Vast.ai जैसे GPU क्लाउड प्रदाताओं से 141GB VRAM वाला एकल NVIDIA H200 किराए पर लेने की अनुशंसा करता हूँ।

Hyperbolic में H200 GPU लॉन्च करना

इंस्टेंस चलने के बाद, अपने टर्मिनल या VS Code Remote SSH के माध्यम से कनेक्ट करें। आपका प्रदाता IP पता देगा। कमांड कुछ ऐसा दिखेगा:

ssh root@<SERVER_IP> -L 8080:localhost:8080

विकल्प -L 8080:localhost:8080 Motif-3 API पोर्ट को आपके लोकल PC पर भी फ़ॉरवर्ड करता है, ताकि बाद में आप इसे http://127.0.0.1:8080 पर एक्सेस कर सकें।

अब सर्वर को तैयार करें:

apt update
apt install -y git cmake build-essential python3-pip

pip install -U huggingface_hub

mkdir -p /workspace/motif3
cd /workspace/motif3

अंत में, जाँचें कि H200 उपलब्ध है:

nvidia-smi

H200 GPU सारांश

आपको लगभग 141GB VRAM वाला NVIDIA H200 दिखना चाहिए।

2. Motif-3 Mixed Quant GGUF डाउनलोड करें

अब Hugging Face से Baekpica/Motif-3-Mixed-Quant-GGUF मॉडल डाउनलोड करें। हम MQ87-88-FIT वेरिएंट का उपयोग कर रहे हैं, जो 11 GGUF फाइलों में विभाजित है और कुल आकार लगभग 94GB है।

/workspace/motif3 डायरेक्टरी से, यह चलाएँ:

hf download Baekpica/Motif-3-Mixed-Quant-GGUF \
  --include "Motif-3-MQ87-88-FIT-*.gguf" \
  --include MQ87-88-FIT-SHA256SUMS \ 
  --local-dir model

Motif-3 Mixed Quant GGUF डाउनलोड करें

आपके कनेक्शन पर निर्भर करते हुए, पूरे 94GB डाउनलोड होने में समय लग सकता है। पूरा होने पर, सुनिश्चित करें कि सभी शार्ड मौजूद हैं:

ls -lh model

मर्ज करने से पहले, शार्ड्स को सत्यापित करें। 94GB पर यह एक बार का मर्ज ऑपरेशन है, इसलिए अभी किसी भी खराब डाउनलोड को पकड़ना फायदेमंद है:

cd model && sha256sum -c MQ87-88-FIT-SHA256SUMS && cd ..

3. GGUF शार्ड्स को मर्ज करें

ds4 रनटाइम मॉडल को एकल GGUF फाइल के रूप में अपेक्षा करता है, इसलिए पहले हमें डाउनलोड किए गए 11 शार्ड्स को मर्ज करना होगा।

llama.cpp क्लोन करें और उसकी GGUF यूटिलिटी बनाएं:

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git

cmake -S llama.cpp -B llama.cpp/build -DLLAMA_CURL=OFF

cmake --build llama.cpp/build \
  --target llama-gguf-split \
  -j$(nproc)

अब सभी 11 शार्ड्स को एक फाइल में मर्ज करें:

./llama.cpp/build/bin/llama-gguf-split --merge \
  model/Motif-3-MQ87-88-FIT-00001-of-00011.gguf \
  motif3.gguf

मर्ज किए गए मॉडल की जाँच करें:

ls -lh motif3.gguf

आपको एक बड़ा motif3.gguf फाइल दिखना चाहिए। 

4. Motif-3 रनटाइम इंस्टॉल करें

हमें NVIDIA H200 पर Motif-3 को कुशलता से लोड और सर्व करने के लिए ds4 रनटाइम की आवश्यकता होगी।

dfm ब्रांच क्लोन करें:

git clone --branch dfm https://github.com/Baekpica/ds4.git
cd ds4

इसे H200 (Hopper, sm_90) के लिए CUDA सपोर्ट के साथ कॉम्पाइल करें। ध्यान दें कि ds4 का प्राथमिक लक्ष्य DGX Spark/GB10 है, और H200 सपोर्ट प्रोजेक्ट के ब्रिंग-अप कार्य से आता है न कि इसके मुख्य सर्विंग पथ से:

make cuda CUDA_ARCH=sm_90 -j$(nproc)

जाँचें कि बायनरी सफलतापूर्वक बन गई हैं:

ls -lh ds4*

आपको ds4-server और ds4_weight_server जैसी बायनरी दिखनी चाहिए।

5. Motif-3 को GPU पर लोड करें

वेट सर्वर GPU पर मॉडल वेट्स को लोड और मैनेज करता है ताकि API सर्वर उन्हें इन्फरेंस के लिए उपयोग कर सके।

पहले, रनटाइम फाइलों और KV कैश के लिए डायरेक्टरी बनाएं:

mkdir -p /workspace/motif3/run
mkdir -p /workspace/motif3/kv

पूर्ण लोड से पहले प्रीफ्लाइट चलाएँ ताकि सुनिश्चित हो सके कि मॉडल फिट होगा:

./ds4_weight_server \
  --base /workspace/motif3/motif3.gguf \
  --manifest /workspace/motif3/run/weights.manifest \
  --backend vmm \
  --scope base \
  --reserve-gb 24 \
  --no-repack-q8-aligned \
  --dry-run

यदि यह पास हो जाए, तो वही कमांड --dry-run हटाकर चलाएँ:

./ds4_weight_server \
  --base /workspace/motif3/motif3.gguf \
  --manifest /workspace/motif3/run/weights.manifest \
  --backend vmm \
  --scope base \
  --reserve-gb 24 \
  --no-repack-q8-aligned

Motif-3 को GPU पर लोड करें

यह टर्मिनल चालू रखें। Motif-3 चलाते समय वेट सर्वर सक्रिय रहना चाहिए।

6. Motif-3 API सर्वर शुरू करें और परीक्षण करें

अब हम ds4 API सर्वर शुरू करेंगे, जो Motif-3 को OpenAI-संगत एंडपॉइंट के माध्यम से एक्सपोज़ करता है, जिसे आप अपने लोकल कंप्यूटर से एक्सेस कर सकते हैं।

एक और टर्मिनल खोलें और सर्वर से कनेक्ट करें, फिर ds4 डायरेक्टरी में जाएँ:

cd /workspace/motif3/ds4

आवश्यक एनवायरनमेंट वेरिएबल्स सेट करें:

export DS4_CUDA_WEIGHT_IPC_MANIFEST=/workspace/motif3/run/weights.manifest
export DS4_CUDA_WEIGHT_IPC_SCOPE=base
export DS4_SERVER_COALESCE_MAX=2
export DS4_SERVER_COALESCE_MAX_TOKENS=4096
export DS4_MOTIF3_PREFILL_CHUNK=4096

125K कॉन्टेक्स्ट विंडो के साथ API सर्वर शुरू करें। H200 पर, रनटाइम 128K तक वेलिडेटेड है, जबकि 256K केवल आंशिक प्रीफिल तक पहुँचता है, इसलिए 125K परीक्षण सीमा के भीतर है:

./ds4-server \
  -m /workspace/motif3/motif3.gguf \
  --cuda \
  -c 125000 \
  --host 0.0.0.0 \
  --port 8080 \
  --no-spec \
  --kv-disk-dir /workspace/motif3/kv \
  --kv-disk-space-mb 32768

Motif-3 API सर्वर शुरू करें

यह टर्मिनल चालू रखें।

क्योंकि हमने पहले SSH के जरिए पोर्ट 8080 फ़ॉरवर्ड किया था, अब आप अपने लोकल PC पर टर्मिनल खोलकर API जाँच सकते हैं:

curl http://127.0.0.1:8080/v1/models

Motif-3 API सर्वर का परीक्षण करें

आपको motif-3 मॉडल सूचीबद्ध दिखाई देना चाहिए, जिसका कॉन्टेक्स्ट लेंथ 125000 है।

अब अपना पहला प्रॉम्प्ट भेजें:

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "motif-3",
    "messages": [
      {
        "role": "user",
        "content": "Explain mixture-of-experts models in simple terms."
      }
    ],
    "max_tokens": 256,
    "temperature": 0
  }'

Motif-3 API सर्वर का परीक्षण करें

यदि सब ठीक है, तो Motif-3 आपके H200 से सीधे प्रतिक्रिया जेनरेट करेगा। मेरे परीक्षण में, मॉडल ने ये मेट्रिक्स हासिल किए:

  • जनरेशन स्पीड: 23.7 टोकन/सेकंड
  • प्रीफिल स्पीड: 189.3 टोकन/सेकंड
  • टाइम टू फर्स्ट टोकन (TTFT): लगभग 90 ms

आप सर्वर पर GPU मेमोरी उपयोग भी जाँच सकते हैं:

nvidia-smi

Motif-3 मॉडल पूरी तरह लोड होने के बाद GPU सारांश

मेरे सेटअप में, Motif-3 ने H200 की 141GB रिपोर्टेड GPU मेमोरी में से लगभग 101GB का उपयोग किया, जिससे इन्फरेंस और KV कैश के लिए अतिरिक्त VRAM उपलब्ध रही।

7. Motif-3 को Pi कोडिंग एजेंट से कनेक्ट करें

अब हम लोकल Motif-3 API को Pi से कनेक्ट करेंगे, जिससे मॉडल एक कोडिंग एजेंट की तरह काम कर सकेगा—फाइलें बना सके, कमांड चला सके और किसी प्रोजेक्ट पर इटरेट कर सके।

सुनिश्चित करें कि Motif-3 यहाँ उपलब्ध है:

http://127.0.0.1:8080/v1

Pi को आधिकारिक इंस्टॉलर से इंस्टॉल करें:

curl -fsSL https://pi.dev/install.sh | sh

अपना टर्मिनल रीस्टार्ट करें, फिर इंस्टॉलेशन की पुष्टि करें:

pi --version

Pi ~/.pi/agent/models.json के माध्यम से कस्टम OpenAI-संगत मॉडलों को सपोर्ट करता है। यह कॉन्फ़िगरेशन बनाएँ:

mkdir -p ~/.pi/agent

cat > ~/.pi/agent/models.json <<'EOF'
{
  "providers": {
    "motif-local": {
      "baseUrl": "http://127.0.0.1:8080/v1",
      "api": "openai-completions",
      "apiKey": "none",
      "models": [
        {
          "id": "motif-3",
          "name": "Motif-3",
          "reasoning": true,
          "input": ["text"],
          "contextWindow": 125000,
          "maxTokens": 125000
        }
      ]
    }
  }
}
EOF

8. Motif-3 को कोडिंग एजेंट की तरह टेस्ट करें

अब हम Motif-3 को एक वास्तविक कोडिंग टास्क देंगे और देखेंगे कि क्या यह स्वायत्त रूप से कोई एप्लिकेशन बना, चला और सुधार कर सकता है।

एक टेस्ट प्रोजेक्ट बनाएँ और Pi शुरू करें:

mkdir -p ~/motif-test
cd ~/motif-test
pi

लोकल Motif3 मॉडल के साथ Pi कोडिंग एजेंट का एकीकरण

Motif-3 के साथ एक साधारण टू-डू ऐप बनाना

आइए मॉडल का परीक्षण करें। सबसे पहले, हम इसे एक साधारण टू-डू ऐप बनाने के लिए कहेंगे।

Create a simple Python CLI to-do app that can add, list, complete, and delete tasks, save them locally to a JSON file, then run and test it.

कुछ ही मिनटों में, Motif-3 ने एक काम करने वाला CLI एप्लिकेशन बनाया और सफलतापूर्वक उसका परीक्षण किया। कार्यक्षमता अच्छी थी, लेकिन शुरुआती इंटरफ़ेस बहुत बुनियादी था।

Pi में कोडिंग एजेंट के रूप में Motif3 मॉडल का परीक्षण

फिर मैंने एजेंट से एप्लिकेशन को अधिक इंटरएक्टिव और रंगीन बनाने, लेआउट सुधारने और टर्मिनल अनुभव बेहतर करने को कहा। Motif-3 ने फिर से शुरू करने के बजाय मौजूदा प्रोजेक्ट को संशोधित किया, और सुधरा हुआ संस्करण काफी ज्यादा परिष्कृत था।

CLI TODO ऐप Motif3 और Pi द्वारा जेनरेट किया गया

Motif-3 के साथ एक वेबसाइट बनाना

अंत में, मैं देखना चाहता था कि Motif-3 एक अधिक विजुअल वेब डेवलपमेंट टास्क पर कैसा प्रदर्शन करता है, जहाँ एक काम करने वाली वेबसाइट बनाना केवल चुनौती का एक हिस्सा है।

image4.png

शुरुआती एप्लिकेशन काम कर रहा था, लेकिन कई UI विवरण मुझे पसंद नहीं आए। मॉडल को एक विशाल रीडिज़ाइन प्रॉम्प्ट देने के बजाय, मैंने उससे मुद्दों को एक-एक करके ठीक करने के लिए कहा, और परीक्षण करते हुए इंटरफ़ेस के अलग-अलग हिस्सों को बेहतर कराया।

यह आश्चर्यजनक रूप से अच्छी तरह काम किया। Motif-3 मौजूदा प्रोजेक्ट का निरीक्षण करने, लक्षित बदलाव करने और एप्लिकेशन को कार्यात्मक रखते हुए UI को बार-बार परिष्कृत करने में सक्षम था। 

कुल मिलाकर, मैं इसकी कोडिंग परफॉर्मेंस और Pi के माध्यम से मौजूदा प्रोजेक्ट पर इटरेट करने की क्षमता से प्रभावित हुआ।

image9.png

अंतिम विचार

कुल मिलाकर, मेरा अनुभव थोड़ा मिला-जुला रहा। Motif-3 प्रभावशाली है, लेकिन अधिकांश लोगों के लिए चलाने हेतु इससे बेहतर और कम मेमोरी-हेवी मॉडल मौजूद हैं। 

मिश्रित क्वांटाइज़ेशन के बावजूद, जो आकार को काफी घटा देता है, इसे आराम से चलाने के लिए आपको अभी भी लगभग 100GB या अधिक GPU या संयुक्त मेमोरी की आवश्यकता होगी। इस वजह से, कई छोटे मॉडल चलाना कहीं आसान है, जैसे Qwen3.8-27B और अन्य कोडिंग-केंद्रित मॉडल।

यह कहा जाए, तो यदि आप DeepSeek Flash श्रेणी के मॉडलों के करीब कुछ चाहते हैं, तो Motif-3 अब भी काफ़ी दिलचस्प है। यह H200 पर तेज़ है, कोडिंग गुणवत्ता अच्छी है, और बेहतर ट्यूनिंग से संभवतः और प्रदर्शन निकाला जा सकता है। 

मुख्य समस्या मुझे Pi कोडिंग एजेंट के साथ हुई, जहाँ कभी-कभी जनरेशन रुक जाती थी या बाधित हो जाती थी। मैंने कुछ आउटपुट लिमिट्स बढ़ाईं, जिससे मदद मिली, लेकिन समस्या पूरी तरह हल नहीं हुई। यह मेरा DS4 रनटाइम का भी पहला उपयोग था, इसलिए भविष्य में शायद मैं और अनुकूलन कर सकूँ।

फिर भी, यदि आप विशेष रूप से किसी कोरियाई-डेवलप्ड मॉडल की तलाश में हैं, या चीनी-डेवलप्ड मॉडलों का विकल्प चाहते हैं, तो यह फिलहाल अधिक दिलचस्प विकल्पों में से एक है। यह भी अच्छा है कि अधिक देश अपने स्वयं के AI मॉडल और इकोसिस्टम बना रहे हैं, बजाय केवल कुछ बड़े प्रदाताओं पर निर्भर रहने के।

Motif-3 FAQs

Motif 3 क्या है?

Motif 3 Motif Technologies का 314B-पैरामीटर मिश्रण-विशेषज्ञ (MoE) भाषा मॉडल है, जो दक्षिण कोरिया की कंपनी है। यह 384 रूटेड एक्सपर्ट्स में टॉप-8 रूटिंग के साथ प्रति टोकन 13.2B पैरामीटर्स सक्रिय करता है, और इसे लगभग 12.5 ट्रिलियन टोकन पर प्रीट्रेन किया गया है।

क्या Motif 3 का व्यावसायिक रूप से उपयोग निःशुल्क है?

हाँ। अंतिम Motif 3 वेट्स MIT लाइसेंस के तहत जारी किए गए हैं, जो व्यावसायिक उपयोग, फाइन-ट्यूनिंग और पुनर्वितरण की अनुमति देता है। ध्यान दें कि पहले का Motif-3-Beta प्रीव्यू नॉन-कमर्शियल प्रतिबंध लेकर आता था, इसलिए सुनिश्चित करें कि आप अंतिम चेकपॉइंट का उपयोग कर रहे हैं।

Motif 3 को लोकल रूप से चलाने के लिए मुझे किस हार्डवेयर की आवश्यकता है?

फुल प्रिसीजन पर, अधिकांश लोगों के पास जितना होता है उससे कहीं अधिक। इस गाइड में उपयोग किए गए मिश्रित-क्वांट GGUF के साथ, मॉडल लगभग 94GB तक आता है, जो एकल 141GB H200 या 128GB DGX Spark पर रनटाइम और KV कैश के लिए स्पेस के साथ फिट हो जाता है।

Motif 3 का कॉन्टेक्स्ट विंडो कितना है?

262,144 टोकन, यानी 256K। व्यवहार में, आपका उपयोगी कॉन्टेक्स्ट रनटाइम और उपलब्ध मेमोरी पर निर्भर करता है। H200 पर, ds4 पाथ 128K तक वेलिडेटेड है, जबकि 256K केवल आंशिक प्रीफिल तक पहुँचता है।

Motif 3 किन चीज़ों में अच्छा है?

इसे कोड, गणित और STEM डेटा पर भारी जोर के साथ प्रशिक्षित किया गया है, और यह एजेंटिक व टूल-यूज़ बेंचमार्क्स पर विशेष रूप से अच्छा प्रदर्शन करता है। यह कोरियाई भाषा में भी मजबूत है, जो इसकी उत्पत्ति को देखते हुए अपेक्षित है।

विषय
एआई एजेंट्स
कृत्रिम बुद्धिमत्ता

DataCamp के साथ AI सीखें!

Track

डेवलपर्स के लिए एसोसिएट AI इंजीनियर

26 घंटा
एपीआई और ओपन-सोर्स लाइब्रेरी का उपयोग करके सॉफ़्टवेयर अनुप्रयोगों में AI को एकीकृत करना सीखें। आज ही AI इंजीनियर बनने की अपनी यात्रा शुरू करें!
विस्तृत जानकारी देखेंRight Arrow
कोर्स शुरू करें
और देखेंRight Arrow