मुख्य सामग्री पर जाएं

NVIDIA RTX 5090 पर Qwen3.8-27B को लोकली कैसे चलाएँ

Blackwell-नेटिव NVFP4 और MTP speculative decoding के साथ Qwen3.8-27B को लोकली चलाना सीखें, और llama.cpp के साथ प्रति सेकंड 170 टोकन तक की गति पाएँ।
अपडेट किया गया 31 अग॰ 2026  · 6 मि॰ पढ़ें

AI के साथ खोजें

ChatGPTClaudePerplexity

Qwen3.8-27B तेजी से लोकल AI के लिए सबसे लोकप्रिय मॉडलों में से एक बन रहा है। महज 27 अरब पैरामीटर्स होने के बावजूद, यह कोडिंग, तर्क, एजेंटिक और सामान्य-उद्देश्य बेंचमार्क्स में इससे कहीं बड़े मॉडलों से टक्कर लेने वाला प्रदर्शन देता है। यह कई क्षेत्रों में GLM-5.2 जैसे मॉडलों के करीब भी पहुँच रहा है, जिसके चलते यह शक्तिशाली लोकल हार्डवेयर के साथ प्रयोग करने वालों में खासा लोकप्रिय हुआ है।

RTX 5090 Qwen3.8-27B के लिए खास तौर पर उपयुक्त है क्योंकि इसकी Blackwell आर्किटेक्चर NVFP4 को सपोर्ट करती है, जिससे मॉडल बहुत तेज़ गति पर चलते हुए भी आउटपुट गुणवत्ता बनाए रखता है। multi-token prediction (MTP) के ज़रिए speculative decoding, एक ऑप्टिमाइज़्ड llama.cpp बिल्ड, और सही GGUF मॉडल के संयोजन से, Qwen3.8-27B एकल RTX 5090 पर 100 से अधिक टोकन प्रति सेकंड दे सकता है।

इस गाइड में, हम RTX 5090 या किसी अन्य Blackwell GPU पर स्पीड, सटीकता और long-context सपोर्ट के बेहतरीन संतुलन के लिए एक आसान सेटअप तैयार करेंगे। हम native Blackwell सपोर्ट के साथ llama.cpp को कंपाइल करेंगे, Qwen3.8-27B NVFP4-MTP GGUF डाउनलोड करेंगे, इसे GPU त्वरण और MTP speculative decoding के साथ चलाएँगे, OpenAI-कंपैटिबल API और बिल्ट-इन वेब इंटरफ़ेस को टेस्ट करेंगे, और अंत में इसे Pi से जोड़ेंगे ताकि हम Qwen3.8-27B को पूरी तरह लोकल कोडिंग एजेंट की तरह इस्तेमाल कर सकें।

मैं यह भी सुझाऊँगा कि हमारा Qwen3.8-Flash-Next गाइड, Qwen4 के नए प्रीव्यू, और यह ट्यूटोरियल देखें कि Qwen3.8-Flash-Next को लोकली कैसे चलाएँ।

1. Blackwell GPUs के लिए llama.cpp सेट अप करें

सबसे पहले, हम सुनिश्चित करेंगे कि GPU सही से डिटेक्ट हो रहा है और NVIDIA ड्राइवर व CUDA वर्ज़न जाँचेंगे।

nvidia-smi

RTX 5090 GPU summary

आपको अपना RTX 5090, ड्राइवर वर्ज़न, CUDA वर्ज़न, GPU मेमोरी, और मौजूदा GPU उपयोग दिखाई देना चाहिए।

नोट: यह सेटअप विशेष रूप से NVIDIA Blackwell GPUs, जैसे RTX 5090, के लिए है। नीचे दिया गया बिल्ड SM120 को टार्गेट करता है, जो RTX 5090 द्वारा उपयोग की जाने वाली compute आर्किटेक्चर है।

अगले चरण में, हम CUDA सपोर्ट के साथ llama.cpp का नवीनतम वर्ज़न डाउनलोड और कंपाइल करेंगे।

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

यहाँ महत्वपूर्ण हिस्सा है -DCMAKE_CUDA_ARCHITECTURES=120। यह llama.cpp को बताता है कि RTX 5090 में उपयोग होने वाली Blackwell आर्किटेक्चर के लिए विशेष रूप से बिल्ड करें।

बिल्ड पूरा हो जाने के बाद, हम llama-server को ग्लोबली उपलब्ध कराएँगे ताकि इसे किसी भी फ़ोल्डर से चला सकें:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

अब जाँचें कि सब कुछ काम कर रहा है:

llama-server --version

आपको कुछ इस तरह का आउटपुट मिलना चाहिए:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

बस इतना ही। अब हमारे पास CUDA-सक्षम llama.cpp बिल्ड है जो RTX 5090 और उसकी नेटिव Blackwell NVFP4 सपोर्ट का लाभ उठा सकता है।

2. Qwen3.8-27B NVFP4-MTP मॉडल डाउनलोड करें

अब हम Qwen3.8-27B मॉडल डाउनलोड करेंगे।

पहले, Hugging Face CLI इंस्टॉल करें:

pip install -U huggingface_hub

एक फ़ोल्डर बनाएँ जहाँ हम मॉडल रखेंगे:

mkdir -p /workspace/models/qwen38

फिर NVFP4-MTP GGUF डाउनलोड करें:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

यह वही वर्ज़न है जिसकी हमें इस सेटअप के लिए ज़रूरत है, क्योंकि यह NVFP4 का उपयोग करता है और MTP सपोर्ट शामिल है—यही वह जगह है जहाँ RTX 5090 पर स्पीड में बड़ा सुधार मिलता है।

3. Qwen3.8-27B सर्वर शुरू करें

अब मज़ेदार हिस्सा आता है। हम Qwen3.8-27B को पूरी तरह GPU पर Flash Attention, 131K context window, और तेज़ जनरेशन के लिए MTP speculative decoding के साथ सर्व करेंगे। 

चलाएँ:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

यहाँ बहुत सारे विकल्प हैं, लेकिन इनमें से अधिकांश 5090 से सर्वश्रेष्ठ प्रदर्शन निकालने के लिए ही हैं।

मुख्य विकल्प जिनके बारे में जानना ज़रूरी है:

  • --ctx-size 131072 हमें लगभग 131K का context window देता है।

  • --n-gpu-layers all मॉडल को GPU पर ही रखता है।

  • --flash-attn on Flash Attention सक्षम करता है।

  • --cache-type-k q8_0 और --cache-type-v q8_0 KV cache मेमोरी उपयोग को घटाने में मदद करते हैं।

  • --spec-type draft-mtp Qwen3.8 का MTP speculative decoding सक्षम करता है।

  • --spec-draft-n-max 4 नियंत्रित करता है कि MTP एक बार में कितने speculative टोकन जनरेट कर सकता है।

इस सेटअप के लिए, हम RTX 5090 पर शुरुआती बिंदु के रूप में n-max 4 का उपयोग कर रहे हैं। आप बाद में 2 (जिसकी इस GGUF के लिए मॉडल कार्ड सिफारिश करता है) या 3 के साथ प्रयोग कर सकते हैं, क्योंकि सबसे तेज़ सेटिंग आपके सिस्टम पर थोड़ा-बहुत भिन्न हो सकती है।

जब llama-server मॉडल लोड करना पूरा कर लेगा, तब Qwen3.8 लोकली http://127.0.0.1:8910 पर उपलब्ध होगा।

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

अब हमारे पास Qwen3.8-27B लोकली चल रहा है। अगला कदम है API और बिल्ट-इन ब्राउज़र इंटरफ़ेस—दोनों के जरिए मॉडल को टेस्ट करना।

4. Qwen3.8-27B की स्पीड और कोडिंग परफॉर्मेंस टेस्ट करें

सर्वर चल रहा हो तो, दूसरा टर्मिनल खोलें और OpenAI-कंपैटिबल API को एक टेस्ट रिक्वेस्ट भेजें:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

इस टेस्ट में, Qwen3.8-27B ने 2,000 टोकन 122 टोकन/सेकंड की गति से जनरेट किए, और 84.9% का प्रभावशाली MTP स्वीकृति दर मिली। 

llama.cpp में एक ब्राउज़र इंटरफ़ेस भी शामिल है, जिससे आप API का उपयोग किए बिना मॉडल को टेस्ट कर सकते हैं।

UI देखने के लिए अपने ब्राउज़र में http://127.0.0.1:8910 खोलें।

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

एक अधिक जटिल टेस्ट के लिए, मैंने यह प्रॉम्प्ट इस्तेमाल किया:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

मेरे RTX 5090 पर, औसतन लगभग 142 टोकन प्रति सेकंड मिल रहे थे, और कभी-कभी जनरेशन स्पीड लगभग 170 टोकन प्रति सेकंड तक पहुँच रही थी—जो लोकली चल रहे 27B मॉडल के लिए बेहद तेज़ है। 

image4.png

Qwen3.8-27B ने एक पॉलिश्ड, पूरी तरह काम करने वाली वेबसाइट जनरेट की जो तुरंत चल पड़ी। यह मॉडल की कोडिंग क्षमता और लोकल सेटअप की स्पीड, दोनों को जल्दी से जाँचने का अच्छा तरीका है। 

5. Pi के साथ Qwen3.8-27B का उपयोग करें

इस सेक्शन में, हम Qwen3.8-27B को Pi से जोड़ेंगे और इसे पूरी तरह लोकल कोडिंग एजेंट की तरह इस्तेमाल करेंगे।

Pi एक हल्का, टर्मिनल-आधारित कोडिंग एजेंट है जो आपको कमांड लाइन से सीधे प्रोजेक्ट बनाना, संपादित करना, टेस्ट करना और डिबग करने में मदद करता है।

Pi इंस्टॉल करें:

curl -fsSL https://pi.dev/install.sh | sh

इंस्टॉलर को Node.js और npm की आवश्यकता होती है। यह Pi को आपके ग्लोबल npm प्रीफ़िक्स में इंस्टॉल करता है। यदि आपके पास अभी तक Node नहीं है, तो पहले nvm या अपने पैकेज मैनेजर से इंस्टॉल करें।

इंस्टॉलेशन पूरा हो जाने के बाद, अपना टर्मिनल रीस्टार्ट करें।

इसके बाद, pi-llama एक्सटेंशन इंस्टॉल करें और Pi को हमारे लोकल llama.cpp सर्वर की ओर पॉइंट करें:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

एक नया प्रोजेक्ट बनाएँ और Pi शुरू करें:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

Pi के अंदर, /model चलाएँ, llama-cpp खोजें और Qwen3.8-27B चुनें।

टेस्टिंग के लिए, मैंने इसे यह प्रॉम्प्ट दिया:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

यहने कुछ ही मिनटों में पूरा प्रोजेक्ट बना दिया। 

Testing the qwen3.8-27b model with Pi coding agent

इसके बाद मैंने इसे सर्वर शुरू करने और फ्रंटएंड व एप्लीकेशन लॉजिक—दोनों—का टेस्ट करने को कहा। यह सब कुछ ठीक से काम कर रहा है, यह सुनिश्चित करने के लिए अधिक समय डिबगिंग और टेस्टिंग में लगाया।

web dashboard generated with qwen3.8-27b model and Pi coding agent

जब मैंने खुद डैशबोर्ड टेस्ट किया, ऐप अच्छी तरह चला, ग्राफ शानदार दिखे, और कुल मिलाकर अनुभव स्मूथ रहा।

web dashboard generated with qwen3.8-27b model and Pi coding agent

मुख्य कमी थी सटीक UI बदलाव कराना। कई फ़ॉलो-अप प्रॉम्प्ट्स के बाद, यह मेरे इरादे को ठीक से समझने के बजाय असंबंधित बदलाव करने लगा, तो मैंने अंततः वहीं रोक दिया।

अंतिम विचार

Qwen3.8-27B अभी भी बहुत नया है, और समुदाय सक्रिय रूप से क्वांटाइज़ेशन और speculative decoding के सर्वश्रेष्ठ संयोजन की तलाश कर रहा है। MTP बेहद अच्छा काम करता है, लेकिन DFlash 2 और DSpark जैसे नए तरीकों का भी परीक्षण हो रहा है, और कुछ यूज़र्स हार्डवेयर और वर्कलोड के आधार पर और भी अधिक स्पीड रिपोर्ट कर रहे हैं। 

Unsloth ने भी अभी-अभी Qwen3.8-27B के लिए Dynamic v3.0 GGUFs जारी किए हैं, जो अपने पिछले क्वांट्स की तुलना में समान मॉडल आकार पर लगभग 10% अधिक सटीकता का दावा करते हैं। यदि आप उसी लोकल इंफ़्रेंस सेटअप के साथ बेहतर गुणवत्ता चाहते हैं, तो Unsloth एक और बहुत दिलचस्प विकल्प बन जाता है। 

फिलहाल, मुझे लगता है कि NVFP4 + MTP + llama.cpp RTX 5090 के लिए सबसे आसान और तेज़ सेटअप में से एक है। 27B मॉडल से लगभग 140 टोकन प्रति सेकंड हासिल करना, वह भी बड़े context window और इतना सामर्थ्य रखते हुए कि एक असली कोडिंग एजेंट चल सके—काफी प्रभावशाली है। जैसे-जैसे llama.cpp, Unsloth, DFlash 2 और DSpark बेहतर होंगे, यह सेटअप संभवतः और भी तेज़ हो जाएगा।

Qwen3.8-27B को लोकली चलाने के लिए FAQs

क्या Qwen3.8-27B को लोकली चलाने के लिए RTX 5090 ज़रूरी है?

नहीं। Qwen3.8-27B के स्टैंडर्ड 4-बिट GGUF क्वांट्स लगभग 16–19 GB VRAM में फिट हो जाते हैं, इसलिए RTX 5080, 4090, या 24 GB Mac पर भी मॉडल चलेगा। इस विशेष सेटअप में RTX 5090 इसलिए मायने रखता है क्योंकि NVFP4 को Blackwell टेंसर कोर्स की ज़रूरत होती है। पुरानी कार्ड्स पर NVFP4 फाइलें चलेंगी, लेकिन वे आपको केवल मेमोरी बचत देंगी, स्पीडअप नहीं।

इस कॉन्फ़िगरेशन में वास्तव में कितनी VRAM लगती है?

NVFP4-MTP GGUF डिस्क पर लगभग 19 GB का है, और context बढ़ने पर कुल उपयोग को ऊपर धकेलने वाला हिस्सा KV cache होता है। बहुत लंबे context पर q8_0 K/V क्वांटाइज़ेशन के साथ, प्रकाशित RTX 5090 रन मध्यम-20s GB रेंज में आते हैं, इसलिए 32 GB कार्ड आरामदायक है। 24 GB पर आपको --ctx-size को 131072 से काफी नीचे रखना होगा।

MTP speculative decoding क्या करता है, और क्या यह lossless है?

Qwen3.8 में multi-token prediction लेयर्स GGUF में ही बेक्ड आती हैं, जो बिना किसी दूसरी फाइल के बिल्ट-इन ड्राफ्ट मॉडल की तरह काम करती हैं। ड्राफ्ट हेड एक साथ कई टोकन प्रस्तावित करता है और फुल मॉडल उन्हें वैरिफ़ाई करता है, इसलिए स्वीकृत ड्राफ्ट का खर्च सामान्य फ़ॉरवर्ड पास के एक अंश जितना होता है। आउटपुट गुणवत्ता अपरिवर्तित रहती है, क्योंकि मुख्य मॉडल जो भी टोकन स्वीकार करता है, वह वैसा ही टोकन होता है जो वह वैसे भी जनरेट करता।

आपको NVFP4 लेना चाहिए या रेगुलर Q4_K_M क्वांट?

यदि आपके पास Blackwell GPU है और अधिकतम स्पीड चाहते हैं तो NVFP4 चुनें; यदि आप Ampere या Ada पर हैं, या प्रति गीगाबाइट आउटपुट गुणवत्ता को ज़्यादा प्राथमिकता देते हैं, तो Q4_K_M जैसे स्टैंडर्ड GGUF या Unsloth का UD-Q4_K_XL चुनें। llama.cpp में NVFP4 सपोर्ट K-quant पाथ की तुलना में नया भी है, इसलिए कन्वर्ज़न और टूलिंग के आसपास कुछ खुरदुरे किनारों की उम्मीद रखें।

क्या यह सेटअप इमेजेज़ संभाल सकता है, क्योंकि Qwen3.8-27B एक विज़न मॉडल है?

Qwen3.8-27B एक नैटिव विज़न-लैंग्वेज मॉडल है, लेकिन टेक्स्ट-ओनली GGUF कन्वर्ज़न विज़न टावर हटा देते हैं। इमेजेज़ का उपयोग करने के लिए, आपको मॉडल के साथ --mmproj के जरिए एक मल्टीमॉडल प्रोजेक्टर पास करना होगा, आमतौर पर वही mmproj फाइल जो उसी रिपो में या Unsloth के GGUF रिपो में प्रकाशित होती है।

विषय
कृत्रिम बुद्धिमत्ता

DataCamp के साथ AI Engineer बनें!

लर्निंग पाथ

डेवलपर्स के लिए एसोसिएट AI इंजीनियर

26 घंटा
एपीआई और ओपन-सोर्स लाइब्रेरी का उपयोग करके सॉफ़्टवेयर अनुप्रयोगों में AI को एकीकृत करना सीखें। आज ही AI इंजीनियर बनने की अपनी यात्रा शुरू करें!
विवरण देखेंRight Arrow
पाठ्यक्रम शुरू करें
और देखेंRight Arrow