Track
Qwen3.8-27B स्थानीय AI के लिए तेज़ी से सबसे लोकप्रिय मॉडलों में से एक बन रहा है। केवल 27 बिलियन पैरामीटर होने के बावजूद, यह कोडिंग, तर्क, एजेंटिक, और सामान्य-उद्देश्य बेंचमार्क में कहीं अधिक बड़े मॉडलों से टक्कर लेने वाला प्रदर्शन देता है। यह कई क्षेत्रों में GLM-5.2 जैसे मॉडलों के क़रीब पहुँच रहा है, जिसके कारण यह शक्तिशाली लोकल हार्डवेयर के साथ प्रयोग करने वालों में विशेष रूप से लोकप्रिय हो गया है।
RTX 5090 Qwen3.8-27B के लिए खास तौर पर उपयुक्त है क्योंकि इसकी Blackwell आर्किटेक्चर NVFP4 को सपोर्ट करती है, जिससे मॉडल बहुत अधिक गति पर चलते हुए भी आउटपुट क्वालिटी मज़बूत बनाए रखता है। मल्टी-टोकन प्रेडिक्शन (MTP) के ज़रिए speculative decoding, एक ऑप्टिमाइज़्ड llama.cpp बिल्ड, और सही GGUF मॉडल के साथ मिलकर, Qwen3.8-27B एक अकेले RTX 5090 पर 100 से अधिक टोकन प्रति सेकंड की गति दे सकता है।
इस गाइड में, हम RTX 5090 या किसी अन्य Blackwell GPU पर गति, शुद्धता, और लंबी संदर्भ-सपोर्ट का सर्वोत्तम संतुलन पाने के सबसे आसान तरीकों में से एक सेटअप करेंगे। हम Blackwell नेटिव सपोर्ट के साथ llama.cpp कॉम्पाइल करेंगे, Qwen3.8-27B NVFP4-MTP GGUF डाउनलोड करेंगे, इसे GPU त्वरण और MTP speculative decoding के साथ चलाएँगे, OpenAI-कम्पैटिबल API और इन-बिल्ट वेब इंटरफ़ेस का परीक्षण करेंगे, और अंत में इसे Pi से जोड़ेंगे ताकि हम Qwen3.8-27B को एक पूरी तरह लोकल कोडिंग एजेंट के रूप में इस्तेमाल कर सकें।
1. Blackwell GPUs के लिए llama.cpp सेट अप करें
सबसे पहले, हम सुनिश्चित करेंगे कि GPU ठीक से डिटेक्ट हो रहा है और NVIDIA ड्राइवर तथा CUDA वर्ज़न की जाँच करेंगे।
nvidia-smi
आपको अपना RTX 5090, ड्राइवर वर्ज़न, CUDA वर्ज़न, GPU मेमोरी, और वर्तमान GPU उपयोग दिखना चाहिए।
नोट: यह सेटअप विशेष रूप से NVIDIA Blackwell GPUs, जैसे RTX 5090, के लिए है। नीचे दिया गया बिल्ड SM120 को टार्गेट करता है, जो RTX 5090 द्वारा उपयोग की जाने वाली कंप्यूट आर्किटेक्चर है।
अगले चरण में, हम नवीनतम llama.cpp को CUDA सपोर्ट के साथ डाउनलोड और कॉम्पाइल करेंगे।
cd /workspace
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build --config Release -j$(nproc)

यहाँ महत्वपूर्ण हिस्सा है -DCMAKE_CUDA_ARCHITECTURES=120। यह llama.cpp को RTX 5090 में उपयोग की जाने वाली Blackwell आर्किटेक्चर के लिए विशेष रूप से बिल्ड करने को बताता है।
बिल्ड पूरा होने के बाद, हम llama-server को ग्लोबली उपलब्ध कराएँगे ताकि इसे किसी भी फ़ोल्डर से चलाया जा सके:
sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server
अब जाँचें कि सब कुछ ठीक से काम कर रहा है:
llama-server --version
आपको कुछ इस तरह का आउटपुट दिखना चाहिए:
version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64
बस इतना ही। अब हमारे पास CUDA-सक्षम llama.cpp बिल्ड है जो RTX 5090 और उसकी नेटिव Blackwell NVFP4 सपोर्ट का लाभ उठा सकता है।
2. Qwen3.8-27B NVFP4-MTP मॉडल डाउनलोड करें
अब हम Qwen3.8-27B मॉडल डाउनलोड करेंगे।
सबसे पहले, Hugging Face CLI इंस्टॉल करें:
pip install -U huggingface_hub
एक फ़ोल्डर बनाएँ जहाँ हम मॉडल रखेंगे:
mkdir -p /workspace/models/qwen38
फिर NVFP4-MTP GGUF डाउनलोड करें:
hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
--local-dir /workspace/models/qwen38

यह वही वर्ज़न है जिसकी हमें इस सेटअप के लिए ज़रूरत है, क्योंकि यह NVFP4 का उपयोग करता है और MTP सपोर्ट शामिल करता है—जो RTX 5090 पर गति में बड़े सुधार का मुख्य स्रोत है।
3. Qwen3.8-27B सर्वर शुरू करें
अब आता है मज़ेदार हिस्सा। हम Qwen3.8-27B को पूरी तरह GPU पर Flash Attention, 131K कॉन्टेक्स्ट विंडो, और तेज़ जेनरेशन के लिए MTP speculative decoding के साथ सर्व करेंगे।
चलाएँ:
cd /workspace/llama.cpp
llama-server \
-m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
--alias qwen3.8-27b \
--host 0.0.0.0 \
--port 8910 \
--ctx-size 131072 \
--n-gpu-layers all \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--spec-draft-p-min 0.75 \
--spec-draft-ngl all \
--spec-draft-type-k q8_0 \
--spec-draft-type-v q8_0 \
--reasoning-effort medium \
--jinja
यहाँ बहुत से विकल्प हैं, पर इनमें से ज़्यादातर 5090 से सर्वोत्तम प्रदर्शन पाने के लिए हैं।
मुख्य बातें जो जाननी चाहिए:
-
--ctx-size 131072हमें लगभग 131K की कॉन्टेक्स्ट विंडो देता है। -
--n-gpu-layers allमॉडल को GPU पर रखता है। -
--flash-attn onFlash Attention सक्षम करता है। -
--cache-type-k q8_0और--cache-type-v q8_0KV कैश मेमोरी उपयोग को कम करने में मदद करते हैं। -
--spec-type draft-mtpQwen3.8 का MTP speculative decoding सक्षम करता है। -
--spec-draft-n-max 4नियंत्रित करता है कि MTP एक बार में कितने speculative टोकन जेनरेट कर सकता है।
इस सेटअप के लिए, हम RTX 5090 पर शुरुआती बिंदु के रूप में n-max 4 उपयोग कर रहे हैं। आप 2 (जिसकी सिफारिश इस GGUF के लिए मॉडल कार्ड करता है) या 3 के साथ बाद में प्रयोग कर सकते हैं, क्योंकि सबसे तेज़ सेटिंग आपकी प्रणाली पर थोड़ा भिन्न हो सकती है।
जब llama-server मॉडल लोड करना पूरा कर लेगा, तो Qwen3.8 लोकली http://127.0.0.1:8910 पर उपलब्ध होगा।

अब हमारे पास Qwen3.8-27B लोकली चल रहा है। अगला कदम है मॉडल को API और इन-बिल्ट ब्राउज़र इंटरफ़ेस—दोनों के माध्यम से टेस्ट करना।
4. Qwen3.8-27B की गति और कोडिंग प्रदर्शन जाँचें
सर्वर चल रहा हो तो, एक और टर्मिनल खोलें और OpenAI-कम्पैटिबल API को एक टेस्ट अनुरोध भेजें:
curl http://127.0.0.1:8910/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-27b",
"messages": [
{
"role": "user",
"content": "Write a Python FastAPI application that monitors GPU usage."
}
],
"max_tokens": 2000
}'

इस टेस्ट में, Qwen3.8-27B ने 2,000 टोकन 122 टोकन/सेकंड की दर से जेनरेट किए, और प्रभावशाली 84.9% MTP स्वीकृति दर प्राप्त हुई।
llama.cpp में ब्राउज़र इंटरफ़ेस भी शामिल है, इसलिए आप API का उपयोग किए बिना भी मॉडल को टेस्ट कर सकते हैं।
UI देखने के लिए अपने ब्राउज़र में http://127.0.0.1:8910 खोलें।

एक अधिक जटिल टेस्ट के लिए, मैंने यह प्रॉम्प्ट इस्तेमाल किया:
Create a stunning single-file animated HTML website with a dark futuristic
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

मेरे RTX 5090 पर, मुझे औसतन लगभग 142 टोकन प्रति सेकंड मिल रहे थे, और कभी-कभी जेनरेशन गति लगभग 170 टोकन प्रति सेकंड तक पहुँच रही थी, जो लोकल तौर पर चल रहे 27B मॉडल के लिए अत्यंत तेज़ है।

Qwen3.8-27B ने एक परिष्कृत, पूरी तरह काम करने वाली वेबसाइट जेनरेट की जो तुरंत चल पड़ी। यह मॉडल की कोडिंग क्षमता और लोकल सेटअप की गति—दोनों को जल्दी परखने का अच्छा तरीका है।
5. Qwen3.8-27B को Pi के साथ इस्तेमाल करें
इस खंड में, हम Qwen3.8-27B को Pi से जोड़ेंगे और इसे एक पूरी तरह लोकल कोडिंग एजेंट के रूप में इस्तेमाल करेंगे।
Pi एक हल्का, टर्मिनल-आधारित कोडिंग एजेंट है जो आपको कमांड लाइन से ही प्रोजेक्ट बनाना, संपादित करना, टेस्ट करना और डिबग करने में मदद कर सकता है।
Pi इंस्टॉल करें:
curl -fsSL https://pi.dev/install.sh | sh
इंस्टॉलर को Node.js और npm की आवश्यकता होती है। यह Pi को आपके ग्लोबल npm प्रीफ़िक्स में इंस्टॉल करता है। यदि आपके पास अभी Node नहीं है, तो पहले nvm या अपने पैकेज मैनेजर से इसे इंस्टॉल करें।
इंस्टॉलेशन पूरा होने के बाद, अपना टर्मिनल रिस्टार्ट करें।
अगला, pi-llama एक्सटेंशन इंस्टॉल करें और Pi को हमारे लोकल llama.cpp सर्वर की ओर पॉइंट करें:
pi install git:github.com/huggingface/pi-llama
export LLAMA_BASE_URL=http://127.0.0.1:8910/v1
एक नया प्रोजेक्ट बनाएँ और Pi शुरू करें:
mkdir new-project
cd new-project
Pi

Pi के अंदर, /model चलाएँ, llama-cpp खोजें और Qwen3.8-27B चुनें।
टेस्टिंग के लिए, मैंने इसे यह प्रॉम्प्ट दिया:
Build a polished personal finance dashboard from scratch that imports CSV
bank statements, categorizes spending, shows monthly trends and charts, and
detects unusual expenses; also generate a realistic sample CSV, import it,
test the full app end-to-end, and fix any errors automatically.

इसने पूरा प्रोजेक्ट कुछ ही मिनटों में बना दिया।

इसके बाद मैंने इसे सर्वर शुरू करने और फ्रंटएंड व एप्लिकेशन लॉजिक—दोनों का परीक्षण करने के लिए कहा। इसने हर चीज़ के सही ढंग से काम करने का यक़ीन करने के लिए डिबगिंग और टेस्टिंग में अधिक समय लगाया।

जब मैंने स्वयं डैशबोर्ड टेस्ट किया, तो ऐप अच्छी तरह काम कर रहा था, ग्राफ़ शानदार दिख रहे थे, और समग्र अनुभव सुचारु था।

मुख्य कमी थी सटीक UI बदलाव कराना। कई फॉलो-अप प्रॉम्प्ट के बाद यह ठीक-ठीक मेरी इच्छा समझने के बजाय असंबंधित परिवर्तन करने लगा, इसलिए मैंने वहीं रुकना उचित समझा।
अंतिम विचार
Qwen3.8-27B अभी भी काफ़ी नया है, और समुदाय क्वांटाइज़ेशन व speculative decoding के सर्वश्रेष्ठ संयोजन की सक्रिय रूप से तलाश कर रहा है। MTP बहुत अच्छा काम करता है, लेकिन DFlash 2 और DSpark जैसे नए तरीकों का भी परीक्षण हो रहा है, और कुछ उपयोगकर्ता हार्डवेयर व वर्कलोड के आधार पर और भी अधिक गति रिपोर्ट कर रहे हैं।
Unsloth ने अभी-अभी Qwen3.8-27B के लिए Dynamic v3.0 GGUFs जारी किए हैं, जो पिछले क्वांट्स की तुलना में समान मॉडल आकार पर लगभग 10% अधिक शुद्धता का दावा करते हैं। यदि आप लगभग समान लोकल इन्फ़रेंस सेटअप रखते हुए बेहतर क्वालिटी चाहते हैं, तो Unsloth एक और बहुत दिलचस्प विकल्प बन जाता है।
फिलहाल, मुझे लगता है कि NVFP4 + MTP + llama.cpp RTX 5090 के लिए सबसे आसान और सबसे तेज़ सेटअप में से एक है। 27B मॉडल से लगभग 140 टोकन प्रति सेकंड पाना, वह भी बड़े कॉन्टेक्स्ट विंडो और वास्तविक कोडिंग एजेंट चलाने की पर्याप्त क्षमता के साथ—काफी प्रभावशाली है। जैसे-जैसे llama.cpp, Unsloth, DFlash 2 और DSpark में सुधार होता जाएगा, यह सेटअप शायद और भी तेज़ हो जाएगा।
Qwen3.8-27B को लोकल चलाने से जुड़े FAQs
क्या Qwen3.8-27B को लोकल चलाने के लिए RTX 5090 की ज़रूरत है?
नहीं। Qwen3.8-27B के मानक 4-बिट GGUF क्वांट्स लगभग 16–19 GB VRAM में फ़िट हो जाते हैं, इसलिए RTX 5080, 4090, या 24 GB Mac भी मॉडल चला लेंगे। इस विशेष सेटअप में RTX 5090 इसलिए महत्वपूर्ण है क्योंकि NVFP4 को Blackwell टेन्सर कोर की ज़रूरत होती है। पुरानी कार्ड्स पर NVFP4 फ़ाइलें चलेंगी, पर वे केवल मेमोरी बचत देंगी, गति बढ़त नहीं।
यह कॉन्फ़िगरेशन वास्तव में कितनी VRAM इस्तेमाल करता है?
NVFP4-MTP GGUF डिस्क पर लगभग 19 GB का है, और कॉन्टेक्स्ट बढ़ने के साथ कुल उपयोग को ऊपर धकेलने वाला KV कैश होता है। बहुत लंबे कॉन्टेक्स्ट पर q8_0 K/V क्वांटाइज़ेशन के साथ, प्रकाशित RTX 5090 रन मध्य-20s GB में आते हैं, इसलिए 32 GB कार्ड आरामदायक है। 24 GB पर आपको --ctx-size को 131072 से काफ़ी नीचे लाना होगा।
MTP speculative decoding क्या करता है, और क्या यह लॉसलेस है?
Qwen3.8 की GGUF में मल्टी-टोकन प्रेडिक्शन लेयर्स पहले से बेक्ड होती हैं, जो बिना किसी दूसरे फ़ाइल के इन-बिल्ट ड्राफ्ट मॉडल की तरह काम करती हैं। ड्राफ्ट हेड एक साथ कई टोकन प्रस्तावित करता है और फुल मॉडल उन्हें सत्यापित करता है, इसलिए स्वीकृत ड्राफ्ट की लागत सामान्य फ़ॉरवर्ड पास के एक अंश जितनी होती है। आउटपुट क्वालिटी अपरिवर्तित रहती है, क्योंकि मुख्य मॉडल जो भी टोकन स्वीकार करता है, वही वह वैसे भी जेनरेट करता।
क्या आपको NVFP4 लेना चाहिए या एक सामान्य Q4_K_M क्वांट?
यदि आपके पास Blackwell GPU है और अधिकतम गति चाहिए तो NVFP4 चुनें; यदि आप Ampere या Ada पर हैं, या प्रति गीगाबाइट आउटपुट क्वालिटी अधिक महत्वपूर्ण है, तो Q4_K_M जैसे मानक GGUF या Unsloth का UD-Q4_K_XL चुनें। llama.cpp में NVFP4 सपोर्ट भी K-quant पाथ से नया है, इसलिए कन्वर्ज़न और टूलिंग के आसपास अधिक खुरदुरे किनारों की उम्मीद रखें।
क्योंकि Qwen3.8-27B एक विज़न मॉडल है, क्या यह सेटअप इमेज संभाल सकता है?
Qwen3.8-27B एक नेटिव विज़न-लैंग्वेज मॉडल है, लेकिन टेक्स्ट-ओनली GGUF कन्वर्ज़न विज़न टावर हटा देते हैं। इमेज का उपयोग करने के लिए, आपको मॉडल के साथ --mmproj के ज़रिए एक मल्टीमॉडल प्रोजेक्टर पास करना होगा—आमतौर पर वही mmproj फ़ाइल जो उसी रिपो में या Unsloth के GGUF रिपो में प्रकाशित की जाती है।
