मुख्य सामग्री पर जाएं

NVIDIA RTX 5090 पर Qwen3.8-27B को लोकल तौर पर कैसे चलाएँ

जानें कि Blackwell-नेटिव NVFP4 और MTP speculative decoding के साथ Qwen3.8-27B को लोकल कैसे चलाएँ, और llama.cpp के साथ प्रति सेकंड 170 टोकन तक की गति पाएँ।
अद्यतन 25 अग॰ 2026  · 6 मि॰ पढ़ना

AI के साथ खोजें

ChatGPTClaudePerplexity

Qwen3.8-27B स्थानीय AI के लिए तेज़ी से सबसे लोकप्रिय मॉडलों में से एक बन रहा है। केवल 27 बिलियन पैरामीटर होने के बावजूद, यह कोडिंग, तर्क, एजेंटिक, और सामान्य-उद्देश्य बेंचमार्क में कहीं अधिक बड़े मॉडलों से टक्कर लेने वाला प्रदर्शन देता है। यह कई क्षेत्रों में GLM-5.2 जैसे मॉडलों के क़रीब पहुँच रहा है, जिसके कारण यह शक्तिशाली लोकल हार्डवेयर के साथ प्रयोग करने वालों में विशेष रूप से लोकप्रिय हो गया है।

RTX 5090 Qwen3.8-27B के लिए खास तौर पर उपयुक्त है क्योंकि इसकी Blackwell आर्किटेक्चर NVFP4 को सपोर्ट करती है, जिससे मॉडल बहुत अधिक गति पर चलते हुए भी आउटपुट क्वालिटी मज़बूत बनाए रखता है। मल्टी-टोकन प्रेडिक्शन (MTP) के ज़रिए speculative decoding, एक ऑप्टिमाइज़्ड llama.cpp बिल्ड, और सही GGUF मॉडल के साथ मिलकर, Qwen3.8-27B एक अकेले RTX 5090 पर 100 से अधिक टोकन प्रति सेकंड की गति दे सकता है।

इस गाइड में, हम RTX 5090 या किसी अन्य Blackwell GPU पर गति, शुद्धता, और लंबी संदर्भ-सपोर्ट का सर्वोत्तम संतुलन पाने के सबसे आसान तरीकों में से एक सेटअप करेंगे। हम Blackwell नेटिव सपोर्ट के साथ llama.cpp कॉम्पाइल करेंगे, Qwen3.8-27B NVFP4-MTP GGUF डाउनलोड करेंगे, इसे GPU त्वरण और MTP speculative decoding के साथ चलाएँगे, OpenAI-कम्पैटिबल API और इन-बिल्ट वेब इंटरफ़ेस का परीक्षण करेंगे, और अंत में इसे Pi से जोड़ेंगे ताकि हम Qwen3.8-27B को एक पूरी तरह लोकल कोडिंग एजेंट के रूप में इस्तेमाल कर सकें।

1. Blackwell GPUs के लिए llama.cpp सेट अप करें

सबसे पहले, हम सुनिश्चित करेंगे कि GPU ठीक से डिटेक्ट हो रहा है और NVIDIA ड्राइवर तथा CUDA वर्ज़न की जाँच करेंगे।

nvidia-smi

RTX 5090 GPU summary

आपको अपना RTX 5090, ड्राइवर वर्ज़न, CUDA वर्ज़न, GPU मेमोरी, और वर्तमान GPU उपयोग दिखना चाहिए।

नोट: यह सेटअप विशेष रूप से NVIDIA Blackwell GPUs, जैसे RTX 5090, के लिए है। नीचे दिया गया बिल्ड SM120 को टार्गेट करता है, जो RTX 5090 द्वारा उपयोग की जाने वाली कंप्यूट आर्किटेक्चर है।

अगले चरण में, हम नवीनतम llama.cpp को CUDA सपोर्ट के साथ डाउनलोड और कॉम्पाइल करेंगे।

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

यहाँ महत्वपूर्ण हिस्सा है -DCMAKE_CUDA_ARCHITECTURES=120। यह llama.cpp को RTX 5090 में उपयोग की जाने वाली Blackwell आर्किटेक्चर के लिए विशेष रूप से बिल्ड करने को बताता है।

बिल्ड पूरा होने के बाद, हम llama-server को ग्लोबली उपलब्ध कराएँगे ताकि इसे किसी भी फ़ोल्डर से चलाया जा सके:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

अब जाँचें कि सब कुछ ठीक से काम कर रहा है:

llama-server --version

आपको कुछ इस तरह का आउटपुट दिखना चाहिए:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

बस इतना ही। अब हमारे पास CUDA-सक्षम llama.cpp बिल्ड है जो RTX 5090 और उसकी नेटिव Blackwell NVFP4 सपोर्ट का लाभ उठा सकता है।

2. Qwen3.8-27B NVFP4-MTP मॉडल डाउनलोड करें

अब हम Qwen3.8-27B मॉडल डाउनलोड करेंगे।

सबसे पहले, Hugging Face CLI इंस्टॉल करें:

pip install -U huggingface_hub

एक फ़ोल्डर बनाएँ जहाँ हम मॉडल रखेंगे:

mkdir -p /workspace/models/qwen38

फिर NVFP4-MTP GGUF डाउनलोड करें:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

यह वही वर्ज़न है जिसकी हमें इस सेटअप के लिए ज़रूरत है, क्योंकि यह NVFP4 का उपयोग करता है और MTP सपोर्ट शामिल करता है—जो RTX 5090 पर गति में बड़े सुधार का मुख्य स्रोत है।

3. Qwen3.8-27B सर्वर शुरू करें

अब आता है मज़ेदार हिस्सा। हम Qwen3.8-27B को पूरी तरह GPU पर Flash Attention, 131K कॉन्टेक्स्ट विंडो, और तेज़ जेनरेशन के लिए MTP speculative decoding के साथ सर्व करेंगे। 

चलाएँ:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

यहाँ बहुत से विकल्प हैं, पर इनमें से ज़्यादातर 5090 से सर्वोत्तम प्रदर्शन पाने के लिए हैं।

मुख्य बातें जो जाननी चाहिए:

  • --ctx-size 131072 हमें लगभग 131K की कॉन्टेक्स्ट विंडो देता है।

  • --n-gpu-layers all मॉडल को GPU पर रखता है।

  • --flash-attn on Flash Attention सक्षम करता है।

  • --cache-type-k q8_0 और --cache-type-v q8_0 KV कैश मेमोरी उपयोग को कम करने में मदद करते हैं।

  • --spec-type draft-mtp Qwen3.8 का MTP speculative decoding सक्षम करता है।

  • --spec-draft-n-max 4 नियंत्रित करता है कि MTP एक बार में कितने speculative टोकन जेनरेट कर सकता है।

इस सेटअप के लिए, हम RTX 5090 पर शुरुआती बिंदु के रूप में n-max 4 उपयोग कर रहे हैं। आप 2 (जिसकी सिफारिश इस GGUF के लिए मॉडल कार्ड करता है) या 3 के साथ बाद में प्रयोग कर सकते हैं, क्योंकि सबसे तेज़ सेटिंग आपकी प्रणाली पर थोड़ा भिन्न हो सकती है।

जब llama-server मॉडल लोड करना पूरा कर लेगा, तो Qwen3.8 लोकली http://127.0.0.1:8910 पर उपलब्ध होगा।

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

अब हमारे पास Qwen3.8-27B लोकली चल रहा है। अगला कदम है मॉडल को API और इन-बिल्ट ब्राउज़र इंटरफ़ेस—दोनों के माध्यम से टेस्ट करना।

4. Qwen3.8-27B की गति और कोडिंग प्रदर्शन जाँचें

सर्वर चल रहा हो तो, एक और टर्मिनल खोलें और OpenAI-कम्पैटिबल API को एक टेस्ट अनुरोध भेजें:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

इस टेस्ट में, Qwen3.8-27B ने 2,000 टोकन 122 टोकन/सेकंड की दर से जेनरेट किए, और प्रभावशाली 84.9% MTP स्वीकृति दर प्राप्त हुई। 

llama.cpp में ब्राउज़र इंटरफ़ेस भी शामिल है, इसलिए आप API का उपयोग किए बिना भी मॉडल को टेस्ट कर सकते हैं।

UI देखने के लिए अपने ब्राउज़र में http://127.0.0.1:8910 खोलें।

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

एक अधिक जटिल टेस्ट के लिए, मैंने यह प्रॉम्प्ट इस्तेमाल किया:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

मेरे RTX 5090 पर, मुझे औसतन लगभग 142 टोकन प्रति सेकंड मिल रहे थे, और कभी-कभी जेनरेशन गति लगभग 170 टोकन प्रति सेकंड तक पहुँच रही थी, जो लोकल तौर पर चल रहे 27B मॉडल के लिए अत्यंत तेज़ है। 

image4.png

Qwen3.8-27B ने एक परिष्कृत, पूरी तरह काम करने वाली वेबसाइट जेनरेट की जो तुरंत चल पड़ी। यह मॉडल की कोडिंग क्षमता और लोकल सेटअप की गति—दोनों को जल्दी परखने का अच्छा तरीका है। 

5. Qwen3.8-27B को Pi के साथ इस्तेमाल करें

इस खंड में, हम Qwen3.8-27B को Pi से जोड़ेंगे और इसे एक पूरी तरह लोकल कोडिंग एजेंट के रूप में इस्तेमाल करेंगे।

Pi एक हल्का, टर्मिनल-आधारित कोडिंग एजेंट है जो आपको कमांड लाइन से ही प्रोजेक्ट बनाना, संपादित करना, टेस्ट करना और डिबग करने में मदद कर सकता है।

Pi इंस्टॉल करें:

curl -fsSL https://pi.dev/install.sh | sh

इंस्टॉलर को Node.js और npm की आवश्यकता होती है। यह Pi को आपके ग्लोबल npm प्रीफ़िक्स में इंस्टॉल करता है। यदि आपके पास अभी Node नहीं है, तो पहले nvm या अपने पैकेज मैनेजर से इसे इंस्टॉल करें।

इंस्टॉलेशन पूरा होने के बाद, अपना टर्मिनल रिस्टार्ट करें।

अगला, pi-llama एक्सटेंशन इंस्टॉल करें और Pi को हमारे लोकल llama.cpp सर्वर की ओर पॉइंट करें:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

एक नया प्रोजेक्ट बनाएँ और Pi शुरू करें:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

Pi के अंदर, /model चलाएँ, llama-cpp खोजें और Qwen3.8-27B चुनें।

टेस्टिंग के लिए, मैंने इसे यह प्रॉम्प्ट दिया:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

इसने पूरा प्रोजेक्ट कुछ ही मिनटों में बना दिया। 

Testing the qwen3.8-27b model with Pi coding agent

इसके बाद मैंने इसे सर्वर शुरू करने और फ्रंटएंड व एप्लिकेशन लॉजिक—दोनों का परीक्षण करने के लिए कहा। इसने हर चीज़ के सही ढंग से काम करने का यक़ीन करने के लिए डिबगिंग और टेस्टिंग में अधिक समय लगाया।

web dashboard generated with qwen3.8-27b model and Pi coding agent

जब मैंने स्वयं डैशबोर्ड टेस्ट किया, तो ऐप अच्छी तरह काम कर रहा था, ग्राफ़ शानदार दिख रहे थे, और समग्र अनुभव सुचारु था।

web dashboard generated with qwen3.8-27b model and Pi coding agent

मुख्य कमी थी सटीक UI बदलाव कराना। कई फॉलो-अप प्रॉम्प्ट के बाद यह ठीक-ठीक मेरी इच्छा समझने के बजाय असंबंधित परिवर्तन करने लगा, इसलिए मैंने वहीं रुकना उचित समझा।

अंतिम विचार

Qwen3.8-27B अभी भी काफ़ी नया है, और समुदाय क्वांटाइज़ेशन व speculative decoding के सर्वश्रेष्ठ संयोजन की सक्रिय रूप से तलाश कर रहा है। MTP बहुत अच्छा काम करता है, लेकिन DFlash 2 और DSpark जैसे नए तरीकों का भी परीक्षण हो रहा है, और कुछ उपयोगकर्ता हार्डवेयर व वर्कलोड के आधार पर और भी अधिक गति रिपोर्ट कर रहे हैं। 

Unsloth ने अभी-अभी Qwen3.8-27B के लिए Dynamic v3.0 GGUFs जारी किए हैं, जो पिछले क्वांट्स की तुलना में समान मॉडल आकार पर लगभग 10% अधिक शुद्धता का दावा करते हैं। यदि आप लगभग समान लोकल इन्फ़रेंस सेटअप रखते हुए बेहतर क्वालिटी चाहते हैं, तो Unsloth एक और बहुत दिलचस्प विकल्प बन जाता है। 

फिलहाल, मुझे लगता है कि NVFP4 + MTP + llama.cpp RTX 5090 के लिए सबसे आसान और सबसे तेज़ सेटअप में से एक है। 27B मॉडल से लगभग 140 टोकन प्रति सेकंड पाना, वह भी बड़े कॉन्टेक्स्ट विंडो और वास्तविक कोडिंग एजेंट चलाने की पर्याप्त क्षमता के साथ—काफी प्रभावशाली है। जैसे-जैसे llama.cpp, Unsloth, DFlash 2 और DSpark में सुधार होता जाएगा, यह सेटअप शायद और भी तेज़ हो जाएगा।

Qwen3.8-27B को लोकल चलाने से जुड़े FAQs

क्या Qwen3.8-27B को लोकल चलाने के लिए RTX 5090 की ज़रूरत है?

नहीं। Qwen3.8-27B के मानक 4-बिट GGUF क्वांट्स लगभग 16–19 GB VRAM में फ़िट हो जाते हैं, इसलिए RTX 5080, 4090, या 24 GB Mac भी मॉडल चला लेंगे। इस विशेष सेटअप में RTX 5090 इसलिए महत्वपूर्ण है क्योंकि NVFP4 को Blackwell टेन्सर कोर की ज़रूरत होती है। पुरानी कार्ड्स पर NVFP4 फ़ाइलें चलेंगी, पर वे केवल मेमोरी बचत देंगी, गति बढ़त नहीं।

यह कॉन्फ़िगरेशन वास्तव में कितनी VRAM इस्तेमाल करता है?

NVFP4-MTP GGUF डिस्क पर लगभग 19 GB का है, और कॉन्टेक्स्ट बढ़ने के साथ कुल उपयोग को ऊपर धकेलने वाला KV कैश होता है। बहुत लंबे कॉन्टेक्स्ट पर q8_0 K/V क्वांटाइज़ेशन के साथ, प्रकाशित RTX 5090 रन मध्य-20s GB में आते हैं, इसलिए 32 GB कार्ड आरामदायक है। 24 GB पर आपको --ctx-size को 131072 से काफ़ी नीचे लाना होगा।

MTP speculative decoding क्या करता है, और क्या यह लॉसलेस है?

Qwen3.8 की GGUF में मल्टी-टोकन प्रेडिक्शन लेयर्स पहले से बेक्ड होती हैं, जो बिना किसी दूसरे फ़ाइल के इन-बिल्ट ड्राफ्ट मॉडल की तरह काम करती हैं। ड्राफ्ट हेड एक साथ कई टोकन प्रस्तावित करता है और फुल मॉडल उन्हें सत्यापित करता है, इसलिए स्वीकृत ड्राफ्ट की लागत सामान्य फ़ॉरवर्ड पास के एक अंश जितनी होती है। आउटपुट क्वालिटी अपरिवर्तित रहती है, क्योंकि मुख्य मॉडल जो भी टोकन स्वीकार करता है, वही वह वैसे भी जेनरेट करता।

क्या आपको NVFP4 लेना चाहिए या एक सामान्य Q4_K_M क्वांट?

यदि आपके पास Blackwell GPU है और अधिकतम गति चाहिए तो NVFP4 चुनें; यदि आप Ampere या Ada पर हैं, या प्रति गीगाबाइट आउटपुट क्वालिटी अधिक महत्वपूर्ण है, तो Q4_K_M जैसे मानक GGUF या Unsloth का UD-Q4_K_XL चुनें। llama.cpp में NVFP4 सपोर्ट भी K-quant पाथ से नया है, इसलिए कन्वर्ज़न और टूलिंग के आसपास अधिक खुरदुरे किनारों की उम्मीद रखें।

क्योंकि Qwen3.8-27B एक विज़न मॉडल है, क्या यह सेटअप इमेज संभाल सकता है?

Qwen3.8-27B एक नेटिव विज़न-लैंग्वेज मॉडल है, लेकिन टेक्स्ट-ओनली GGUF कन्वर्ज़न विज़न टावर हटा देते हैं। इमेज का उपयोग करने के लिए, आपको मॉडल के साथ --mmproj के ज़रिए एक मल्टीमॉडल प्रोजेक्टर पास करना होगा—आमतौर पर वही mmproj फ़ाइल जो उसी रिपो में या Unsloth के GGUF रिपो में प्रकाशित की जाती है।

विषय

DataCamp के साथ AI इंजीनियर बनें!

Track

डेवलपर्स के लिए एसोसिएट AI इंजीनियर

26 घंटा
एपीआई और ओपन-सोर्स लाइब्रेरी का उपयोग करके सॉफ़्टवेयर अनुप्रयोगों में AI को एकीकृत करना सीखें। आज ही AI इंजीनियर बनने की अपनी यात्रा शुरू करें!
विस्तृत जानकारी देखेंRight Arrow
कोर्स शुरू करें
और देखेंRight Arrow