Hoppa till huvudinnehållet

Så kör du Qwen3.8-27B lokalt på en NVIDIA RTX 5090

Lär dig köra Qwen3.8-27B lokalt med Blackwell-native NVFP4 och MTP spekulativ avkodning, och nå upp till 170 tokens per sekund med llama.cpp.
Uppdaterad 25 aug. 2026  · 6 min läsa

Utforska med AI

ChatGPTClaudePerplexity

Qwen3.8-27B håller snabbt på att bli en av de mest populära modellerna för lokal AI. Trots att den bara har 27 miljarder parametrar levererar den prestanda som kan mäta sig med betydligt större modeller inom kodning, resonemang, agentbeteende och allmänna benchmarktester. Den närmar sig till och med modeller som GLM-5.2 på flera områden, vilket har gjort den särskilt populär bland dem som experimenterar med kraftfull lokal hårdvara.

RTX 5090 passar särskilt bra ihop med Qwen3.8-27B eftersom Blackwell-arkitekturen har stöd för NVFP4, vilket gör att modellen kan köras i mycket höga hastigheter med bibehållen hög outputkvalitet. I kombination med spekulativ avkodning via multi-token prediction (MTP), en optimerad llama.cpp-build och rätt GGUF-modell kan Qwen3.8-27B leverera långt över 100 tokens per sekund på en enda RTX 5090.

I den här guiden sätter vi upp det som enligt mig är ett av de enklaste sätten att få bästa balans mellan hastighet, noggrannhet och stöd för långa kontexter på en RTX 5090 eller ett annat Blackwell-GPU. Vi kommer att kompilera llama.cpp med inbyggt Blackwell-stöd, ladda ner Qwen3.8-27B NVFP4-MTP-GGUF, köra den med GPU-acceleration och MTP spekulativ avkodning, testa det OpenAI-kompatibla API:et och det inbyggda webbgränssnittet och till sist koppla den till Pi så att vi kan använda Qwen3.8-27B som en helt lokal kodningsagent.

1. Ställ in llama.cpp för Blackwell-GPU:er

Först ser vi till att GPU:n identifieras korrekt och kontrollerar NVIDIA-drivrutin och CUDA-version.

nvidia-smi

RTX 5090 GPU summary

Du bör se din RTX 5090, drivrutinsversion, CUDA-version, GPU-minne och aktuell GPU-användning.

Obs: Denna setup är specifikt för NVIDIA Blackwell-GPU:er, såsom RTX 5090. Bygget nedan riktar in sig på SM120, vilket är beräkningsarkitekturen som används av RTX 5090.

Därefter laddar vi ner och kompilerar den senaste versionen av llama.cpp med CUDA-stöd.

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

Det viktiga här är -DCMAKE_CUDA_ARCHITECTURES=120. Detta talar om för llama.cpp att bygga specifikt för Blackwell-arkitekturen som används av RTX 5090.

När bygget är klart gör vi llama-server tillgängligt globalt så att vi kan köra det från valfri mapp:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

Kontrollera nu att allt fungerar:

llama-server --version

Du bör få utdata liknande:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

Det var allt. Vi har nu en CUDA-aktiverad llama.cpp-build som kan dra nytta av RTX 5090 och dess inbyggda Blackwell NVFP4-stöd.

2. Ladda ner Qwen3.8-27B NVFP4-MTP-modellen

Nu laddar vi ner Qwen3.8-27B-modellen.

Installera först Hugging Face CLI:

pip install -U huggingface_hub

Skapa en mapp där vi ska lägga modellen:

mkdir -p /workspace/models/qwen38

Ladda sedan ner NVFP4-MTP GGUF:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

Detta är versionen vi vill ha för den här setupen eftersom den använder NVFP4 och inkluderar MTP-stöd, vilket är där mycket av hastighetsförbättringen på RTX 5090 kommer ifrån.

3. Starta Qwen3.8-27B-server

Nu kommer den roliga delen. Vi kommer att serva Qwen3.8-27B helt på GPU:n med Flash Attention, ett 131K kontextfönster och MTP spekulativ avkodning för snabbare generering. 

Kör:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

Det finns många flaggor här, men de flesta finns där för att få ut bästa prestanda ur 5090:n.

De viktigaste att känna till är:

  • --ctx-size 131072 ger oss ungefär ett 131K kontextfönster.

  • --n-gpu-layers all håller modellen på GPU:n.

  • --flash-attn on aktiverar Flash Attention.

  • --cache-type-k q8_0 och --cache-type-v q8_0 hjälper till att minska KV-cacheminnet.

  • --spec-type draft-mtp aktiverar Qwen3.8:s MTP spekulativa avkodning.

  • --spec-draft-n-max 4 styr hur många spekulativa tokens MTP kan generera åt gången.

För den här setupen använder vi n-max 4 som startpunkt för en RTX 5090. Du kan experimentera med värden som 2 (vilket modellkortet rekommenderar för denna GGUF) eller 3 senare, eftersom den snabbaste inställningen kan variera något beroende på ditt system.

När llama-server har laddat modellen klart kommer Qwen3.8 att vara tillgänglig lokalt på http://127.0.0.1:8910.

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

Vi har nu Qwen3.8-27B igång lokalt. Nästa steg är att testa modellen via både API:et och det inbyggda webbläsargränssnittet.

4. Testa Qwen3.8-27B:s hastighet och kodningsprestanda

Med servern igång, öppna en annan terminal och skicka en testråbegäran till det OpenAI-kompatibla API:et:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

I detta test genererade Qwen3.8-27B 2 000 tokens i 122 tokens/s med en imponerande MTP-acceptansgrad på 84,9%. 

llama.cpp inkluderar även ett webbläsargränssnitt, så du kan testa modellen utan att använda API:et.

Öppna http://127.0.0.1:8910 i din webbläsare för att se gränssnittet.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

För ett mer komplext test använde jag denna prompt:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

På min RTX 5090 låg jag runt 142 tokens per sekund i snitt, med toppar på omkring 170 tokens per sekund, vilket är extremt snabbt för en 27B-modell som körs lokalt. 

image4.png

Qwen3.8-27B genererade en välputsad, fullt fungerande webbplats som körde direkt. Det här är ett bra sätt att snabbt testa både modellens kodningsförmåga och hastigheten i den lokala setupen. 

5. Använd Qwen3.8-27B med Pi

I det här avsnittet kopplar vi Qwen3.8-27B till Pi och använder den som en helt lokal kodningsagent.

Pi är en lättvikts, terminalbaserad kodningsagent som kan hjälpa dig att bygga, redigera, testa och felsöka projekt direkt från kommandoraden.

Installera Pi med:

curl -fsSL https://pi.dev/install.sh | sh

Installationsprogrammet kräver Node.js och npm. Det installerar Pi i ditt globala npm-prefix. Om du inte har Node ännu, installera det först med nvm eller din pakethanterare.

När installationen är klar, starta om din terminal.

Installera sedan pi-llama-tillägget och peka Pi mot vår lokala llama.cpp-server:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

Skapa ett nytt projekt och starta Pi:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

Inne i Pi, kör /model, sök efter llama-cpp och välj Qwen3.8-27B.

För test gav jag den denna prompt:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

Den byggde hela projektet på några minuter. 

Testing the qwen3.8-27b model with Pi coding agent

Jag bad den sedan att starta servern och testa både frontend och applikationslogik. Den lade mer tid på felsökning och testning för att säkerställa att allt fungerade som det skulle.

web dashboard generated with qwen3.8-27b model and Pi coding agent

När jag testade instrumentpanelen själv fungerade appen bra, graferna såg utmärkt ut och helhetsupplevelsen var smidig.

web dashboard generated with qwen3.8-27b model and Pi coding agent

Den största svagheten var att göra precisa UI-ändringar. Efter flera följdfrågor började den göra orelaterade ändringar istället för att förstå exakt vad jag ville, så jag slutade till slut där.

Avslutande tankar

Qwen3.8-27B är fortfarande väldigt ny, och communityn håller aktivt på att hitta den bästa kombinationen av kvantisering och spekulativ avkodning. MTP fungerar mycket bra, men nyare metoder som DFlash 2 och DSpark testas också, och vissa användare rapporterar ännu högre hastigheter beroende på hårdvara och arbetsbelastning. 

Unsloth har också precis släppt Dynamic v3.0 GGUF:er för Qwen3.8-27B, med anspråk på cirka 10% högre noggrannhet vid samma modellstorlek jämfört med deras tidigare kvantiseringar. Detta gör Unsloth till ett annat mycket intressant alternativ om du vill ha bättre kvalitet samtidigt som du behåller ungefär samma lokala inferenssetup. 

För tillfället tycker jag att NVFP4 + MTP + llama.cpp är en av de enklaste och snabbaste setup:erna för en RTX 5090. Att få omkring 140 tokens per sekund från en 27B-modell samtidigt som man har ett stort kontextfönster och tillräcklig kapacitet för att köra en verklig kodningsagent är imponerande. Setupen lär bli ännu snabbare i takt med att llama.cpp, Unsloth, DFlash 2 och DSpark fortsätter att förbättras.

Vanliga frågor om att köra Qwen3.8-27B lokalt

Behöver du en RTX 5090 för att köra Qwen3.8-27B lokalt?

Nej. Standard 4-bitars GGUF-kvantiseringar av Qwen3.8-27B ryms i ungefär 16–19 GB VRAM, så en RTX 5080, en 4090 eller en Mac med 24 GB kommer att köra modellen. RTX 5090 är viktig för just denna setup eftersom NVFP4 kräver Blackwell tensor-kärnor. På äldre kort fungerar NVFP4-filer men ger bara minnesbesparingar, inte hastighetsökningen.

Hur mycket VRAM använder den här konfigurationen i praktiken?

NVFP4-MTP GGUF är cirka 19 GB på disk, och KV-cachen är det som driver upp den totala användningen när kontexten växer. Med q8_0 K/V-kvantisering vid mycket långa kontexter hamnar publicerade RTX 5090-körningar på drygt 20 GB, så ett 32 GB-kort är bekvämt. Med 24 GB behöver du sänka --ctx-size rejält under 131072.

Vad gör MTP spekulativ avkodning, och är den förlustfri?

Qwen3.8 levereras med multi-token prediction-lager inbakade i GGUF, som fungerar som en inbyggd utkastmodell utan att en andra fil behövs. Utkasthuvudet föreslår flera tokens på en gång, och fullmodellen verifierar dem, så accepterade utkast kostar en bråkdel av ett normalt framåtpass. Outputkvaliteten är oförändrad, eftersom varje token som huvudmodellen accepterar är en den ändå skulle ha producerat.

Ska du använda NVFP4 eller en vanlig Q4_K_M-kvantisering?

Välj NVFP4 om du har en Blackwell-GPU och vill ha maximal hastighet; välj en vanlig GGUF som Q4_K_M eller Unsloths UD-Q4_K_XL om du kör på Ampere eller Ada, eller om du bryr dig mer om outputkvalitet per gigabyte. NVFP4-stödet i llama.cpp är också nyare än K-quant-vägen, så räkna med fler barnsjukdomar kring konvertering och verktyg.

Klarar denna setup bilder, eftersom Qwen3.8-27B är en visionmodell?

Qwen3.8-27B är en inbyggd vision-language-modell, men text-only GGUF-konverteringar plockar bort vision-tornet. För att använda bilder behöver du skicka med en multimodal projektor tillsammans med modellen via --mmproj, oftast mmproj-filen som publiceras i samma repo eller i Unsloths GGUF-repo.

Ämnen

Bli AI-ingenjör med DataCamp!

track

Associate AI Engineer för utvecklare

26 timmar
Lär dig hur du integrerar AI i mjukvaruapplikationer med hjälp av API:er och bibliotek med öppen källkod. Börja din resa mot att bli AI Engineer idag!
Se detaljerRight Arrow
Starta Kursen
Se merRight Arrow