Ana içeriğe atla

Qwen3.8-27B’yi NVIDIA RTX 5090’da Yerel Olarak Nasıl Çalıştırırsınız

Qwen3.8-27B’yi Blackwell’e özgü NVFP4 ve MTP spekülatif kod çözme ile yerelde nasıl çalıştıracağınızı öğrenin; llama.cpp ile saniyede 170 tokene kadar hızlara ulaşın.
Güncel 31 Ağu 2026  · 6 dk. oku

Yapay Zekâyla Keşfet

ChatGPTClaudePerplexity

Qwen3.8-27B, yerel yapay zekâ için hızla en popüler modellerden biri haline geliyor. Sadece 27 milyar parametreye sahip olmasına rağmen, kodlama, akıl yürütme, ajan yetenekleri ve genel amaçlı kıyaslamalarda çok büyük modellerle yarışan bir performans sunuyor. Hatta bazı alanlarda GLM-5.2 gibi modellere yaklaşarak, güçlü yerel donanımlarla deney yapanlar arasında özellikle popüler hale geldi.

RTX 5090, Blackwell mimarisinin NVFP4’ü desteklemesi sayesinde Qwen3.8-27B’ye özel olarak uygundur; bu da modelin yüksek çıktı kalitesini korurken çok yüksek hızlarda çalışmasını sağlar. çoklu token tahmini (MTP) ile yapılan spekülatif kod çözme, optimize edilmiş bir llama.cpp derlemesi ve doğru GGUF model ile birleştirildiğinde, Qwen3.8-27B tek bir RTX 5090 üzerinde saniyede 100’ün oldukça üzerinde token üretebilir.

Bu kılavuzda, RTX 5090 veya başka bir Blackwell GPU’da hız, doğruluk ve uzun bağlam desteği arasında en iyi dengeyi kurmanın en kolay yollarından birini kuracağız. llama.cpp’yi yerel Blackwell desteğiyle derleyecek, Qwen3.8-27B NVFP4-MTP GGUF’unu indirecek, GPU hızlandırması ve MTP spekülatif kod çözme ile çalıştıracak, OpenAI uyumlu API’yi ve yerleşik web arayüzünü test edecek ve son olarak Pi’ye bağlayarak Qwen3.8-27B’yi tamamen yerel bir kodlama ajanı olarak kullanacağız.

Ayrıca yeni Qwen4 ön izlemesi olan Qwen3.8-Flash-Next kılavuzumuza ve Qwen3.8-Flash-Next’i yerelde çalıştırma eğitimine de göz atmanızı öneririm.

1. Blackwell GPU’lar için llama.cpp’yi Kurun

Önce GPU’nun doğru algılandığından emin olacak ve NVIDIA sürücüsünü ile CUDA sürümünü kontrol edeceğiz.

nvidia-smi

RTX 5090 GPU summary

RTX 5090’unuzu, sürüm numarasını, CUDA sürümünü, GPU belleğini ve mevcut GPU kullanımını görmelisiniz.

Not: Bu kurulum, RTX 5090 gibi NVIDIA Blackwell GPU’larına özeldir. Aşağıdaki derleme, RTX 5090’un kullandığı hesaplama mimarisi olan SM120’yi hedefler.

Sonraki adımda, llama.cpp’nin en son sürümünü CUDA desteğiyle indirip derleyeceğiz.

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

Buradaki kritik kısım -DCMAKE_CUDA_ARCHITECTURES=120. Bu, llama.cpp’ye RTX 5090’un kullandığı Blackwell mimarisi için özel olarak derleme yapmasını söyler.

Derleme tamamlandığında, llama-server’ı global olarak kullanılabilir hale getirip herhangi bir klasörden çalıştıracağız:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

Şimdi her şeyin çalıştığını kontrol edin:

llama-server --version

Şuna benzer bir çıktı almalısınız:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

Bu kadar. Artık RTX 5090 ve yerel Blackwell NVFP4 desteğinden yararlanabilen CUDA etkin bir llama.cpp derlememiz var.

2. Qwen3.8-27B NVFP4-MTP Modelini İndirin

Şimdi Qwen3.8-27B modelini indireceğiz.

Önce Hugging Face CLI’ı kurun:

pip install -U huggingface_hub

Modeli saklayacağımız bir klasör oluşturun:

mkdir -p /workspace/models/qwen38

Ardından NVFP4-MTP GGUF’u indirin:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

Bu kurulum için istediğimiz sürüm budur; çünkü NVFP4 kullanır ve MTP desteğini içerir. RTX 5090’da hız artışının büyük kısmı buradan gelir.

3. Qwen3.8-27B Sunucusunu Başlatın

Şimdi işin eğlenceli kısmına geldik. Qwen3.8-27B’yi tamamen GPU üzerinde, Flash Attention, 131K bağlam penceresi ve daha hızlı üretim için MTP spekülatif kod çözme ile sunacağız. 

Şunu çalıştırın:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

Burada çok sayıda seçenek var; ancak çoğu, 5090’dan en iyi performansı almak için bulunuyor.

Bilmeniz gereken başlıca seçenekler:

  • --ctx-size 131072 bize yaklaşık 131K’lık bir bağlam penceresi verir.

  • --n-gpu-layers all modeli GPU üzerinde tutar.

  • --flash-attn on Flash Attention’ı etkinleştirir.

  • --cache-type-k q8_0 ve --cache-type-v q8_0 KV önbellek bellek kullanımını azaltmaya yardımcı olur.

  • --spec-type draft-mtp Qwen3.8’in MTP spekülatif kod çözmesini etkinleştirir.

  • --spec-draft-n-max 4 MTP’nin aynı anda kaç spekülatif token üretebileceğini kontrol eder.

Bu kurulumda, RTX 5090 için başlangıç noktası olarak n-max 4 kullanıyoruz. Model kartının bu GGUF için önerdiği 2 veya daha sonra 3 gibi değerlerle deney yapabilirsiniz; zira en hızlı ayar sisteminize göre biraz değişebilir.

Model yüklemesini llama-server tamamladığında, Qwen3.8 yerelde http://127.0.0.1:8910 adresinde kullanılabilir olacaktır.

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

Artık Qwen3.8-27B yerelde çalışıyor. Sırada modeli hem API hem de yerleşik tarayıcı arayüzü üzerinden test etmek var.

4. Qwen3.8-27B’nin Hızını ve Kodlama Performansını Test Edin

Sunucu çalışırken başka bir terminal açın ve OpenAI uyumlu API’ye bir test isteği gönderin:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

Bu testte Qwen3.8-27B, etkileyici bir %84,9 MTP kabul oranıyla saniyede 122 token hızında 2.000 token üretti. 

llama.cpp ayrıca bir tarayıcı arayüzü içerir; böylece API kullanmadan da modeli test edebilirsiniz.

http://127.0.0.1:8910 adresini tarayıcınızda açarak arayüzü görebilirsiniz.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

Daha karmaşık bir test için şu istemi kullandım:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

RTX 5090’umda ortalama saniyede yaklaşık 142 token alıyordum; üretim hızları zaman zaman saniyede 170 tokene yaklaşıyordu ki bu, yerelde çalışan 27B bir model için son derece hızlı. 

image4.png

Qwen3.8-27B, kutudan çıktığı gibi çalışan, pürüzsüz ve tam işlevli bir web sitesi üretti. Bu, hem modelin kodlama yeteneğini hem de yerel kurulumun hızını hızlıca test etmenin iyi bir yoludur. 

5. Qwen3.8-27B’yi Pi ile Kullanın

Bu bölümde, Qwen3.8-27B’yi Pi’ye bağlayacak ve onu tamamen yerel bir kodlama ajanı olarak kullanacağız.

Pi, komut satırından doğrudan proje oluşturma, düzenleme, test etme ve hata ayıklamada yardımcı olabilen hafif bir terminal tabanlı kodlama ajanıdır.

Pi’yi şununla kurun:

curl -fsSL https://pi.dev/install.sh | sh

Yükleyici Node.js ve npm gerektirir. Pi’yi global npm önekinize kurar. Henüz Node yoksa, önce nvm veya paket yöneticinizle kurun.

Kurulum tamamlandığında terminalinizi yeniden başlatın.

Sonraki adımda pi-llama uzantısını kurup Pi’yi yerel llama.cpp sunucumuza yönlendirin:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

Yeni bir proje oluşturup Pi’yi başlatın:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

Pi içinde /model komutunu çalıştırın, llama-cpp’yi arayın ve Qwen3.8-27B’yi seçin.

Test için şu istemi verdim:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

Tüm projeyi birkaç dakika içinde oluşturdu. 

Testing the qwen3.8-27b model with Pi coding agent

Daha sonra sunucuyu başlatmasını, hem ön yüzü hem de uygulama mantığını test etmesini istedim. Her şeyin düzgün çalıştığından emin olmak için hata ayıklama ve test etmeye daha fazla zaman harcadı.

web dashboard generated with qwen3.8-27b model and Pi coding agent

Panoyu kendim test ettiğimde, uygulama iyi çalıştı, grafikler harika görünüyordu ve genel deneyim pürüzsüzdü.

web dashboard generated with qwen3.8-27b model and Pi coding agent

Başlıca zayıflık, hassas UI değişiklikleriydi. Birkaç takip isteminden sonra, tam olarak ne istediğimi anlamak yerine alakasız değişiklikler yapmaya başladı; bu yüzden sonunda orada durdum.

Son Düşünceler

Qwen3.8-27B hâlâ çok yeni ve topluluk, en iyi niceleme ile spekülatif kod çözme kombinasyonunu aktif olarak keşfediyor. MTP son derece iyi çalışıyor; ancak DFlash 2 ve DSpark gibi daha yeni yaklaşımlar da test ediliyor ve bazı kullanıcılar donanım ve iş yüküne bağlı olarak daha yüksek hızlar bildiriyor. 

Unsloth ayrıca Qwen3.8-27B için Dynamic v3.0 GGUF’leri yeni yayımladı ve önceki nicelemelerine kıyasla aynı model boyutunda yaklaşık %10 daha yüksek doğruluk iddia ediyor. Bu da, benzer yerel çıkarım kurulumunu korurken daha iyi kalite isterseniz Unsloth’u oldukça ilgi çekici bir seçenek haline getiriyor. 

Şimdilik NVFP4 + MTP + llama.cpp’nin RTX 5090 için en kolay ve en hızlı kurulumlardan biri olduğunu düşünüyorum. 27B bir modelden yaklaşık saniyede 140 token alırken, büyük bir bağlam penceresine ve gerçek bir kodlama ajanını çalıştıracak yeterli yeteneğe sahip olmak etkileyici. llama.cpp, Unsloth, DFlash 2 ve DSpark geliştikçe bu kurulum muhtemelen daha da hızlanacaktır.

Qwen3.8-27B’yi Yerelde Çalıştırma Hakkında SSS

Qwen3.8-27B’yi yerelde çalıştırmak için RTX 5090’a ihtiyacınız var mı?

Hayır. Qwen3.8-27B’nin standart 4 bit GGUF nicelemeleri yaklaşık 16–19 GB VRAM’e sığar; dolayısıyla bir RTX 5080, 4090 veya 24 GB’lık bir Mac modeli çalıştıracaktır. Bu özel kurulum için RTX 5090 önemlidir; çünkü NVFP4, Blackwell tensör çekirdeklerini gerektirir. Daha eski kartlarda NVFP4 dosyaları çalışır ancak yalnızca bellek tasarrufu sağlar, hız artışı sağlamaz.

Bu yapılandırma gerçekte ne kadar VRAM kullanır?

NVFP4-MTP GGUF diskte yaklaşık 19 GB’tır ve bağlam büyüdükçe toplamı artıran şey KV önbellektir. Çok uzun bağlamda q8_0 K/V nicelemesiyle, yayımlanan RTX 5090 çalıştırmaları orta 20 GB’larda seyreder; bu nedenle 32 GB’lık bir kart rahattır. 24 GB’ta --ctx-size’ı 131072’nin epey altına düşürmeniz gerekir.

MTP spekülatif kod çözme ne yapar ve kayıpsız mıdır?

Qwen3.8, GGUF içine gömülü çoklu token tahmin katmanlarıyla gelir; bu katmanlar, ikinci bir dosyaya gerek olmadan yerleşik bir taslak model gibi davranır. Taslak kafa bir seferde birkaç token önerir ve tam model bunları doğrular; bu nedenle kabul edilen taslakların maliyeti normal bir ileri geçirime kıyasla çok daha düşüktür. Çıktı kalitesi değişmez; çünkü ana modelin kabul ettiği her token, zaten üreteceği bir tokendir.

NVFP4 mü yoksa normal bir Q4_K_M nicelemesi mi kullanmalısınız?

Blackwell GPU’nuz varsa ve maksimum hızı istiyorsanız NVFP4’ü seçin; Ampere veya Ada üzerindeyseniz ya da gigabayt başına çıktı kalitesine daha çok önem veriyorsanız Q4_K_M gibi standart bir GGUF veya Unsloth’un UD-Q4_K_XL’ini seçin. llama.cpp’de NVFP4 desteği de K-quant yoluna göre daha yenidir; bu nedenle dönüştürme ve araçlarda daha fazla pürüz bekleyin.

Qwen3.8-27B bir görsel model olduğuna göre bu kurulum görselleri işleyebilir mi?

Qwen3.8-27B yerel olarak görsel-dil modelidir; ancak yalnızca metin GGUF dönüşümleri görsel katmanı kaldırır. Görselleri kullanmak için modele --mmproj ile bir multimodal projektör geçirmeniz gerekir; genellikle aynı depoda veya Unsloth’un GGUF deposunda yayımlanan mmproj dosyası kullanılır.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Sertifikalı bir veri bilimcisi olarak, yenilikçi makine öğrenimi uygulamaları oluşturmak için en son teknolojileri kullanmaya büyük ilgi duyuyorum. Konuşma tanıma, veri analizi ve raporlama, MLOps, konuşma yapay zekası ve NLP alanlarında güçlü bir geçmişe sahip olarak, gerçek bir etki yaratabilecek akıllı sistemler geliştirme becerilerimi geliştirdim. Teknik uzmanlığımın yanı sıra, karmaşık kavramları açık ve özlü bir dille ifade etme yeteneğine sahip, becerikli bir iletişimciyim. Sonuç olarak, veri bilimi konusunda aranan bir blog yazarı oldum ve giderek büyüyen veri profesyonelleri topluluğuyla görüşlerimi ve deneyimlerimi paylaşıyorum. Şu anda, içerik oluşturma ve düzenlemeye odaklanıyorum. Büyük dil modelleriyle çalışarak, hem işletmelerin hem de bireylerin verilerinden en iyi şekilde yararlanmalarına yardımcı olabilecek güçlü ve ilgi çekici içerikler geliştiriyorum.

Konular
Yapay Zeka

DataCamp ile Bir Yapay Zekâ Mühendisi Olun!

Program

Geliştiriciler için Yardımcı Yapay Zeka Mühendisi

26 sa
API'leri ve açık kaynak kütüphanelerini kullanarak yapay zekayı yazılım uygulamalarına nasıl entegre edeceğinizi öğrenin. Yapay Zeka Mühendisi olma yolculuğunuza bugün başlayın!
Ayrıntıları GörRight Arrow
Kursa Başla
Devamını GörRight Arrow
İlgili

blog

Hızlı Sevkiyat İçin Pratik Vibe Kodlama Teknoloji Yığını

Ön uç, arka uç, veritabanları, kimlik doğrulama, depolama, e-posta, test, dağıtım ve izleme için en iyi araçları keşfedin.
Abid Ali Awan's photo

Abid Ali Awan

14 dk.

blog

2026’da En Popüler 40 Yazılım Mühendisi Mülakat Sorusu

Algoritmalar, sistem tasarımı ve davranışsal senaryoları kapsayan bu temel sorularla teknik mülakat sürecine hakim olun. Uzman cevapları, kod örnekleri ve kanıtlanmış hazırlık stratejileri edinin.
Dario Radečić's photo

Dario Radečić

15 dk.

Eğitim

Python'da Listeyi String'e Nasıl Dönüştürürsünüz

Bu hızlı eğitimde, Python'da bir listeyi string'e nasıl dönüştüreceğinizi öğrenin.
Adel Nehme's photo

Adel Nehme

Eğitim

.gitignore Nasıl Kullanılır: Örneklerle Pratik Bir Giriş

Git deponuzu temiz tutmak için .gitignore’u nasıl kullanacağınızı öğrenin. Bu eğitim; temelleri, yaygın kullanım durumlarını ve başlamanıza yardımcı olacak pratik örnekleri kapsar!
Kurtis Pykes 's photo

Kurtis Pykes

8 dk.

Devamını GörDevamını Gör