Ana içeriğe atla

Qwen3.8-27B’yi NVIDIA RTX 5090’da Yerel Olarak Nasıl Çalıştırırsınız

Qwen3.8-27B’yi Blackwell’e özgü NVFP4 ve MTP spekülatif ayrıştırma ile yerelde çalıştırmayı öğrenin; llama.cpp ile saniyede 170 tokene kadar hız elde edin.
Güncel 25 Ağu 2026  · 6 dk. oku

Yapay Zekâyla Keşfet

ChatGPTClaudePerplexity

Qwen3.8-27B, yerel yapay zekâ için hızla en popüler modellerden biri haline geliyor. Yalnızca 27 milyar parametreye sahip olmasına rağmen, kodlama, akıl yürütme, ajan yetenekleri ve genel amaçlı kıyaslamalarda çok daha büyük modellerle rekabet eden bir performans sunuyor. Hatta bazı alanlarda GLM-5.2 gibi modellere de yaklaşıyor; bu da güçlü yerel donanımlarla deney yapanlar arasında özellikle popüler olmasını sağladı.

RTX 5090, Blackwell mimarisinin NVFP4’ü desteklemesi sayesinde Qwen3.8-27B için özellikle uygun; bu da modelin çıktı kalitesini korurken çok yüksek hızlarda çalışmasına imkân tanır. çoklu token tahmini (MTP) ile yapılan spekülatif ayrıştırma, optimize bir llama.cpp derlemesi ve doğru GGUF model ile birleştirildiğinde, Qwen3.8-27B tek bir RTX 5090 üzerinde saniyede 100’ün oldukça üzerinde token üretebilir.

Bu kılavuzda, RTX 5090 veya başka bir Blackwell GPU’da hız, doğruluk ve uzun bağlam desteği arasında en iyi dengeyi elde etmenin en kolay yollarından birini kuracağız. llama.cpp’yi yerel Blackwell desteğiyle derleyecek, Qwen3.8-27B NVFP4-MTP GGUF’unu indirecek, GPU hızlandırma ve MTP spekülatif ayrıştırma ile çalıştıracak, OpenAI uyumlu API’yi ve yerleşik web arayüzünü test edecek ve son olarak Qwen3.8-27B’yi tamamen yerel bir kodlama ajanı olarak kullanabilmek için Pi’ye bağlayacağız.

1. Blackwell GPU’lar için llama.cpp’yi Kurun

Önce, GPU’nun doğru algılandığından emin olacak ve NVIDIA sürücüsü ile CUDA sürümünü kontrol edeceğiz.

nvidia-smi

RTX 5090 GPU summary

RTX 5090’unuzu, sürücü sürümünü, CUDA sürümünü, GPU belleğini ve mevcut GPU kullanımını görmelisiniz.

Not: Bu kurulum, RTX 5090 gibi NVIDIA Blackwell GPU’larına özeldir. Aşağıdaki derleme, RTX 5090’un kullandığı hesaplama mimarisi olan SM120’yi hedefler.

Şimdi, llama.cpp’nin en son sürümünü CUDA desteğiyle indirip derleyeceğiz.

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

Buradaki kritik kısım -DCMAKE_CUDA_ARCHITECTURES=120. Bu, llama.cpp’ye RTX 5090’un kullandığı Blackwell mimarisi için özel olarak derleme yapmasını söyler.

Derleme bittiğinde, llama-server’ı herhangi bir klasörden çalıştırabilmek için sistem genelinde erişilebilir hâle getireceğiz:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

Şimdi her şeyin çalıştığını kontrol edin:

llama-server --version

Şuna benzer bir çıktı almalısınız:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

Hepsi bu. Artık RTX 5090 ve onun yerel Blackwell NVFP4 desteğinden yararlanabilen CUDA etkin bir llama.cpp derlememiz var.

2. Qwen3.8-27B NVFP4-MTP Modelini İndirin

Şimdi Qwen3.8-27B modelini indireceğiz.

Önce, Hugging Face CLI’ı kurun:

pip install -U huggingface_hub

Modeli saklayacağımız bir klasör oluşturun:

mkdir -p /workspace/models/qwen38

Ardından NVFP4-MTP GGUF’u indirin:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

Bu kurulum için istediğimiz sürüm budur; çünkü NVFP4 kullanır ve MTP desteği içerir. RTX 5090’da hız artışının önemli bir kısmı buradan gelir.

3. Qwen3.8-27B Sunucusunu Başlatın

Şimdi işin eğlenceli kısmına geliyoruz. Qwen3.8-27B’yi Flash Attention, 131K bağlam penceresi ve daha hızlı üretim için MTP spekülatif ayrıştırma ile tamamen GPU üzerinde sunacağız. 

Çalıştırın:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

Burada pek çok seçenek var; ancak çoğu sadece 5090’dan en iyi performansı almak için bulunuyor.

Bilmeniz gereken başlıca seçenekler şunlardır:

  • --ctx-size 131072 yaklaşık 131K’lık bir bağlam penceresi verir.

  • --n-gpu-layers all modeli GPU üzerinde tutar.

  • --flash-attn on Flash Attention’ı etkinleştirir.

  • --cache-type-k q8_0 ve --cache-type-v q8_0 KV önbellek bellek kullanımını azaltmaya yardımcı olur.

  • --spec-type draft-mtp Qwen3.8’in MTP spekülatif ayrıştırmasını etkinleştirir.

  • --spec-draft-n-max 4 MTP’nin aynı anda kaç spekülatif token üretebileceğini kontrol eder.

Bu kurulumda, RTX 5090 için başlangıç noktası olarak n-max 4 kullanıyoruz. Model kartının bu GGUF için önerdiği 2 veya 3 gibi değerlerle daha sonra deneyebilirsiniz; zira en hızlı ayar sisteminize göre biraz değişebilir.

Model yüklemeyi llama-server bitirdiğinde, Qwen3.8 yerelde http://127.0.0.1:8910 adresinden erişilebilir olacaktır.

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

Artık Qwen3.8-27B yerelde çalışıyor. Sırada modeli hem API hem de yerleşik tarayıcı arayüzü üzerinden test etmek var.

4. Qwen3.8-27B’nin Hızını ve Kodlama Performansını Test Edin

Sunucu çalışırken, başka bir terminal açın ve OpenAI uyumlu API’ye bir test isteği gönderin:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

Bu testte, Qwen3.8-27B 2.000 tokenı saniyede 122 token hızla ve etkileyici bir %84,9 MTP kabul oranıyla üretti. 

llama.cpp ayrıca bir tarayıcı arayüzü de içerir; böylece API kullanmadan modeli test edebilirsiniz.

Arayüzü görmek için tarayıcınızda http://127.0.0.1:8910 adresini açın.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

Daha karmaşık bir test için şu istemi kullandım:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

RTX 5090’umda, ortalama saniyede yaklaşık 142 token elde ettim; üretim hızları zaman zaman saniyede 170 token civarına çıktı, ki bu 27B’lik bir modelin yerelde çalışması için olağanüstü hızlı. 

image4.png

Qwen3.8-27B kutudan çıktığı gibi çalışan, cilalı ve eksiksiz bir web sitesi üretti. Bu, hem modelin kodlama yeteneğini hem de yerel kurulumun hızını hızlıca test etmenin iyi bir yoludur. 

5. Qwen3.8-27B’yi Pi ile Kullanın

Bu bölümde, Qwen3.8-27B’yi Pi’ye bağlayacak ve onu tamamen yerel bir kodlama ajanı olarak kullanacağız.

Pi, terminal tabanlı hafif bir kodlama ajanıdır; projeleri doğrudan komut satırından oluşturmanıza, düzenlemenize, test etmenize ve hata ayıklamanıza yardımcı olabilir.

Pi’yi şu komutla kurun:

curl -fsSL https://pi.dev/install.sh | sh

Yükleyici Node.js ve npm gerektirir. Pi’yi global npm önekine kurar. Node yoksa önce nvm veya paket yöneticinizle kurun.

Kurulum tamamlandığında terminalinizi yeniden başlatın.

Ardından pi-llama uzantısını kurun ve Pi’yi yerel llama.cpp sunucumuza yönlendirin:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

Yeni bir proje oluşturun ve Pi’yi başlatın:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

Pi içinde /model komutunu çalıştırın, llama-cpp’yi arayın ve Qwen3.8-27B’yi seçin.

Test için şu istemi verdim:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

Tüm projeyi birkaç dakika içinde oluşturdu. 

Testing the qwen3.8-27b model with Pi coding agent

Sonrasında sunucuyu başlatmasını ve hem ön yüzü hem de uygulama mantığını test etmesini istedim. Her şeyin düzgün çalıştığından emin olmak için hata ayıklama ve testlere daha fazla zaman harcadı.

web dashboard generated with qwen3.8-27b model and Pi coding agent

Panoyu kendim test ettiğimde, uygulama iyi çalıştı, grafikler harika görünüyordu ve genel deneyim akıcıydı.

web dashboard generated with qwen3.8-27b model and Pi coding agent

Başlıca zayıflık, tam isabetli UI değişiklikleri yapmasıydı. Birkaç takip isteminden sonra tam olarak ne istediğimi anlamak yerine ilgisiz değişiklikler yapmaya başladı; bu yüzden sonunda orada bıraktım.

Son Düşünceler

Qwen3.8-27B hâlâ çok yeni ve topluluk en iyi quantization ve spekülatif ayrıştırma kombinasyonunu aktif olarak keşfediyor. MTP son derece iyi çalışıyor; ancak DFlash 2 ve DSpark gibi daha yeni yaklaşımlar da test ediliyor; bazı kullanıcılar donanım ve iş yüküne bağlı olarak daha yüksek hızlar bildirdi. 

Unsloth ayrıca Qwen3.8-27B için Dynamic v3.0 GGUF’leri yeni yayımladı ve önceki quantlarına göre aynı model boyutunda yaklaşık %10 daha yüksek doğruluk iddia ediyor. Bu da, benzer yerel çıkarım kurulumunu korurken daha iyi kalite istiyorsanız Unsloth’u çok ilgi çekici bir seçenek hâline getiriyor. 

Şimdilik, bence NVFP4 + MTP + llama.cpp, RTX 5090 için en kolay ve en hızlı kurulumlardan biri. 27B bir modelden, geniş bir bağlam penceresini korurken ve gerçek bir kodlama ajanını çalıştıracak yeterlilikte olup, saniyede yaklaşık 140 token elde etmek etkileyici. llama.cpp, Unsloth, DFlash 2 ve DSpark geliştikçe kurulum muhtemelen daha da hızlanacaktır.

Qwen3.8-27B’yi Yerelde Çalıştırma Hakkında SSS

Qwen3.8-27B’yi yerelde çalıştırmak için RTX 5090’a ihtiyaç var mı?

Hayır. Qwen3.8-27B’nin standart 4-bit GGUF quantları kabaca 16–19 GB VRAM’e sığar; dolayısıyla bir RTX 5080, 4090 veya 24 GB’lık bir Mac modeli çalıştırır. Bu özel kurulumda RTX 5090 önemlidir çünkü NVFP4, Blackwell tensör çekirdeklerine ihtiyaç duyar. Daha eski kartlarda NVFP4 dosyaları çalışır ancak hız artışı değil yalnızca bellek tasarrufu sağlar.

Bu yapılandırma gerçekte ne kadar VRAM kullanır?

NVFP4-MTP GGUF diskte yaklaşık 19 GB’tır ve toplam kullanım, bağlam büyüdükçe KV önbelleğiyle artar. Çok uzun bağlamda q8_0 K/V quantization ile yayımlanan RTX 5090 çalıştırmaları orta 20’ler GB seviyesine iner; bu yüzden 32 GB’lık bir kart rahattır. 24 GB’ta --ctx-size’ı 131072’nin oldukça altına düşürmeniz gerekir.

MTP spekülatif ayrıştırma ne yapar, kayıpsız mıdır?

Qwen3.8, GGUF içine gömülü çoklu token tahmin katmanlarıyla (MTP) gelir; bu katmanlar ikinci bir dosyaya gerek olmadan yerleşik bir taslak model gibi davranır. Taslak kafa aynı anda birkaç token önerir ve tam model bunları doğrular; kabul edilen taslakların maliyeti normal bir ileri geçişin küçük bir kısmıdır. Çıktı kalitesi değişmez; çünkü ana modelin kabul ettiği her token, zaten üreteceği tokendir.

NVFP4 mü yoksa normal Q4_K_M quant mı kullanılmalı?

Blackwell GPU’nuz varsa ve maksimum hızı istiyorsanız NVFP4’ü seçin; Ampere veya Ada kullanıyorsanız ya da gigabayt başına çıktı kalitesine daha çok önem veriyorsanız Q4_K_M gibi standart bir GGUF veya Unsloth’un UD-Q4_K_XL sürümünü seçin. llama.cpp’deki NVFP4 desteği, K-quant yoluna göre daha yenidir; bu yüzden dönüştürme ve araçlar etrafında daha fazla pürüz bekleyin.

Qwen3.8-27B bir görsel model olduğuna göre bu kurulum görselleri işleyebilir mi?

Qwen3.8-27B yerel olarak bir görme-dil modelidir; ancak yalnızca metin GGUF dönüşümleri görsel katmanı çıkarır. Görselleri kullanmak için, modelle birlikte genellikle aynı depoda veya Unsloth’un GGUF deposunda yayımlanan mmproj dosyasını --mmproj ile geçirmeniz gerekir.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Sertifikalı bir veri bilimcisi olarak, yenilikçi makine öğrenimi uygulamaları oluşturmak için en son teknolojileri kullanmaya büyük ilgi duyuyorum. Konuşma tanıma, veri analizi ve raporlama, MLOps, konuşma yapay zekası ve NLP alanlarında güçlü bir geçmişe sahip olarak, gerçek bir etki yaratabilecek akıllı sistemler geliştirme becerilerimi geliştirdim. Teknik uzmanlığımın yanı sıra, karmaşık kavramları açık ve özlü bir dille ifade etme yeteneğine sahip, becerikli bir iletişimciyim. Sonuç olarak, veri bilimi konusunda aranan bir blog yazarı oldum ve giderek büyüyen veri profesyonelleri topluluğuyla görüşlerimi ve deneyimlerimi paylaşıyorum. Şu anda, içerik oluşturma ve düzenlemeye odaklanıyorum. Büyük dil modelleriyle çalışarak, hem işletmelerin hem de bireylerin verilerinden en iyi şekilde yararlanmalarına yardımcı olabilecek güçlü ve ilgi çekici içerikler geliştiriyorum.

Konular

DataCamp ile Yapay Zekâ Mühendisi Olun!

Program

Geliştiriciler için Yardımcı Yapay Zeka Mühendisi

26 sa
API'leri ve açık kaynak kütüphanelerini kullanarak yapay zekayı yazılım uygulamalarına nasıl entegre edeceğinizi öğrenin. Yapay Zeka Mühendisi olma yolculuğunuza bugün başlayın!
Ayrıntıları GörRight Arrow
Kursa Başla
Devamını GörRight Arrow