Program
Qwen3.8-27B, yerel yapay zekâ için hızla en popüler modellerden biri haline geliyor. Yalnızca 27 milyar parametreye sahip olmasına rağmen, kodlama, akıl yürütme, ajan yetenekleri ve genel amaçlı kıyaslamalarda çok daha büyük modellerle rekabet eden bir performans sunuyor. Hatta bazı alanlarda GLM-5.2 gibi modellere de yaklaşıyor; bu da güçlü yerel donanımlarla deney yapanlar arasında özellikle popüler olmasını sağladı.
RTX 5090, Blackwell mimarisinin NVFP4’ü desteklemesi sayesinde Qwen3.8-27B için özellikle uygun; bu da modelin çıktı kalitesini korurken çok yüksek hızlarda çalışmasına imkân tanır. çoklu token tahmini (MTP) ile yapılan spekülatif ayrıştırma, optimize bir llama.cpp derlemesi ve doğru GGUF model ile birleştirildiğinde, Qwen3.8-27B tek bir RTX 5090 üzerinde saniyede 100’ün oldukça üzerinde token üretebilir.
Bu kılavuzda, RTX 5090 veya başka bir Blackwell GPU’da hız, doğruluk ve uzun bağlam desteği arasında en iyi dengeyi elde etmenin en kolay yollarından birini kuracağız. llama.cpp’yi yerel Blackwell desteğiyle derleyecek, Qwen3.8-27B NVFP4-MTP GGUF’unu indirecek, GPU hızlandırma ve MTP spekülatif ayrıştırma ile çalıştıracak, OpenAI uyumlu API’yi ve yerleşik web arayüzünü test edecek ve son olarak Qwen3.8-27B’yi tamamen yerel bir kodlama ajanı olarak kullanabilmek için Pi’ye bağlayacağız.
1. Blackwell GPU’lar için llama.cpp’yi Kurun
Önce, GPU’nun doğru algılandığından emin olacak ve NVIDIA sürücüsü ile CUDA sürümünü kontrol edeceğiz.
nvidia-smi
RTX 5090’unuzu, sürücü sürümünü, CUDA sürümünü, GPU belleğini ve mevcut GPU kullanımını görmelisiniz.
Not: Bu kurulum, RTX 5090 gibi NVIDIA Blackwell GPU’larına özeldir. Aşağıdaki derleme, RTX 5090’un kullandığı hesaplama mimarisi olan SM120’yi hedefler.
Şimdi, llama.cpp’nin en son sürümünü CUDA desteğiyle indirip derleyeceğiz.
cd /workspace
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build --config Release -j$(nproc)

Buradaki kritik kısım -DCMAKE_CUDA_ARCHITECTURES=120. Bu, llama.cpp’ye RTX 5090’un kullandığı Blackwell mimarisi için özel olarak derleme yapmasını söyler.
Derleme bittiğinde, llama-server’ı herhangi bir klasörden çalıştırabilmek için sistem genelinde erişilebilir hâle getireceğiz:
sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server
Şimdi her şeyin çalıştığını kontrol edin:
llama-server --version
Şuna benzer bir çıktı almalısınız:
version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64
Hepsi bu. Artık RTX 5090 ve onun yerel Blackwell NVFP4 desteğinden yararlanabilen CUDA etkin bir llama.cpp derlememiz var.
2. Qwen3.8-27B NVFP4-MTP Modelini İndirin
Şimdi Qwen3.8-27B modelini indireceğiz.
Önce, Hugging Face CLI’ı kurun:
pip install -U huggingface_hub
Modeli saklayacağımız bir klasör oluşturun:
mkdir -p /workspace/models/qwen38
Ardından NVFP4-MTP GGUF’u indirin:
hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
--local-dir /workspace/models/qwen38

Bu kurulum için istediğimiz sürüm budur; çünkü NVFP4 kullanır ve MTP desteği içerir. RTX 5090’da hız artışının önemli bir kısmı buradan gelir.
3. Qwen3.8-27B Sunucusunu Başlatın
Şimdi işin eğlenceli kısmına geliyoruz. Qwen3.8-27B’yi Flash Attention, 131K bağlam penceresi ve daha hızlı üretim için MTP spekülatif ayrıştırma ile tamamen GPU üzerinde sunacağız.
Çalıştırın:
cd /workspace/llama.cpp
llama-server \
-m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
--alias qwen3.8-27b \
--host 0.0.0.0 \
--port 8910 \
--ctx-size 131072 \
--n-gpu-layers all \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--spec-draft-p-min 0.75 \
--spec-draft-ngl all \
--spec-draft-type-k q8_0 \
--spec-draft-type-v q8_0 \
--reasoning-effort medium \
--jinja
Burada pek çok seçenek var; ancak çoğu sadece 5090’dan en iyi performansı almak için bulunuyor.
Bilmeniz gereken başlıca seçenekler şunlardır:
-
--ctx-size 131072yaklaşık 131K’lık bir bağlam penceresi verir. -
--n-gpu-layers allmodeli GPU üzerinde tutar. -
--flash-attn onFlash Attention’ı etkinleştirir. -
--cache-type-k q8_0ve--cache-type-v q8_0KV önbellek bellek kullanımını azaltmaya yardımcı olur. -
--spec-type draft-mtpQwen3.8’in MTP spekülatif ayrıştırmasını etkinleştirir. -
--spec-draft-n-max 4MTP’nin aynı anda kaç spekülatif token üretebileceğini kontrol eder.
Bu kurulumda, RTX 5090 için başlangıç noktası olarak n-max 4 kullanıyoruz. Model kartının bu GGUF için önerdiği 2 veya 3 gibi değerlerle daha sonra deneyebilirsiniz; zira en hızlı ayar sisteminize göre biraz değişebilir.
Model yüklemeyi llama-server bitirdiğinde, Qwen3.8 yerelde http://127.0.0.1:8910 adresinden erişilebilir olacaktır.

Artık Qwen3.8-27B yerelde çalışıyor. Sırada modeli hem API hem de yerleşik tarayıcı arayüzü üzerinden test etmek var.
4. Qwen3.8-27B’nin Hızını ve Kodlama Performansını Test Edin
Sunucu çalışırken, başka bir terminal açın ve OpenAI uyumlu API’ye bir test isteği gönderin:
curl http://127.0.0.1:8910/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-27b",
"messages": [
{
"role": "user",
"content": "Write a Python FastAPI application that monitors GPU usage."
}
],
"max_tokens": 2000
}'

Bu testte, Qwen3.8-27B 2.000 tokenı saniyede 122 token hızla ve etkileyici bir %84,9 MTP kabul oranıyla üretti.
llama.cpp ayrıca bir tarayıcı arayüzü de içerir; böylece API kullanmadan modeli test edebilirsiniz.
Arayüzü görmek için tarayıcınızda http://127.0.0.1:8910 adresini açın.

Daha karmaşık bir test için şu istemi kullandım:
Create a stunning single-file animated HTML website with a dark futuristic
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

RTX 5090’umda, ortalama saniyede yaklaşık 142 token elde ettim; üretim hızları zaman zaman saniyede 170 token civarına çıktı, ki bu 27B’lik bir modelin yerelde çalışması için olağanüstü hızlı.

Qwen3.8-27B kutudan çıktığı gibi çalışan, cilalı ve eksiksiz bir web sitesi üretti. Bu, hem modelin kodlama yeteneğini hem de yerel kurulumun hızını hızlıca test etmenin iyi bir yoludur.
5. Qwen3.8-27B’yi Pi ile Kullanın
Bu bölümde, Qwen3.8-27B’yi Pi’ye bağlayacak ve onu tamamen yerel bir kodlama ajanı olarak kullanacağız.
Pi, terminal tabanlı hafif bir kodlama ajanıdır; projeleri doğrudan komut satırından oluşturmanıza, düzenlemenize, test etmenize ve hata ayıklamanıza yardımcı olabilir.
Pi’yi şu komutla kurun:
curl -fsSL https://pi.dev/install.sh | sh
Yükleyici Node.js ve npm gerektirir. Pi’yi global npm önekine kurar. Node yoksa önce nvm veya paket yöneticinizle kurun.
Kurulum tamamlandığında terminalinizi yeniden başlatın.
Ardından pi-llama uzantısını kurun ve Pi’yi yerel llama.cpp sunucumuza yönlendirin:
pi install git:github.com/huggingface/pi-llama
export LLAMA_BASE_URL=http://127.0.0.1:8910/v1
Yeni bir proje oluşturun ve Pi’yi başlatın:
mkdir new-project
cd new-project
Pi

Pi içinde /model komutunu çalıştırın, llama-cpp’yi arayın ve Qwen3.8-27B’yi seçin.
Test için şu istemi verdim:
Build a polished personal finance dashboard from scratch that imports CSV
bank statements, categorizes spending, shows monthly trends and charts, and
detects unusual expenses; also generate a realistic sample CSV, import it,
test the full app end-to-end, and fix any errors automatically.

Tüm projeyi birkaç dakika içinde oluşturdu.

Sonrasında sunucuyu başlatmasını ve hem ön yüzü hem de uygulama mantığını test etmesini istedim. Her şeyin düzgün çalıştığından emin olmak için hata ayıklama ve testlere daha fazla zaman harcadı.

Panoyu kendim test ettiğimde, uygulama iyi çalıştı, grafikler harika görünüyordu ve genel deneyim akıcıydı.

Başlıca zayıflık, tam isabetli UI değişiklikleri yapmasıydı. Birkaç takip isteminden sonra tam olarak ne istediğimi anlamak yerine ilgisiz değişiklikler yapmaya başladı; bu yüzden sonunda orada bıraktım.
Son Düşünceler
Qwen3.8-27B hâlâ çok yeni ve topluluk en iyi quantization ve spekülatif ayrıştırma kombinasyonunu aktif olarak keşfediyor. MTP son derece iyi çalışıyor; ancak DFlash 2 ve DSpark gibi daha yeni yaklaşımlar da test ediliyor; bazı kullanıcılar donanım ve iş yüküne bağlı olarak daha yüksek hızlar bildirdi.
Unsloth ayrıca Qwen3.8-27B için Dynamic v3.0 GGUF’leri yeni yayımladı ve önceki quantlarına göre aynı model boyutunda yaklaşık %10 daha yüksek doğruluk iddia ediyor. Bu da, benzer yerel çıkarım kurulumunu korurken daha iyi kalite istiyorsanız Unsloth’u çok ilgi çekici bir seçenek hâline getiriyor.
Şimdilik, bence NVFP4 + MTP + llama.cpp, RTX 5090 için en kolay ve en hızlı kurulumlardan biri. 27B bir modelden, geniş bir bağlam penceresini korurken ve gerçek bir kodlama ajanını çalıştıracak yeterlilikte olup, saniyede yaklaşık 140 token elde etmek etkileyici. llama.cpp, Unsloth, DFlash 2 ve DSpark geliştikçe kurulum muhtemelen daha da hızlanacaktır.
Qwen3.8-27B’yi Yerelde Çalıştırma Hakkında SSS
Qwen3.8-27B’yi yerelde çalıştırmak için RTX 5090’a ihtiyaç var mı?
Hayır. Qwen3.8-27B’nin standart 4-bit GGUF quantları kabaca 16–19 GB VRAM’e sığar; dolayısıyla bir RTX 5080, 4090 veya 24 GB’lık bir Mac modeli çalıştırır. Bu özel kurulumda RTX 5090 önemlidir çünkü NVFP4, Blackwell tensör çekirdeklerine ihtiyaç duyar. Daha eski kartlarda NVFP4 dosyaları çalışır ancak hız artışı değil yalnızca bellek tasarrufu sağlar.
Bu yapılandırma gerçekte ne kadar VRAM kullanır?
NVFP4-MTP GGUF diskte yaklaşık 19 GB’tır ve toplam kullanım, bağlam büyüdükçe KV önbelleğiyle artar. Çok uzun bağlamda q8_0 K/V quantization ile yayımlanan RTX 5090 çalıştırmaları orta 20’ler GB seviyesine iner; bu yüzden 32 GB’lık bir kart rahattır. 24 GB’ta --ctx-size’ı 131072’nin oldukça altına düşürmeniz gerekir.
MTP spekülatif ayrıştırma ne yapar, kayıpsız mıdır?
Qwen3.8, GGUF içine gömülü çoklu token tahmin katmanlarıyla (MTP) gelir; bu katmanlar ikinci bir dosyaya gerek olmadan yerleşik bir taslak model gibi davranır. Taslak kafa aynı anda birkaç token önerir ve tam model bunları doğrular; kabul edilen taslakların maliyeti normal bir ileri geçişin küçük bir kısmıdır. Çıktı kalitesi değişmez; çünkü ana modelin kabul ettiği her token, zaten üreteceği tokendir.
NVFP4 mü yoksa normal Q4_K_M quant mı kullanılmalı?
Blackwell GPU’nuz varsa ve maksimum hızı istiyorsanız NVFP4’ü seçin; Ampere veya Ada kullanıyorsanız ya da gigabayt başına çıktı kalitesine daha çok önem veriyorsanız Q4_K_M gibi standart bir GGUF veya Unsloth’un UD-Q4_K_XL sürümünü seçin. llama.cpp’deki NVFP4 desteği, K-quant yoluna göre daha yenidir; bu yüzden dönüştürme ve araçlar etrafında daha fazla pürüz bekleyin.
Qwen3.8-27B bir görsel model olduğuna göre bu kurulum görselleri işleyebilir mi?
Qwen3.8-27B yerel olarak bir görme-dil modelidir; ancak yalnızca metin GGUF dönüşümleri görsel katmanı çıkarır. Görselleri kullanmak için, modelle birlikte genellikle aynı depoda veya Unsloth’un GGUF deposunda yayımlanan mmproj dosyasını --mmproj ile geçirmeniz gerekir.
Sertifikalı bir veri bilimcisi olarak, yenilikçi makine öğrenimi uygulamaları oluşturmak için en son teknolojileri kullanmaya büyük ilgi duyuyorum. Konuşma tanıma, veri analizi ve raporlama, MLOps, konuşma yapay zekası ve NLP alanlarında güçlü bir geçmişe sahip olarak, gerçek bir etki yaratabilecek akıllı sistemler geliştirme becerilerimi geliştirdim. Teknik uzmanlığımın yanı sıra, karmaşık kavramları açık ve özlü bir dille ifade etme yeteneğine sahip, becerikli bir iletişimciyim. Sonuç olarak, veri bilimi konusunda aranan bir blog yazarı oldum ve giderek büyüyen veri profesyonelleri topluluğuyla görüşlerimi ve deneyimlerimi paylaşıyorum. Şu anda, içerik oluşturma ve düzenlemeye odaklanıyorum. Büyük dil modelleriyle çalışarak, hem işletmelerin hem de bireylerin verilerinden en iyi şekilde yararlanmalarına yardımcı olabilecek güçlü ve ilgi çekici içerikler geliştiriyorum.

