Program
Qwen3.8-27B, yerel yapay zekâ için hızla en popüler modellerden biri haline geliyor. Sadece 27 milyar parametreye sahip olmasına rağmen, kodlama, akıl yürütme, ajan yetenekleri ve genel amaçlı kıyaslamalarda çok büyük modellerle yarışan bir performans sunuyor. Hatta bazı alanlarda GLM-5.2 gibi modellere yaklaşarak, güçlü yerel donanımlarla deney yapanlar arasında özellikle popüler hale geldi.
RTX 5090, Blackwell mimarisinin NVFP4’ü desteklemesi sayesinde Qwen3.8-27B’ye özel olarak uygundur; bu da modelin yüksek çıktı kalitesini korurken çok yüksek hızlarda çalışmasını sağlar. çoklu token tahmini (MTP) ile yapılan spekülatif kod çözme, optimize edilmiş bir llama.cpp derlemesi ve doğru GGUF model ile birleştirildiğinde, Qwen3.8-27B tek bir RTX 5090 üzerinde saniyede 100’ün oldukça üzerinde token üretebilir.
Bu kılavuzda, RTX 5090 veya başka bir Blackwell GPU’da hız, doğruluk ve uzun bağlam desteği arasında en iyi dengeyi kurmanın en kolay yollarından birini kuracağız. llama.cpp’yi yerel Blackwell desteğiyle derleyecek, Qwen3.8-27B NVFP4-MTP GGUF’unu indirecek, GPU hızlandırması ve MTP spekülatif kod çözme ile çalıştıracak, OpenAI uyumlu API’yi ve yerleşik web arayüzünü test edecek ve son olarak Pi’ye bağlayarak Qwen3.8-27B’yi tamamen yerel bir kodlama ajanı olarak kullanacağız.
Ayrıca yeni Qwen4 ön izlemesi olan Qwen3.8-Flash-Next kılavuzumuza ve Qwen3.8-Flash-Next’i yerelde çalıştırma eğitimine de göz atmanızı öneririm.
1. Blackwell GPU’lar için llama.cpp’yi Kurun
Önce GPU’nun doğru algılandığından emin olacak ve NVIDIA sürücüsünü ile CUDA sürümünü kontrol edeceğiz.
nvidia-smi
RTX 5090’unuzu, sürüm numarasını, CUDA sürümünü, GPU belleğini ve mevcut GPU kullanımını görmelisiniz.
Not: Bu kurulum, RTX 5090 gibi NVIDIA Blackwell GPU’larına özeldir. Aşağıdaki derleme, RTX 5090’un kullandığı hesaplama mimarisi olan SM120’yi hedefler.
Sonraki adımda, llama.cpp’nin en son sürümünü CUDA desteğiyle indirip derleyeceğiz.
cd /workspace
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build --config Release -j$(nproc)

Buradaki kritik kısım -DCMAKE_CUDA_ARCHITECTURES=120. Bu, llama.cpp’ye RTX 5090’un kullandığı Blackwell mimarisi için özel olarak derleme yapmasını söyler.
Derleme tamamlandığında, llama-server’ı global olarak kullanılabilir hale getirip herhangi bir klasörden çalıştıracağız:
sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server
Şimdi her şeyin çalıştığını kontrol edin:
llama-server --version
Şuna benzer bir çıktı almalısınız:
version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64
Bu kadar. Artık RTX 5090 ve yerel Blackwell NVFP4 desteğinden yararlanabilen CUDA etkin bir llama.cpp derlememiz var.
2. Qwen3.8-27B NVFP4-MTP Modelini İndirin
Şimdi Qwen3.8-27B modelini indireceğiz.
Önce Hugging Face CLI’ı kurun:
pip install -U huggingface_hub
Modeli saklayacağımız bir klasör oluşturun:
mkdir -p /workspace/models/qwen38
Ardından NVFP4-MTP GGUF’u indirin:
hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
--local-dir /workspace/models/qwen38

Bu kurulum için istediğimiz sürüm budur; çünkü NVFP4 kullanır ve MTP desteğini içerir. RTX 5090’da hız artışının büyük kısmı buradan gelir.
3. Qwen3.8-27B Sunucusunu Başlatın
Şimdi işin eğlenceli kısmına geldik. Qwen3.8-27B’yi tamamen GPU üzerinde, Flash Attention, 131K bağlam penceresi ve daha hızlı üretim için MTP spekülatif kod çözme ile sunacağız.
Şunu çalıştırın:
cd /workspace/llama.cpp
llama-server \
-m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
--alias qwen3.8-27b \
--host 0.0.0.0 \
--port 8910 \
--ctx-size 131072 \
--n-gpu-layers all \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--spec-draft-p-min 0.75 \
--spec-draft-ngl all \
--spec-draft-type-k q8_0 \
--spec-draft-type-v q8_0 \
--reasoning-effort medium \
--jinja
Burada çok sayıda seçenek var; ancak çoğu, 5090’dan en iyi performansı almak için bulunuyor.
Bilmeniz gereken başlıca seçenekler:
-
--ctx-size 131072bize yaklaşık 131K’lık bir bağlam penceresi verir. -
--n-gpu-layers allmodeli GPU üzerinde tutar. -
--flash-attn onFlash Attention’ı etkinleştirir. -
--cache-type-k q8_0ve--cache-type-v q8_0KV önbellek bellek kullanımını azaltmaya yardımcı olur. -
--spec-type draft-mtpQwen3.8’in MTP spekülatif kod çözmesini etkinleştirir. -
--spec-draft-n-max 4MTP’nin aynı anda kaç spekülatif token üretebileceğini kontrol eder.
Bu kurulumda, RTX 5090 için başlangıç noktası olarak n-max 4 kullanıyoruz. Model kartının bu GGUF için önerdiği 2 veya daha sonra 3 gibi değerlerle deney yapabilirsiniz; zira en hızlı ayar sisteminize göre biraz değişebilir.
Model yüklemesini llama-server tamamladığında, Qwen3.8 yerelde http://127.0.0.1:8910 adresinde kullanılabilir olacaktır.

Artık Qwen3.8-27B yerelde çalışıyor. Sırada modeli hem API hem de yerleşik tarayıcı arayüzü üzerinden test etmek var.
4. Qwen3.8-27B’nin Hızını ve Kodlama Performansını Test Edin
Sunucu çalışırken başka bir terminal açın ve OpenAI uyumlu API’ye bir test isteği gönderin:
curl http://127.0.0.1:8910/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-27b",
"messages": [
{
"role": "user",
"content": "Write a Python FastAPI application that monitors GPU usage."
}
],
"max_tokens": 2000
}'

Bu testte Qwen3.8-27B, etkileyici bir %84,9 MTP kabul oranıyla saniyede 122 token hızında 2.000 token üretti.
llama.cpp ayrıca bir tarayıcı arayüzü içerir; böylece API kullanmadan da modeli test edebilirsiniz.
http://127.0.0.1:8910 adresini tarayıcınızda açarak arayüzü görebilirsiniz.

Daha karmaşık bir test için şu istemi kullandım:
Create a stunning single-file animated HTML website with a dark futuristic
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

RTX 5090’umda ortalama saniyede yaklaşık 142 token alıyordum; üretim hızları zaman zaman saniyede 170 tokene yaklaşıyordu ki bu, yerelde çalışan 27B bir model için son derece hızlı.

Qwen3.8-27B, kutudan çıktığı gibi çalışan, pürüzsüz ve tam işlevli bir web sitesi üretti. Bu, hem modelin kodlama yeteneğini hem de yerel kurulumun hızını hızlıca test etmenin iyi bir yoludur.
5. Qwen3.8-27B’yi Pi ile Kullanın
Bu bölümde, Qwen3.8-27B’yi Pi’ye bağlayacak ve onu tamamen yerel bir kodlama ajanı olarak kullanacağız.
Pi, komut satırından doğrudan proje oluşturma, düzenleme, test etme ve hata ayıklamada yardımcı olabilen hafif bir terminal tabanlı kodlama ajanıdır.
Pi’yi şununla kurun:
curl -fsSL https://pi.dev/install.sh | sh
Yükleyici Node.js ve npm gerektirir. Pi’yi global npm önekinize kurar. Henüz Node yoksa, önce nvm veya paket yöneticinizle kurun.
Kurulum tamamlandığında terminalinizi yeniden başlatın.
Sonraki adımda pi-llama uzantısını kurup Pi’yi yerel llama.cpp sunucumuza yönlendirin:
pi install git:github.com/huggingface/pi-llama
export LLAMA_BASE_URL=http://127.0.0.1:8910/v1
Yeni bir proje oluşturup Pi’yi başlatın:
mkdir new-project
cd new-project
Pi

Pi içinde /model komutunu çalıştırın, llama-cpp’yi arayın ve Qwen3.8-27B’yi seçin.
Test için şu istemi verdim:
Build a polished personal finance dashboard from scratch that imports CSV
bank statements, categorizes spending, shows monthly trends and charts, and
detects unusual expenses; also generate a realistic sample CSV, import it,
test the full app end-to-end, and fix any errors automatically.

Tüm projeyi birkaç dakika içinde oluşturdu.

Daha sonra sunucuyu başlatmasını, hem ön yüzü hem de uygulama mantığını test etmesini istedim. Her şeyin düzgün çalıştığından emin olmak için hata ayıklama ve test etmeye daha fazla zaman harcadı.

Panoyu kendim test ettiğimde, uygulama iyi çalıştı, grafikler harika görünüyordu ve genel deneyim pürüzsüzdü.

Başlıca zayıflık, hassas UI değişiklikleriydi. Birkaç takip isteminden sonra, tam olarak ne istediğimi anlamak yerine alakasız değişiklikler yapmaya başladı; bu yüzden sonunda orada durdum.
Son Düşünceler
Qwen3.8-27B hâlâ çok yeni ve topluluk, en iyi niceleme ile spekülatif kod çözme kombinasyonunu aktif olarak keşfediyor. MTP son derece iyi çalışıyor; ancak DFlash 2 ve DSpark gibi daha yeni yaklaşımlar da test ediliyor ve bazı kullanıcılar donanım ve iş yüküne bağlı olarak daha yüksek hızlar bildiriyor.
Unsloth ayrıca Qwen3.8-27B için Dynamic v3.0 GGUF’leri yeni yayımladı ve önceki nicelemelerine kıyasla aynı model boyutunda yaklaşık %10 daha yüksek doğruluk iddia ediyor. Bu da, benzer yerel çıkarım kurulumunu korurken daha iyi kalite isterseniz Unsloth’u oldukça ilgi çekici bir seçenek haline getiriyor.
Şimdilik NVFP4 + MTP + llama.cpp’nin RTX 5090 için en kolay ve en hızlı kurulumlardan biri olduğunu düşünüyorum. 27B bir modelden yaklaşık saniyede 140 token alırken, büyük bir bağlam penceresine ve gerçek bir kodlama ajanını çalıştıracak yeterli yeteneğe sahip olmak etkileyici. llama.cpp, Unsloth, DFlash 2 ve DSpark geliştikçe bu kurulum muhtemelen daha da hızlanacaktır.
Qwen3.8-27B’yi Yerelde Çalıştırma Hakkında SSS
Qwen3.8-27B’yi yerelde çalıştırmak için RTX 5090’a ihtiyacınız var mı?
Hayır. Qwen3.8-27B’nin standart 4 bit GGUF nicelemeleri yaklaşık 16–19 GB VRAM’e sığar; dolayısıyla bir RTX 5080, 4090 veya 24 GB’lık bir Mac modeli çalıştıracaktır. Bu özel kurulum için RTX 5090 önemlidir; çünkü NVFP4, Blackwell tensör çekirdeklerini gerektirir. Daha eski kartlarda NVFP4 dosyaları çalışır ancak yalnızca bellek tasarrufu sağlar, hız artışı sağlamaz.
Bu yapılandırma gerçekte ne kadar VRAM kullanır?
NVFP4-MTP GGUF diskte yaklaşık 19 GB’tır ve bağlam büyüdükçe toplamı artıran şey KV önbellektir. Çok uzun bağlamda q8_0 K/V nicelemesiyle, yayımlanan RTX 5090 çalıştırmaları orta 20 GB’larda seyreder; bu nedenle 32 GB’lık bir kart rahattır. 24 GB’ta --ctx-size’ı 131072’nin epey altına düşürmeniz gerekir.
MTP spekülatif kod çözme ne yapar ve kayıpsız mıdır?
Qwen3.8, GGUF içine gömülü çoklu token tahmin katmanlarıyla gelir; bu katmanlar, ikinci bir dosyaya gerek olmadan yerleşik bir taslak model gibi davranır. Taslak kafa bir seferde birkaç token önerir ve tam model bunları doğrular; bu nedenle kabul edilen taslakların maliyeti normal bir ileri geçirime kıyasla çok daha düşüktür. Çıktı kalitesi değişmez; çünkü ana modelin kabul ettiği her token, zaten üreteceği bir tokendir.
NVFP4 mü yoksa normal bir Q4_K_M nicelemesi mi kullanmalısınız?
Blackwell GPU’nuz varsa ve maksimum hızı istiyorsanız NVFP4’ü seçin; Ampere veya Ada üzerindeyseniz ya da gigabayt başına çıktı kalitesine daha çok önem veriyorsanız Q4_K_M gibi standart bir GGUF veya Unsloth’un UD-Q4_K_XL’ini seçin. llama.cpp’de NVFP4 desteği de K-quant yoluna göre daha yenidir; bu nedenle dönüştürme ve araçlarda daha fazla pürüz bekleyin.
Qwen3.8-27B bir görsel model olduğuna göre bu kurulum görselleri işleyebilir mi?
Qwen3.8-27B yerel olarak görsel-dil modelidir; ancak yalnızca metin GGUF dönüşümleri görsel katmanı kaldırır. Görselleri kullanmak için modele --mmproj ile bir multimodal projektör geçirmeniz gerekir; genellikle aynı depoda veya Unsloth’un GGUF deposunda yayımlanan mmproj dosyası kullanılır.
Sertifikalı bir veri bilimcisi olarak, yenilikçi makine öğrenimi uygulamaları oluşturmak için en son teknolojileri kullanmaya büyük ilgi duyuyorum. Konuşma tanıma, veri analizi ve raporlama, MLOps, konuşma yapay zekası ve NLP alanlarında güçlü bir geçmişe sahip olarak, gerçek bir etki yaratabilecek akıllı sistemler geliştirme becerilerimi geliştirdim. Teknik uzmanlığımın yanı sıra, karmaşık kavramları açık ve özlü bir dille ifade etme yeteneğine sahip, becerikli bir iletişimciyim. Sonuç olarak, veri bilimi konusunda aranan bir blog yazarı oldum ve giderek büyüyen veri profesyonelleri topluluğuyla görüşlerimi ve deneyimlerimi paylaşıyorum. Şu anda, içerik oluşturma ve düzenlemeye odaklanıyorum. Büyük dil modelleriyle çalışarak, hem işletmelerin hem de bireylerin verilerinden en iyi şekilde yararlanmalarına yardımcı olabilecek güçlü ve ilgi çekici içerikler geliştiriyorum.


