Program
Qwen3.8-Flash-Next, özellikle kodlama ve aracısal görevler için son dönemde test ettiğim en ilginç yerel modellerden biri. Ufak bir spoiler: Modelin performansı beni olumlu anlamda şaşırttı.
Bu kılavuzda, 96 GB VRAM’e sahip tek bir RTX PRO 6000 üzerinde Unsloth UD-Q4_K_XL GGUF kuantizasyonunu çalıştıracak, yerelde llama.cpp ile sunacak, yerleşik WebUI üzerinden test edecek ve son olarak OpenCode’a bağlayarak tamamen yerel bir kodlama aracısı olarak kullanacağız.
Qwen3.8-Flash-Next Nedir?
Qwen3.8-Flash-Next 26 Ağustos 2026’da yayımlandı. Qwen ekibinin yeni bir açık-ağırlıklı Uzman Karışımı (MoE) modeli ve aynı zamanda Qwen4 için geliştirilen mimarinin erken bir ön izlemesi.
Model hakkında tam kıyaslamalar ve özellik özetinin yanı sıra fiyatlandırma, erişilebilirlik ve rakip modellere karşı karşılaştırmayı içeren daha derin bir inceleme için Qwen3.8-Flash-Next rehberimizi okumanızı öneririm.
Qwen3.8-Flash-Next mimarisi
125B parametreli bir ana MoE modelidir, ancak belirteç başına yalnızca yaklaşık 6B parametre etkinleştirilir. Ayrıca n-gram gömlemelerinde ek 51B parametre içerir.
Mimari, Qwen’in Qwen4 için araştırdığı birkaç fikri tanıtıyor:
- Gated DeltaNet + Qwen Sparse Attention (QSA), uzun bağlam işlemede daha yüksek verimlilik için
- Gated Residual bağlantılar, katmanlar arası bilgi akışını iyileştirmek için
- N-gram gömlemeleri, tüm parametrelerin etkin hesaplanmasını gerektirmeden model kapasitesi eklemek için

Kaynak: Qwen
Modelin yerel bağlam penceresi uzunluğu 262.144 belirteçtir ve teorik olarak YaRN kullanılarak 1 milyon belirtece kadar genişletilebilir.
Qwen3.8-Flash-Next kodlamada nasıl performans gösteriyor?
Kodlamada da şaşırtıcı derecede güçlü. Bunlar, Qwen3.8-27B ile karşılaştırıldığında Qwen’in kendi rapor ettiği bazı sonuçlar:
|
Kıyaslama |
Qwen3.8-Flash-Next |
Qwen3.8-27B |
|
DeepSWE 1.1 |
58.7 |
42.2 |
|
SWE-bench Pro |
62.5 |
61.7 |
|
SWE-bench Multilingual |
81.0 |
73.8 |
|
Toolathlon Verified |
73.5 |
67.1 |
Bunlar Qwen’in kendi değerlendirmeleri, bu yüzden yine de satıcı tarafından bildirilen sonuçlar olarak ele alırdım; ancak modelle kodlama yaparken yaşadığım deneyimle oldukça iyi örtüşüyorlar.
Qwen3.8-Flash-Next için GPU Sunucusunu Hazırlama
Ben 96 GB VRAM’li bir RTX PRO 6000 kullandım; ancak bu kadar VRAM şart değil.

Bu aslında Qwen3.8-Flash-Next’in ilginç yanlarından biri. llama.cpp modelin bir kısmını sistem RAM’ine boşaltabildiği için, yeterli RAM’iniz olduğu sürece daha az VRAM’li bir GPU kullanabilirsiniz.
Kullandığımız Unsloth UD-Q4_K_XL kuantizasyonu yaklaşık 111 GB ve dört GGUF dosyasına bölünmüş durumda.
Benim kurulumum için kullanılabilir RAM ve VRAM toplamının en az 140 GB olmasını öneririm; böylece model, bağlam, KV önbelleği ve çalışma zamanı ek yükü için yeterli alan kalır.
Elinizde H200 gibi bir şey varsa neredeyse her şeyi GPU’da tutabilirsiniz. Ben ise orta yolu seçtim.
GPU’nuzu kontrol ederek başlayın:
nvidia-smi

GPU’nuzu, sürücü sürümünü, CUDA sürümünü ve mevcut VRAM’i görmelisiniz.
Ardından gerekli paketleri kurun:
sudo apt update
sudo apt install -y \
git \
cmake \
build-essential \
curl \
libcurl4-openssl-dev \
python3-pip
Qwen3.8-Flash-Next Desteğiyle llama.cpp Derleme
Qwen3.8-Flash-Next yeni qwen4_exp mimarisini kullanır; bu da yalnızca başka bir Qwen3.8 modelini yüklemekten çok farklıdır.
Destek hâlâ son derece yeni olduğundan, mimariyi tanımayabilecek daha eski bir llama.cpp yapısına güvenmek yerine Unsloth tarafından bakımı yapılan Qwen3.8-Flash-Next dalını kullandım. İlgili llama.cpp çalışması yeni qwen4exp mimarisini, QSA’yı, n-gram gömlemelerini ve diğer modele özgü bileşenleri ekliyor.
Çalışma alanına geçin:
cd /workspace
Unsloth dalını klonlayın:
git clone \
--branch qwen4exp/qwen3.8-flash-next \
https://github.com/unslothai/llama.cpp.git
Dizine girin:
cd llama.cpp
llama.cpp’yi CUDA ile derleyin:
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_BUILD_TYPE=Release
cmake --build build \
--config Release \
-j"$(nproc)"
Son olarak, llama-server doğru şekilde oluşturulmuş mu doğrulayın:
./build/bin/llama-server --version
Benim yapım şu çıktıyı verdi:
version: 0.3.0-dev (build 10656, commit 035e22731)
built with GNU 13.3.0 for Linux x86_64
Qwen3.8-Flash-Next GGUF Modelini İndirme
Modeli indirmek aslında bu kurulumun en can sıkıcı kısımlarından biriydi.
Önce ModelScope’u denedim, ama hız iyi değildi. Hugging Face’te indirme başlangıçta fena değildi, sonra birden KB/s seviyesine düştü.
Hugging Face artık büyük model indirmeleri için Xet arka ucunu kullanıyor ve normalde uyarlanabilir eşzamanlılığı otomatik etkinleştiriyor. Sorun çıkardığında devre dışı bırakmak için HF_HUB_DISABLE_XET de sağlıyor.
Benim durumumda Xet’i devre dışı bırakmak ve dört GGUF parçayı paralel indirmek çok daha iyi çalıştı.
Hugging Face CLI’yı kurun:
pip install -U huggingface_hub
Bu indirme için Xet’i devre dışı bırakın:
export HF_HUB_DISABLE_XET=1
unset HF_XET_HIGH_PERFORMANCE
unset HF_XET_NUM_CONCURRENT_RANGE_GETS
unset HF_HUB_ENABLE_HF_TRANSFER
HF_HUB_ENABLE_HF_TRANSFER zaten artık kullanımdan kaldırıldı; çünkü Hugging Face büyük aktarımları Xet’e taşıdı.
Model dizinini oluşturun:
cd /workspace
mkdir -p Qwen3.8-Flash-Next-GGUF
Şimdi dört parçanın tamamını paralel indirin:
for i in 1 2 3 4; do
shard=$(printf "%05d" "$i")
hf download unsloth/Qwen3.8-Flash-Next-GGUF \
"UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-${shard}-of-00004.gguf" \
--local-dir Qwen3.8-Flash-Next-GGUF &
done
wait

Tam UD-Q4_K_XL kuant yaklaşık 111 GB.
Qwen3.8-Flash-Next’i llama.cpp ile Çalıştırma
llama.cpp dizinine dönün:
cd /workspace/llama.cpp
Sunucuyu başlatın:
./build/bin/llama-server \
-m /workspace/Qwen3.8-Flash-Next-GGUF/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf \
--alias qwen3.8-flash-next \
--host 0.0.0.0 \
--port 8080 \
--ctx-size 131072 \
--parallel 1 \
--flash-attn on \
--fit on \
--fit-target 4096 \
--jinja \
--batch-size 1024 \
--ubatch-size 512 \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0

Bilerek 262K’lık tam yerel bağlam yerine 131.072 belirteçlik bir bağlam penceresi kullandım.
Kodlama aracıları için 131K zaten çok büyük ve OpenCode’a kaynak dosyaları, araç çıktıları, terminal günlükleri ve uzun konuşmalar için fazlasıyla alan bırakıyor; muhtemelen kullanmayacağım daha geniş bir bağlam için belleği boşa harcamıyor.
Buradaki önemli ayarlar şunlar:
-
--fit on, modelin ne kadarının GPU’da tutulacağını llama.cpp’nin otomatik belirlemesine izin verir. -
--fit-target 4096, çalışma zamanına nefes payı vermek için yaklaşık 4 GB GPU belleğini boş bırakmasını söyler; böylece VRAM sınırına doğrudan dayanmak yerine bir marj olur. llama.cpp hem otomatik sığdırmayı hem de yapılandırılabilir hedef bellek marjını resmen destekler. -
Örnekleme ayarları da rastgele değil. Qwen, düşünme modunda
temperature=1.0,top_p=0.95,top_k=20vemin_p=0.0önermektedir.

Tam modeli yükledikten sonra bile hâlâ yeterli belleğim kalmıştı; yaklaşık 13 GB VRAM bağlam penceresi, KV önbelleği ve diğer uygulamalar için boştu.
CURL Kullanarak Qwen3.8-Flash-Next Sunucusunu Test Etme
llama-server, OpenAI uyumlu bir API sunar.
Mevcut modeli kontrol edin:
curl http://127.0.0.1:8080/v1/models
qwen3.8-flash-next görmelisiniz.
Şimdi bir yanıt üretmeyi test edelim:
curl http://127.0.0.1:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash-next",
"messages": [
{
"role": "user",
"content": "Write a Python function that checks whether a number is prime."
}
]
}'
Geçerli bir yanıt alırsanız yerel sunucu hazır demektir.

Benim kurulumumda başlangıçta saniyede yaklaşık 80 belirteç gördüm; modelin bir kısmının sistem RAM’inde olduğunu düşününce bu beni şaşırttı.
Bağlam büyüdükçe hızlar saniyede 64 belirteçe yaklaştı.
Bu boyuttaki bir model için hâlâ son derece kullanılabilir ve mimari bunun nedenini açıklıyor. Model 125B ana parametreye sahip olsa da belirteç başına yalnızca yaklaşık 6B parametre etkin.
llama.cpp WebUI ile Qwen3.8-Flash-Next’i Test Etme
llama.cpp ile gerçekten sevdiğim bir şey, llama-server size zaten basit bir WebUI sunması.
http://localhost:8080 adresini açın. Her şey doğru çalışıyorsa model zaten kullanılabilir olmalı.

İlk kapsamlı testim için, tek seferde tam bir kamu kurumunun BT birimi web sitesini oluşturmasını istedim:
Create a modern, professional government IT department portfolio website in a single index.html file.
Use HTML, CSS, and JavaScript featuring a clean official design and responsive layout with smooth animations, interactive elements, and accessible government-style navigation.
It should display department overview, key services, digital transformation projects, achievements, technology initiatives, statistics, leadership/team section, latest updates, contact information,

Oldukça büyük bir üretimdi. Model önce birçok belirteç harcayarak düşündü, sonra tek bir HTML dosyasında tüm siteyi oluşturdu. Bitirmesi yaklaşık 13 dakika sürdü ve bağlam büyüdükçe üretim hızı kademeli olarak düştü.
Ama sonuç beklediğimden çok daha iyiydi.

Grafikler, animasyonlar, sekmeler, farklı bölümler, duyarlı stiller, JavaScript etkileşimleri ve şaşırtıcı derecede cilalı bir genel düzen içeriyordu.

İlginç olan, bunun temelde tek atımlık bir üretim olmasıydı. Bu küçük ayrıntıların çoğunu açıkça istememiştim.
Bu, modele her uygulama ayrıntısını tek tek belirtmek yerine biraz özgürlük verdiğiniz kodlama görevlerinde özellikle iyi olabileceğini fark ettiğim ilk noktaydı.
Qwen3.8-Flash-Next’i OpenCode’a Bağlama
Sohbet güzel, ama ben esas olarak Qwen3.8-Flash-Next’i aracısal bir kodlama modeli olarak test etmek istedim.
Bunun için OpenCode kullandım. Önce kurun:
curl -fsSL https://opencode.ai/install | bash
Terminalinizi yeniden başlatın ve kurulumu kontrol edin:
opencode --version
Benim durumumda sürüm 1.18.23 idi.
Şimdi OpenCode yapılandırmasını oluşturun:
mkdir -p ~/.config/opencode
Az önce oluşturduğumuz yerel llama.cpp sağlayıcısını ekleyin:
printf '%s\n' '{"$schema":"https://opencode.ai/config.json","model":"llama.cpp/qwen3.8-flash-next","provider":{"llama.cpp":{"npm":"@ai-sdk/openai-compatible","name":"Qwen3.8 Flash Next Local","options":{"baseURL":"http://127.0.0.1:8080/v1"},"models":{"qwen3.8-flash-next":{"name":"Qwen3.8 Flash Next","limit":{"context":65536,"output":32768}}}}}}' > ~/.config/opencode/opencode.json
En önemli kısım http://127.0.0.1:8080/v1.
OpenCode, @ai-sdk/openai-compatible aracılığıyla özel OpenAI uyumlu sağlayıcıları destekler; bu da llama.cpp’yi bağlamayı çok kolaylaştırır.
llama.cpp sunucusunun kendisinde 131K mevcut olsa da OpenCode’u 65K çalışma bağlamına ayarladım.
Bu, uzun çıktılar için bolca pay bırakır ve aracı oturumlarının tüm sunucu bağlamını aşırı hızlı doldurmasını engeller.
Qwen3.8-Flash-Next’i Yerel Kodlama Aracısı Olarak Kullanma
Bir proje dizinine gidin ve OpenCode’u başlatın:
cd /workspace/my-project
opencode

Artık modele normal aracısal kodlama görevleri verebilirsiniz. Örneğin, Qwen’e bir analitik panosu oluşturmasını söyledim:
Build a modern system analytics and task-management dashboard.
It should monitor CPU, RAM, VRAM, GPU usage, temperatures, disk usage, running processes, and temporary files.
Users should be able to safely terminate tasks, free unused RAM/VRAM, clear caches, and clean temporary files from one interface.

Model, yazmadan önce bir yapılacaklar listesi oluşturarak ve uygulamayı planlayarak başladı.

Birkaç dakika içinde ilk çalışan panoyu üretti. İlk UI’yı pek sevmedim. Fazla dağınık hissettirdi ve birkaç kullanılabilirlik sorunu vardı.
Bu yüzden hoşuma gitmeyenleri basitçe söyledim ve arayüzü daha kompakt bir sistem komuta merkezine dönüştürmesini istedim.
İkinci sürüm çok daha iyiydi.

Sonunda CPU, RAM, VRAM, GPU kullanımı, depolama, ağ etkinliği ve çalışan işlemleri gerçek zamanlı izleyebildiğim kompakt bir panele ulaştım. Önbellekleri temizleme, geçici dosyaları temizleme ve süreçleri yönetme kontrolleri de eklendi.
İlginç olan, Qwen’in uygulamaya yaklaşımıydı. İki farklı uygulamada test ettim ve sıklıkla basit vanilla HTML, CSS ve JavaScript kullanmayı; hemen React, Node paketleri veya başka büyük bir çerçeve kurmaya tercih etti.
Açıkçası bu davranışı sevdim. Bir çerçeve belirtmezsem, gereksiz bağımlılıklar eklemek yerine problemi çözecek en basit mimariyi bulmaya çalıştı.
Dezavantajı ise zaman alması. Çokça akıl yürütme, çokça üretilen belirteç ve bazen hatırı sayılır bir hata ayıklama söz konusu. Modelin problemi düşünmek için belirteç harcadığını hissedebiliyorsunuz.
Ama nihai projeler genel olarak daha küçük yerel modellerden genelde aldıklarımdan çok daha tamamlanmış hissettirdi.
Son Düşünceler
Qwen3.8-Flash-Next’i web sitesi üretimi ve aracısal kodlama için test ettikten sonra, Qwen3.8-27B’den belirgin bir sıçrama olduğunu düşünüyorum. En büyük fark, projelere yaklaşımı. Yalnızca kod üretmek yerine yapıya, ayrıntılara ve pratik uygulamaya daha çok dikkat ediyor. Bu modeli yerelde çalıştırmakla ilgileniyorsanız Qwen3.8-27B öğreticimizi okuyun.
Ayrıca sıkça gereksiz çerçeveler ve bağımlılıklar eklemek yerine basit HTML, CSS, JavaScript ve Python’a dayanmasını da sevdim.
Ana dezavantaj boyut. UD-Q4_K_XL GGUF yaklaşık 111 GB ve model özellikle hata ayıklama sırasında çokça akıl yürütme ve çıktı belirteci kullanabiliyor.
Bunun dışında kurulum şaşırtıcı derecede sorunsuzdu. Yeterli RAM ve VRAM’iniz varsa, Qwen3.8-Flash-Next şimdiye kadar test ettiğim en güçlü yerel kodlama modellerinden biri.
FAQs
Qwen3.8-Flash-Next’i yerelde çalıştırmak için hangi donanıma ihtiyacınız var?
Unsloth’un donanım tablosu, en küçük 1-bit kuantı 75 GB ve 4-bit kuantı 112 GB olarak veriyor; ölçüm toplam bellek (VRAM ve sistem RAM’i toplamı veya Mac’te birleşik bellek) cinsindendir. 96 GB’lık bir GPU’ya ihtiyacınız yok: llama.cpp modeli VRAM ve RAM arasında böler; bu nedenle bol sistem RAM’i olan daha küçük bir kart da çalışır, yalnızca boşaltılan kısım daha yavaş olur.
Qwen3.8-Flash-Next’in hangi kuantizasyonunu seçmelisiniz?
UD-Q4_K_XL, 111.3 GB ile tatlı nokta; tam kesinlikli modelle yaklaşık %93 üst-belirteç uyumunu korur. Bellekten kısıtlıysanız, UD-IQ4_XS (93.7 GB) ve UD-Q3_K_XL (90 GB) %90’ın üzerinde kalır; UD-IQ1_S ise 72.5 GB’da hâlâ %80 tutar. Düşük bitli kuantların 125B bir model için beklediğinizden büyük olduğunu unutmayın; çünkü n-gram gömme katmanları hiçbir zaman 4-bit’in altına kuantize edilmez.
OpenCode yerine Qwen3.8-Flash-Next’i Claude Code veya Codex ile kullanabilir misiniz?
OpenCode yerine özel bir OpenAI uyumlu temel URL kabul eden her şey için evet. Aracıyı http://127.0.0.1:8080/v1 adresine yönlendirin ve sunucuya verdiğiniz --alias’ı model kimliği olarak kullanın. Claude Code, Anthropic biçimli istekler bekler; bu yüzden doğrudan temel URL değişimi yerine bir çeviri proxy’si gerekir. Hangi aracıyı kullanırsanız kullanın, uzun oturumların sunucu --ctx-size değerini aşmaması için sunucunun değerinin altında açık bir bağlam sınırı ayarlayın.
Qwen3.8-Flash-Next’in bu kadar çok belirteç harcayarak düşünmesini nasıl engellersiniz?
Akıl yürütme çabası varsayılan olarak xhigh’dır. llama-server’a --chat-template-kwargs '{\"reasoning_effort\":\"medium\"}' geçirerek düşürebilirsiniz; low ve none da mevcuttur. Model ayrıca varsayılan olarak önceki turlardaki düşünme izlerini saklar (preserve thinking); bu yüzden uzun aracı oturumlarında preserve_thinking değerini false yapmanız belirteç kullanımını daha da azaltır.
Sertifikalı bir veri bilimcisi olarak, yenilikçi makine öğrenimi uygulamaları oluşturmak için en son teknolojileri kullanmaya büyük ilgi duyuyorum. Konuşma tanıma, veri analizi ve raporlama, MLOps, konuşma yapay zekası ve NLP alanlarında güçlü bir geçmişe sahip olarak, gerçek bir etki yaratabilecek akıllı sistemler geliştirme becerilerimi geliştirdim. Teknik uzmanlığımın yanı sıra, karmaşık kavramları açık ve özlü bir dille ifade etme yeteneğine sahip, becerikli bir iletişimciyim. Sonuç olarak, veri bilimi konusunda aranan bir blog yazarı oldum ve giderek büyüyen veri profesyonelleri topluluğuyla görüşlerimi ve deneyimlerimi paylaşıyorum. Şu anda, içerik oluşturma ve düzenlemeye odaklanıyorum. Büyük dil modelleriyle çalışarak, hem işletmelerin hem de bireylerin verilerinden en iyi şekilde yararlanmalarına yardımcı olabilecek güçlü ve ilgi çekici içerikler geliştiriyorum.
