Ana içeriğe atla

2026’da Kodlama İçin En İyi LLM: 9 Model Sıralaması

Eylül 2026’nın en iyi 9 kodlama LLM’ini, Claude Opus 5.5’ten yerelde çalıştırabileceğiniz açık ağırlıklılara kadar, SWE-bench Pro ve Terminal-Bench ile sıraladık.
Güncel 25 Eyl 2026  · 15 dk. oku

Yapay Zekâyla Keşfet

ChatGPTClaudePerplexity

Şubat 2025’te Claude 3.7 Sonnet SWE-bench Verified’da %62,3, özel bir iskeletle ise %70,3 elde ederken, dönemin en iyi açık ağırlıklı modeli DeepSeek-R1 makalesinde %49,2 bildirdi.

Bu, iskelete ne kadar cömert davrandığınıza bağlı olarak 13 ila 21 puanlık bir farktı.

Eylül 2026’ya gelindiğinde, bağımsız SWE-bench Verified için Vals AI kurulu Claude Opus 5’i %97,0’ta, açık ağırlıklı DeepSeek V4 Pro 0813’ü %96,4’te gösteriyor ve metrik doygunlaştığı için Vals kıyaslamayı arşivledi.

Sınır, SWE-bench Pro ve Terminal-Bench 4.0 gibi daha zor aracısal değerlendirmelere kaydı; açık ağırlıklar eskilerine yetişti ve “kodlama için en iyi LLM” sorusu “neyde en iyi, hangi donanımda, hangi fiyata” sorusuna dönüştü.

Bugün gerçekten kullanmayı düşüneceğim 9 model için bu soruyu yanıtlayacağım; kısası, çoğu ekibin başlaması gereken model Claude Opus 5.5.

Sıralamadan önce bir not: bu yazı modellerin kendisiyle ilgili, etrafına sarılan araçlarla değil. Cursor, Copilot ve Windsurf karşılaştırmasını istiyorsanız, 2026’nın en iyi yapay zekâ kodlama asistanları özetimiz bunu kapsıyor.

Kısaca: Eylül 2026’nın En İyi Kodlama LLM’leri

Claude Opus 5.5 artık çoğu kıyaslamada hem en güçlü kodlama modeli hem de çoğu geliştirmenin varsayılan olarak seçmesi gereken model; Claude Fable 5.1 en uzun ufuklu işler için yükseltilecek model ve Qwen3.8-27B tek bir GPU’da çalıştırılacak açık ağırlıklı model. Amaca göre en iyi seçimler:

  • Aracısal kodlama için genel olarak en iyi: Claude Opus 5.5 (Anthropic), SWE-bench Pro’da %89,9 ve Terminal-Bench 4.0’da %66,4, milyon token başına $4 giriş ve $20 çıkış.
  • En uzun ufuklu işler için en iyi: Claude Fable 5.1 (Anthropic), SWE-bench Pro’da %81,2 ve Artificial Analysis’te Terminal-Bench 2.1’de en yüksek skor (%91,4), milyon token başına $10 giriş ve $50 çıkış.
  • Kodlama için en iyi OpenAI modeli: GPT-6 Astra (OpenAI), tbench.ai Terminal-Bench 4.0 ajan lider panosunda %58,2 ile birinci ve Artificial Analysis’in çalışmasında Opus 5.5 ile %59,6’da başa baş.
  • Sınır laboratuvarından en iyi fiyat/performans: Gemini 3.8 Flash (Google), Terminal-Bench 2.1’de %89,4; 31 Aralık 2026’ya kadar milyon token başına $0,75 giriş ve $3,75 çıkış.
  • API üzerinden en iyi açık ağırlıklar: DeepSeek V4.1 Flash, MIT lisansı, Terminal-Bench 2.1’de %90,6, yoğun olmayan saatlerde milyon çıkış token’ı başına $0,60.
  • Evde çalıştıramayacağınız en iyi açık ağırlıklar: Kimi K3 (Moonshot AI), 2,8 trilyon parametre, Terminal-Bench 2.1’de %88,3.
  • 24 GB GPU’da en iyi yerel model: Qwen3.8-27B (Alibaba), Apache 2.0, Terminal-Bench 2.1’de %73,0, UD-Q4_K_M’de 16,5 GB.
  • 128 GB iş istasyonu için en iyi yerel model: Laguna S 2.1 (Poolside), 118B parametre, yalnızca 8B aktif, 1M bağlam.
  • Eski donanım için en iyi hızlı yerel model: Qwen3-Coder-Next, toplam 80B ama 3B aktif, SWE-bench Verified’da %70,6.

Yukarıdaki her skor aksi belirtilmedikçe üretici tarafından yayınlanmıştır. Yazının devamı bu seçimlere nasıl vardığımı ve her birinin nerede sınırına geldiğini açıklıyor.

Bu Liste Neden Modellerle İlgili de Kodlama Asistanlarıyla Değil?

Kodlama LLM’i, isteminizi okuyan ve token üreten modeldir; kodlama asistanı ise ona dosyaları besleyen, komutlarını çalıştıran ve farkları gösteren kuşaktır.

Claude Code, Codex, Cursor, GitHub Copilot ve Windsurf birer kuşaktır. Claude Opus 5.5, GPT-6 Astra ve Qwen3.8-27B ise modellerdir ve kuşak, çoğu kişinin beklediğinden daha fazla skoru değiştirir.

Anthropic’in Claude Opus 4.8 lansman yazısı bunu bir dipnotta somutlaştırır.

Her modelin Terminal-Bench 2.1 skorunu herkese açık Terminus-2 kuşağında raporlar, ardından GPT-5.5’in sayısının OpenAI’nin Codex CLI’ında %83,4’e yükseldiğini belirtir. Aynı ağırlıklar, farklı tesisat, farklı sonuç.

Bu yüzden aşağıdaki sıralamalar, bulabildiğim her yerde kuşakla birlikte gelir. Modellerin kaput altında nasıl çalıştığına yeniyseniz, büyük dil modeli (LLM) nedir rehberimiz 15 dakikalık bir okuma ve bu yazının geri kalanını takip etmeyi kolaylaştırır.

Kodlama LLM’leri İçin Hangi Kıyaslamalar Gerçekten Önemli?

2026’da kodlama LLM’leri için önemli kıyaslamalar SWE-bench Pro, Terminal-Bench (2.1 ve 4.0 sürümleri) ve hâlâ raporlayan açık ağırlıklar için LiveCodeBench v6’dır. SWE-bench Verified 2 yıl standarttı ve artık en üst modelleri ayırmak için fazla doygun.

Her şeyi sıralamadan önce, model girişlerindeki her sayının ne anlama geldiğini açıklayayım.

SWE-bench Verified doygunlaştı

SWE-bench Verified, modelin depoyu ve sorun metnini aldığı ve gizli birim testlerini geçen bir yama üretmesi gereken, popüler Python depolarından 500 insan-doğrulamalı GitHub sorunundan oluşan bir kümedir.

OpenAI, orijinal SWE-bench’te yetersiz tanımlanmış sorunlar veya bozuk testler bulunduğu için 2024’te Verified alt kümesini tanıttı. Hâlâ en fazla alıntılanan kodlama sayısıdır ve bu tam da sorundur.

Aynı minimal yalnızca bash ajanıyla her modeli çalıştıran Vals AI lider panosu, 1 Eylül 2026 güncellemesinde Claude Opus 5’i %97,0, DeepSeek V4 Pro 0813’ü %96,4 ve GPT-5.6 Sol’u %96,2 olarak verdi ve ardından kıyaslamayı arşivledi.

Üç farklı laboratuvardan 3 model birbirine 1 puan içinde ve tavana 4 puan kala oturuyorsa, metrik ayırt etmeyi bırakmıştır. Yine de eski ve küçük modeller için alıntılıyorum, çünkü kartlarında bu sayı yazıyor; ama sıralamada kullanmıyorum.

SWE-bench Pro daha zoru olarak yerini aldı

Scale AI tarafından sürdürülen SWE-bench Pro, 41 profesyonel depoda 1.865 görev içerir; 731 görevlik herkese açık bir ayrım ve tutulmuş özel setler vardır. 22 Eylül 2026’da Scale, SWE-Bench Pro V2’yi yayınladı; geçersiz bulduğu 89 görevi çıkararak herkese açık seti 642 göreve indirir; bu yüzden bir skorun hangi sürümde çalıştırıldığını kontrol edin.

Ortalama düzeltme 4,1 dosyada 107,4 satıra dokunur ve depolar yalnızca Python değil birden çok dili kapsar. SWE-bench Pro makalesi Eylül 2025’te çıktığında en iyi modeller %23 civarında skor alıyordu.

Bir yıl sonra Anthropic’in Fable 5.1 sistem kartı Fable 5.1 için %81,2 ve Opus 5 için %79,2 raporladı; OpenAI’nin GPT-5.6 lansman tablosu GPT-5.6 Sol için %64,6 bildirdi. Fable kartından üç hafta sonra Opus 5.5 sistem kartı en üst skoru %89,9’a taşıdı.

Bunlar üretici çalıştırmalarıdır; Anthropic tarafında azami çabayla 5 denemenin ortalaması. Scale’in kendi herkese açık panosu üretici sayılarını aylarca geriden takip ettiği için, üretici rakamını tavan, panoyu taban olarak ele alıyorum.

Terminal-Bench 2.1 ve 4.0

Terminal-Bench, bir kapsül içinde canlı bir kabuk verip “bu modeli eğit”, “bu derlemeyi düzelt” veya “bu bozuk arşivi kurtar” gibi görevler verir ve üretilen yapıtları notlar.

2.1 sürümü, yazılım mühendisliği, sistem yönetimi, veri işleme ve güvenlikten seçilmiş 89 görevdir ve Artificial Analysis bunu Terminus 2 kuşağıyla 3 koşunun ortalaması olan pass@1 olarak puanlar. Kodlama ajanları inşa eden veya kullanan herkes için en çok ağırlık verdiğim tek sayıdır.

Stanford, Harbor ve Laude Enstitüsü tarafından tbench.ai üzerinde barındırılan Terminal-Bench 4.0 ise yeni sınır setidir.

Anthropic’in Opus 5.5 sistem kartı, bunu hesaplamalı biyoloji, fizik simülasyonu, CAD, biçimsel ispatlar ve GPU performans işi gibi alanlara eğilimli 66 görev olarak tanımlar; zaman aşımı süreleri daha uzundur, bu yüzden kuşak daha az önemlidir.

tbench.ai ajan lider panosunda GPT-6 Astra hâlâ %58,2 ile birinci, Claude Fable 5.1 %57,9 ile arkasında; ancak Claude Opus 5.5’in orada bir ajan girişi henüz yok. Model düzeyi çalışmalarda Artificial Analysis Opus 5.5 ve Astra’yı %59,6’da eşit gösteriyor; Vals AI ise Opus 5.5’i %61,6 ile birinci koyuyor; ancak Vals, korumalarının bir yedek modele devrettiği görevler başarısız sayılırsa bu rakamın %53,5’e düştüğünü belirtiyor. İşte sınırın sürüden ayrıldığı yer burası.

LiveCodeBench v6 ezberlemeyi yakalar

LiveCodeBench, Jain ve arkadaşlarının 2024 makalesinde tanıtıldığı üzere, LeetCode, AtCoder ve Codeforces’tan sürekli görev toplar ve her birini zaman damgalar; böylece bir modeli yalnızca eğitim kesiminden sonra yayınlanan sorunlarda değerlendirebilirsiniz.

Sürüm 6, herkese açık lider panoda güncel penceredir. Depo ölçekli mühendislikten ziyade algoritmik akıl yürütmeyi ölçer; bu nedenle mülakat tarzı ve veri yapıları işleri için yararlı kalmıştır.

Sınır laboratuvarları 2026’da bunu büyük ölçüde raporlamayı bıraktı; elimdeki sayılar açık ağırlıklılardan: Nisan DeepSeek V4 Pro ön izlemesi %93,5, Qwen3.8-27B %90,3 ve Kimi K2.6 %89,6. Gemini 3.1 Pro ilgili bir metriği, 2.887 LiveCodeBench Pro Elo raporlar.

Bir üretici kıyaslama tablosunu nasıl okurum

Bir üretici kıyaslama tablosu en iyi ihtimali temsil eder: kendi kuşakları, kendi çaba ayarları, kendi deneme sayıları. 3 puandan küçük bir farka inanmadan önce Artificial Analysis, Vals AI veya tbench.ai lider panosunda bağımsız bir tekrarı ararım.

LLM kıyasları ve modelleri nasıl karşılaştıracağınız hakkındaki özetimiz büyük panoları anlatır; MMLU’nun ne ölçtüğüne dair yazımız da bir bilgi kıyasının, bir modelin sallanan bir testi düzeltip düzeltemeyeceği hakkında size neredeyse hiçbir şey söylemediğini hatırlatır.

Kendi değerlendirme kuşağınızı inşa etmek için, LLM değerlendirme metrikleri ve metodolojileri rehberimiz, genç meslektaşlarıma ilk yönlendirdiğim kaynaktır.

Bu kıyasları tanımladıktan sonra, buluttaki sınırla başlayarak 9 modelin üzerlerinde nasıl skor aldığı geliyor.

Kodlama İçin En İyi Bulut Sınır Modelleri Hangileri?

Eylül 2026’da kodlama için en iyi bulut sınır modelleri Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra ve Gemini 3.8 Flash’tır ve dördü de yaklaşık 1M tokenlık bir bağlam penceresiyle gelir.

Farklar fiyat, çaba ayarları ve her laboratuvarın optimize ettiği kıyaslardır.

Herhangi birini karşılayabilen bir ekibe önereceğim sırayla listeliyorum.

1. Claude Opus 5.5 (Anthropic)

Claude Opus 5.5, 22 Eylül 2026’da yayınlanan Anthropic’in yeni Opus sınıfı amiralidir ve artık neredeyse herkes için önereceğim kodlama modelidir. Bunu Opus 5’ten 2 ay sonra yazmayı beklemiyordum. Anthropic’in lansman yazısı, çoğu işte Fable 5.1 seviyesinde performans gösterdiğini ve Opus 5’e kıyasla çalıştırma maliyetinin %40 daha düşük olduğunu söylüyor; model genel bakışı ise geliştiricilere Opus 5.5 ile başlamalarını, zorlu uzun ufuklu işler veya Opus 5.5’in değerlendirmelerinin yetersiz kaldığı durumlarda Fable 5.1’e yönelmelerini söylüyor.

Opus 5.5 sistem kartı SWE-bench Pro’da %89,9, DeepSWE v1.1’de %74,2 ve Terminal-Bench 4.0’da xhigh çabada %66,4 raporlar; Anthropic’in yayınladığı her kod satırında Fable 5.1’in önündedir. Bağımsız sayılar daha yakın: Artificial Analysis Terminal-Bench 4.0’da GPT-6 Astra ile %59,6’da eşit gösteriyor ve Vals AI Terminal-Bench 4.0’da %61,6 ve Terminal-Bench 2.1’de %87,6 ile birinci koyuyor. Her iki Vals sayısı da güvenlik geri dönüşlerini içeriyor; bunları başarısız sayarsanız %53,5 ve %79,8’e düşüyorlar.

Öne çıkanlar:

  • Milyon giriş token’ı başına $4 ve milyon çıkış token’ı başına $20, Opus 5’in %20 altında; önbellek okuma maliyeti %60 düşüşle milyon başına $0,20
  • 1M token bağlam, 128K çıktı, kapatılamayan uyarlamalı düşünme ve varsayılan çaba yüksek yerine orta
  • CursorBench 4.0’da azami çabayla %57,8; Cursor panosunun en yüksek skoru; orta çabada %52,5, yine de Fable 5.1’in azami skorunun üzerinde
  • Claude API’de claude-opus-5-5 olarak, ayrıca Amazon Bedrock, Google Cloud ve Microsoft Foundry’de mevcut

En uygun kullanım: günlük kodlama, tüm kod tabanında göçler ve kod inceleme. Daha düşük fiyata Opus 5’in yerini doğrudan alır ve Claude Code artık varsayılan Opus modeli olarak bunu kullanır. Claude Opus 5.5 rehberimiz lansmanı kapsar ve GPT-6 Sol ve Claude Opus 5.5 karşılaştırmamız uygulamalı bir test içerir.

Ödünleşim: %40 tasarruf varsayılan çabada geçerlidir. Azami çabada Artificial Analysis Opus 5’e kıyasla çok daha fazla token kullandığını buldu; bu yüzden Zekâ Endeksi görevi başına maliyeti ($5,98), Opus 5’in ($5,86) neredeyse aynı seviyesine indi. Ayrıca çoğu siber güvenlik görevini Opus 4.8’e yönlendiren Fable tarzı korumalarla birlikte gelir ve kod göçleri dikkat ister; çünkü düşünmenin devre dışı bırakıldığı veya zorunlu araç kullanımının olduğu istekler artık hata döndürür.

2. Claude Fable 5.1 (Anthropic)

Claude Fable 5.1, 1 Eylül 2026’da yayınlanan Anthropic’in Mythos sınıfı modelinin herkese açık sürümüdür ve Opus 5.5’in yolu bittiğinde yükselttiğim modeldir. Anthropic’in lansman sayfası, Fable 5.1 ile Claude Mythos 5.1’in aynı model olduğunu, yalnızca korumaların farklı olduğunu belirtir.

Fable 5.1 sistem kartındaki sayılar SWE-bench Pro’da %81,2 ve Terminal-Bench 4.0’da %55,8’dir. Artificial Analysis bağımsız olarak azami çabada Terminal-Bench 2.1’de %91,4 ölçtü; hâlâ o panodaki en yüksek skor.

Öne çıkanlar:

  • 1M token bağlam penceresi ve 128K çıktı token’ı
  • Uyarlamalı düşünme daima açık
  • 5.1 ile istem önbelleği okumaları milyon token başına $0,25’e %75 düştü; Anthropic bu durumun aracısal iş yüklerini %45’e kadar azalttığını tahmin ediyor
  • Güçlü çok dosyalı planlama ve daha geniş düşünme, daha iyi araç kullanımıyla

En uygun kullanım: üretim aracısal hatları, çok günlük yeniden düzenlemeler ve yanlış cevabın token’lardan daha pahalıya patladığı her iş; tabii değerlendirmeleriniz Opus 5.5’in bu işte yetersiz kaldığını gösterdikten sonra. Claude Fable 5.1 rehberimiz bu sürümü, Claude Fable 5 genel bakışımız ise Haziran’daki orijinali kapsar.

Ödünleşim: Milyon giriş token’ı başına $10 ve milyon çıkış token’ı başına $50, Opus 5.5’in oranının 2,5 katıdır ve Anthropic’in kendi tablosunda Fable 5.1 artık SWE-bench Pro, Terminal-Bench 4.0 ve CursorBench 4.0’da Opus 5.5’in gerisinde kalır. Anthropic gerçek dünyadaki farkın bu skorların ima ettiğinden daha dar olduğunu söylüyor; fakat ispat yükü tersine döndü. Daha eski CursorBench 3.2.0’da Fable 5.1 orta çabada görev başına $3,53 maliyetle %68,0 aldı.

3. GPT-6 Astra (OpenAI)

GPT-6 Astra, 3 Eylül 2026’da yayınlanan OpenAI’nin sınır modelidir ve hâlâ tbench.ai Terminal-Bench 4.0 ajan lider panosunda Codex kuşağı ve azami çabayla %58,2 ile birincidir; gerçi Opus 5.5’in orada henüz bir ajan girişi yok.

Model sayfası 1.050.000 tokenlık bir bağlam penceresi, 128.000 çıktı token’ı, 30 Nisan 2026 bilgi kesimi ve hiçten azamiye çaba düzeylerini listeler. Fiyatlandırma milyon giriş token’ı başına $10, önbelleğe alınmış giriş için $1 ve milyon çıkış token’ı başına $50’dir.

OpenAI’nin lansman materyali, karma laboratuvar kıyasları yerine kendi değerlendirmelerine ve sistem kartına dayanır. Değerlendirmeleri güçlüdür; fakat Astra’nın Opus 5.5 veya Fable 5.1’e karşı net bir galip olduğunu söylemem. Lansman sayılarını GPT-6 Astra genel bakışımızda ele alıyoruz.

Öne çıkanlar:

  • Responses API, Codex’in kendisinin çalıştığı araç seti olan hosted_shell, apply_patch, computer_use ve tool_search’ü açığa çıkarır.
  • Önbelleğe alınmış giriş milyon token başına $1; taban fiyatın onda biri; aynı depoyu yeniden okuyan ajan döngüleri için önemlidir.
  • Astra, OpenAI’nin Hazırlıklılık Çerçevesinin en üst siber güvenlik kademesine ulaşan ilk modelidir; bu nedenle bazı güvenlik yanlısı istemler kapılıdır.

En uygun kullanım: Halihazırda Codex, GitHub Copilot veya Microsoft yığınında olan ekipler, bilim ve mühendislik ağırlıklı işler ve daha iyi üçüncü taraf araç desteğine ihtiyaç duyan herkes. Kabiliyetin çoğunu daha ucuza istiyorsanız, GPT-6 Sol 22 Eylül’de milyon token başına $2 giriş ve $10 çıkışla yayınlandı; GPT-5.6 Sol’ün ardılıdır ve GPT-6 Terra olmayınca, artık Terra’nın eski fiyat kademesini doldurur. OpenAI’nin kendi grafiklerinde DeepSWE 1.1’de %68,8 ve FrontierCode’da %49,3 skorlar; gerçi azami çabada GPT-5.6 Sol hâlâ DeepSWE’de daha yüksek skor alır.

Ödünleşim: Fable seviyesinde fiyatlandırma ve Opus 5.5, Anthropic’in hesabına göre görev başına maliyetin yaklaşık %40’ıyla Terminal-Bench 4.0’da Astra’ya yetişmiştir; Artificial Analysis de ikisini eşit skorlar. Astra’nın en net üstünlüğü bilim ağırlıklı işlerde; Terminal-Bench-Science’ta %64,6 ve FrontierSWE v2’de %65,5 ile her ikisinde de Opus 5.5’in önündedir.

4. Gemini 3.8 Flash (Google)

Gemini 3.8 Flash, 2 Eylül 2026’da yayınlanan Google’ın iş atı modelidir ve sınır laboratuvarı seviyesinde aracısal kodlama skoru elde etmenin en ucuz yollarından biridir (GPT-6 Luna token başına daha ucuzdur ama aracısal skorları daha düşüktür). Google’ın değerlendirme raporu Terminal-Bench 2.1’de %89,4 ve uzun ufuklu 113 görevlik DeepSWE v1.1’de %73,7 gösterir; Fable 5.1 aynı sette %67,4 almıştır. Aynı tabloda Opus 5 biraz önde %74,0’tadır; Anthropic Opus 5.5 için %74,2 raporlar ve Google’ın geliştirici rehberi SWE-bench Pro’da %61,6 ekler.

Gemini API fiyatlandırma sayfasında 31 Aralık 2026’ya kadar milyon giriş token’ı başına $0,75 ve milyon çıkış token’ı başına $3,75; 1 Ocak 2027’den itibaren ise $1,50 ve $7,50’dir. 2027 fiyatında bile bu, Opus 5.5’in çıkış oranının üçte birinden biraz fazladır. Bağlam penceresi 1M giriş token ve 64K çıktıdır.

Öne çıkanlar:

  • Yerel çok kipli giriş; böylece mimari diyagramı veya başarısız bir arayüz ekran görüntüsünü kodun yanına verebilirsiniz.
  • Google bunu yüksek hacimli aracısal işler için konumlandırır ve fiyatlamasını buna göre yapar.
  • Güvenlik açığı işleri için ayrı kapılı bir Cyber varyantı vardır; Gemini 3.8 Flash ve Flash Cyber genel bakışımızda bunu kapsıyoruz.

En uygun kullanım: yüksek hacimli ajan döngüleri, maliyete duyarlı ekipler ve Vertex AI kullananlar. 19 Şubat 2026’da yayınlanan Gemini 3.1 Pro, milyon token başına $2 giriş ve $12 çıkışla Google’ın Pro sınıfı modeli olarak %54,2 SWE-bench Pro ile duruyor; ancak özellikle kodlama için bugün 3.8 Flash’ı 3.1 Pro’ya tercih ederim.

Ödünleşim: Terminal-Bench 4.0’da %19,1. Flash iyi tanımlı terminal işlerinde güçlü, sınır bilim görevlerinde zayıftır; bu yüzden en zor biletler için daha güçlü bir modeli hazırda tutun.

Bulut modelleri bu kadar. Listenin geri kalanı indirip çalıştırabileceğiniz modeller.

2026’nın En İyi Açık Ağırlıklı Kodlama LLM’leri Hangileri?

2026’nın en iyi açık ağırlıklı kodlama LLM’leri 2 gruba ayrılır: DeepSeek V4.1 Flash ve Kimi K3 gibi sınır skorlarını yakalayan ama ciddi sunucu donanımı isteyen veri merkezi ölçeği modeller ve Qwen3.8-27B ile Laguna S 2.1 gibi sahip olduğunuz donanımda çalıştırabileceğiniz 120B altı modeller.

Burada “açık ağırlık” ağırlıkların indirilebilir olduğu anlamına gelir. Gerçek lisanslar MIT ve Apache 2.0’dan özel şartlara kadar uzanır.

5. DeepSeek V4.1 Flash (DeepSeek)

DeepSeek V4.1 Flash, 10 Eylül 2026 sürümüdür ve Flash adına rağmen artık öncelikle başvuracağım DeepSeek modelidir. DeepSeek, bu modelin kendi amirali V4 Pro 0813’ü performans, maliyet, hız ve görev tamamlama süresinde geçtiğini söylüyor. Vals AI’nin bağımsız endeksi de aynı yönde; Ağustos’ta V4 Pro 0813 için kaydedilen %52,4’e karşı %57,9 ile en iyi açık ağırlıklı model olarak sıralıyor.

Girişte token başına yaklaşık 8B, çıkışta 16B aktif parametreyle 552B parametreli bir uzman karışımı (MoE) modelidir; 1M token bağlam, yerel görsel giriş ve MIT lisanslı ağırlıklar sunar. DeepSeek Terminal-Bench 2.1’de %90,6 ve DeepSWE v1.1’de %74,2 bildirir; her ikisinde de üretici raporları arasında en yüksek açık ağırlıklı skorlar. Vals AI’nin kendi Terminal-Bench 2.1 koşusu daha az cömerttir: %74,5 ve açık ağırlıklılar arasında ikinci.

Bu sürümü ayrıntılı olarak DeepSeek V4.1 Flash genel bakışımızda ele alıyoruz.

Öne çıkanlar:

  • DeepSeek’in fiyatlandırma sayfasında API fiyatı, yoğun olmayan saatlerde milyon giriş token’ı başına $0,15 ve milyon çıkış token’ı başına $0,60; hafta içi yoğun saatlerde (UTC 01:00–04:00 ve 06:00–10:00) iki katı ($0,30 ve $1,20). Önbellek isabeti yoğun olmayan saatlerde milyon başına $0,003.
  • OpenAI uyumlu bir API’de deepseek-flash olarak sunulur; bu yüzden bu yazının ilerleyen kısmındaki ask_coding_model.py yalnızca temel URL değişikliğiyle çalışır.
  • V4 Flash’ın yaklaşık dörtte biri boyutunda bir KV önbelleği; DeepSeek uzun bağlam işlerini bu kadar ucuza böyle fiyatlar.

En uygun kullanım: çok düşük maliyetle sınır seviyesine yakın terminal kodlama ve yoğun olmayan saatlere planlanabilecek yığın kod işleri.

Ödünleşim: DeepSeek’in kendi raporunda Terminal-Bench 4.0’da %31,2; dolayısıyla en zor uzun ufuklu ajan işleri hâlâ sınır laboratuvarlarına aittir. Kontrol noktası da yaklaşık 510 GB’tır; bu yüzden burada “açık ağırlık” çoklu GPU sunucu demektir. V4 Pro 0813 üzerindeyseniz, DeepSeek bu modeli 14 Eylül’de V4.1 Flash’a yönlendireceğini duyurdu, sonra kararından döndü ve V4 Pro, yeni bir duyuruya kadar yoğun olmayan saatlerde $0,66/$1,98’ten sunulmaya devam ediyor.

6. Kimi K3 (Moonshot AI)

Kimi K3, Temmuz 2026’da yayınlanan Moonshot AI’nin 2,8 trilyon parametreli açık ağırlıklı amiralidir ve Terminal-Bench 2.1’de %88,3 alır; açık modeller arasında DeepSeek V4.1 Flash’ın üretici raporlu %90,6’sının arkasından ikinci.

Hugging Face kartı, 896 uzmanda 104B aktif parametre (token başına 16 yönlendirilmiş + 2 paylaşılan), 1.048.576 token bağlam ve MXFP4 ağırlıkları listeler. Vals AI, SWE-bench Verified’da %93,4 ölçtü.

Öne çıkanlar:

  • 1M token bağlam ve yerel görsel.
  • Kimi K3 Lisansı altında sunulur; MIT veya Apache yerine özel bir lisans; ticari kullanım öncesi okuyun.
  • Önerilen çıkarım yığınları vLLM, SGLang ve TokenSpeed’dir; Moonshot bazı GPU değerlendirme görevlerini H20 GPU’lar için kalibre etti.

En uygun kullanım: mevcut en güçlü açık aracısal kodlayıcıyı isteyen herkes.

Ödünleşim: sınır seviyesine yakın kabiliyet yalnızca veri merkezi ölçeğinde gelir. Terminal-Bench 2.1’de Fable 5.1 ile 3 puanlık fark yakın görünür; fakat bire bir değildir: Moonshot %88,3’ü kendi Kimi Code kuşağında ölçtü; Fable’ın %91,4’ü ise Artificial Analysis’in Terminus 2 koşularından gelir. Pratikte bunu barındırılmış bir sağlayıcıdan kiralarsınız veya kendi kümenizi çalıştırırsınız; ayrıca önce hukukla temizlenmesi gereken özel bir lisans vardır.

7. Qwen3.8-27B (Alibaba)

Qwen3.8-27B, Ağustos 2026’da Apache 2.0 altında yayınlanan yoğun 27 milyar parametreli bir modeldir ve tek bir 24 GB GPU’da çalıştırabileceğiniz en iyi kodlama LLM’idir.

Model kartı SWE-bench Pro’da %61,7, Terminal-Bench 2.1’de %73,0, LiveCodeBench v6’da %90,3 ve DeepSWE 1.1’de %42,2 raporlar; yerel 262.144 token bağlam YaRN ile 1M’e uzatılabilir. Bu SWE-bench Pro ve Terminal-Bench sayıları, boyutunun 4 katı olan Laguna S 2.1’i ve SWE-bench Pro’da Gemini 3.1 Pro’yu geçiyor. Kabul; Qwen, SWE-bench Pro’yu kendi düzeltilmiş görev setinde çalıştırdı; bu yüzden laboratuvarlar arası karşılaştırmaları yön gösterici olarak ele alın.

Öne çıkanlar:

  • Topluluktan Unsloth UD-Q4_K_M GGUF tek bir 16,5 GB dosyadır; 24 GB kartta 32K bağlam için alan bırakır. UD-Q4_K_XL 17,6 GB’tır.
  • Yoğun mimari; token başına 3B aktif MoE’den daha yavaştır ama çok dosyalı düzenlemelerde çok daha tutarlıdır.
  • Apache 2.0; ticari ürünler için kullanım kısıtı yoktur.

En uygun kullanım: kodu harici bir API’ye gönderemeyen geliştiriciler, tek bir RTX sınıfı GPU’ya sahip bireysel çalışmacılar ve buluta para vermeden önce kendi deponuzda yerel ve Claude karşılaştırması yapmak isteyen herkes.

Ödünleşim: Terminal-Bench 2.1’de %73,0’a karşı %91,4 hâlâ 18 puanlık bir farktır ve bu, uzun aracısal görevlerde daha fazla denemeye dönüşür.

8. Laguna S 2.1 (Poolside)

Laguna S 2.1, 21 Temmuz 2026’da yayınlanan, 8B aktif parametreli 118B parametreli Poolside’ın uzman karışımı kodlama modelidir ve Mac Studio, DGX Spark veya çoklu GPU iş istasyonu için açık ağırlıklı seçimdir.

Poolside’ın lansman yazısı herkese açık SWE-bench Pro setinde %59,4, Terminal-Bench 2.1’de azami düşünmeyle %70,2 (düşünme kapalıyken %60,4), SWE-bench Multilingual’da %78,5 ve DeepSWE’de %40,4 raporlar.

Model 409.000 ortamda, 83.000 terminal görevi ve 168.000 yazılım mühendisliği iş akışı dahil, 4.096 H200 üzerinde 9 haftadan kısa sürede eğitildi.

Öne çıkanlar:

  • Bu boyutta alışılmadık şekilde 1M token bağlam penceresi.
  • OpenMDW-1.1 lisansı; izin vericidir ama hukuk ekibinizin okumasına değerdir.
  • Düşünme modu varsayılan olarak açıktır ve Terminal-Bench 2.1’de yaklaşık 10 puan kazandırır; Poolside’ın koşularında ortalama tamamlama uzunluğu görev başına yaklaşık 23K ile 249K token arasında değişti; buna göre bütçeleyin.

En uygun kullanım: 96 ila 128 GB birleşik bellekli bir makinede Claude Code tarzı yerel bir ajan isteyen ekipler ve yerelde 1M pencereye ihtiyaç duyan kadar büyük depolar.

Ödünleşim: 4 bit’te 118B parametre, bir KV önbelleği ayırmadan önce kabaca 60 ila 70 GB ağırlık demektir; bu yüzden 24 GB GPU olmaz. Ham skorlarda Qwen3.8-27B onu az farkla geçer; ancak Laguna’nın 8B aktif parametresi, ağırlıklar sığdıktan sonra çok daha hızlıdır; bir gece boyunca çalışan ajanın amacı da budur.

9. Qwen3-Coder-Next (Alibaba)

Qwen3-Coder-Next, token başına yalnızca 3B parametre etkinleştiren 80B parametreli bir uzman karışımı modeldir; 3 Şubat 2026’da Apache 2.0 altında yayınlanmıştır ve yoğun 27B modeli hızda tutamayan donanım için hâlâ faydalı olan en hızlı yerel kodlayıcıdır.

Model kartı SWE-bench Verified’da %70,6, SWE-bench Pro’da %44,3 ve Terminal-Bench 2.0’da %36,2 raporlar; 512 uzman (token başına 10 aktif + 1 paylaşılan) ve 262.144 token bağlam vardır. Yalnızca düşünmesiz modda çalışır.

Öne çıkanlar:

  • Resmî Q4_K_M GGUF yaklaşık 48 GB’tır; tek bir tüketici GPU’dan ziyade 64 GB’lık bir Mac veya CPU-yük aktarma kurulumuna daha uygundur.
  • Hibrit dikkat (her standart dikkat katmanı başına 3 Gated DeltaNet katmanı) uzun bağlam bellek kullanımını düşük tutar.
  • Karta göre vLLM, SGLang, Ollama, LM Studio, MLX-LM, llama.cpp ve KTransformers’ta desteklidir.

En uygun kullanım: doruk doğruluktan ziyade saniye başına token’ın önemli olduğu uzun ufuklu gece görevleri ve 64 GB birleşik belleğe sahip dizüstüler.

Ödünleşim: SWE-bench Pro’da %44,3, Qwen3.8-27B’nin 17 puan gerisindedir; tek bir zor hata için yoğun modele giderdim.

Bakmaya değer diğer açık ağırlıklı modeller

Dörde yakın model listeye girmeye yaklaştı ve bunlardan 2’si belirli ekipler için benim seçimlerimden daha uygun olacaktır:

Bu açık ağırlık seçeneklerinden biri donanımınıza uyuyorsa, bir sonrakinde nasıl çalıştıracağınıza bakalım.

Açık Ağırlıklı Bir Kodlama Modelini Yerelde Nasıl Çalıştırırsınız?

Açık ağırlıklı bir kodlama modelini yerelde çalıştırmak 3 adım ister: nicemlenmiş bir kontrol noktası indirin, OpenAI uyumlu bir uç noktanın arkasında servis edin ve istemcinizi veya kodlama asistanınızı bu uç noktaya yönlendirin. Bu örnekte, tüketici donanımına sığdırması en kolay olduğu için Qwen3.8-27B’yi kullanacağım.

İlk olarak indirme. huggingface_hub kitaplığı, bu büyük dosyalarda yardımcı olan sürdürülebilir aktarımları ve önbelleğe almayı yönetir:

"""Download a quantized coding model from Hugging Face.
 
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
 
from huggingface_hub import hf_hub_download
 
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
 
 
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
    """Download one file from the Hub and return its local path."""
    path = hf_hub_download(repo_id=repo_id, filename=filename)
    print(f"Saved to {path}")
    return path
 
 
if __name__ == "__main__":
    fetch()

Bunu download_gguf.py olarak kaydedin ve uv run --with huggingface_hub python download_gguf.py komutunu çalıştırın. Windows’ta Geliştirici Modu kapalıysa sembolik bağlantılar hakkında bir uyarı görürsünüz.

İkinci adım, servis etmek.

llama.cpp’nin llama-server’ı, LM Studio veya Ollama, OpenAI uyumlu bir /v1 uç noktası sunar. llama.cpp ile komut tek satırdır ve işi 2 bayrak yapar: -ngl 99 tüm katmanları GPU’ya aktarır ve -c 32768 32K bağlam ayarlar.

llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080

Üçüncü adım, istemci. Değerlendirdiğim her model için (yerel veya barındırılmış) tek bir betik tutarım ve hedefleri 3 ortam değişkeniyle değiştiririm. Aynı dosya yukarıdaki yerel sunucuya, DeepSeek’in API’sine veya OpenAI’ye konuşur:

"""Send one coding prompt to any OpenAI-compatible endpoint.
 
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
 
    LLM_BASE_URL   e.g. http://localhost:8080/v1  or  https://api.deepseek.com
    LLM_MODEL      e.g. qwen3.8-27b  or  deepseek-flash
    LLM_API_KEY    anything non-empty for a local server
"""
 
import os
 
from openai import OpenAI
 
PROMPT = (
    "Write a Python function top_n(df, col, n) that returns the n largest "
    "rows of a pandas DataFrame by column col, with a docstring and a "
    "ValueError if col is missing."
)
 
 
def ask(prompt: str = PROMPT) -> str:
    """Return the model's reply for a single-turn coding request."""
    client = OpenAI(
        base_url=os.environ["LLM_BASE_URL"],
        api_key=os.environ.get("LLM_API_KEY", "local"),
    )
    response = client.chat.completions.create(
        model=os.environ["LLM_MODEL"],
        messages=[{"role": "user", "content": prompt}],
        temperature=0.2,  # keep code generation close to deterministic
    )
    return response.choices[0].message.content
 
 
if __name__ == "__main__":
    print(ask())

Bunu ask_coding_model.py olarak kaydedin ve LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.py ile çalıştırın.

Bu uç noktaların birkaçını yeniden denemeler, yönlendirme ve araç çağrılarıyla bir uygulamaya bağlamaya devam ederseniz, LangChain ile LLM uygulamaları geliştirme kursumuz, bunun bir if yığınına dönüşmesini engelleyen soyutlamaları kapsar.

Kodlama İçin En İyi LLM’i Nasıl Seçmelisiniz?

Kodlama için en iyi LLM’i seçmek 4 kısıta dayanır: kodunuz makinenizden çıkabilir mi, ne kadar belleğiniz var, milyon çıkış token’ı başına ne ödeyeceksiniz ve tek bir görevin ne kadar bağlama ihtiyacı var. Aşağıdaki tablo, sıralanan 9 modeli en çok güvendiğim sayılarla yan yana koyar; ardından gelen karar rehberi bu kısıtları bir seçime eşler.

Model Tür Terminal-Bench 2.1 SWE-bench Pro Bağlam Fiyat (1M çıkış) veya bellek En uygun kullanım
Claude Opus 5.5 Bulut %87,6 (Vals AI) %89,9 1M $20 Çoğu kodlama işi için varsayılan
Claude Fable 5.1 Bulut %91,4 (Artificial Analysis) %81,2 1M $50 En uzun ufuklu aracısal işler
GPT-6 Astra Bulut Yayınlanmadı (Terminal-Bench 4.0’da %58,2 tbench.ai / %59,6 Artificial Analysis) Yayınlanmadı 1,05M $50 Codex kullanıcıları, sınır bilim işleri
Gemini 3.8 Flash Bulut %89,4 %61,6 1M 2026 sonuna kadar $3,75 Yüksek hacim, maliyet duyarlı ajanlar
DeepSeek V4.1 Flash Açık (MIT) %90,6 (üretici); %74,5 (Vals AI) Yayınlanmadı 1M Yoğun olmayan saatte $0,60 API ile en ucuz yetkin açık ağırlıklar
Kimi K3 Açık (özel) %88,3 (Kimi Code kuşağı) Yayınlanmadı 1M 2,8T parametre, yalnız küme En güçlü öz barındırılan ajan
Qwen3.8-27B Açık (Apache 2.0) %73,0 %61,7 262K UD-Q4_K_M’de 16,5 GB Tek 24 GB GPU
Laguna S 2.1 Açık (OpenMDW-1.1) %70,2 %59,4 1M Q4’te 60–70 GB 128 GB iş istasyonu, yerel ajanlar
Qwen3-Coder-Next Açık (Apache 2.0) %36,2 (2.0) %44,3 262K Yaklaşık 48 GB Q4’te Hızlı yerel model, 64 GB Mac

Karar rehberi

4 kısıtı sıralamalara şöyle eşliyorum:

  • Doğruluğun maliyete baskın geldiği aracısal kodlama hatları: Yüksek veya çok yüksek çabada Claude Opus 5.5; değerlendirmeleriniz Opus 5.5’in yetersiz kaldığını gösterdiği uzun ufuklu görevlerde Fable 5.1 hazırda.
  • Makûl fiyata günlük yapay zekâ destekli kodlama: Önce varsayılan orta çabada Claude Opus 5.5; Codex ekosistemindeyseniz ikinci olarak GPT-6 Sol.
  • Sınır bilim, simülasyon veya GPU çekirdeği işleri: GPT-6 Astra veya Claude Opus 5.5. Astra Terminal-Bench-Science’ta önde, Opus 5.5 Terminal-Bench 4.0’da.
  • Dev kod tabanı, 1M tokenlık istemler, dar bütçe: Fiyat için Gemini 3.8 Flash; Flash’ın yanıtları dağıldığında Opus 5.5.
  • API üzerinden açık ağırlıklar: Yoğun olmayan saatte DeepSeek V4.1 Flash.
  • Tek bir 24 GB GPU’da yerel ve özel: UD-Q4_K_M’de Qwen3.8-27B.
  • 96 ila 128 GB makinede yerel ve özel: Laguna S 2.1; “makine” kümeyse Kimi K3.
  • 64 GB dizüstünde yerel ve hızlı: Qwen3-Coder-Next.

Bir modeli bir uygulamayla eşlemek için barındırma seçenekleri ve lisanslamayı da içeren daha genel bir çerçeve istiyorsanız, uygulamanız için en iyi LLM’i nasıl seçeceğiniz üzerine rehberimiz, kodlamanın ötesine geçer.

Ve hangi modeli seçerseniz seçin, ondan değer çıkarmayı sağlayan beceriler aynıdır: Yazılım Mühendisliği için Yapay Zekâ beceri yolumuz ve geliştiriciler için yapay zekâ destekli kodlama kursumuz, %91’lik bir kıyaslamayı birleştirilmiş bir çekme isteğine dönüştüren istem, test ve inceleme alışkanlıklarını öğretir.

Son Düşünceler

Claude Opus 5.5, Eylül 2026’nın en iyi kodlama LLM’i ve alışılmadık şekilde, ekibinizin faturasında da yer vermeniz gereken model. En uzun görevler için yükseltme yolu Claude Fable 5.1 ve Qwen3.8-27B, 24 GB’lık bir GPU’yu geçen yılın sınırını SWE-bench Pro’da yenen özel bir kodlama asistanına çeviren açık ağırlıklı model. Geri kalan her şey kısıtlarınızdır ve yukarıdaki karar rehberi onları nasıl çözeceğime dair yolumdur.

Daha büyük değişim, bu kategoriyi 2 yıl boyunca tanımlayan kıyasın, SWE-bench Verified’ın, açık ağırlıkların ona yetiştiği aynı 12 ayda önemini yitirmiş olması.

Bu bir tesadüf değil.

Opus 5 ve DeepSeek V4 Pro doygun bir testte 0,6 puan arayla otururken ve milyon başına $20’lik bir model artık Anthropic’in kendi $50’lik modelini SWE-bench Pro’da geçerken, değer kuşak tasarımına, çaba bütçelerine ve kendi deponuzda değerlendirmeye kaydı; bu da tam olarak bir üretici tablosunun sizin yerinize yapamayacağı iştir.

O halde bu işi yapın. ask_coding_model.py betiğini alın, 2 veya 3 modele yöneltin, gerçekten ödeyeceğiniz çaba düzeyinde beklemenizden 20 gerçek bilet üzerinde çalıştırın ve burada yazdığım her şeyi o sonuçla geçersiz kılın. Değerlendirme kuşaklarından çok “vibe coding” derseniz, vibe coding nedir ve nerede kırılır yazımız, ödünleşimlere dürüstçe bakar ve aynı model sıralamaları geçerlidir.

SSS

SWE-bench Verified nedir ve kodlama LLM’lerini değerlendirmede neden önemlidir?

SWE-bench Verified, her GitHub sorununun çözülebilir ve testlerinin adil olduğunu insan notlayıcıların doğruladığı 500 görevlik SWE-bench alt kümesidir; bir model, gizli testleri geçen bir yama üretmek zorundadır. Önemliydi; çünkü oyuncak fonksiyonlar yazmak yerine gerçek depoları düzeltmeye yönelik ilk geniş güven kazanan testti. 2026’da üst modeller bunun üzerinde %96’nın üzerine çıkıyor; bu yüzden onları ayırmak için SWE-bench Pro ve Terminal-Bench kullanıyorum.

Açık ağırlıklı modeller 2026’da gerçek kodlama görevlerinde Claude ve GPT ile rekabet edebilir mi?

Evet; eski kıyaslarda ve neredeyse aracısal olanlarda. Kimi K3 %88,3 ve DeepSeek V4 Pro 0813 Terminal-Bench 2.1’de %87,9 alıyor; Claude Fable 5.1 ise %91,4. Vals AI, DeepSeek’i SWE-bench Verified’da Opus 5’in 0,6 puan içinde ölçtü. Püf noktası boyut: bu açık modeller 1,6 ila 2,8 trilyon parametreye sahip; bu yüzden “açık”, “dizüstümde çalışır” değil, “API üzerinden ucuz” demektir.

Kodumu harici bir API ile paylaşamazsam kodlama için en iyi LLM hangisi?

Kodumu harici bir API ile paylaşamıyorsam en iyi LLM hangisi? Tek bir 24 GB GPU’da Qwen3.8-27B en iyi seçimdir; Terminal-Bench 2.1’de %73,0 ve SWE-bench Pro’da %61,7, Apache 2.0 lisansı altında. 96 ila 128 GB birleşik belleğiniz varsa, Laguna S 2.1 size hızlı bir yerel ajan için 1M token bağlam ve 8B aktif parametre verir. 64 GB dizüstü için, Qwen3-Coder-Next’in 3B aktif parametresi, hâlâ faydalı olan en hızlı seçenektir.

Bir kodlama LLM’i ile Cursor veya GitHub Copilot gibi bir yapay zekâ kodlama asistanı arasındaki fark nedir?

Bir kodlama LLM’i, kodu üreten modeldir; bir kodlama asistanı ise dosyalarınızı okuyan, komutları çalıştıran ve farkları sunan kuşaktır. Cursor, Copilot, Windsurf, Claude Code ve Codex, alttaki modeli değiştirmenize izin verir ve aynı model farklı kuşaklarda birkaç puan farklı skor alabilir. Modeli kıyaslar ve fiyata göre, asistanı ise iş akışına göre seçin.

En iyi kodlama LLM’i ne sıklıkla değişir ve nasıl güncel kalmalıyım?

Anthropic ve OpenAI, 28 Mayıs ile 24 Eylül 2026 arasında tek başlarına 7 sınır sınıfı model gönderdi (Opus 4.8, Fable 5, Sonnet 5, GPT-5.6, Opus 5 ve 5.5 ve Fable 5.1 artı GPT-6 Astra); bu yüzden liderin her 4 ila 8 haftada bir değişmesini bekleyin. Lansman yazıları yerine Artificial Analysis, Vals AI ve tbench.ai olmak üzere 3 bağımsız panoyu izleyerek güncel kalın ve kullandığınız bir model yeni sürüm aldığında, gerçekten ödeyeceğiniz çaba düzeyinde kendi 20 görevlik değerlendirmenizi tekrar çalıştırın.


Tim Lu's photo
Author
Tim Lu
LinkedIn

Mekânsal analiz, makine öğrenimi ve veri hatları konusunda deneyime sahip bir veri bilimciyim. GCP, Hadoop, Hive, Snowflake, Airflow ve diğer veri bilimi/mühendisliği süreçleriyle çalıştım.

Konular
Yapay Zeka
Büyük Dil Modelleri