In februari 2025 scoorde Claude 3.7 Sonnet 62,3% op SWE-bench Verified, of 70,3% met een custom scaffold, terwijl het beste open-weight model van dat moment, DeepSeek-R1, 49,2% in zijn paper rapporteerde.
Dat was een kloof van 13 tot 21 punten, afhankelijk van hoe gul je was met scaffolding.
In september 2026 zet de onafhankelijke Vals AI-board voor SWE-bench Verified Claude Opus 5 op 97,0% en de open-weight DeepSeek V4 Pro 0813 op 96,4%, en Vals archiveerde de benchmark omdat die verzadigd raakte.
De frontier verschoof naar moeilijkere agentic evaluaties zoals SWE-bench Pro en Terminal-Bench 4.0, open weights haalden de oude in, en de vraag "beste LLM voor coderen" werd "beste waarvoor, op welke hardware, tegen welke prijs".
Ik beantwoord die vraag voor de 9 modellen die ik vandaag echt zou overwegen, en de korte versie is dat Claude Opus 5.5 degene is waarmee de meeste teams zouden moeten beginnen.
Een opmerking vooraf: dit artikel gaat over de modellen zelf, niet over de tools eromheen. Als je de vergelijking Cursor, Copilot en Windsurf zoekt, onze roundup van de beste AI-codeerassistenten in 2026 behandelt dat.
In het kort: de beste codeer-LLM's in september 2026
Claude Opus 5.5 is nu zowel het sterkste codeermodel op de meeste benchmarks als degene waar de meeste ontwikkelaars standaard voor zouden moeten kiezen, Claude Fable 5.1 is degene om op te schalen voor werk met de langste horizon, en Qwen3.8-27B is het open-weight model om op één GPU te draaien. Dit zijn de beste keuzes per doel:
- Beste overall voor agentic coderen: Claude Opus 5.5 (Anthropic), 89,9% SWE-bench Pro en 66,4% Terminal-Bench 4.0, voor $4 input en $20 output per miljoen tokens.
- Beste voor werk met de langste horizon: Claude Fable 5.1 (Anthropic), 81,2% SWE-bench Pro en de hoogste Terminal-Bench 2.1-score op Artificial Analysis (91,4%), voor $10 input en $50 output per miljoen tokens.
- Beste OpenAI-model voor coderen: GPT-6 Astra (OpenAI), eerste op het tbench.ai Terminal-Bench 4.0 agent-leaderboard met 58,2%, en gelijk met Opus 5.5 op 59,6% bij de run van Artificial Analysis.
- Beste value van een frontier-lab: Gemini 3.8 Flash (Google), 89,4% Terminal-Bench 2.1 voor $0,75 input en $3,75 output per miljoen tokens t/m 31 december 2026.
- Beste open weights via API: DeepSeek V4.1 Flash, MIT-licentie, 90,6% Terminal-Bench 2.1, $0,60 per miljoen outputtokens buiten piekuren.
- Beste open weights die je niet thuis kunt draaien: Kimi K3 (Moonshot AI), 2,8 biljoen parameters, 88,3% Terminal-Bench 2.1.
- Beste lokaal model op een 24 GB GPU: Qwen3.8-27B (Alibaba), Apache 2.0, 73,0% Terminal-Bench 2.1, 16,5 GB bij UD-Q4_K_M.
- Beste lokaal model voor een 128 GB workstation: Laguna S 2.1 (Poolside), 118B parameters met slechts 8B actief, 1M context.
- Beste snel lokaal model voor oudere hardware: Qwen3-Coder-Next, 80B totaal maar 3B actief, 70,6% SWE-bench Verified.
Elke score hierboven is door de leverancier gepubliceerd, tenzij anders vermeld. De rest van het artikel legt uit hoe ik tot die keuzes kwam en waar elk model tekortschiet.
Waarom gaat deze lijst over modellen en niet over codeerassistenten?
Een codeer-LLM is het model dat je prompt leest en tokens schrijft, terwijl een codeerassistent het harnas is dat bestanden aanlevert, commando's uitvoert en diffs toont.
Claude Code, Codex, Cursor, GitHub Copilot en Windsurf zijn harnassen. Claude Opus 5.5, GPT-6 Astra en Qwen3.8-27B zijn modellen, en het harnas verandert de score meer dan de meeste mensen verwachten.
Anthropic’s eigen launchpost voor Claude Opus 4.8 maakt dit concreet in een voetnoot.
Daarin staat elke modelscore op Terminal-Bench 2.1 op het publieke Terminus-2-harnas, met de aantekening dat GPT-5.5’s score stijgt naar 83,4% binnen OpenAI’s Codex CLI. Zelfde weights, andere plumbing, ander resultaat.
Daarom komen de ranglijsten hieronder met het harnas erbij waar ik dat kon vinden. Als je nieuw bent met hoe deze modellen onder de motorkap werken, onze gids wat een large language model (LLM) is kost 15 minuten en maakt de rest van dit artikel makkelijker te volgen.
Welke benchmarks doen er echt toe voor codeer-LLM's?
De benchmarks die ertoe doen voor codeer-LLM's in 2026 zijn SWE-bench Pro, Terminal-Bench (versies 2.1 en 4.0) en, voor open-weight modellen die het nog melden, LiveCodeBench v6. SWE-bench Verified was 2 jaar de standaard en is nu te verzadigd om de topmodellen te onderscheiden.
Voor ik iets rangschik, dit betekent elk getal in de modelbeschrijvingen.
SWE-bench Verified is verzadigd
SWE-bench Verified is een set van 500 door mensen gevalideerde GitHub-issues uit populaire Python-repositories; het model krijgt de repository en de issue-tekst en moet een patch produceren die de verborgen unittests doorstaat.
OpenAI introduceerde de Verified-subset in 2024 omdat de oorspronkelijke SWE-bench taken bevatte met ondergespecificeerde issues of kapotte tests. Het is nog steeds het meest geciteerde codenummer, en precies dat is het probleem.
De Vals AI-leaderboard, die elk model door dezelfde minimale bash-only agent stuurt, zette Claude Opus 5 op 97,0%, DeepSeek V4 Pro 0813 op 96,4% en GPT-5.6 Sol op 96,2% in de update van 1 september 2026, en markeerde de benchmark daarna als gearchiveerd.
Als 3 modellen van 3 labs binnen één punt van elkaar en 4 punten van het plafond zitten, discrimineert de metric niet meer. Ik citeer ’m nog voor oudere en kleinere modellen omdat het het getal is op hun kaarten, maar ik rangschik er niet op.
SWE-bench Pro is de moeilijkere vervanger
SWE-bench Pro, onderhouden door Scale AI, bevat 1.865 taken over 41 professionele repositories, met een publieke split van 731 taken en achtergehouden private sets. Op 22 september 2026 bracht Scale SWE-Bench Pro V2 uit, die de publieke set terugbrengt naar 642 taken na het droppen van 89 ongeldige, dus check welke versie bij een score hoort.
De gemiddelde fix raakt 107,4 regels over 4,1 bestanden, en de repositories beslaan meerdere talen in plaats van alleen Python. Toen de SWE-bench Pro-paper in september 2025 uitkwam, scoorden de beste modellen rond 23%.
Een jaar later rapporteert Anthropic’s Fable 5.1-systeemkaart 81,2% voor Fable 5.1 en 79,2% voor Opus 5, en OpenAI’s GPT-5.6-launchtabel meldt 64,6% voor GPT-5.6 Sol. Drie weken na de Fable-kaart duwde de Opus 5.5-systeemkaart de topscore naar 89,9%.
Dat zijn vendor-runs, gemiddeld over 5 trials op maximale inspanning bij Anthropic. Scale’s eigen publieke leaderboard loopt maanden achter op de vendorcijfers, dus ik behandel de vendorcijfer als het plafond en het leaderboard als de vloer.
Terminal-Bench 2.1 en 4.0
Terminal-Bench geeft een model een live shell in een container en een taak als "train dit model", "fix deze build" of "herstel dit corrupte archief", en beoordeelt de artefacten die het produceert.
De 2.1-release is 89 gecureerde taken over software-engineering, systeembeheer, dataproc en security, en Artificial Analysis scoort met het Terminus 2-harnas als pass@1 gemiddeld over 3 runs. Dit is het ene getal dat ik het zwaarst weeg voor iedereen die agentic codeerworkflows bouwt of gebruikt.
Terminal-Bench 4.0, gehost door Stanford, Harbor en het Laude Institute op tbench.ai, is de nieuwe frontierset.
Anthropic’s Opus 5.5-systeemkaart beschrijft het als 66 taken met een bias naar computationele biologie, fysicasimulatie, CAD, formele bewijzen en GPU-performancetaken, met langere timeouts zodat het harnas minder uitmaakt.
Op het tbench.ai agent-leaderboard leidt GPT-6 Astra nog steeds met 58,2% met Claude Fable 5.1 op 57,9%, maar Claude Opus 5.5 heeft daar nog geen agentvermelding. Op modelruns heeft Artificial Analysis Opus 5.5 en Astra gelijk op 59,6%, en Vals AI zet Opus 5.5 eerst op 61,6%, al merkt Vals op dat dat cijfer daalt naar 53,5% als je de taken die zijn safeguards aan een fallbackmodel doorgaven als mislukt telt. Hier scheidt de frontier zich van het peloton.
LiveCodeBench v6 pakt memorisatie
LiveCodeBench, geïntroduceerd in de paper uit 2024 van Jain en collega’s, verzamelt continu problemen van LeetCode, AtCoder en Codeforces en timestamp’t elk probleem zodat je een model alleen kunt evalueren op problemen die na zijn training cutoff zijn gepubliceerd.
Versie 6 is het huidige venster op het publieke leaderboard. Het meet algoritmisch redeneren in plaats van engineering op repository-schaal, en bleef daarom nuttig voor interview- en datastructuurwerk.
De frontierlabs stopten in 2026 grotendeels met rapporteren, dus de cijfers die ik heb komen van open-weight modellen: de DeepSeek V4 Pro-preview van april op 93,5%, Qwen3.8-27B op 90,3% en Kimi K2.6 op 89,6%. Gemini 3.1 Pro meldt een gerelateerde metric, een LiveCodeBench Pro Elo van 2.887.
Hoe ik een vendor-benchmarktabel lees
Een vendor-benchmarktabel is een best case: hun harnas, hun effortssetting, hun aantal trials. Ik zoek naar een onafhankelijke replicatie op Artificial Analysis, Vals AI of het tbench.ai-leaderboard voor ik een kloof kleiner dan 3 punten geloof.
Onze primer over LLM-benchmarks en hoe je modellen vergelijkt loopt door de belangrijkste leaderboards, en ons stuk over wat MMLU meet is een goede reminder dat een knowledge-benchmark je bijna niets vertelt over of een model een flaky test kan fixen.
Voor het bouwen van je eigen evaluatieharnas is onze gids over LLM-evaluatiemetrics en methodologieën degene waar ik junior collega’s als eerste naartoe stuur.
Met die benchmarks gedefinieerd, zo scoren de 9 modellen erop, beginnend met de cloudfrontier.
Wat zijn de beste cloud-frontiermodellen voor coderen?
De beste cloud-frontiermodellen voor coderen in september 2026 zijn Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra en Gemini 3.8 Flash, en alle 4 leveren een contextvenster van ongeveer 1M tokens.
De verschillen zitten in prijs, effort-instellingen en voor welke benchmark elk lab optimaliseerde.
Ik noem ze in de volgorde waarin ik ze zou aanbevelen aan een team dat ze allemaal kan betalen.
1. Claude Opus 5.5 (Anthropic)
Claude Opus 5.5 is Anthropic’s nieuwe Opus-tier flagship, uitgebracht op 22 september 2026, en het is nu het codeermodel dat ik aan bijna iedereen zou aanraden. Dat had ik 2 maanden na Opus 5 niet verwacht te schrijven. Anthropic’s launchpost zegt dat het op het niveau van Fable 5.1 presteert op het meeste werk terwijl het 40% minder kost om te draaien dan Opus 5, en hun modeloverzicht vertelt ontwikkelaars nu om te beginnen met Opus 5.5 en naar Fable 5.1 te grijpen voor veeleisend lang-horizonwerk of als evals op Opus 5.5 tekortschieten.
De Opus 5.5-systeemkaart meldt 89,9% op SWE-bench Pro, 74,2% op DeepSWE v1.1 en 66,4% op Terminal-Bench 4.0 bij xhigh effort, voor op Fable 5.1 op elke coderij die Anthropic publiceerde. De onafhankelijke cijfers liggen dichter bij elkaar: Artificial Analysis heeft het gelijk met GPT-6 Astra op 59,6% op Terminal-Bench 4.0, en Vals AI zet het eerste op 61,6% op Terminal-Bench 4.0 en 87,6% op Terminal-Bench 2.1. Beide Vals-cijfers bevatten safeguard-fallbacks; die als mislukkingen tellen brengt ze omlaag naar 53,5% en 79,8%.
Belangrijkste kenmerken:
- $4 per miljoen inputtokens en $20 per miljoen outputtokens, 20% onder Opus 5, met cache-reads 60% omlaag naar $0,20 per miljoen
- 1M-token context, 128K output, adaptief denken dat niet kan worden uitgezet, en een standaard effort van medium in plaats van high
- 57,8% op CursorBench 4.0 bij max effort, de hoogste score op Cursor’s leaderboard; bij medium scoort het 52,5%, nog steeds boven Fable 5.1 op max
- Beschikbaar op de Claude API als
claude-opus-5-5, plus Amazon Bedrock, Google Cloud en Microsoft Foundry
Beste voor: dagelijks coderen, migraties over de hele codebase en code review. Het vervangt Opus 5 direct tegen een lagere prijs, en Claude Code gebruikt het nu als het standaard Opus-model. Onze Claude Opus 5.5-gids behandelt de launch, en onze GPT-6 Sol vs Claude Opus 5.5-vergelijking bevat een hands-ontest.
Afweging: de 40% besparing geldt bij standaard effort. Bij max effort vond Artificial Analysis dat het veel meer tokens gebruikte dan Opus 5, waardoor de kosten per Intelligence Index-taak ($5,98) bijna gelijk uitkwamen met die van Opus 5 ($5,86). Het wordt ook geleverd met Fable-achtige safeguards die de meeste cybersecuritytaken naar Opus 4.8 routeren, en code migreren vergt zorg, want verzoeken met denken uitgeschakeld of geforceerd toolgebruik geven nu errors.
2. Claude Fable 5.1 (Anthropic)
Claude Fable 5.1 is de publiek beschikbare versie van Anthropic’s Mythos-klasse model, uitgebracht op 1 september 2026, en het is het model waar ik naar opschaal als Opus 5.5 niet verder komt. Anthropic’s launchpagina stelt dat Fable 5.1 en Claude Mythos 5.1 hetzelfde model zijn met verschillende safeguards.
De cijfers uit de Fable 5.1-systeemkaart zijn 81,2% op SWE-bench Pro en 55,8% op Terminal-Bench 4.0. Artificial Analysis mat onafhankelijk 91,4% op Terminal-Bench 2.1 bij max effort, nog steeds de topscore op dat bord.
Belangrijkste kenmerken:
- 1M-token contextvenster en 128K outputtokens
- Adaptief denken staat altijd aan
- Prompt-cache-reads daalden met 75% naar $0,25 per miljoen tokens bij 5.1, wat Anthropic inschat tot 45% aan agentic workloads te besparen
- Sterke planning over meerdere bestanden en breder denken met beter toolgebruik
Beste voor: productie-achtige agentic pipelines, refactors over meerdere dagen en elke taak waar een fout antwoord meer kost dan de tokens, zodra je evals laten zien dat Opus 5.5 daarop tekortschiet. Onze Claude Fable 5.1-gids behandelt deze release, en ons overzicht van Claude Fable 5 behandelt het origineel van juni.
Afweging: $10 per miljoen inputtokens en $50 per miljoen outputtokens is 2,5 keer het tarief van Opus 5.5, en op Anthropic’s eigen tabel loopt Fable 5.1 nu achter op Opus 5.5 op SWE-bench Pro, Terminal-Bench 4.0 en CursorBench 4.0. Anthropic zegt dat de kloof in de praktijk kleiner is dan die scores suggereren, maar de bewijslast is omgedraaid. Op de oudere CursorBench 3.2.0 scoorde Fable 5.1 bij medium effort 68,0% voor $3,53 per taak.
3. GPT-6 Astra (OpenAI)
GPT-6 Astra is OpenAI’s frontiermodel, uitgebracht op 3 september 2026, en het staat nog steeds eerste op het tbench.ai Terminal-Bench 4.0 agent-leaderboard met 58,2% met het Codex-harnas op max effort, hoewel Opus 5.5 daar nog geen agentvermelding heeft.
De modelpagina vermeldt een contextvenster van 1.050.000 tokens, 128.000 outputtokens, een knowledge cutoff van 30 april 2026 en effort levels van none t/m max. Prijzen zijn $10 per miljoen inputtokens, $1 voor gecachte input en $50 per miljoen outputtokens.
OpenAI’s launchmateriaal leunt op eigen evaluaties en de systeemkaart in plaats van cross-lab benchmarks. Hun evaluaties zijn sterk, maar ik zou Astra geen duidelijke winnaar boven Opus 5.5 of Fable 5.1 noemen. We behandelen de launchcijfers in ons overzicht van GPT-6 Astra.
Belangrijkste kenmerken:
- De Responses API stelt
hosted_shell,apply_patch,computer_useentool_searchbloot, de toolset waarop Codex zelf draait. - Gecachte input voor $1 per miljoen tokens, een tiende van de basisprijs, wat telt voor agent-loops die dezelfde repo herlezen.
- Astra is het eerste OpenAI-model dat de hoogste cybersecurity-tier van zijn Preparedness Framework haalt, dus sommige security-adjacent prompts zijn afgeschermd.
Beste voor: teams die al op Codex, GitHub Copilot of de Microsoft-stack zitten, wetenschap- en engineeringzware taken, en iedereen die betere third-party toolondersteuning nodig heeft. Wil je het meeste vermogen voor minder, dan GPT-6 Sol, uitgebracht op 22 september voor $2 input en $10 output per miljoen tokens, volgt GPT-5.6 Sol op, en zonder GPT-6 Terra vult het nu Terra’s oude prijsslot. Op OpenAI’s eigen grafieken scoort het 68,8% op DeepSWE 1.1 en 49,3% op FrontierCode, al scoort GPT-5.6 Sol op max effort nog hoger op DeepSWE.
Afweging: Fable-tier prijs, en Opus 5.5 evenaart Astra nu op Terminal-Bench 4.0 voor ongeveer 40% van de kosten per taak volgens Anthropic, met Artificial Analysis die de twee gelijk scoort. Astra’s duidelijkste voorsprongen liggen in wetenschap-zware taken, met 64,6% op Terminal-Bench-Science en 65,5% op FrontierSWE v2, beide voor op Opus 5.5.
4. Gemini 3.8 Flash (Google)
Gemini 3.8 Flash is Google’s werkpaardmodel, uitgebracht op 2 september 2026, en een van de goedkoopste manieren om een agentic codeerscore van een frontier-lab te krijgen (GPT-6 Luna is goedkoper per token, maar scoort lager op agentic tests). Google’s evaluatierapport toont 89,4% op Terminal-Bench 2.1 en 73,7% op DeepSWE v1.1, een 113-taken lang-horizon suite waar Fable 5.1 67,4% scoorde. Dezelfde tabel heeft Opus 5 iets hoger op 74,0%, Anthropic meldt 74,2% voor Opus 5.5, en Google’s ontwikkelaarsgids voegt 61,6% op SWE-bench Pro toe.
De prijzen op de Gemini API-prijspagina zijn $0,75 per miljoen inputtokens en $3,75 per miljoen outputtokens t/m 31 december 2026, daarna $1,50 en $7,50 vanaf 1 januari 2027. Zelfs tegen de prijs van 2027 is dat net iets meer dan een derde van het outputtarief van Opus 5.5. Het contextvenster is 1M inputtokens met 64K output.
Belangrijkste kenmerken:
- Natieve multimodale input, zodat je een architectuurdiagram of een screenshot van een falende UI naast de code kunt aanleveren.
- Google positioneert het als het model voor high-volume agentic werk en prijst het daar ook naar.
- Er is een Cyber-variant voor kwetsbaarhedenwerk, apart afgeschermd, die we behandelen in ons overzicht van Gemini 3.8 Flash en Flash Cyber.
Beste voor: agent-loops met hoog volume, kostenbewuste teams en Vertex AI-omgevingen. Gemini 3.1 Pro, uitgebracht op 19 februari 2026, blijft Google’s Pro-tier model met 54,2% SWE-bench Pro voor $2 input en $12 output per miljoen tokens, maar specifiek voor coderen zou ik vandaag 3.8 Flash boven 3.1 Pro kiezen.
Afweging: 19,1% op Terminal-Bench 4.0. Flash is sterk in goed afgebakend terminalwerk en zwak in frontier-wetenschapstaken, dus houd een sterker model achter de hand voor de zwaarste tickets.
Dat dekt de cloudmodellen. De rest van de lijst zijn modellen die je kunt downloaden.
Wat zijn de beste open-weight codeer-LLM's in 2026?
De beste open-weight codeer-LLM's in 2026 splitsen in 2 groepen: datacenter-schaalmodellen zoals DeepSeek V4.1 Flash en Kimi K3 die frontier-scores evenaren maar serieuze serverhardware nodig hebben, en sub-120B modellen zoals Qwen3.8-27B en Laguna S 2.1 die je op eigen hardware kunt draaien.
"Open weight" betekent hier dat de weights downloadbaar zijn. De daadwerkelijke licenties variëren van MIT en Apache 2.0 tot custom voorwaarden.
5. DeepSeek V4.1 Flash (DeepSeek)
DeepSeek V4.1 Flash is DeepSeek’s release van 10 september 2026, en ondanks de naam Flash is dit nu het DeepSeek-model waar ik eerst naar zou grijpen. DeepSeek zegt dat het zijn eigen V4 Pro 0813-flagship verslaat op performance, kosten, snelheid en taakafrondingstijd. Vals AI’s onafhankelijke index wijst dezelfde kant op en rangschikt het als het beste open-weight model op 57,9%, tegen de 52,4% die Vals in augustus noteerde voor V4 Pro 0813.
Het is een mixture-of-experts (MoE) model met 552B parameters met ongeveer 8B parameters actief per token op input en 16B op output, een context van 1M tokens, native beeldinput en MIT-gelicentieerde weights. DeepSeek rapporteert 90,6% op Terminal-Bench 2.1 en 74,2% op DeepSWE v1.1, de hoogste door de leverancier gerapporteerde open-weight scores op beide. Vals AI’s eigen Terminal-Bench 2.1-run is minder gul op 74,5%, tweede onder open-weight modellen.
We behandelen de release uitgebreider in ons overzicht van DeepSeek V4.1 Flash.
Belangrijkste kenmerken:
- API-prijzen op DeepSeek’s prijspagina zijn $0,15 per miljoen inputtokens en $0,60 per miljoen outputtokens buiten piekuren, verdubbelend naar $0,30 en $1,20 tijdens piekuren op werkdagen (01:00–04:00 en 06:00–10:00 UTC). Cache-hits kosten $0,003 per miljoen buiten piek.
- Aangeboden als
deepseek-flashop een OpenAI-compatibele API, dus het scriptask_coding_model.pylater in dit artikel werkt met alleen een andere base URL. - Een KV-cache ongeveer een kwart van de grootte van V4 Flash, wat is hoe DeepSeek lang-contextwerk zo laag prijst.
Beste voor: frontier-adjacent terminalcoderen voor centen, en batch code-jobs die je buiten piekuren kunt inplannen.
Afweging: het scoort 31,2% op Terminal-Bench 4.0 in DeepSeek’s eigen rapport, dus het zwaarste lang-horizon agentwerk hoort nog bij de frontierlabs. De checkpoint is ook ongeveer 510 GB, dus "open weights" betekent hier een multi-GPU server. Als je op V4 Pro 0813 zit: DeepSeek kondigde aan dat het dat model op 14 september zou routeren naar V4.1 Flash, maar draaide dat terug, en V4 Pro wordt nog steeds geserveerd op $0,66/$1,98 buiten piek tot nader order.
6. Kimi K3 (Moonshot AI)
Kimi K3 is Moonshot AI’s open-weight flagship met 2,8 biljoen parameters, uitgebracht in juli 2026, en het noteert 88,3% op Terminal-Bench 2.1, tweede onder open modellen achter de door de leverancier gemelde 90,6% van DeepSeek V4.1 Flash.
De Hugging Face-kaart vermeldt 104B actieve parameters over 896 experts (16 gerouteerd plus 2 gedeeld per token), een context van 1.048.576 tokens en MXFP4-weights. Vals AI mat 93,4% op SWE-bench Verified.
Belangrijkste kenmerken:
- 1M-token context met native vision.
- Wordt geleverd onder de Kimi K3-licentie, een custom licentie in plaats van MIT of Apache, dus lees die voor commercieel gebruik.
- Aanbevolen inference-stacks zijn vLLM, SGLang en TokenSpeed, en Moonshot kalibreerde enkele GPU-evaluatietaken voor H20 GPU’s.
Beste voor: iedereen die de sterkste open agentic coder beschikbaar wil.
Afweging: bijna-frontiercapaciteit komt alleen op datacenterschaal. De kloof van 3 punten met Fable 5.1 op Terminal-Bench 2.1 lijkt klein, maar is niet appels met appels: Moonshot mat 88,3% in zijn eigen Kimi Code-harnas, terwijl Fable’s 91,4% komt van Terminus 2-runs van Artificial Analysis. In de praktijk huur je ’m via een hosted provider of draai je je eigen cluster, plus een custom licentie die je juridisch moet afstemmen.
7. Qwen3.8-27B (Alibaba)
Qwen3.8-27B is een dense model met 27 miljard parameters, uitgebracht in augustus 2026 onder Apache 2.0, en het is de beste codeer-LLM die je op één 24 GB GPU kunt draaien.
De modelkaart meldt 61,7% op SWE-bench Pro, 73,0% op Terminal-Bench 2.1, 90,3% op LiveCodeBench v6 en 42,2% op DeepSWE 1.1, met een native context van 262.144 tokens uitbreidbaar naar 1M met YaRN. Die SWE-bench Pro- en Terminal-Bench-cijfers verslaan Laguna S 2.1, een model dat 4 keer zo groot is, en ze verslaan Gemini 3.1 Pro op SWE-bench Pro. Toegegeven, Qwen draaide SWE-bench Pro op zijn eigen gecorrigeerde taakset, dus behandel die cross-lab vergelijkingen als richtinggevend.
Belangrijkste kenmerken:
- De community-UD-Q4_K_M GGUF van Unsloth is één bestand van 16,5 GB, wat ruimte laat voor een 32K context op een 24 GB kaart. UD-Q4_K_XL is 17,6 GB.
- Dichte architectuur, dus langzamer per token dan een 3B-actieve MoE maar veel consistenter bij edits over meerdere bestanden.
- Apache 2.0, dus geen gebruiksbeperkingen voor commerciële producten.
Beste voor: ontwikkelaars die geen code naar een externe API mogen sturen, solisten met één RTX-klasse GPU, en iedereen die lokaal versus Claude wil vergelijken op de eigen repository voor ze voor de cloud betalen.
Afweging: 73,0% versus 91,4% op Terminal-Bench 2.1 is nog steeds een kloof van 18 punten, en dat merk je als meer retries op lange agentic taken.
8. Laguna S 2.1 (Poolside)
Laguna S 2.1 is Poolside’s mixture-of-experts codeermodel met 118B parameters en 8B actieve parameters, uitgebracht op 21 juli 2026, en het is de open-weight keuze voor een Mac Studio, DGX Spark of multi-GPU workstation.
Poolside’s launchpost meldt 59,4% op de SWE-bench Pro public set, 70,2% op Terminal-Bench 2.1 met max thinking (60,4% met denken uit), 78,5% op SWE-bench Multilingual en 40,4% op DeepSWE.
Het model is getraind op 409.000 omgevingen, waaronder 83.000 terminaltaken en 168.000 software-engineeringworkflows, op 4.096 H200’s in minder dan 9 weken.
Belangrijkste kenmerken:
- 1M-token contextvenster, ongebruikelijk op deze schaal.
- OpenMDW-1.1-licentie, permissief maar het lezen waard voor je juridische team.
- Thinking-modus staat standaard aan en is ongeveer 10 punten waard op Terminal-Bench 2.1; de gemiddelde completielengte varieerde van ~23K tot 249K tokens per taak in Poolside’s runs, dus budgetteer daarvoor.
Beste voor: teams die een Claude Code-achtige lokale agent willen op een machine met 96 tot 128 GB unified memory, en repositories die groot genoeg zijn om lokaal het 1M-venster nodig te hebben.
Afweging: 118B parameters op 4-bit is ruwweg 60 tot 70 GB aan weights voordat je een KV-cache toewijst, dus een 24 GB GPU valt af. Op ruwe scores wint Qwen3.8-27B nipt, maar Laguna’s 8B actieve parameters maken het veel sneller zodra de weights passen, wat nu juist het punt is van een overnight agent.
9. Qwen3-Coder-Next (Alibaba)
Qwen3-Coder-Next is een mixture-of-experts model met 80B parameters dat slechts 3B parameters per token activeert, uitgebracht op 3 februari 2026 onder Apache 2.0, en het is de snelste capabele lokale coder voor hardware die geen dense 27B-model op snelheid kan houden.
De modelkaart meldt 70,6% op SWE-bench Verified, 44,3% op SWE-bench Pro en 36,2% op Terminal-Bench 2.0, met 512 experts (10 actief plus 1 gedeeld) en een context van 262.144 tokens. Het draait alleen in non-thinking modus.
Belangrijkste kenmerken:
- De officiële Q4_K_M GGUF is ongeveer 48 GB, wat beter past bij een 64 GB Mac of een CPU-offload setup dan bij één consument-GPU.
- Hybride attentie (3 Gated DeltaNet-lagen per standaard attentielaag) houdt geheugengebruik bij lange context laag.
- Ondersteund in vLLM, SGLang, Ollama, LM Studio, MLX-LM, llama.cpp en KTransformers, volgens de kaart.
Beste voor: lang-horizon overnachttaken waar tokens per seconde zwaarder wegen dan pieknauwkeurigheid, en laptops met 64 GB unified memory.
Afweging: 44,3% op SWE-bench Pro is 17 punten achter Qwen3.8-27B, dus voor één harde bug zou ik naar het dense model grijpen.
Andere open-weight modellen die de moeite waard zijn
Vier modellen haalden de lijst net niet, en 2 daarvan passen beter bij specifieke teams dan mijn keuzes:
- DeepSeek V4 Pro 0813 (DeepSeek): 1,6T totaal, 49B actief, 1M context, MIT-licentie, 96,4% op Vals AI’s gearchiveerde SWE-bench Verified. Nog steeds geserveerd voor $0,66 input en $1,98 output per miljoen tokens buiten piek, maar Vals mat 54,7% op Terminal-Bench 2.1 tegen de 87,9% die DeepSeek meldt, en DeepSeek verwijst gebruikers nu naar V4.1 Flash. Onze DeepSeek V4-uitleg behandelt de architectuur.
- Kimi K2.6 (Moonshot): 1T totaal, 32B actief, 256K context, aangepaste MIT-licentie, 80,2% SWE-bench Verified, 58,6% SWE-bench Pro en 89,6% LiveCodeBench v6. De schoonste licentie onder de trillion-scale modellen na de plain MIT van DeepSeek V4 Pro.
- MiniMax M3: 428B totaal, 23B actief, 1M context, native beeld- en video-input, 80,5% SWE-bench Verified en 59% SWE-bench Pro. De open keuze als je taken code met screenshots mengen.
- Qwen3.8-Flash-Next: 125B totaal met 6B actief, 62,5% SWE-bench Pro en 58,7% DeepSWE, onder de restrictievere qwen-community-1.0 licentie. Sterker dan Qwen3.8-27B op DeepSWE, maar de licentie hield het uit mijn top 9.
Als een van deze open-weight keuzes bij je hardware past, laat de volgende sectie zien hoe je ’m draait.
Hoe draai je een open-weight codeermodel lokaal?
Een open-weight codeermodel lokaal draaien kost 3 stappen: download een gequantiseerde checkpoint, serveer ’m achter een OpenAI-compatibele endpoint en wijs je client of codeerassistent naar die endpoint. Ik gebruik Qwen3.8-27B in dit voorbeeld omdat dat de makkelijkste van de 9 is om op consumentenharde te passen.
Eerst de download. De bibliotheek huggingface_hub handelt hervatbare transfers en caching af, wat helpt bij deze grotere bestanden:
"""Download a quantized coding model from Hugging Face.
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
from huggingface_hub import hf_hub_download
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
"""Download one file from the Hub and return its local path."""
path = hf_hub_download(repo_id=repo_id, filename=filename)
print(f"Saved to {path}")
return path
if __name__ == "__main__":
fetch()
Sla dat op als download_gguf.py en voer uv run --with huggingface_hub python download_gguf.py uit. Op Windows zie je een waarschuwing over symlinks tenzij Ontwikkelaarsmodus aan staat.
Tweede, serveer ’m.
Een van llama.cpp’s llama-server, LM Studio of Ollama stelt een OpenAI-compatibele /v1-endpoint bloot. Met llama.cpp is het commando één regel, en 2 flags doen het werk: -ngl 99 offloadt elke laag naar de GPU en -c 32768 zet een 32K context.
llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080
Derde, de client. Ik houd één script aan voor elk model dat ik evalueer, lokaal of hosted, en wissel targets met 3 omgevingsvariabelen. Ditzelfde bestand praat met de lokale server hierboven, met de API van DeepSeek of met die van OpenAI:
"""Send one coding prompt to any OpenAI-compatible endpoint.
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
LLM_BASE_URL e.g. http://localhost:8080/v1 or https://api.deepseek.com
LLM_MODEL e.g. qwen3.8-27b or deepseek-flash
LLM_API_KEY anything non-empty for a local server
"""
import os
from openai import OpenAI
PROMPT = (
"Write a Python function top_n(df, col, n) that returns the n largest "
"rows of a pandas DataFrame by column col, with a docstring and a "
"ValueError if col is missing."
)
def ask(prompt: str = PROMPT) -> str:
"""Return the model's reply for a single-turn coding request."""
client = OpenAI(
base_url=os.environ["LLM_BASE_URL"],
api_key=os.environ.get("LLM_API_KEY", "local"),
)
response = client.chat.completions.create(
model=os.environ["LLM_MODEL"],
messages=[{"role": "user", "content": prompt}],
temperature=0.2, # keep code generation close to deterministic
)
return response.choices[0].message.content
if __name__ == "__main__":
print(ask())
Sla het op als ask_coding_model.py en draai het met LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.py.
Als je vervolgens meerdere van deze endpoints in een applicatie met routing, retries en tool calls wilt hangen, behandelt onze course over LLM-applicaties ontwikkelen met LangChain de abstracties die voorkomen dat dit een stapel if-statements wordt.
Hoe kies je de beste LLM voor coderen?
De beste LLM voor coderen kiezen komt neer op 4 randvoorwaarden: of je code je machine mag verlaten, hoeveel geheugen je hebt, wat je per miljoen outputtokens wil betalen en hoeveel context één taak nodig heeft. De tabel hieronder zet de 9 gerangschikte modellen naast elkaar op de cijfers die ik het meest vertrouw, en de beslisgids erna mapt die constraints naar een keuze.
| Model | Type | Terminal-Bench 2.1 | SWE-bench Pro | Context | Prijs (per 1M output) of geheugen | Beste voor |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | Cloud | 87,6% (Vals AI) | 89,9% | 1M | $20 | Standaard voor het meeste codeerwerk |
| Claude Fable 5.1 | Cloud | 91,4% (Artificial Analysis) | 81,2% | 1M | $50 | Langste-horizon agentic werk |
| GPT-6 Astra | Cloud | Niet gepubliceerd (58,2% tbench.ai / 59,6% Artificial Analysis op Terminal-Bench 4.0) | Niet gepubliceerd | 1,05M | $50 | Codex-gebruikers, frontier wetenschapstaken |
| Gemini 3.8 Flash | Cloud | 89,4% | 61,6% | 1M | $3,75 t/m 2026 | High-volume, kostengevoelige agents |
| DeepSeek V4.1 Flash | Open (MIT) | 90,6% (vendor); 74,5% (Vals AI) | Niet gepubliceerd | 1M | $0,60 buiten piek | Goedkoopste capabele open weights via API |
| Kimi K3 | Open (custom) | 88,3% (Kimi Code-harnas) | Niet gepubliceerd | 1M | 2,8T params, alleen cluster | Sterkste self-hosted agent |
| Qwen3.8-27B | Open (Apache 2.0) | 73,0% | 61,7% | 262K | 16,5 GB bij UD-Q4_K_M | Enkele 24 GB GPU |
| Laguna S 2.1 | Open (OpenMDW-1.1) | 70,2% | 59,4% | 1M | 60 tot 70 GB op Q4 | 128 GB workstation, lokale agents |
| Qwen3-Coder-Next | Open (Apache 2.0) | 36,2% (2.0) | 44,3% | 262K | Ongeveer 48 GB op Q4 | Snel lokaal model, 64 GB Mac |
De beslisgids
Zo vertaal ik de 4 randvoorwaarden naar de ranglijst:
- Agentic codeerpipelines waar correctheid zwaarder weegt dan kosten: Claude Opus 5.5 op high of xhigh effort, met Fable 5.1 stand-by voor lang-horizon taken waar je evals laten zien dat Opus 5.5 tekortschiet.
- Dagelijks AI-ondersteund coderen voor een redelijke prijs: Eerst Claude Opus 5.5 op zijn standaard medium effort, GPT-6 Sol tweede als je in Codex leeft.
- Frontier wetenschap, simulatie of GPU-kernelwerk: GPT-6 Astra of Claude Opus 5.5. Astra leidt op Terminal-Bench-Science, Opus 5.5 op Terminal-Bench 4.0.
- Massieve codebase, 1M-token prompts, krap budget: Gemini 3.8 Flash voor de prijs, Opus 5.5 wanneer de antwoorden van Flash slordig worden.
- Open weights via API: DeepSeek V4.1 Flash buiten piekuren.
- Lokaal en privé op één 24 GB GPU: Qwen3.8-27B op UD-Q4_K_M.
- Lokaal en privé op een machine met 96 tot 128 GB: Laguna S 2.1, of Kimi K3 als "machine" "cluster" betekent.
- Lokaal en snel op een laptop met 64 GB: Qwen3-Coder-Next.
Wil je een algemener framework om een model aan een applicatie te koppelen, inclusief hostingopties en licenties, onze gids hoe je de beste LLM voor je applicatie selecteert gaat breder dan coderen.
En welk model je ook kiest, de skills om er waarde uit te halen zijn hetzelfde: onze AI for Software Engineering skill track en onze course AI-assisted coding for developers leren de prompting-, test- en reviewgewoontes die een 91% benchmark omzetten in een merged pull request.
Slotgedachten
Claude Opus 5.5 is de beste codeer-LLM in september 2026 en, ongewoon, ook degene om op de rekening van je team te zetten. Claude Fable 5.1 is het escalatiepad voor de langste taken, en Qwen3.8-27B is het open-weight model dat van een 24 GB GPU een privé codeerassistent maakt die beter scoort dan de frontier van vorig jaar op SWE-bench Pro. Alles daarbuiten is een kwestie van je randvoorwaarden, en de beslisgids hierboven is hoe ik die zou oplossen.
De grotere verschuiving is dat de benchmark die deze categorie 2 jaar definieerde, SWE-bench Verified, er in hetzelfde jaar mee ophield belangrijk te zijn waarin open weights ’m had ingehaald.
Dat is geen toeval.
Wanneer Opus 5 en DeepSeek V4 Pro 0,6 punten uit elkaar zitten op een verzadigde test, en een model van $20 per miljoen nu Anthropic’s eigen $50-model verslaat op SWE-bench Pro, is de waarde verhuisd naar harnasontwerp, effort-budgetten en evaluatie op je eigen repository, precies het werk dat een vendortabel niet voor je kan doen.
Dus doe dat werk. Pak het script ask_coding_model.py, wijs het op 2 of 3 van deze modellen, draai het tegen 20 echte tickets uit je backlog op het effortniveau dat je daadwerkelijk gaat betalen, en laat dat resultaat alles overstemmen wat ik hier schreef. Als vibe coding meer jouw stijl is dan evaluatieharnassen, is ons stuk over wat vibe coding is en waar het breekt een eerlijke kijk op de trade-offs, en dezelfde modelrangschikkingen gelden.
FAQs
Wat is SWE-bench Verified en waarom is het belangrijk voor het evalueren van codeer-LLM's?
SWE-bench Verified is een subset van 500 taken uit SWE-bench waarin menselijke annotators bevestigden dat elke GitHub-issue oplosbaar is en de tests eerlijk zijn; een model moet een patch produceren die de verborgen tests doorstaat. Het was belangrijk omdat het de eerste breed vertrouwde test was van echte repositories fixen in plaats van speelgoedfuncties schrijven. In 2026 scoren de topmodellen er boven 96% op, dus gebruik ik SWE-bench Pro en Terminal-Bench om ze te onderscheiden.
Kunnen open-weight modellen in 2026 concurreren met Claude en GPT voor echte coderingstaken?
Ja, op de oudere benchmarks en bijna op de agentische. Kimi K3 scoort 88,3% en DeepSeek V4 Pro 0813 scoort 87,9% op Terminal-Bench 2.1, tegen 91,4% voor Claude Fable 5.1, en Vals AI mat DeepSeek binnen 0,6 punt van Opus 5 op SWE-bench Verified. De catch is de omvang: die open modellen hebben 1,6 tot 2,8 biljoen parameters, dus "open" betekent "goedkoop via een API", niet "draait op mijn laptop".
Wat is de beste LLM voor coderen als ik mijn code niet met een externe API kan delen?
Qwen3.8-27B is de beste keuze op een enkele 24 GB GPU, met 73,0% op Terminal-Bench 2.1 en 61,7% op SWE-bench Pro onder een Apache 2.0-licentie. Heb je 96 tot 128 GB unified memory, dan geeft Laguna S 2.1 je een 1M-token context en 8B actieve parameters voor een snelle lokale agent. Voor een laptop met 64 GB maken de 3B actieve parameters van Qwen3-Coder-Next het de snelste optie die nog steeds nuttig is.
Wat is het verschil tussen een codeer-LLM en een AI-codeerassistent zoals Cursor of GitHub Copilot?
Een codeer-LLM is het model dat de code genereert, terwijl een codeerassistent het harnas eromheen is dat je bestanden leest, commando's uitvoert en diffs presenteert. Cursor, Copilot, Windsurf, Claude Code en Codex laten je het onderliggende model wisselen, en hetzelfde model kan enkele punten anders scoren afhankelijk van het harnas. Kies het model op benchmarks en prijs, en kies daarna de assistent op workflow.
Hoe vaak verandert de beste codeer-LLM, en hoe blijf ik bij?
Anthropic en OpenAI alleen al leverden 7 frontier-klasse modellen tussen 28 mei en 24 september 2026 (Opus 4.8, Fable 5, Sonnet 5, GPT-5.6, Opus 5 en 5.5, en Fable 5.1 plus GPT-6 Astra), dus verwacht dat de leider elke 4 tot 8 weken verandert. Blijf bij door 3 onafhankelijke borden te volgen, Artificial Analysis, Vals AI en tbench.ai, in plaats van launchposts, en draai je eigen 20-taaksevaluatie op het effortniveau dat je betaalt telkens als een model dat je gebruikt een nieuwe versie krijgt.
Ik ben een data scientist met ervaring in ruimtelijke analyse, machine learning en datapijplijnen. Ik heb gewerkt met GCP, Hadoop, Hive, Snowflake, Airflow en andere data science- en engineeringprocessen.
