I februari 2025 nådde Claude 3.7 Sonnet 62,3% på SWE-bench Verified, eller 70,3% med ett skräddarsytt scaffold, medan den då bästa open-weight-modellen, DeepSeek-R1, rapporterade 49,2% i sin artikel.
Det var ett gap på 13 till 21 poäng, beroende på hur generöst du scaffoldade.
I september 2026 har den oberoende Vals AI-tavlan för SWE-bench Verified Claude Opus 5 på 97,0% och open-weight-modellen DeepSeek V4 Pro 0813 på 96,4%, och Vals arkiverade benchmarken eftersom den blev mättad.
Frontlinjen flyttade till svårare agent-evalueringar som SWE-bench Pro och Terminal-Bench 4.0, open weights hann ikapp på de gamla, och frågan om "bästa LLM för kodning" blev "bäst till vad, på vilken hårdvara, till vilket pris".
Jag besvarar den frågan för de 9 modeller jag faktiskt skulle överväga att använda idag, och den korta versionen är att Claude Opus 5.5 är den de flesta team bör börja med.
En notis innan rankingen: den här artikeln handlar om modellerna i sig, inte verktygen runt dem. Vill du ha jämförelsen mellan Cursor, Copilot och Windsurf, täcker vår sammanställning av de bästa AI-kodningsassistenterna 2026 det.
I korthet: De bästa kodnings-LLM:erna i september 2026
Claude Opus 5.5 är nu både den starkaste kodningsmodellen på de flesta benchmark och den som de flesta utvecklare bör utgå från, Claude Fable 5.1 är den att eskalera till för arbete med längst horisont, och Qwen3.8-27B är open-weight-modellen att köra på ett enda GPU. Här är de bästa valen för respektive syfte:
- Bäst totalt för agentisk kodning: Claude Opus 5.5 (Anthropic), 89,9% SWE-bench Pro och 66,4% Terminal-Bench 4.0, för $4 in och $20 ut per miljon token.
- Bäst för arbete med längst horisont: Claude Fable 5.1 (Anthropic), 81,2% SWE-bench Pro och högsta Terminal-Bench 2.1-poängen på Artificial Analysis (91,4%), för $10 in och $50 ut per miljon token.
- Bästa OpenAI-modellen för kodning: GPT-6 Astra (OpenAI), etta på tbench.ai:s Terminal-Bench 4.0 agent-leaderboard med 58,2%, och i nivå med Opus 5.5 på 59,6% i Artificial Analysis körning.
- Bästa värdet från ett frontier-labb: Gemini 3.8 Flash (Google), 89,4% Terminal-Bench 2.1 för $0,75 in och $3,75 ut per miljon token till och med 31 december 2026.
- Bästa open weights via API: DeepSeek V4.1 Flash, MIT-licens, 90,6% Terminal-Bench 2.1, $0,60 per miljon output-token utanför högtrafik.
- Bästa open weights du inte kan köra hemma: Kimi K3 (Moonshot AI), 2,8 biljoner parametrar, 88,3% Terminal-Bench 2.1.
- Bästa lokala modellen på ett 24 GB GPU: Qwen3.8-27B (Alibaba), Apache 2.0, 73,0% Terminal-Bench 2.1, 16,5 GB på UD-Q4_K_M.
- Bästa lokala modellen för en 128 GB arbetsstation: Laguna S 2.1 (Poolside), 118B parametrar med endast 8B aktiva, 1M kontext.
- Bästa snabba lokala modellen för äldre hårdvara: Qwen3-Coder-Next, totalt 80B men 3B aktiva, 70,6% SWE-bench Verified.
Varje poäng ovan är leverantörspublicerad om inte annat anges. Resten av artikeln förklarar hur jag kom fram till de valen och var varje modell brister.
Varför handlar den här listan om modeller och inte kodningsassistenter?
En kodnings-LLM är modellen som läser din prompt och skriver token, medan en kodningsassistent är selemet som ger den filer, kör dess kommandon och visar dina diffs.
Claude Code, Codex, Cursor, GitHub Copilot och Windsurf är sele. Claude Opus 5.5, GPT-6 Astra och Qwen3.8-27B är modeller, och selet påverkar poängen mer än de flesta tror.
Anthropics egen lanseringspost för Claude Opus 4.8 gör detta konkret i en fotnot.
Den redovisar varje modells Terminal-Bench 2.1-poäng på det offentliga Terminus-2-selet och noterar sedan att GPT-5.5:s siffra stiger till 83,4% i OpenAIs egen Codex CLI. Samma vikter, annan rördragning, annat resultat.
Det är därför rankningarna nedan kommer med selet angivet där jag kunnat hitta det. Om du är ny på hur dessa modeller fungerar under huven är vår guide till vad en large language model (LLM) är en 15-minuters läsning som gör resten av artikeln lättare att följa.
Vilka benchmark spelar faktiskt roll för kodnings-LLM:er?
Benchmark som spelar roll för kodnings-LLM:er 2026 är SWE-bench Pro, Terminal-Bench (version 2.1 och 4.0) och, för open-weight-modeller som fortfarande rapporterar det, LiveCodeBench v6. SWE-bench Verified var standard i 2 år och är nu för mättad för att skilja toppmodellerna åt.
Innan jag rankar något, så här läser du varje siffra i modellraderna.
SWE-bench Verified är mättad
SWE-bench Verified är en uppsättning av 500 mänskligt validerade GitHub-ärenden från populära Python-repon; modellen får repositoriet och ärendetexten och ska ta fram en patch som klarar de dolda enhetstesterna.
OpenAI introducerade Verified-delmängden 2024 eftersom originalet innehöll uppgifter med underspecificerade ärenden eller trasiga test. Det är fortfarande den mest citerade kodningssiffran, vilket är just problemet.
Vals AI:s leaderboard, som kör varje modell genom samma minimala bash-endast agent, satte Claude Opus 5 på 97,0%, DeepSeek V4 Pro 0813 på 96,4% och GPT-5.6 Sol på 96,2% i sin uppdatering 1 september 2026 och markerade sedan benchmarken som arkiverad.
När 3 modeller från 3 labb ligger inom en poäng från varandra och 4 poäng från taket, har metriksen slutat diskriminera. Jag citerar den fortfarande för äldre och mindre modeller eftersom det är siffran deras kort redovisar, men jag rankar inte på den.
SWE-bench Pro är den svårare ersättaren
SWE-bench Pro, som underhålls av Scale AI, innehåller 1 865 uppgifter över 41 professionella repositorier, med en offentlig delmängd om 731 uppgifter och undanställda privata set. Den 22 september 2026 släppte Scale SWE-Bench Pro V2, som minskar den offentliga mängden till 642 uppgifter efter att ha strukit 89 ogiltiga, så kontrollera vilken version en poäng gäller.
En genomsnittlig fix berör 107,4 rader över 4,1 filer och repositorierna spänner över flera språk snarare än bara Python. När SWE-bench Pro-artikeln kom i september 2025 låg de bästa modellerna runt 23%.
Ett år senare rapporterar Anthropics Fable 5.1 systemkort 81,2% för Fable 5.1 och 79,2% för Opus 5, och OpenAIs GPT-5.6 lanseringstabell rapporterar 64,6% för GPT-5.6 Sol. Tre veckor efter Fable-kortet höjde Opus 5.5 systemkort toppnoteringen till 89,9%.
Detta är leverantörskörningar, medel över 5 försök på max effort i Anthropics fall. Scales offentliga leaderboard släpar månader efter leverantörssiffrorna, så jag ser leverantörsiffran som taket och leaderboarden som golvet.
Terminal-Bench 2.1 och 4.0
Terminal-Bench ger en modell ett levande skal i en container och en uppgift som "träna den här modellen", "fixa den här builden" eller "återställ det här korrupta arkivet", och betygsätter sedan artefakterna den producerar.
Version 2.1 är 89 kuraterade uppgifter inom mjukvaruingenjörskap, systemadministration, databehandling och säkerhet, och Artificial Analysis betygsätter den med Terminus 2-selet som pass@1 medel över 3 körningar. Det är den enskilda siffran jag väger tyngst för alla som bygger eller använder kodningsagenter.
Terminal-Bench 4.0, som drivs av Stanford, Harbor och Laude Institute på tbench.ai, är den nya frontiersviten.
Anthropics Opus 5.5 systemkort beskriver den som 66 uppgifter med slagsida mot beräkningsbiologi, fysiksimulering, CAD, formella bevis och GPU-prestandaarbete, med längre timeouts så selet spelar mindre roll.
På tbench.ai:s agent-leaderboard leder GPT-6 Astra fortfarande med 58,2% med Claude Fable 5.1 på 57,9%, men Claude Opus 5.5 har ännu ingen agentpost där. På modellnivå har Artificial Analysis Opus 5.5 och Astra lika på 59,6%, och Vals AI sätter Opus 5.5 först på 61,6%, även om Vals noterar att siffran sjunker till 53,5% om du räknar uppgifter som dess skyddsåtgärder skickade till en fallback-modell som misslyckanden. Här separerar frontlinjen från klungan.
LiveCodeBench v6 fångar memorisering
LiveCodeBench, introducerat i 2024 års artikel av Jain med kollegor, samlar löpande problem från LeetCode, AtCoder och Codeforces och tidsstämplar varje så du kan utvärdera en modell endast på problem publicerade efter dess träningscutoff.
Version 6 är det aktuella fönstret på den offentliga leaderboarden. Den mäter algoritmisk problemlösning snarare än engineering i repo-skala, vilket är varför den fortsatt vara användbar för intervjustil och datastrukturer.
Frontier-labben slutade mestadels rapportera den 2026, så siffrorna jag har är från open-weight-modeller: DeepSeek V4 Pro-förhandsvisning i april på 93,5%, Qwen3.8-27B på 90,3% och Kimi K2.6 på 89,6%. Gemini 3.1 Pro rapporterar en relaterad metrik, en LiveCodeBench Pro Elo på 2 887.
Hur jag läser en leverantörsbenchmark-tabell
En leverantörstabell är ett bästa fall: deras sele, deras effort-inställning, deras antal försök. Jag letar efter en oberoende replikation på Artificial Analysis, Vals AI eller tbench.ai:s leaderboard innan jag tror på ett gap mindre än 3 poäng.
Vår introduktion till LLM-benchmark och hur man jämför modeller går igenom de stora leaderboardarna, och vår artikel om vad MMLU mäter är en bra påminnelse om att ett kunskapsbenchmark säger nästan inget om huruvida en modell kan fixa ett fladdrigt test.
För att bygga eget eval-sele är vår guide till LLM-utvärderingsmått och metoder den jag först pekar juniora kollegor mot.
Med de benchmarken definierade, så här poängterar de 9 modellerna på dem, med molnfronten först.
Vilka är de bästa cloud frontier-modellerna för kodning?
De bästa cloud frontier-modellerna för kodning i september 2026 är Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra och Gemini 3.8 Flash, och alla fyra har ett kontextfönster kring 1M token.
Skillnaderna är pris, effort-inställningar och vilket benchmark varje labb optimerade för.
Jag listar dem i den ordning jag skulle rekommendera dem till ett team som kan ha råd med vilken som helst.
1. Claude Opus 5.5 (Anthropic)
Claude Opus 5.5 är Anthropics nya Opus-flaggskep, släppt 22 september 2026, och det är nu kodningsmodellen jag skulle rekommendera till nästan alla. Jag trodde inte att jag skulle skriva det två månader efter Opus 5. Anthropics lanseringspost säger att den presterar på Fable 5.1:s nivå i det mesta samtidigt som den kostar 40% mindre att köra än Opus 5, och deras modellöversikt säger nu till utvecklare att börja med Opus 5.5 och gå till Fable 5.1 för krävande långhorisontjobb eller när evals på Opus 5.5 inte räcker.
Opus 5.5 systemkort rapporterar 89,9% på SWE-bench Pro, 74,2% på DeepSWE v1.1 och 66,4% på Terminal-Bench 4.0 vid xhigh effort, före Fable 5.1 på varje kodningsrad Anthropic publicerade. De oberoende siffrorna ligger närmare: Artificial Analysis har den lika med GPT-6 Astra på 59,6% på Terminal-Bench 4.0, och Vals AI sätter den först på 61,6% på Terminal-Bench 4.0 och 87,6% på Terminal-Bench 2.1. Båda Vals-siffrorna inkluderar safeguard-fallbacks; om de räknas som misslyckanden sjunker de till 53,5% respektive 79,8%.
Viktiga egenskaper:
- $4 per miljon input-token och $20 per miljon output-token, 20% under Opus 5, med cache-läsningar ned 60% till $0,20 per miljon
- 1M-token kontext, 128K output, adaptivt tänkande som inte kan stängas av, och ett standardeffort på medium i stället för high
- 57,8% på CursorBench 4.0 vid max effort, högsta poängen på Cursors leaderboard; vid medium når den 52,5%, fortfarande över Fable 5.1 vid max
- Tillgänglig på Claude API som
claude-opus-5-5, plus Amazon Bedrock, Google Cloud och Microsoft Foundry
Bäst för: daglig kodning, migreringar över kodbasen och kodgranskning. Den ersätter Opus 5 rakt av till ett lägre pris, och Claude Code använder den nu som standard-Opus. Vår guide till Claude Opus 5.5 täcker lanseringen, och vår jämförelse GPT-6 Sol vs Claude Opus 5.5 innehåller ett praktiskt test.
Avvägning: 40%-besparingen gäller vid standardeffort. Vid max effort fann Artificial Analysis att den använde långt fler token än Opus 5, så kostnaden per Intelligence Index-uppgift ($5,98) landade nästan i nivå med Opus 5:s ($5,86). Den levereras också med Fable-liknande skydd som dirigerar de flesta cybersäkerhetsuppgifter till Opus 4.8, och kodmigrering kräver omsorg, eftersom förfrågningar med avstängt tänkande eller påtvingad verktygsanvändning nu returnerar fel.
2. Claude Fable 5.1 (Anthropic)
Claude Fable 5.1 är den publikt tillgängliga versionen av Anthropics Mythos-klassmodell, släppt 1 september 2026, och det är modellen jag eskalerar till när Opus 5.5 tar slut på väg. Anthropics lanseringssida anger att Fable 5.1 och Claude Mythos 5.1 är samma modell med olika skydd.
Siffrorna från Fable 5.1 systemkort är 81,2% på SWE-bench Pro och 55,8% på Terminal-Bench 4.0. Artificial Analysis mätte oberoende 91,4% på Terminal-Bench 2.1 vid max effort, fortfarande toppnoteringen där.
Viktiga egenskaper:
- 1M-token kontextfönster och 128K output-token
- Adaptivt tänkande är alltid på
- Prompt-cache-läsningar sjönk 75% till $0,25 per miljon token med 5.1, vilket Anthropic uppskattar minskar agent-arbetslaster med upp till 45%
- Stark planering över flera filer och bredare tänk med bättre verktygsanvändning
Bäst för: produktionsmässiga agent-pipelines, flerdagars refaktoreringar och alla uppgifter där ett fel svar kostar mer än tokenen—när dina evals visar att Opus 5.5 inte räcker. Vår guide till Claude Fable 5.1 täcker denna release, och vår översikt över Claude Fable 5 täcker originalet från juni.
Avvägning: $10 per miljon input-token och $50 per miljon output-token är 2,5 gånger Opus 5.5:s taxa, och på Anthropics egen tabell ligger Fable 5.1 nu efter Opus 5.5 på SWE-bench Pro, Terminal-Bench 4.0 och CursorBench 4.0. Anthropic säger att verkliga gapet är smalare än siffrorna antyder, men bevisbördan har vänt. På äldre CursorBench 3.2.0 nådde Fable 5.1 vid medium effort 68,0% för $3,53 per uppgift.
3. GPT-6 Astra (OpenAI)
GPT-6 Astra är OpenAIs frontier-modell, släppt 3 september 2026, och den ligger fortfarande etta på tbench.ai:s Terminal-Bench 4.0 agent-leaderboard på 58,2% med Codex-selet vid max effort, även om Opus 5.5 ännu saknar agentpost där.
Modellsidan listar ett kontextfönster på 1 050 000 token, 128 000 output-token, en kunskapscutoff 30 april 2026 och effort-nivåer från none till max. Priset är $10 per miljon input-token, $1 för cachad input och $50 per miljon output-token.
OpenAIs lanseringsmaterial lutar mot deras egna utvärderingar och systemkort snarare än korslabb-benchmark. Deras utvärderingar är starka, men jag skulle inte kalla Astra en tydlig vinnare över Opus 5.5 eller Fable 5.1. Vi täcker lanseringssiffrorna i vår översikt av GPT-6 Astra.
Viktiga egenskaper:
- Responses API exponerar
hosted_shell,apply_patch,computer_useochtool_search, vilket är verktygssatsen som Codex själv kör på. - Cached input för $1 per miljon token, en tiondel av baspriset, vilket spelar roll för agentloopar som läser samma repo igen.
- Astra är den första OpenAI-modellen i högsta cybersäkerhetsnivån i deras Preparedness Framework, så vissa säkerhetsnära prompts är grindade.
Bäst för: team som redan är på Codex, GitHub Copilot eller Microsoft-stacken, uppgifter tunga på vetenskap och ingenjörskap, och alla som behöver bättre tredjepartsverktygsstöd. Vill du ha det mesta av kapaciteten billigare är GPT-6 Sol, släppt 22 september till $2 in och $10 ut per miljon token, efterträdare till GPT-5.6 Sol, och utan GPT-6 Terra fyller den nu Terras gamla prisspann. På OpenAIs egna diagram får den 68,8% på DeepSWE 1.1 och 49,3% på FrontierCode, även om GPT-5.6 Sol vid max effort fortfarande ligger högre på DeepSWE.
Avvägning: Fable-klassens prissättning, och Opus 5.5 matchar nu Astra på Terminal-Bench 4.0 för cirka 40% av kostnaden per uppgift enligt Anthropics beräkning, med Artificial Analysis som sätter dem lika. Astras tydligaste ledningar är i vetenskapstunga uppgifter, med 64,6% på Terminal-Bench-Science och 65,5% på FrontierSWE v2, båda före Opus 5.5.
4. Gemini 3.8 Flash (Google)
Gemini 3.8 Flash är Googles arbetshäst, släppt 2 september 2026, och ett av de billigaste sätten att få en agentisk kodningspoäng i frontier-klass (GPT-6 Luna är billigare per token, men ger lägre agentiska poäng). Googles utvärderingsrapport visar 89,4% på Terminal-Bench 2.1 och 73,7% på DeepSWE v1.1, en långhorisontsvit med 113 uppgifter där Fable 5.1 nådde 67,4%. Samma tabell har Opus 5 något före på 74,0%, Anthropic rapporterar 74,2% för Opus 5.5, och Googles utvecklarguide lägger till 61,6% på SWE-bench Pro.
Priset på Gemini API:s prissida är $0,75 per miljon input-token och $3,75 per miljon output-token till och med 31 december 2026, sedan $1,50 och $7,50 från 1 januari 2027. Även till 2027 års pris är det strax över en tredjedel av Opus 5.5:s output-taxa. Kontextfönstret är 1M input-token med 64K output.
Viktiga egenskaper:
- Inbyggt multimodalt input, så du kan ge den ett arkitekturschema eller en skärmdump av ett fallerande UI bredvid koden.
- Google positionerar den som modellen för högvolym agent-arbete och prissätter därefter.
- Det finns en Cyber-variant för sårbarhetsarbete, separat grindad, som vi täcker i vår översikt av Gemini 3.8 Flash och Flash Cyber.
Bäst för: högvolym agentloopar, kostnadskänsliga team och Vertex AI-miljöer. Gemini 3.1 Pro, släppt 19 februari 2026, förblir Googles Pro-klassmodell med 54,2% SWE-bench Pro till $2 in och $12 ut per miljon token, men för just kodning skulle jag välja 3.8 Flash över 3.1 Pro idag.
Avvägning: 19,1% på Terminal-Bench 4.0. Flash är stark på välavgränsat terminalarbete och svag på frontier-uppgifter inom vetenskap, så håll en starkare modell i beredskap för de tuffaste ärendena.
Det var molnmodellerna. Resten av listan är modeller du kan ladda ner.
Vilka är de bästa open-weight kodnings-LLM:erna 2026?
De bästa open-weight kodnings-LLM:erna 2026 delar sig i två grupper: datacenterstora modeller som DeepSeek V4.1 Flash och Kimi K3 som matchar frontier-poäng men kräver rejäl serverhårdvara, och modeller under 120B som Qwen3.8-27B och Laguna S 2.1 som du kan köra på egen hårdvara.
"Open weight" betyder här att vikterna är nedladdningsbara. De faktiska licenserna spänner från MIT och Apache 2.0 till specialvillkor.
5. DeepSeek V4.1 Flash (DeepSeek)
DeepSeek V4.1 Flash är DeepSeeks release 10 september 2026, och trots Flash-namnet är det nu DeepSeek-modellen jag skulle välja först. DeepSeek säger att den slår sin egen V4 Pro 0813-flaggskepp på prestanda, kostnad, hastighet och uppgiftssluttid. Vals AI:s oberoende index lutar åt samma håll och rankar den högst bland open-weight-modeller på 57,9%, mot 52,4% som Vals noterade för V4 Pro 0813 i augusti.
Det är en 552B-parameters mixture-of-experts (MoE) med cirka 8B parametrar aktiva per token på input och 16B på output, 1M-token kontext, inbyggd bildinput och MIT-licensierade vikter. DeepSeek rapporterar 90,6% på Terminal-Bench 2.1 och 74,2% på DeepSWE v1.1, de högsta leverantörsrapporterade open-weight-poängen på båda. Vals AI:s egen Terminal-Bench 2.1-körning är mindre generös på 74,5%, tvåa bland open-weight-modeller.
Vi täcker releasen mer i vår översikt av DeepSeek V4.1 Flash.
Viktiga egenskaper:
- API-priser på DeepSeeks prissida är $0,15 per miljon input-token och $0,60 per miljon output-token utanför högtrafik, fördubblas till $0,30 och $1,20 under vardagstoppar (01:00–04:00 och 06:00–10:00 UTC). Cache-träffar kostar $0,003 per miljon utanför högtrafik.
- Serveras som
deepseek-flashpå ett OpenAI-kompatibelt API, så skriptetask_coding_model.pylängre ner fungerar med byte av bas-URL. - En KV-cache ungefär en fjärdedel av storleken på V4 Flashs, vilket är hur DeepSeek prissätter långkontext så här lågt.
Bäst för: frontier-nära terminalkodning för småpengar och batchjobb på kod som du kan schemalägga utanför högtrafik.
Avvägning: den får 31,2% på Terminal-Bench 4.0 i DeepSeeks egen rapport, så det svåraste långhorisont-agentarbetet hör fortfarande hemma hos frontier-labben. Checkpointen är också cirka 510 GB, så "open weights" betyder här en multi-GPU-server. Om du är på V4 Pro 0813 meddelade DeepSeek att den skulle dirigeras till V4.1 Flash 14 september, men backade, och V4 Pro serveras fortfarande för $0,66/$1,98 utanför högtrafik tills vidare.
6. Kimi K3 (Moonshot AI)
Kimi K3 är Moonshot AI:s open-weight-flaggskepp med 2,8 biljoner parametrar, släppt i juli 2026, och den når 88,3% på Terminal-Bench 2.1, tvåa bland öppna modeller efter DeepSeek V4.1 Flashs leverantörsrapporterade 90,6%.
Hugging Face-kortet listar 104B aktiva parametrar över 896 experter (16 routade plus 2 delade per token), 1 048 576-token kontext och MXFP4-vikter. Vals AI mätte 93,4% på SWE-bench Verified.
Viktiga egenskaper:
- 1M-token kontext med inbyggd vision.
- Levereras under Kimi K3 License, en speciallicens snarare än MIT eller Apache, så läs den före kommersiell användning.
- Rekommenderade inferensstackar är vLLM, SGLang och TokenSpeed, och Moonshot kalibrerade vissa GPU-evalueringsuppgifter för H20-GPU:er.
Bäst för: alla som vill ha den starkaste öppna agentiska kodaren som finns.
Avvägning: nästintill frontier-kapabilitet kommer bara i datacenter-skala. Gapet på 3 poäng till Fable 5.1 på Terminal-Bench 2.1 ser nära ut, men det är inte likvärdigt: Moonshot mätte 88,3% i sitt eget Kimi Code-sele, medan Fables 91,4% kommer från Artificial Analysis Terminus 2-körningar. I praktiken hyr du den via en hostad leverantör eller kör ett eget kluster, plus en speciallicens att förankra juridiskt först.
7. Qwen3.8-27B (Alibaba)
Qwen3.8-27B är en tät 27-miljardersmodell släppt i augusti 2026 under Apache 2.0, och det är den bästa kodnings-LLM du kan köra på ett enda 24 GB GPU.
Modellkortet rapporterar 61,7% på SWE-bench Pro, 73,0% på Terminal-Bench 2.1, 90,3% på LiveCodeBench v6 och 42,2% på DeepSWE 1.1, med ett inbyggt 262 144-token kontext som kan utökas till 1M med YaRN. Dessa SWE-bench Pro- och Terminal-Bench-siffror slår Laguna S 2.1, en modell fyra gånger så stor, och slår Gemini 3.1 Pro på SWE-bench Pro. Medgivande: Qwen körde SWE-bench Pro på sitt eget korrigerade task set, så se dessa korslabb-jämförelser som indikativa.
Viktiga egenskaper:
- Communityns UD-Q4_K_M GGUF från Unsloth är en enda 16,5 GB-fil, vilket lämnar utrymme för 32K kontext på ett 24 GB-kort. UD-Q4_K_XL är 17,6 GB.
- Tät arkitektur, så den är långsammare per token än en 3B-aktiv MoE men mycket mer konsekvent på flerfiliga ändringar.
- Apache 2.0, så inga användningsbegränsningar för kommersiella produkter.
Bäst för: utvecklare som inte kan skicka kod till ett externt API, solopraktiker med ett RTX-klassat GPU, och alla som vill ha en lokal-versus-Claude-jämförelse på sitt eget repo innan de betalar för molnet.
Avvägning: 73,0% mot 91,4% på Terminal-Bench 2.1 är fortfarande ett gap på 18 poäng, och det syns som fler omtag på långa agentuppgifter.
8. Laguna S 2.1 (Poolside)
Laguna S 2.1 är Poolsides 118B-parameters mixture-of-experts-kodningsmodell med 8B aktiva parametrar, släppt 21 juli 2026, och det är open-weight-valet för en Mac Studio, DGX Spark eller multi-GPU-arbetsstation.
Poolsides lanseringspost rapporterar 59,4% på SWE-bench Pro public set, 70,2% på Terminal-Bench 2.1 med max thinking (60,4% med thinking av), 78,5% på SWE-bench Multilingual och 40,4% på DeepSWE.
Modellen tränades på 409 000 miljöer, inklusive 83 000 terminaluppgifter och 168 000 mjukvaruingenjörsarbetsflöden, på 4 096 H200:or på under 9 veckor.
Viktiga egenskaper:
- 1M-token kontext, ovanligt i denna storlek.
- OpenMDW-1.1-licens, tillåtande men värd att låta juridik läsa.
- Thinking-läge är på som standard och värt omkring 10 poäng på Terminal-Bench 2.1; medellängden på completion varierade från ca 23K till 249K token per uppgift i Poolsides körningar, så budgetera för det.
Bäst för: team som vill ha en Claude Code-liknande lokal agent på en maskin med 96 till 128 GB enat minne, och repositorier stora nog att behöva 1M-fönstret lokalt.
Avvägning: 118B parametrar vid 4-bit är ungefär 60 till 70 GB vikter innan du avsätter en KV-cache, så ett 24 GB GPU går bort. På råa poäng kniper Qwen3.8-27B det, men Lagunas 8B aktiva parametrar gör den mycket snabbare när vikterna väl får plats, vilket är poängen med en nattlig agent.
9. Qwen3-Coder-Next (Alibaba)
Qwen3-Coder-Next är en 80B-parameters mixture-of-experts-modell som aktiverar endast 3B parametrar per token, släppt 3 februari 2026 under Apache 2.0, och det är den snabbaste kompetenta lokala kodaren för hårdvara som inte rymmer en tät 27B-modell i hastighet.
Modellkortet rapporterar 70,6% på SWE-bench Verified, 44,3% på SWE-bench Pro och 36,2% på Terminal-Bench 2.0, med 512 experter (10 aktiva plus 1 delad) och 262 144-token kontext. Den körs endast utan thinking-läge.
Viktiga egenskaper:
- Den officiella Q4_K_M GGUF är cirka 48 GB, vilket passar en 64 GB Mac eller en CPU-offload-setup bättre än ett enskilt konsument-GPU.
- Hybrid attention (3 Gated DeltaNet-lager per standard attention-lager) håller minnesanvändningen låg i lång kontext.
- Stöds i vLLM, SGLang, Ollama, LM Studio, MLX-LM, llama.cpp och KTransformers, enligt kortet.
Bäst för: långhorisont-uppgifter över natten där token per sekund är viktigare än toppnoggrannhet, och laptops med 64 GB enat minne.
Avvägning: 44,3% på SWE-bench Pro är 17 poäng bakom Qwen3.8-27B, så för en enskild svår bugg skulle jag välja den täta modellen.
Andra open-weight-modeller värda att titta på
Fyra modeller till var nära att komma med, och 2 av dem kan passa vissa team bättre än mina val:
- DeepSeek V4 Pro 0813 (DeepSeek): 1,6T totalt, 49B aktiva, 1M kontext, MIT-licens, 96,4% på Vals AI:s arkiverade SWE-bench Verified. Serveras fortfarande för $0,66 in och $1,98 ut per miljon token utanför högtrafik, men Vals mätte den till 54,7% på Terminal-Bench 2.1 mot 87,9% som DeepSeek rapporterar, och DeepSeek pekar nu användare mot V4.1 Flash. Vår förklaring av DeepSeek V4 täcker arkitekturen.
- Kimi K2.6 (Moonshot): 1T totalt, 32B aktiva, 256K kontext, modifierad MIT-licens, 80,2% SWE-bench Verified, 58,6% SWE-bench Pro och 89,6% LiveCodeBench v6. Den renaste licensen bland triljonklassen efter DeepSeek V4 Pros rena MIT.
- MiniMax M3: 428B totalt, 23B aktiva, 1M kontext, inbyggd bild- och videoinput, 80,5% SWE-bench Verified och 59% SWE-bench Pro. Det öppna valet om dina uppgifter blandar kod med skärmdumpar.
- Qwen3.8-Flash-Next: 125B totalt med 6B aktiva, 62,5% SWE-bench Pro och 58,7% DeepSWE, under den mer restriktiva qwen-community-1.0-licensen. Starkare än Qwen3.8-27B på DeepSWE, men licensen höll den utanför min topp 9.
Om någon av dessa open-weight-val passar din hårdvara visar nästa avsnitt hur du får den att rulla.
Hur kör du en open-weight-kodningsmodell lokalt?
Att köra en open-weight-kodningsmodell lokalt tar tre steg: ladda ner en kvantiserad checkpoint, exponera den bakom en OpenAI-kompatibel endpoint och peka din klient eller kodningsassistent mot den endpointen. Jag använder Qwen3.8-27B i exemplet eftersom det är den enklaste av de nio att få plats med på konsumenthårdvara.
Först, nedladdningen. Biblioteket huggingface_hub hanterar återupptagbara överföringar och caching, vilket hjälper med de här större filerna:
"""Download a quantized coding model from Hugging Face.
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
from huggingface_hub import hf_hub_download
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
"""Download one file from the Hub and return its local path."""
path = hf_hub_download(repo_id=repo_id, filename=filename)
print(f"Saved to {path}")
return path
if __name__ == "__main__":
fetch()
Spara det som download_gguf.py och kör uv run --with huggingface_hub python download_gguf.py. På Windows ser du en varning om symlänkar om inte Utvecklarläge är på.
För det andra, serva den.
Valfritt av llama.cpp:s llama-server, LM Studio eller Ollama exponerar en OpenAI-kompatibel /v1-endpoint. Med llama.cpp är kommandot en rad, och 2 flaggor gör jobbet: -ngl 99 lägger varje lager på GPU och -c 32768 sätter 32K kontext.
llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080
För det tredje, klienten. Jag håller ett skript per modell jag utvärderar, lokal eller hostad, och byter mål med 3 miljövariabler. Samma fil pratar med den lokala servern ovan, med DeepSeeks API eller med OpenAI:
"""Send one coding prompt to any OpenAI-compatible endpoint.
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
LLM_BASE_URL e.g. http://localhost:8080/v1 or https://api.deepseek.com
LLM_MODEL e.g. qwen3.8-27b or deepseek-flash
LLM_API_KEY anything non-empty for a local server
"""
import os
from openai import OpenAI
PROMPT = (
"Write a Python function top_n(df, col, n) that returns the n largest "
"rows of a pandas DataFrame by column col, with a docstring and a "
"ValueError if col is missing."
)
def ask(prompt: str = PROMPT) -> str:
"""Return the model's reply for a single-turn coding request."""
client = OpenAI(
base_url=os.environ["LLM_BASE_URL"],
api_key=os.environ.get("LLM_API_KEY", "local"),
)
response = client.chat.completions.create(
model=os.environ["LLM_MODEL"],
messages=[{"role": "user", "content": prompt}],
temperature=0.2, # keep code generation close to deterministic
)
return response.choices[0].message.content
if __name__ == "__main__":
print(ask())
Spara som ask_coding_model.py och kör med LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.py.
Om du sedan kopplar flera sådana endpoints i en applikation med routing, omtag och verktygsanrop, täcker vår kurs om att utveckla LLM-appar med LangChain de abstraktioner som hindrar detta från att bli en hög av if-satser.
Hur väljer du den bästa LLM:en för kodning?
Att välja den bästa LLM:en för kodning handlar om fyra begränsningar: om din kod kan lämna din maskin, hur mycket minne du har, vad du vill betala per miljon output-token och hur mycket kontext en enskild uppgift behöver. Tabellen nedan ställer de 9 rankade modellerna sida vid sida på de siffror jag litar mest på, och beslutsguiden efteråt mappar dessa begränsningar till ett val.
| Model | Type | Terminal-Bench 2.1 | SWE-bench Pro | Context | Price (per 1M output) or memory | Best for |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | Cloud | 87.6% (Vals AI) | 89.9% | 1M | $20 | Default for most coding work |
| Claude Fable 5.1 | Cloud | 91.4% (Artificial Analysis) | 81.2% | 1M | $50 | Longest-horizon agentic work |
| GPT-6 Astra | Cloud | Not published (58.2% tbench.ai / 59.6% Artificial Analysis on Terminal-Bench 4.0) | Not published | 1.05M | $50 | Codex users, frontier science tasks |
| Gemini 3.8 Flash | Cloud | 89.4% | 61.6% | 1M | $3.75 through 2026 | High-volume, cost-sensitive agents |
| DeepSeek V4.1 Flash | Open (MIT) | 90.6% (vendor); 74.5% (Vals AI) | Not published | 1M | $0.60 off-peak | Cheapest capable open weights via API |
| Kimi K3 | Open (custom) | 88.3% (Kimi Code harness) | Not published | 1M | 2.8T params, cluster only | Strongest self-hosted agent |
| Qwen3.8-27B | Open (Apache 2.0) | 73.0% | 61.7% | 262K | 16.5 GB at UD-Q4_K_M | Single 24 GB GPU |
| Laguna S 2.1 | Open (OpenMDW-1.1) | 70.2% | 59.4% | 1M | 60 to 70 GB at Q4 | 128 GB workstation, local agents |
| Qwen3-Coder-Next | Open (Apache 2.0) | 36.2% (2.0) | 44.3% | 262K | About 48 GB at Q4 | Fast local model, 64 GB Mac |
Beslutsguiden
Så här mappar jag de fyra begränsningarna till rankningen:
- Agentiska kodningspipelines där korrekthet väger tyngre än kostnad: Claude Opus 5.5 på high eller xhigh effort, med Fable 5.1 i beredskap för långhorisontuppgifter där dina evals visar att Opus 5.5 inte räcker.
- Daglig AI-assisterad kodning till rimligt pris: Claude Opus 5.5 på sitt standard-medium först, GPT-6 Sol som tvåa om du lever i Codex.
- Frontier inom vetenskap, simulering eller GPU-kernelarbete: GPT-6 Astra eller Claude Opus 5.5. Astra leder på Terminal-Bench-Science, Opus 5.5 på Terminal-Bench 4.0.
- Enorm kodbas, 1M-token prompts, stram budget: Gemini 3.8 Flash för priset, Opus 5.5 när Flashs svar blir slarviga.
- Open weights via API: DeepSeek V4.1 Flash utanför högtrafik.
- Lokalt och privat på ett enda 24 GB GPU: Qwen3.8-27B på UD-Q4_K_M.
- Lokalt och privat på en maskin med 96 till 128 GB: Laguna S 2.1, eller Kimi K3 om "maskin" betyder "kluster".
- Lokalt och snabbt på en laptop med 64 GB: Qwen3-Coder-Next.
Vill du ha en mer allmän ram för att matcha en modell till en applikation, inklusive hosting och licenser, går vår guide om hur du väljer bästa LLM för din applikation bredare än kodning.
Och oavsett vilken modell du väljer är färdigheterna som ger värde desamma: vår färdighetsväg AI för mjukvaruingenjörskap och vår kurs om AI-assisterad kodning för utvecklare lär ut promptning, testning och granskningsvanor som förvandlar ett 91%-benchmark till en mergad pull request.
Avslutande tankar
Claude Opus 5.5 är den bästa kodnings-LLM:en i september 2026 och, ovanligt nog, också den du bör sätta på teamets nota. Claude Fable 5.1 är eskaleringsvägen för de längsta uppgifterna, och Qwen3.8-27B är open-weight-modellen som gör ett 24 GB GPU till en privat kodassistent som slår fjolårets frontier på SWE-bench Pro. Allt annat handlar om dina begränsningar, och beslutsguiden ovan är hur jag skulle lösa dem.
Den större förskjutningen är att benchmarken som definierade kategorin i 2 år, SWE-bench Verified, slutade spela roll under samma 12 månader som open weights hann ikapp på den.
Det är ingen slump.
När Opus 5 och DeepSeek V4 Pro ligger 0,6 poäng isär på ett mättat test, och en modell för $20 per miljon nu slår Anthropics egen $50-modell på SWE-bench Pro, har värdet flyttats till seledesign, effort-budgetar och utvärdering på ditt eget repo—vilket är precis det arbete en leverantörstabell inte kan göra åt dig.
Så gör det arbetet. Ta skriptet ask_coding_model.py, peka det mot 2 eller 3 av dessa modeller, kör det mot 20 riktiga ärenden från din backlog på den effort-nivå du faktiskt betalar för, och låt det resultatet övertrumfa allt jag skrev här. Om vibe coding passar dig bättre än eval-sele är vår artikel om vad vibe coding är och var det brister en ärlig genomgång av avvägningarna, och samma modellrankning gäller.
FAQs
What is SWE-bench Verified and why does it matter for evaluating coding LLMs?
SWE-bench Verified är en delmängd med 500 uppgifter av SWE-bench där mänskliga annotatörer bekräftade att varje GitHub-ärende är lösbart och att testerna är rättvisa; en modell måste producera en patch som klarar de dolda testerna. Den var viktig eftersom den blev det första allmänt betrodda testet av att fixa riktiga repositorier snarare än att skriva leksaksfunktioner. År 2026 ligger toppmodeller över 96% på den, så jag använder SWE-bench Pro och Terminal-Bench för att särskilja dem.
Can open-weight models compete with Claude and GPT for real coding tasks in 2026?
Ja, på de äldre benchmarken och nästan på de agentiska. Kimi K3 får 88,3% och DeepSeek V4 Pro 0813 får 87,9% på Terminal-Bench 2.1, mot 91,4% för Claude Fable 5.1, och Vals AI mätte DeepSeek inom 0,6 poäng från Opus 5 på SWE-bench Verified. Haken är storleken: de öppna modellerna har 1,6 till 2,8 biljoner parametrar, så "öppen" betyder "billig via ett API", inte "körs på min laptop".
What is the best LLM for coding if I cannot share my code with an external API?
Qwen3.8-27B är bästa valet på ett enda 24 GB GPU, med 73,0% på Terminal-Bench 2.1 och 61,7% på SWE-bench Pro under en Apache 2.0-licens. Har du 96 till 128 GB enat minne ger Laguna S 2.1 dig 1M-token kontext och 8B aktiva parametrar för en snabb lokal agent. För en 64 GB laptop gör Qwen3-Coder-Nexts 3B aktiva parametrar den till det snabbaste alternativet som fortfarande är användbart.
What is the difference between a coding LLM and an AI coding assistant like Cursor or GitHub Copilot?
En kodnings-LLM är modellen som genererar koden, medan en kodningsassistent är selet runt den som läser dina filer, kör kommandon och visar diffs. Cursor, Copilot, Windsurf, Claude Code och Codex låter dig byta underliggande modell, och samma modell kan få flera poängs skillnad mellan sele. Välj modellen utifrån benchmark och pris, välj assistenten utifrån arbetsflöde.
How often does the best coding LLM change, and how should I keep up?
Anthropic och OpenAI själva släppte 7 frontier-klassmodeller mellan 28 maj och 24 september 2026 (Opus 4.8, Fable 5, Sonnet 5, GPT-5.6, Opus 5 och 5.5, och Fable 5.1 plus GPT-6 Astra), så räkna med att ledaren byts var 4–8 vecka. Häng med genom att följa tre oberoende tavlor, Artificial Analysis, Vals AI och tbench.ai, snarare än lanseringsposter, och kör om din egen 20-uppgiftsutvärdering på den effort-nivå du betalar för när en modell du använder får en ny version.