Weiter zum Inhalt

Das beste LLM zum Programmieren 2026: 9 Modelle im Vergleich

Wir bewerten die 9 besten Coding-LLMs im September 2026 – von Claude Opus 5.5 bis zu lokalen Open-Weight-Modellen – anhand von SWE-bench Pro und Terminal-Bench.
Aktualisiert 25. Sept. 2026  · 15 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Im Februar 2025 erzielte Claude 3.7 Sonnet 62,3% auf SWE-bench Verified, bzw. 70,3% mit individuellem Scaffold, während das damals beste Open-Weight-Modell, DeepSeek-R1, in seinem Paper 49,2% meldete.

Je nach Scaffolding lag die Lücke damit bei 13 bis 21 Punkten.

Bis September 2026 führt das unabhängige Vals-AI-Board für SWE-bench Verified Claude Opus 5 mit 97,0% und das Open-Weight-Modell DeepSeek V4 Pro 0813 mit 96,4%, und Vals hat den Benchmark archiviert, weil er gesättigt ist.

Die Spitze verlagerte sich zu schwierigeren agentischen Evaluierungen wie SWE-bench Pro und Terminal-Bench 4.0, Open Weights zogen bei den alten Tests nach, und aus der Frage „Bestes LLM fürs Programmieren“ wurde „Bestes wofür, auf welcher Hardware, zu welchem Preis“.

Ich beantworte das für die 9 Modelle, die ich heute wirklich nutzen würde. Kurzfassung: Claude Opus 5.5 ist für die meisten Teams der beste Startpunkt.

Vorab ein Hinweis: Dieser Artikel dreht sich um die Modelle selbst, nicht um die Tools drumherum. Wenn du den Vergleich von Cursor, Copilot und Windsurf suchst, findest du ihn in unserer Übersicht zu den besten KI-Coding-Assistenten 2026.

Auf den Punkt: Die besten Coding-LLMs im September 2026

Claude Opus 5.5 ist aktuell sowohl auf den meisten Benchmarks das stärkste Coding-Modell als auch die Standardwahl für die meisten Entwicklerteams. Claude Fable 5.1 ist die Eskalationsstufe für Aufgaben mit sehr langer Perspektive, und Qwen3.8-27B ist das Open-Weight-Modell für eine einzelne GPU. Hier sind die besten Optionen je nach Zweck:

  • Bestes Gesamtpaket für agentisches Coding: Claude Opus 5.5 (Anthropic), 89,9% SWE-bench Pro und 66,4% Terminal-Bench 4.0, zu $4 Input und $20 Output pro Million Tokens.
  • Am besten für Aufgaben mit langem Zeithorizont: Claude Fable 5.1 (Anthropic), 81,2% SWE-bench Pro und die Top-Score auf Terminal-Bench 2.1 bei Artificial Analysis (91,4%), zu $10 Input und $50 Output pro Million Tokens.
  • Bestes OpenAI-Modell fürs Programmieren: GPT-6 Astra (OpenAI), erster Platz auf dem tbench.ai-Agenten-Leaderboard für Terminal-Bench 4.0 mit 58,2% und gleichauf mit Opus 5.5 bei 59,6% in der Messung von Artificial Analysis.
  • Bester Preiswert-Pick aus einem Frontier-Lab: Gemini 3.8 Flash (Google), 89,4% Terminal-Bench 2.1 für $0,75 Input und $3,75 Output pro Million Tokens bis 31. Dezember 2026.
  • Beste Open Weights via API: DeepSeek V4.1 Flash, MIT-Lizenz, 90,6% Terminal-Bench 2.1, $0,60 pro Million Output-Tokens außerhalb der Peak-Zeiten.
  • Beste Open Weights, die du nicht zu Hause laufen lassen kannst: Kimi K3 (Moonshot AI), 2,8 Billionen Parameter, 88,3% Terminal-Bench 2.1.
  • Bestes lokales Modell auf einer 24-GB-GPU: Qwen3.8-27B (Alibaba), Apache 2.0, 73,0% Terminal-Bench 2.1, 16,5 GB bei UD-Q4_K_M.
  • Bestes lokales Modell für eine 128-GB-Workstation: Laguna S 2.1 (Poolside), 118B Parameter mit nur 8B aktiv, 1M Kontext.
  • Schnellstes lokales Modell für ältere Hardware: Qwen3-Coder-Next, 80B total aber 3B aktiv, 70,6% SWE-bench Verified.

Alle oben genannten Werte sind vom Anbieter publiziert, sofern nicht anders vermerkt. Im weiteren Verlauf erkläre ich, wie ich zu diesen Empfehlungen komme und wo jedes Modell an seine Grenzen stößt.

Warum geht es hier um Modelle und nicht um Coding-Assistenten?

Ein Coding-LLM ist das Modell, das deinen Prompt liest und Tokens schreibt, während ein Coding-Assistent das Gerüst ist, das ihm Dateien zuführt, Befehle ausführt und Diffs zeigt.

Claude Code, Codex, Cursor, GitHub Copilot und Windsurf sind Gerüste. Claude Opus 5.5, GPT-6 Astra und Qwen3.8-27B sind Modelle – und das Gerüst verändert den Score stärker, als die meisten erwarten.

Anthropics eigener Launch-Post zu Claude Opus 4.8 macht das in einer Fußnote sehr deutlich.

Dort wird jeder Terminal-Bench-2.1-Wert mit dem öffentlichen Terminus-2-Harness berichtet und dann angemerkt, dass GPT-5.5 im OpenAI-Codex-CLI auf 83,4% steigt. Gleiche Gewichte, andere „Plumbing“, anderes Ergebnis.

Darum kommen die Rankings unten überall dort mit dem genutzten Harness, wo ich ihn finden konnte. Wenn du wissen willst, wie diese Modelle unter der Haube funktionieren, ist unser Leitfaden Was ein Large Language Model (LLM) ist eine 15-minütige Lektüre, die den Rest dieses Artikels leichter macht.

Welche Benchmarks zählen für Coding-LLMs wirklich?

Die Benchmarks, die 2026 für Coding-LLMs zählen, sind SWE-bench Pro, Terminal-Bench (Versionen 2.1 und 4.0) und – für Open-Weight-Modelle, die ihn noch berichten – LiveCodeBench v6. SWE-bench Verified war 2 Jahre lang der Standard und ist nun zu gesättigt, um Top-Modelle sinnvoll zu trennen.

Bevor ich ranke, hier, was jede Zahl in den Modelleinträgen bedeutet.

SWE-bench Verified ist gesättigt

SWE-bench Verified ist ein Set aus 500 menschlich validierten GitHub-Issues aus populären Python-Repositories; das Modell erhält das Repo und den Issue-Text und muss einen Patch liefern, der die versteckten Unittests besteht.

OpenAI führte 2024 die Verified-Teilmenge ein, weil das ursprüngliche SWE-bench Aufgaben mit unterdefinierten Issues oder fehlerhaften Tests enthielt. Es ist noch immer die meistzitierte Coding-Zahl – genau das ist das Problem.

Das Vals-AI-Leaderboard, das jedes Modell durch denselben minimalen Bash-only-Agenten schickt, listete in seinem Update vom 1. September 2026 Claude Opus 5 mit 97,0%, DeepSeek V4 Pro 0813 mit 96,4% und GPT-5.6 Sol mit 96,2% – und markierte den Benchmark dann als archiviert.

Wenn 3 Modelle aus 3 Labs innerhalb eines Punktes zueinander und 4 Punkte unter der Decke liegen, diskriminiert die Metrik nicht mehr. Ich zitiere sie weiterhin für ältere und kleinere Modelle, weil sie auf deren Karten steht, aber ich ranke nicht danach.

SWE-bench Pro ist der härtere Nachfolger

SWE-bench Pro, gepflegt von Scale AI, enthält 1.865 Aufgaben aus 41 professionellen Repositories mit einem öffentlichen Split von 731 Aufgaben und zurückgehaltenen privaten Sets. Am 22. September 2026 veröffentlichte Scale SWE-Bench Pro V2, das den öffentlichen Satz nach dem Entfernen von 89 ungültigen Aufgaben auf 642 Aufgaben kürzt – prüfe also, auf welcher Version ein Score lief.

Der durchschnittliche Fix betrifft 107,4 Zeilen über 4,1 Dateien, und die Repositories umfassen mehrere Sprachen statt nur Python. Als das SWE-bench-Pro-Paper im September 2025 erschien, lagen die besten Modelle bei rund 23%.

Ein Jahr später berichtet Anthropics Fable-5.1-Systemkarte 81,2% für Fable 5.1 und 79,2% für Opus 5, und OpenAIs GPT-5.6-Launch-Tabelle 64,6% für GPT-5.6 Sol. Drei Wochen nach der Fable-Karte hob die Opus-5.5-Systemkarte den Top-Score auf 89,9% an.

Das sind Anbieterläufe, bei Anthropic über 5 Durchgänge im Max-Effort gemittelt. Scales öffentliches Leaderboard hinkt den Anbieterzahlen um Monate hinterher, daher behandle ich die Anbieterzahl als Obergrenze und das Leaderboard als Untergrenze.

Terminal-Bench 2.1 und 4.0

Terminal-Bench gibt einem Modell eine Live-Shell in einem Container und Aufgaben wie „Trainiere dieses Modell“, „Flicke diesen Build“ oder „Rette dieses korrupte Archiv“ und bewertet dann die erzeugten Artefakte.

Der Release 2.1 umfasst 89 kuratierte Aufgaben aus Softwareentwicklung, Systemadministration, Datenverarbeitung und Security. Artificial Analysis scored mit dem Terminus-2-Harness als pass@1 über 3 Läufe. Für alle, die Coding-Agenten bauen oder nutzen, ist das die eine Zahl, die ich am stärksten gewichte.

Terminal-Bench 4.0, gehostet von Stanford, Harbor und dem Laude Institute auf tbench.ai, ist das neue Frontier-Set.

Anthropics Opus-5.5-Systemkarte beschreibt es als 66 Aufgaben mit Schwerpunkt auf Computational Biology, Physiksimulation, CAD, formalen Beweisen und GPU-Performance-Arbeit, mit längeren Timeouts, sodass das Harness weniger stark ins Gewicht fällt.

Auf dem tbench.ai-Agenten-Leaderboard führt weiterhin GPT-6 Astra mit 58,2% vor Claude Fable 5.1 mit 57,9%, aber Claude Opus 5.5 hat dort noch keinen Agenten-Eintrag. In Modell-Läufen zeigt Artificial Analysis Opus 5.5 und Astra gleichauf bei 59,6%, und Vals AI setzt Opus 5.5 mit 61,6% an die Spitze – wobei Vals anmerkt, dass der Wert auf 53,5% fällt, wenn man Aufgaben, die wegen Safeguards an ein Fallback-Modell gingen, als Fehlschläge zählt. Hier trennt sich die Spitze vom Feld.

LiveCodeBench v6 entlarvt Auswendiglernen

LiveCodeBench, eingeführt im Paper von Jain et al. 2024, sammelt kontinuierlich Aufgaben von LeetCode, AtCoder und Codeforces und versieht jede mit einem Zeitstempel, damit man Modelle nur auf Problemen nach ihrem Trainings-Cutoff bewertet.

Version 6 ist das aktuelle Fenster auf dem öffentlichen Leaderboard. Es misst algorithmisches Denken statt Repository-Engineering im großen Stil – deshalb blieb es nützlich für Interview- und Datenstruktur-Aufgaben.

Frontier-Labs berichten es 2026 kaum noch, daher stammen die Zahlen von Open-Weight-Modellen: das DeepSeek-V4-Pro-Preview im April mit 93,5%, Qwen3.8-27B mit 90,3% und Kimi K2.6 mit 89,6%. Gemini 3.1 Pro meldet eine verwandte Metrik, ein LiveCodeBench-Pro-Elo von 2.887.

Wie ich eine Anbieter-Benchmark-Tabelle lese

Eine Anbieter-Tabelle ist ein Best Case: deren Harness, deren Effort-Setting, deren Anzahl an Durchläufen. Bevor ich einer Lücke kleiner als 3 Punkte glaube, suche ich eine unabhängige Replikation bei Artificial Analysis, Vals AI oder auf dem tbench.ai-Board.

Unser Primer zu LLM-Benchmarks und dem Modellvergleich führt durch die wichtigsten Leaderboards, und unser Artikel zu was MMLU misst erinnert daran, dass Wissensbenchmarks kaum etwas darüber aussagen, ob ein Modell einen flaky Test fixen kann.

Für den Bau eines eigenen Evaluation-Harness ist unser Leitfaden zu LLM-Evaluationsmetriken und -methoden die erste Empfehlung für Junior-Kolleginnen und -Kollegen.

Mit diesen Benchmarks im Gepäck folgt nun, wie die 9 Modelle darauf abschneiden – beginnend mit der Cloud-Frontier.

Welche Cloud-Frontier-Modelle sind fürs Coding am besten?

Die besten Cloud-Frontier-Modelle fürs Programmieren im September 2026 sind Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra und Gemini 3.8 Flash. Alle vier kommen mit einem Kontextfenster von rund 1 Mio. Tokens.

Die Unterschiede liegen in Preis, Effort-Settings und dem Benchmark, auf den jedes Lab optimiert hat.

Ich liste sie in der Reihenfolge, in der ich sie einem Team empfehlen würde, das sich alle leisten kann.

1. Claude Opus 5.5 (Anthropic)

Claude Opus 5.5 ist Anthropics neuer Opus-Flaggschiff-Release vom 22. September 2026 – und aktuell das Coding-Modell, das ich fast allen empfehle. Das zwei Monate nach Opus 5 zu schreiben, hätte ich nicht erwartet. Anthropics Launch-Post sagt, es liefere in den meisten Aufgaben Fable-5.1-Niveau bei 40% geringeren Betriebskosten als Opus 5, und die Modellübersicht rät Entwicklerinnen und Entwicklern nun, mit Opus 5.5 zu starten und für sehr lange Aufgaben oder schwache Eval-Ergebnisse zu Fable 5.1 zu greifen.

Die Opus-5.5-Systemkarte meldet 89,9% auf SWE-bench Pro, 74,2% auf DeepSWE v1.1 und 66,4% auf Terminal-Bench 4.0 bei xhigh Effort – vor Fable 5.1 in jeder von Anthropic publizierten Coding-Zeile. Die unabhängigen Zahlen liegen näher zusammen: Artificial Analysis sieht es auf Terminal-Bench 4.0 gleichauf mit GPT-6 Astra bei 59,6%, und Vals AI setzt es mit 61,6% auf Terminal-Bench 4.0 und 87,6% auf Terminal-Bench 2.1 an die Spitze. Beide Vals-Werte beinhalten Safeguard-Fallbacks; rechnet man diese als Fehlschläge, sinken sie auf 53,5% bzw. 79,8%.

Wichtigste Merkmale:

  • $4 pro Million Input-Tokens und $20 pro Million Output-Tokens, 20% unter Opus 5, mit Cache-Reads um 60% auf $0,20 pro Million gesenkt
  • 1M-Token-Kontext, 128K Output, adaptives Denken immer aktiv und standardmäßig mittlerer statt hoher Effort
  • 57,8% auf CursorBench 4.0 bei max Effort – Top-Score auf Cursors Leaderboard; bei medium 52,5%, immer noch über Fable 5.1 bei max
  • Verfügbar über die Claude API als claude-opus-5-5 sowie auf Amazon Bedrock, Google Cloud und Microsoft Foundry

Am besten geeignet für: tägliches Coding, Codebase-weite Migrationen und Code-Reviews. Es ersetzt Opus 5 zu einem niedrigeren Preis, und Claude Code nutzt es nun als Opus-Standardmodell. Unser Claude-Opus-5.5-Guide deckt den Launch ab, und unser Vergleich GPT-6 Sol vs Claude Opus 5.5 enthält einen Hands-on-Test.

Kompromiss: Die 40% Ersparnis gelten beim Standard-Effort. Bei max Effort fand Artificial Analysis, dass es deutlich mehr Tokens verbraucht als Opus 5, sodass die Kosten pro Intelligence-Index-Aufgabe ($5,98) fast auf dem Niveau von Opus 5 ($5,86) lagen. Außerdem liefert es Fable-ähnliche Safeguards mit, die die meisten Security-Aufgaben an Opus 4.8 routen. Und bei Code-Migrationen ist Vorsicht geboten, da Requests mit deaktiviertem Thinking oder erzwungener Toolnutzung nun Fehler zurückgeben.

2. Claude Fable 5.1 (Anthropic)

Claude Fable 5.1 ist die öffentlich verfügbare Version von Anthropics Mythos-Klasse, erschienen am 1. September 2026, und es ist das Modell, zu dem ich eskaliere, wenn Opus 5.5 an Grenzen stößt. Anthropics Launch-Seite stellt klar, dass Fable 5.1 und Claude Mythos 5.1 dasselbe Modell mit unterschiedlichen Safeguards sind.

Die Zahlen aus der Fable-5.1-Systemkarte sind 81,2% auf SWE-bench Pro und 55,8% auf Terminal-Bench 4.0. Artificial Analysis hat unabhängig 91,4% auf Terminal-Bench 2.1 bei max Effort gemessen – weiterhin die Top-Score dort.

Wichtigste Merkmale:

  • 1M-Token-Kontextfenster und 128K Output-Tokens
  • Adaptives Denken ist immer eingeschaltet
  • Prompt-Cache-Reads um 75% auf $0,25 pro Million Tokens mit 5.1 gesenkt – Anthropic schätzt bis zu 45% Einsparung bei agentischen Workloads
  • Starke Mehrdatei-Planung, breiteres Denken, bessere Toolnutzung

Am besten geeignet für: produktive agentische Pipelines, mehrtägige Refactorings und Aufgaben, bei denen ein falsches Ergebnis teurer ist als Tokens – sobald deine Evals zeigen, dass Opus 5.5 hier schwächelt. Unser Claude-Fable-5.1-Guide behandelt den Release, und unsere Fable-5-Übersicht den Juni-Start.

Kompromiss: $10 pro Million Input und $50 pro Million Output sind das 2,5-Fache der Opus-5.5-Rate, und in Anthropics eigener Tabelle liegt Fable 5.1 nun auf SWE-bench Pro, Terminal-Bench 4.0 und CursorBench 4.0 hinter Opus 5.5. Anthropic sagt, die Lücke in der Praxis sei kleiner als die Scores nahelegen, aber die Beweislast hat sich gedreht. Auf dem älteren CursorBench 3.2.0 erzielte Fable 5.1 bei medium Effort 68,0% für $3,53 pro Aufgabe.

3. GPT-6 Astra (OpenAI)

GPT-6 Astra ist OpenAIs Frontier-Modell vom 3. September 2026 und steht mit dem Codex-Harness bei max Effort weiterhin auf Platz 1 des tbench.ai-Agenten-Leaderboards für Terminal-Bench 4.0 mit 58,2% – auch wenn Opus 5.5 dort noch keinen Agenten-Eintrag hat.

Die Modellseite listet ein Kontextfenster von 1.050.000 Tokens, 128.000 Output-Tokens, einen Knowledge Cutoff vom 30. April 2026 und Effort-Level von none bis max. Die Preise: $10 pro Million Input-Tokens, $1 für gecachten Input und $50 pro Million Output-Tokens.

OpenAIs Launch-Material stützt sich stärker auf eigene Evaluierungen und die Systemkarte als auf labübergreifende Benchmarks. Diese Evals sind stark, aber ich würde Astra nicht klar vor Opus 5.5 oder Fable 5.1 sehen. Die Launch-Zahlen behandeln wir in unserem GPT-6-Astra-Überblick.

Wichtigste Merkmale:

  • Die Responses API bietet hosted_shell, apply_patch, computer_use und tool_search – das Toolset, auf dem Codex selbst läuft.
  • Gecachter Input zu $1 pro Million Tokens, ein Zehntel des Basispreises – entscheidend für Agent-Loops, die dasselbe Repo immer wieder lesen.
  • Astra ist das erste OpenAI-Modell in der höchsten Cybersecurity-Stufe des Preparedness Framework, daher sind einige sicherheitsnahe Prompts gated.

Am besten geeignet für: Teams, die bereits auf Codex, GitHub Copilot oder im Microsoft-Stack sind, sowie wissenschafts- und ingenieurslastige Aufgaben und alle, die bessere Third-Party-Tool-Unterstützung brauchen. Wer das Meiste günstiger will: GPT-6 Sol, erschienen am 22. September zu $2 Input und $10 Output pro Million Tokens, folgt auf GPT-5.6 Sol. Ohne GPT-6 Terra füllt es nun dessen altes Preissegment. In OpenAIs eigenen Charts erzielt es 68,8% auf DeepSWE 1.1 und 49,3% auf FrontierCode, wobei GPT-5.6 Sol bei max Effort auf DeepSWE noch höher liegt.

Kompromiss: Preise auf Fable-Niveau, und Opus 5.5 erreicht nun auf Terminal-Bench 4.0 das Niveau von Astra – bei etwa 40% der Kosten pro Aufgabe laut Anthropic, mit Artificial Analysis, die beide gleichauf misst. Astras klarste Vorsprünge liegen bei wissenschaftslastigen Arbeiten: 64,6% auf Terminal-Bench-Science und 65,5% auf FrontierSWE v2 – beides vor Opus 5.5.

4. Gemini 3.8 Flash (Google)

Gemini 3.8 Flash ist Googles Arbeitstier, erschienen am 2. September 2026 – und eine der günstigsten Möglichkeiten, einen agentischen Coding-Score auf Frontier-Niveau zu bekommen (GPT-6 Luna ist pro Token günstiger, erzielt aber niedrigere agentische Scores). Googles Evaluationsbericht zeigt 89,4% auf Terminal-Bench 2.1 und 73,7% auf DeepSWE v1.1 – einer 113-Task-Langfrist-Suite, auf der Fable 5.1 67,4% erreichte. In derselben Tabelle liegt Opus 5 leicht voran mit 74,0%, Anthropic meldet 74,2% für Opus 5.5, und Googles Developer Guide ergänzt 61,6% auf SWE-bench Pro.

Die Preise auf der Gemini-API-Preisseite betragen $0,75 pro Million Input-Tokens und $3,75 pro Million Output-Tokens bis zum 31. Dezember 2026, danach ab 1. Januar 2027 $1,50 und $7,50. Selbst 2027 sind das etwas mehr als ein Drittel der Opus-5.5-Output-Rate. Das Kontextfenster: 1M Input-Tokens mit 64K Output.

Wichtigste Merkmale:

  • Native Multimodalität im Input – du kannst also ein Architekturschaubild oder einen Screenshot eines fehlschlagenden UIs neben dem Code übergeben.
  • Google positioniert es als Modell für hohes agentisches Volumen und bepreist es entsprechend.
  • Es gibt eine Cyber-Variante für Vulnerability-Arbeit, separat gated – mehr dazu in unserem Überblick zu Gemini 3.8 Flash und Flash Cyber.

Am besten geeignet für: Agent-Loops mit großem Volumen, kostensensible Teams und Vertex-AI-Umgebungen. Gemini 3.1 Pro, erschienen am 19. Februar 2026, bleibt Googles Pro-Modell mit 54,2% SWE-bench Pro zu $2 Input und $12 Output pro Million Tokens, aber speziell fürs Coding würde ich heute 3.8 Flash vor 3.1 Pro wählen.

Kompromiss: 19,1% auf Terminal-Bench 4.0. Flash ist stark bei klar umrissenen Terminal-Aufgaben und schwach bei Frontier-Science-Aufgaben – halte für die härtesten Tickets ein stärkeres Modell bereit.

Damit sind die Cloud-Modelle abgedeckt. Der Rest sind Modelle zum Herunterladen.

Was sind die besten Open-Weight-Coding-LLMs 2026?

Die besten Open-Weight-Coding-LLMs 2026 teilen sich in 2 Gruppen: Rechenzentrums-Modelle wie DeepSeek V4.1 Flash und Kimi K3, die Frontier-Scores erreichen, aber ernsthafte Server-Hardware brauchen, und Sub-120B-Modelle wie Qwen3.8-27B und Laguna S 2.1, die du auf eigener Hardware betreiben kannst.

„Open Weight“ bedeutet hier: Die Gewichte sind downloadbar. Die Lizenzen reichen von MIT und Apache 2.0 bis zu kundenspezifischen Bedingungen.

5. DeepSeek V4.1 Flash (DeepSeek)

DeepSeek V4.1 Flash ist DeepSeeks Release vom 10. September 2026 – und trotz des „Flash“-Namens das DeepSeek-Modell, zu dem ich jetzt zuerst greifen würde. DeepSeek sagt, es schlage das eigene V4 Pro 0813-Flaggschiff bei Leistung, Kosten, Geschwindigkeit und Task-Dauer. Der unabhängige Vals-AI-Index stützt das und rankt es mit 57,9% als bestes Open-Weight-Modell, gegenüber 52,4% für V4 Pro 0813 im August.

Es ist ein MoE-Modell mit 552B Parametern und etwa 8B aktiven Parametern pro Input-Token und 16B pro Output-Token, 1M Kontext, nativem Bildinput und MIT-lizenzierten Gewichten. DeepSeek meldet 90,6% auf Terminal-Bench 2.1 und 74,2% auf DeepSWE v1.1 – die höchsten anbieterseitig berichteten Open-Weight-Scores auf beiden. Vals AIs eigener Terminal-Bench-2.1-Lauf ist mit 74,5% knapper und setzt es auf Platz 2 unter den Open Weights.

Mehr dazu in unserem DeepSeek-V4.1-Flash-Überblick.

Wichtigste Merkmale:

  • API-Preise auf DeepSeeks Preisseite: $0,15 pro Million Input-Tokens und $0,60 pro Million Output-Tokens außerhalb der Peak-Zeiten, verdoppelt auf $0,30 und $1,20 zu Peak-Zeiten an Werktagen (01:00–04:00 und 06:00–10:00 UTC). Cache-Hits kosten $0,003 pro Million außerhalb der Peak-Zeiten.
  • Bereitgestellt als deepseek-flash auf einer OpenAI-kompatiblen API – das ask_coding_model.py-Skript unten funktioniert mit geändertem Base-URL.
  • Ein KV-Cache von etwa einem Viertel der Größe von V4 Flash – der Grund für die niedrigen Langkontext-Kosten.

Am besten geeignet für: frontiernahe Terminal-Coding-Aufgaben zum Spottpreis sowie Batch-Jobs, die du außerhalb der Peak-Zeiten planen kannst.

Kompromiss: Es erzielt laut DeepSeeks eigenem Bericht 31,2% auf Terminal-Bench 4.0 – die härteste, langhorizontale Agentenarbeit bleibt also bei den Frontier-Labs. Der Checkpoint ist zudem etwa 510 GB groß – „Open Weights“ heißt hier Multi-GPU-Server. Falls du auf V4 Pro 0813 bist: DeepSeek kündigte an, dieses Modell am 14. September auf V4.1 Flash zu routen, hat dann aber zurückgerudert, und V4 Pro wird bis auf Weiteres weiterhin zu $0,66/$1,98 außerhalb der Peak-Zeiten serviert.

6. Kimi K3 (Moonshot AI)

Kimi K3 ist Moonshot AIs Open-Weight-Flaggschiff mit 2,8 Billionen Parametern, erschienen im Juli 2026, und erzielt 88,3% auf Terminal-Bench 2.1 – zweitbestes Open-Modell hinter DeepSeek V4.1 Flashs 90,6% aus dem Anbieterbericht.

Die Hugging-Face-Karte listet 104B aktive Parameter über 896 Experten (pro Token 16 geroutete plus 2 Shared), 1.048.576 Tokens Kontext und MXFP4-Gewichte. Vals AI maß 93,4% auf SWE-bench Verified.

Wichtigste Merkmale:

  • 1M-Token-Kontext mit nativer Vision.
  • Kommt unter der Kimi-K3-Lizenz, einer Custom-Lizenz statt MIT oder Apache – vor kommerzieller Nutzung lesen.
  • Empfohlene Inferenz-Stacks sind vLLM, SGLang und TokenSpeed; Moonshot kalibrierte einige GPU-Evals für H20-GPUs.

Am besten geeignet für: alle, die den stärksten offenen agentischen Coder wollen.

Kompromiss: Nahe-Frontier-Fähigkeiten gibt es nur im Rechenzentrum. Die 3-Punkte-Lücke zu Fable 5.1 auf Terminal-Bench 2.1 wirkt klein, ist aber nicht 1:1 vergleichbar: Moonshot maß 88,3% im eigenen Kimi-Code-Harness, während Fables 91,4% aus den Terminus-2-Läufen von Artificial Analysis stammen. In der Praxis mietet man es gehostet oder betreibt einen eigenen Cluster – plus juristische Klärung der Custom-Lizenz.

7. Qwen3.8-27B (Alibaba)

Qwen3.8-27B ist ein dichtes 27-Milliarden-Parameter-Modell, veröffentlicht im August 2026 unter Apache 2.0 – und das beste Coding-LLM, das du auf einer einzelnen 24-GB-GPU betreiben kannst.

Die Modellkarte meldet 61,7% auf SWE-bench Pro, 73,0% auf Terminal-Bench 2.1, 90,3% auf LiveCodeBench v6 und 42,2% auf DeepSWE 1.1, mit nativem 262.144-Token-Kontext, erweiterbar auf 1M mit YaRN. Diese SWE-bench-Pro- und Terminal-Bench-Werte schlagen Laguna S 2.1, ein Modell mit vierfacher Größe, und übertreffen Gemini 3.1 Pro auf SWE-bench Pro. Zugegeben: Qwen lief SWE-bench Pro auf einem eigenen bereinigten Task-Set – Cross-Lab-Vergleiche also nur richtungsweisend sehen.

Wichtigste Merkmale:

  • Das Community-UD-Q4_K_M-GGUF von Unsloth ist eine einzelne 16,5-GB-Datei – genug Luft für 32K Kontext auf einer 24-GB-Karte. UD-Q4_K_XL liegt bei 17,6 GB.
  • Dichte Architektur – pro Token langsamer als ein MoE mit 3B aktiv, dafür viel konstanter bei Mehrdatei-Edits.
  • Apache 2.0 – keine Nutzungseinschränkungen für Produkte.

Am besten geeignet für: Entwickler, die keinen Code an eine externe API schicken können, Solo-Praktiker mit einer RTX-Klasse-GPU und alle, die lokal vs. Claude auf dem eigenen Repo vergleichen wollen, bevor sie für die Cloud zahlen.

Kompromiss: 73,0% vs. 91,4% auf Terminal-Bench 2.1 ist weiterhin eine 18-Punkte-Lücke – das zeigt sich in mehr Retries bei langen agentischen Tasks.

8. Laguna S 2.1 (Poolside)

Laguna S 2.1 ist Poolside’s 118B-MoE-Coding-Modell mit 8B aktiven Parametern, erschienen am 21. Juli 2026 – und der Open-Weight-Pick für Mac Studio, DGX Spark oder eine Multi-GPU-Workstation.

Der Launch-Post meldet 59,4% auf dem öffentlichen SWE-bench-Pro-Set, 70,2% auf Terminal-Bench 2.1 mit Thinking an (60,4% ohne Thinking), 78,5% auf SWE-bench Multilingual und 40,4% auf DeepSWE.

Das Modell wurde auf 409.000 Umgebungen trainiert, darunter 83.000 Terminal-Aufgaben und 168.000 Software-Engineering-Workflows – auf 4.096 H200s in unter 9 Wochen.

Wichtigste Merkmale:

  • 1M-Token-Kontextfenster – ungewöhnlich in dieser Größenklasse.
  • OpenMDW-1.1-Lizenz, permissiv, aber juristisch prüfen.
  • Thinking-Modus standardmäßig an und auf Terminal-Bench 2.1 rund 10 Punkte wert; die mittlere Completion-Länge lag in Poolsides Läufen zwischen ca. 23K und 249K Tokens pro Aufgabe – plane Budget dafür ein.

Am besten geeignet für: Teams, die einen Claude-Code-ähnlichen lokalen Agenten auf einer Maschine mit 96 bis 128 GB Unified Memory wollen, und Repositories, die lokal die 1M-Fenster brauchen.

Kompromiss: 118B Parameter bei 4-Bit sind grob 60 bis 70 GB Gewichte, bevor ein KV-Cache dazukommt – eine 24-GB-GPU scheidet aus. Qwen3.8-27B ist bei Rohscores knapp vorn, doch Lagunas 8B aktive Parameter machen es deutlich schneller, sobald die Gewichte passen – genau der Punkt für einen Overnight-Agenten.

9. Qwen3-Coder-Next (Alibaba)

Qwen3-Coder-Next ist ein 80B-MoE-Modell mit nur 3B aktiven Parametern pro Token, erschienen am 3. Februar 2026 unter Apache 2.0 – der schnellste taugliche Local-Coder für Hardware, die ein dichtes 27B-Modell nicht in Tempo halten kann.

Die Modellkarte meldet 70,6% auf SWE-bench Verified, 44,3% auf SWE-bench Pro und 36,2% auf Terminal-Bench 2.0 – mit 512 Experten (10 aktiv plus 1 Shared) und 262.144 Tokens Kontext. Es läuft nur im Non-Thinking-Modus.

Wichtigste Merkmale:

  • Das offizielle Q4_K_M-GGUF ist rund 48 GB groß – ideal für einen 64-GB-Mac oder CPU-Offload statt eine einzelne Consumer-GPU.
  • Hybride Attention (3 Gated-DeltaNet-Layer pro Standard-Attention-Layer) hält den Langkontext-Speicherbedarf niedrig.
  • Unterstützt in vLLM, SGLang, Ollama, LM Studio, MLX-LM, llama.cpp und KTransformers, laut Karte.

Am besten geeignet für: langhorizontale Overnight-Aufgaben, bei denen Tokens pro Sekunde wichtiger sind als Peak-Genauigkeit, und Laptops mit 64 GB Unified Memory.

Kompromiss: 44,3% auf SWE-bench Pro liegt 17 Punkte hinter Qwen3.8-27B – für einen einzelnen harten Bug würde ich zum dichten Modell greifen.

Weitere interessante Open-Weight-Modelle

Vier weitere Modelle haben es fast in die Liste geschafft – zwei davon passen für bestimmte Teams sogar besser als meine Picks:

Wenn einer dieser Open-Weight-Picks zu deiner Hardware passt, zeigt der nächste Abschnitt, wie du ihn startest.

Wie läuft ein Open-Weight-Coding-Modell lokal?

Ein Open-Weight-Coding-Modell lokal zu betreiben, hat 3 Schritte: einen quantisierten Checkpoint herunterladen, ihn hinter einem OpenAI-kompatiblen Endpoint serven und deinen Client oder Coding-Assistenten auf diesen Endpoint zeigen lassen. Ich nutze im Beispiel Qwen3.8-27B, weil es von den 9 am einfachsten auf Consumer-Hardware passt.

Erstens der Download. Die Bibliothek huggingface_hub unterstützt resumierbare Transfers und Caching – wichtig bei den großen Dateien:

"""Download a quantized coding model from Hugging Face.
 
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
 
from huggingface_hub import hf_hub_download
 
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
 
 
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
    """Download one file from the Hub and return its local path."""
    path = hf_hub_download(repo_id=repo_id, filename=filename)
    print(f"Saved to {path}")
    return path
 
 
if __name__ == "__main__":
    fetch()

Speichere das als download_gguf.py und führe uv run --with huggingface_hub python download_gguf.py aus. Unter Windows siehst du eine Warnung zu Symlinks, wenn der Entwicklermodus nicht aktiviert ist.

Zweitens: Serven.

Egal ob llama-server aus llama.cpp, LM Studio oder Ollama – alle exponieren einen OpenAI-kompatiblen /v1-Endpoint. Mit llama.cpp ist der Befehl einzeilig, zwei Flags machen die Musik: -ngl 99 lagert alle Layer auf die GPU aus, und -c 32768 setzt einen 32K-Kontext.

llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080

Drittens: der Client. Ich halte für jedes Modell – lokal oder gehostet – ein Skript bereit und wechsle das Ziel mit 3 Umgebungsvariablen. Dasselbe File spricht mit dem lokalen Server oben, der DeepSeek-API oder OpenAI:

"""Send one coding prompt to any OpenAI-compatible endpoint.
 
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
 
    LLM_BASE_URL   e.g. http://localhost:8080/v1  or  https://api.deepseek.com
    LLM_MODEL      e.g. qwen3.8-27b  or  deepseek-flash
    LLM_API_KEY    anything non-empty for a local server
"""
 
import os
 
from openai import OpenAI
 
PROMPT = (
    "Write a Python function top_n(df, col, n) that returns the n largest "
    "rows of a pandas DataFrame by column col, with a docstring and a "
    "ValueError if col is missing."
)
 
 
def ask(prompt: str = PROMPT) -> str:
    """Return the model's reply for a single-turn coding request."""
    client = OpenAI(
        base_url=os.environ["LLM_BASE_URL"],
        api_key=os.environ.get("LLM_API_KEY", "local"),
    )
    response = client.chat.completions.create(
        model=os.environ["LLM_MODEL"],
        messages=[{"role": "user", "content": prompt}],
        temperature=0.2,  # keep code generation close to deterministic
    )
    return response.choices[0].message.content
 
 
if __name__ == "__main__":
    print(ask())

Speichere es als ask_coding_model.py und starte mit LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.py.

Wenn du anschließend mehrere Endpoints mit Routing, Retries und Tool-Calls in eine Anwendung verdrahtest, zeigt unser Kurs Developing LLM Applications with LangChain die Abstraktionen, die das vor einem Haufen if-Statements bewahren.

Wie wählst du das beste LLM fürs Programmieren aus?

Die Wahl des besten LLM fürs Programmieren hängt von 4 Faktoren ab: Darf dein Code die Maschine verlassen, wie viel Speicher hast du, was zahlst du pro Million Output-Tokens und wie viel Kontext braucht eine einzelne Aufgabe. Die Tabelle unten stellt die 9 Modelle mit den aus meiner Sicht verlässlichsten Zahlen gegenüber, und die Entscheidungshilfe danach mappt die 4 Faktoren auf eine Empfehlung.

Modell Typ Terminal-Bench 2.1 SWE-bench Pro Kontext Preis (pro 1M Output) oder Speicher Am besten für
Claude Opus 5.5 Cloud 87,6% (Vals AI) 89,9% 1M $20 Standard für die meisten Coding-Aufgaben
Claude Fable 5.1 Cloud 91,4% (Artificial Analysis) 81,2% 1M $50 Längste agentische Arbeiten
GPT-6 Astra Cloud Nicht publiziert (58,2% tbench.ai / 59,6% Artificial Analysis auf Terminal-Bench 4.0) Nicht publiziert 1,05M $50 Codex-Nutzer, Frontier-Science
Gemini 3.8 Flash Cloud 89,4% 61,6% 1M $3,75 bis Ende 2026 Hohe Volumina, kostensensitive Agenten
DeepSeek V4.1 Flash Open (MIT) 90,6% (Anbieter); 74,5% (Vals AI) Nicht publiziert 1M $0,60 off-peak Günstigste leistungsfähige Open Weights via API
Kimi K3 Open (Custom) 88,3% (Kimi-Code-Harness) Nicht publiziert 1M 2,8T Parameter, nur Cluster Stärkster Self-Hosted-Agent
Qwen3.8-27B Open (Apache 2.0) 73,0% 61,7% 262K 16,5 GB bei UD-Q4_K_M Einzelne 24-GB-GPU
Laguna S 2.1 Open (OpenMDW-1.1) 70,2% 59,4% 1M 60 bis 70 GB bei Q4 128-GB-Workstation, lokale Agenten
Qwen3-Coder-Next Open (Apache 2.0) 36,2% (2.0) 44,3% 262K Rund 48 GB bei Q4 Schnelles lokales Modell, 64-GB-Mac

Die Entscheidungshilfe

So mappe ich die 4 Faktoren auf die Empfehlungen:

  • Agentische Coding-Pipelines, bei denen Korrektheit wichtiger ist als Kosten: Claude Opus 5.5 mit hohem oder xhohem Effort, mit Fable 5.1 in Reserve für Langzeitaufgaben, bei denen deine Evals Opus-5.5-Schwächen zeigen.
  • Tägliches KI-unterstütztes Coding zu vernünftigen Kosten: Zuerst Claude Opus 5.5 bei Default „medium“, zweitens GPT-6 Sol, wenn du im Codex-Ökosystem lebst.
  • Frontier-Science, Simulation oder GPU-Kernel-Arbeit: GPT-6 Astra oder Claude Opus 5.5. Astra führt auf Terminal-Bench-Science, Opus 5.5 auf Terminal-Bench 4.0.
  • Riesige Codebasis, 1M-Token-Prompts, knappes Budget: Gemini 3.8 Flash für den Preis, Opus 5.5, wenn Flashs Antworten ungenau werden.
  • Open Weights via API: DeepSeek V4.1 Flash außerhalb der Peak-Zeiten.
  • Lokal und privat auf einer einzelnen 24-GB-GPU: Qwen3.8-27B bei UD-Q4_K_M.
  • Lokal und privat auf einer 96- bis 128-GB-Maschine: Laguna S 2.1 – oder Kimi K3, wenn „Maschine“ „Cluster“ bedeutet.
  • Lokal und schnell auf einem 64-GB-Laptop: Qwen3-Coder-Next.

Wenn du ein allgemeineres Framework zur Modellwahl suchst – inklusive Hosting-Optionen und Lizenzen –, geht unser Leitfaden So wählst du das beste LLM für deine Anwendung über Coding hinaus.

Und egal welches Modell du wählst: Die Kompetenzen, die Wert daraus schöpfen, sind dieselben. Unser AI for Software Engineering Lernpfad und unser Kurs AI-assisted coding for developers vermitteln Prompting, Testing und Review-Gewohnheiten, die aus 91% im Benchmark einen gemergten Pull Request machen.

Fazit

Claude Opus 5.5 ist das beste Coding-LLM im September 2026 – und ungewöhnlich genug zugleich das, das du auf die Teamrechnung setzen solltest. Claude Fable 5.1 ist der Eskalationspfad für die längsten Aufgaben, und Qwen3.8-27B ist das Open-Weight-Modell, das aus einer 24-GB-GPU einen privaten Coding-Assistenten macht, der letztes Jahr’s Frontier auf SWE-bench Pro schlägt. Alles andere hängt von deinen Rahmenbedingungen ab – und die Entscheidungshilfe oben zeigt, wie ich sie auflöse.

Die größere Verschiebung: Der Benchmark, der diese Kategorie 2 Jahre definierte – SWE-bench Verified – verlor im selben Jahr an Relevanz, in dem Open Weights darauf aufschlossen.

Das ist kein Zufall.

Wenn Opus 5 und DeepSeek V4 Pro auf einem gesättigten Test 0,6 Punkte auseinanderliegen und ein $20-pro-Million-Modell nun Anthropics eigenes $50-Modell auf SWE-bench Pro schlägt, verlagert sich der Wert zu Harness-Design, Effort-Budget und Evaluation auf deinem eigenen Repository – genau die Arbeit, die dir keine Anbieter-Tabelle abnimmt.

Also mach diese Arbeit. Nimm das Skript ask_coding_model.py, richte es auf 2 oder 3 dieser Modelle, lass es gegen 20 echte Tickets aus deinem Backlog laufen – auf dem Effort-Level, das du tatsächlich bezahlst – und lass dieses Ergebnis alles überstimmen, was ich hier schreibe. Wenn „Vibe Coding“ eher dein Stil ist als Evaluations-Harnesses, ist unser Artikel was Vibe Coding ist und wo es scheitert ein ehrlicher Blick auf die Trade-offs – und dieselben Modellrankings gelten.

FAQs

Was ist SWE-bench Verified und warum ist es wichtig für die Bewertung von Coding-LLMs?

SWE-bench Verified ist eine 500-Aufgaben-Teilmenge von SWE-bench, in der Annotatorinnen und Annotatoren bestätigt haben, dass jedes GitHub-Issue lösbar ist und die Tests fair sind. Ein Modell muss einen Patch erzeugen, der die versteckten Tests besteht. Es war wichtig, weil es als erstes breit vertrautes Verfahren das Fixen realer Repositories statt das Schreiben von Spielzeugfunktionen testete. 2026 liegen die Top-Modelle darüber bei 96%, daher nutze ich SWE-bench Pro und Terminal-Bench, um sie zu unterscheiden.

Können Open-Weight-Modelle 2026 bei realen Coding-Aufgaben mit Claude und GPT mithalten?

Ja – bei den älteren Benchmarks und fast auch bei den agentischen. Kimi K3 erzielt 88,3% und DeepSeek V4 Pro 0813 87,9% auf Terminal-Bench 2.1 gegenüber 91,4% für Claude Fable 5.1, und Vals AI maß DeepSeek auf SWE-bench Verified nur 0,6 Punkte hinter Opus 5. Der Haken ist die Größe: Diese Open-Modelle haben 1,6 bis 2,8 Billionen Parameter – „open“ heißt also „günstig via API“, nicht „läuft auf meinem Laptop“.

Welches LLM ist am besten, wenn ich meinen Code nicht mit einer externen API teilen kann?

Qwen3.8-27B ist auf einer einzelnen 24-GB-GPU die beste Wahl – mit 73,0% auf Terminal-Bench 2.1 und 61,7% auf SWE-bench Pro unter Apache-2.0-Lizenz. Wenn du 96 bis 128 GB Unified Memory hast, liefert Laguna S 2.1 1M Kontext und 8B aktive Parameter für einen schnellen lokalen Agenten. Für einen 64-GB-Laptop ist Qwen3-Coder-Next mit 3B aktiven Parametern die schnellste noch sinnvolle Option.

Worin unterscheidet sich ein Coding-LLM von einem KI-Coding-Assistenten wie Cursor oder GitHub Copilot?

Ein Coding-LLM ist das Modell, das den Code generiert, während ein Coding-Assistent das Gerüst darum ist: Es liest deine Dateien, führt Befehle aus und zeigt Diffs. Cursor, Copilot, Windsurf, Claude Code und Codex erlauben alle, das zugrunde liegende Modell zu tauschen – und dasselbe Modell kann je nach Gerüst einige Punkte anders abschneiden. Wähle das Modell nach Benchmarks und Preis, den Assistenten nach deinem Workflow.

Wie oft wechselt das beste Coding-LLM und wie bleibe ich auf dem Laufenden?

Anthropic und OpenAI allein haben zwischen dem 28. Mai und dem 24. September 2026 sieben Frontier-Modelle veröffentlicht (Opus 4.8, Fable 5, Sonnet 5, GPT-5.6, Opus 5 und 5.5 sowie Fable 5.1 plus GPT-6 Astra). Rechne also alle 4 bis 8 Wochen mit einem neuen Spitzenreiter. Bleib am Ball, indem du 3 unabhängige Boards verfolgst – Artificial Analysis, Vals AI und tbench.ai – statt nur Launch-Posts, und führe deine eigene 20-Task-Evaluation auf dem Effort-Level, das du bezahlst, immer dann erneut aus, wenn ein genutztes Modell ein Update bekommt.


Tim Lu's photo
Author
Tim Lu
LinkedIn

Ich bin Datenwissenschaftler mit Erfahrung in räumlicher Analyse, maschinellem Lernen und Datenpipelines. Ich habe mit GCP, Hadoop, Hive, Snowflake, Airflow und anderen Data Science/Engineering-Prozessen gearbeitet.

Themen
Künstliche Intelligenz
Große Sprachmodelle