Kurs
Anthropic und OpenAI haben beide diese Woche neue Releases in der Pipeline, allerdings in unterschiedlichen Stadien.
GPT-5.6 wurde vorgestellt, ist aber hinter einer limitierten Vorschau gesperrt. Während GPT-5.6 also noch nicht allgemein verfügbar ist, ist Claude Sonnet 5 heute ausgeliefert worden und in allen Claude-Plänen live — mit einem Einführungspreis für die API, der aktuell sogar unter dem Mid-Tier-Modell Terra von GPT-5.6 liegt.
Hier ist, was wir über beide Modelle wissen, wie sie sich schlagen und wo sich die Zahlen überschneiden.
Was ist Claude Sonnet 5?
Claude Sonnet 5 ist Anthropics neuestes Mid-Tier-Modell, das als bislang agentischstes Sonnet-Modell vermarktet wird. Die Idee: Es schließt einen Großteil der Lücke zu Opus-Klasse-Modellen bei Planung und Toolnutzung, bleibt dabei aber deutlich günstiger.
Anthropic sagt, Sonnet 5 sei gegenüber Sonnet 4.6 ein großer Sprung bei Reasoning, Coding und Toolnutzung. Die Performance liege nun in mehreren agentischen Evaluierungen, darunter BrowseComp (agentische Suche) und OSWorld-Verified (Computerbedienung), einigermaßen nah an Opus 4.8.
Opus 4.8 führt weiterhin bei der reinen Genauigkeit, besonders bei höheren Effort-Einstellungen. Sonnet 5 bietet Entwicklern jedoch ein stärkeres Preis-Leistungs-Verhältnis. Anthropics Mid-Tier-Modelle haben eine Historie, über ihrer Gewichtsklasse zu boxen, wenn eine neue Generation landet, bevor das nächste Opus-Update nachzieht. Es ist zwar gefühlt lange her, aber Claude Sonnet 3.5 schlug 2024 tatsächlich das ältere Claude Opus 3 in mehreren Benchmarks.
Sonnet 5 verwendet außerdem einen aktualisierten Tokenizer. Das bedeutet: Derselbe Input-Text kann nun auf mehr Tokens abgebildet werden (je nach Inhalt etwa 1,0–1,35x).
Was ist GPT-5.6?
GPT-5.6 ist kein einzelnes Modell, sondern eine Familie aus drei Modellen, organisiert nach einem neuen Namensschema: Die Zahl markiert die Generation, der Name die Fähigkeitsstufe:
-
Sol ist das Flaggschiff. Es ist die einzige Stufe mit Zugriff auf zwei neue Steuerungen: eine
max-Einstellung für den Reasoning-Aufwand und denultra mode, der Aufgaben an einen Pool von Subagenten auslagert. -
Terra ist das ausgewogene Alltagsmodell — in der Gesamtqualität grob vergleichbar mit GPT-5.5, etwa zum halben Preis.
-
Luna ist die günstige Stufe für latenzkritische Workloads.
OpenAI hebt Zugewinne in Coding, Biologie und Cybersicherheit hervor. Die große Benchmark-Story ist die Leistung auf mehreren spannenden Benchmarks, allen voran Terminal-Bench 2.1, aber auch GeneBench v1 (ein Langzeit-Genomics-Benchmark) sowie zwei Exploit-Entwicklungsbenchmarks (ExploitBench und ExploitGym).
Benchmark-Vergleich: Claude Sonnet 5 und GPT-5.6
Aus den jeweiligen Ankündigungen geht hervor, dass Sonnet 5 und GPT-5.6 keinen einzigen gemeinsamen Benchmark mit Zahlen von beiden Seiten teilen.
Anthropic hat zwar einige konkrete Zahlen zu Sonnet 5 im Launch-Post und der Systemkarte veröffentlicht, OpenAI hat für GPT-5.6 bislang aber nur einen Wert bestätigt: Terminal-Bench 2.1. Hier ist, was tatsächlich für beide Seiten offiziell ist, nebeneinandergestellt:
| Benchmark | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Sol Ultra | GPT-5.6 Terra | GPT-5.6 Luna |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | Nicht veröffentlicht | 88,8% | 91,9% | 82,5% | 84,3% |
| SWE-bench Pro | 63,2% | Nicht veröffentlicht | — | Nicht veröffentlicht | Nicht veröffentlicht |
| OSWorld-Verified (Computerbedienung) | 81,2% | Nicht veröffentlicht | — | Nicht veröffentlicht | Nicht veröffentlicht |
| Humanity's Last Exam (mit Tools) | 57,4% | Nicht veröffentlicht | — | Nicht veröffentlicht | Nicht veröffentlicht |
Terminal-Bench 2.1 ist die eine Zeile, zu der GPT-5.6 überhaupt etwas veröffentlicht hat, und Sonnet 5 hat dort keinen publizierten Wert. Vielleicht ist das strategisch, weil GPT-5.6 dort stark abgeschnitten hat.
Bei den Benchmarks, zu denen Sonnet 5 Zahlen hat — SWE-bench Pro, OSWorld-Verified, Humanity's Last Exam — hat GPT-5.6 seine Karten noch nicht offengelegt, es gibt also nichts zum direkten Vergleich.
Ehrlich gesagt existiert ein echter Sonnet-5- vs. GPT-5.6-Benchmarkvergleich noch nicht. Beide Unternehmen haben unterschiedliche Sets an Evals veröffentlicht.
Der Blick aufs große Ganze: Wo die Modelle im Feld stehen
Da Sonnet 5 und GPT-5.6 nicht direkt überlappen, lohnt sich ein Schritt zurück: Wie schlagen sich ihre veröffentlichten Werte im Vergleich zum restlichen Feld — Opus 4.8, das suspendierte Fable 5, GPT-5.5 und Gemini 3.1 Pro? Das entscheidet Sonnet 5 vs. GPT-5.6 nicht, zeigt aber, wo beide relativ zur gleichen Konkurrenz stehen:
| Benchmark | Claude Opus 4.8 | Claude Fable 5 (vor Suspendierung) | GPT-5.5 | Gemini 3.1 Pro | GPT-5.6 Sol Ultra |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 78,9% | 83,4% | 88,0% | 70,7% | 91,9% |
| SWE-bench Pro | 69,2% | 80,3% | 58,6% | — | Nicht veröffentlicht |
| Humanity's Last Exam (ohne Tools) | 49,8% | 59,0% | — | 44,4% | Nicht veröffentlicht |
Ein paar Beobachtungen: Bei Terminal-Bench 2.1 übertrifft GPT-5.6 Sol Ultra mit 91,9% jeden verzeichneten Claude-Wert, einschließlich Opus 4.8 mit 78,9%. OpenAI hat also nicht übertrieben, als sie das Ergebnis von GPT-5.6 auf Terminal-Bench 2.1 hervorgehoben haben.
Fable 5 liegt bei SWE-bench Pro und Humanity's Last Exam weiterhin vor Opus 4.8 und GPT-5.5, trotz Suspendierung. Diese Werte wurden bisher von niemandem geschlagen, auch nicht von GPT-5.6 (das keine SWE-bench- oder HLE-Werte zum Vergleich veröffentlicht hat). Sonnet 5 kommt bei SWE-bench Pro auf 63,2% (siehe Tabelle oben) und läge damit über den 58,6% von GPT-5.5, aber unter Opus 4.8 und Fable 5 — bestenfalls eine grobe Näherung, da hier unterschiedliche Modellgenerationen über zwei getrennte Tabellen hinweg verglichen werden.
Preise: Claude Sonnet 5 und GPT-5.6
| Modell | Input (pro 1 Mio. Tokens) | Output (pro 1 Mio. Tokens) |
|---|---|---|
| Claude Sonnet 5 (Einführung, bis 31. Aug. 2026) | $2.00 | $10.00 |
| Claude Sonnet 5 (Standard) | $3.00 | $15.00 |
| GPT-5.6 Sol | $5.00 | $30.00 |
| GPT-5.6 Terra | $2.50 | $15.00 |
| GPT-5.6 Luna | $1.00 | $6.00 |
Beim Listenpreis liegt Sonnet 5 mit dem Einführungspreis zwischen GPT-5.6 Terra und Luna und deutlich unter Sol. Spannend ist aber der Einführungspreis selbst: Mit $2/$10 unterbietet Sonnet 5 tatsächlich GPT-5.6 Terra mit $2,50/$15 — zumindest über den Sommer, bis eine Preiserhöhung greift.
Zur Einordnung: Die Preisgeschichte ist komplexer als eine simple Überschlagsrechnung. Anthropic weist darauf hin, dass der Einführungspreis von Sonnet 5 so kalibriert ist, dass er die höheren Tokenzahlen des neuen Tokenizers in etwa kostenneutral ausgleicht. OpenAI wiederum führt für GPT-5.6 und spätere Modelle ein planbareres Prompt-Caching ein: Cache-Writes werden mit dem 1,25-Fachen der un- gecachten Input-Rate berechnet, Cache-Reads bleiben mit 90% Rabatt.
Warum überhaupt mit einem rabattierten Einführungspreis starten statt direkt den Standardpreis anzusetzen? Der Tokenizer erklärt einen Teil. Gleichzeitig passt das Timing zu dem, was wir sehen: ein dicht besetztes, schnelllebiges Feld. In den letzten Wochen allein hat Sakana AI Fugu ausgeliefert, einen Orchestrator, der über einen Pool von Frontier-Modellen routet und beansprucht, zu einem Bruchteil der Kosten in Schlagdistanz zu Anthropics eigenen Mythos-Klasse-Systemen zu kommen. Sonnet 5 bis Ende August auf $2/$10 zu bepreisen, gibt Anthropic also ein wirklich günstiges, breit verfügbares agentisches Modell an die Hand, während GPT-5.6 noch in der Vorschau steckt. Das Modell zu sein, das man heute tatsächlich nutzen kann — zu einem niedrigen Preis — ist ein echter Wettbewerbsvorteil.
Verfügbarkeit: Claude Sonnet 5 und GPT-5.6
Claude Sonnet 5 ist ab heute überall verfügbar. Es ist das Standardmodell in Free- und Pro-Plänen, verfügbar in Max, Team und Enterprise, und live in Claude Code sowie auf der Claude Platform über die API (Modell-String claude-sonnet-5). Vielleicht ist dir Claude Sonnet 5 im Chatfenster aufgefallen, bevor du die Ankündigung gesehen hast.

GPT-5.6 ist nicht allgemein verfügbar. Während der Vorschau ist es nur über die API und Codex für eine ausgewählte Partnergruppe zugänglich. OpenAI kündigt breitere Verfügbarkeit an, nennt aber kein Datum.
Fazit
Auf dem einen überlappenden Benchmark meldet die Flaggschiff-Stufe von GPT-5.6 höhere Werte als Claude's aktuelles Flaggschiff Opus 4.8 — ein Hinweis darauf, dass OpenAI einen echten Fähigkeitsvorsprung haben könnte, sobald GPT-5.6 breit ausgerollt ist. Sonnet 5 ist jedoch nicht der direkte Gegner von Sol oder Terra in puncto Fähigkeit. Es ist ein Mid-Tier-Modell, das auf agentische Leistung pro Dollar zielt — und in dieser Hinsicht ist es verfügbar, aggressiv bepreist und funktioniert heute.
