Weiter zum Inhalt

Gemini 4 Argon vs. GPT-6 Astra: Benchmarks, Preise und welches du nutzen solltest

In Googles Tabelle liegt Gemini 4 Argon bei Recht, Finanzen und langem Kontext vorn – zum Fünftel des Preises. Astra führt weiter bei hartem Coding und ist das Modell, das du heute nutzen kannst.
Aktualisiert 2. Okt. 2026  · 8 Min. lesen

Entdecke KI

ChatGPTClaudePerplexity

Google hat Gemini 4 Argon ganz Ende September angekündigt. Argon ist Googles erstes Gemini-4-Modell und markiert die neue Spitzenklasse. Der Launch kommt vier Wochen nach OpenAIs GPT-6 Astra, OpenAIs neuem Flaggschiff seit Anfang September.

In Googles Launch-Tabelle liegt Argon in den meisten Zeilen vor Astra – und kostet nur einen Bruchteil. Es gibt jedoch einen Haken, der schwerer wiegt als jeder Benchmark: Argon ist noch nicht allgemein verfügbar. Google rollt es zuerst an geprüfte Cybersicherheitsteams aus, ohne Datum für Entwickler oder Endnutzer.

TL;DR

  • Laut Googles eigener Benchmark-Tabelle schlägt Gemini 4 Argon GPT-6 Astra in den meisten Disziplinen – besonders bei Rechts-, Finanz- und Business-Workflow-Aufgaben.
  • GPT-6 Astra behält die Stärke bei den härtesten Software-Engineering-, wissenschaftlichen Terminal-Aufgaben und der Computerbedienung.
  • Argons Einführungspreis liegt bei einem Fünftel von Astras Preis, und selbst der Standardpreis ist noch weniger als die Hälfte.
  • Aber du kannst Argon noch nicht nutzen: Der Zugang ist auf Googles vertrauenswürdige Cyberverteidiger beschränkt; zahlende API-Kunden und AI-Ultra-Abonnenten sind als Nächstes dran.
  • Wähle also GPT-6 Astra, wenn du diese Woche ein Spitzenmodell produktiv einsetzen musst.

Was ist Gemini 4 Argon?

Gemini 4 Argon ist das neue Spitzenmodell von Google DeepMind, vorgestellt Ende September. Es ist das erste Modell der Gemini-4-Generation.

Google hat Argon dafür entwickelt, tiefes Reasoning über lange, mehrstufige Aufgaben hinweg durchzuhalten. Dafür wurde das Ausgabelimit auf 1 Mio. Token erhöht, damit das Modell ein schweres Problem in einem Durchlauf durchdenken kann.

Was ist GPT-6 Astra?

GPT-6 Astra ist OpenAIs Flaggschiffmodell, veröffentlicht Anfang September. Es steht an der Spitze der GPT-6-Familie über GPT-6.1 Sol und GPT-6 Luna.

OpenAI positioniert es als sein leistungsfähigstes Modell für die anspruchsvollsten Arbeiten – von komplexem Reasoning und Coding bis hin zu Computerbedienung und Recherche.

Gemini 4 Argon vs. GPT-6 Astra: Direktvergleich

Von 19 Benchmarks in Googles Launch-Tabelle erzielt Argon in 14 höhere Werte als Astra, Astra gewinnt 4, und einmal gibt es Gleichstand. Alle Werte stammen aus Googles eigener Tabelle, lies sie also als Googles Argument für Argon und nicht als unabhängiges Ranking. Ich habe die Tabelle etwas eingekürzt und die aus meiner Sicht bekanntesten, spannendsten und relevantesten Tests für diesen Release hervorgehoben.

Feature Gemini 4 Argon GPT-6 Astra
Vals Index 68.9% 63.1%
AutomationBench 51.3% 41.4%
Vals Finance Agent v2 65.4% 53.5%
Harvey's Legal Agent Benchmark 19.6% 5.4%
DeepSWE v1.1 77.9% 74.1%
FrontierSWE v2 55.0% 65.5%
Terminal-bench 4.0 57.4% 58.2%
Terminal-Bench Science 0.1 57.6% 68.1%
OSWorld-2.0 (Offline-Subset) 69.2% 72.6%
Maximale Ausgabetokens 1 Mio. 128K
Verfügbarkeit Nur vertrauenswürdige Cyberverteidiger Allgemein verfügbar

Die folgenden Dimensionen tragen den Rest der Tabelle.

Wissensarbeit: Recht, Finanzen und Business-Workflows

Hier ist Argons Vorsprung am größten – und hier setzt Google den Fokus seines Launches.

Im Harvey's Legal Agent Benchmark, der juristische Recherche und Schriftsätze prüft, erzielt Argon 19,6% gegenüber Astras 5,4%. Das ist für beide niedrig, aber mehr als dreimal so viele erledigte Aufgaben sind die größte relative Lücke der ganzen Tabelle.

Das Muster hält sich über Finanzrecherche und Business-Automatisierung hinweg, wo Argon um rund 10 bis 12 Punkte vorne liegt. Wenn sich die Angaben bestätigen, sobald es nutzbar ist, ist Argon das stärkere Modell für dokumentenlastige Rechts- und Finanzarbeit.

Coding und Software Engineering

Beim Coding ist das Bild gemischt – es hängt davon ab, welche Art von Engineering du meinst.

Argon liegt bei DeepSWE v1.1 vorn, das langfristige Aufgaben in realen Codebasen testet, und es hat bei Vibe Code Bench, der funktionsfähige Apps bewertet, eine Nasenlänge Vorsprung vor Astra.

Astra gewinnt klar bei FrontierSWE v2, und bei Terminal-bench 4.0 liegen beide innerhalb eines Punktes.

Googles eigene Beispiele zielen auf große Migrationen, inklusive C und C++ nach Rust über Google-Codebasen hinweg.

Beim härtesten Engineering-Benchmark in der Tabelle liegt allerdings weiterhin Astra vorn.

Langer Kontext und visuelles Verständnis

Je länger die Eingaben, desto stärker setzt sich Argon ab.

Bei GraphWalks, das Reasoning über Graphstrukturen in langem Kontext testet, liegen beide bis 128K Token eng beieinander, aber von 256K bis 1 Mio. Token erzielt Argon höhere Werte.

Argon führt auch bei LVBench für langes Videoverständnis, während das Auslesen von Diagrammen in Chartography nahezu Gleichstand ist.

Für alle, die ganze Verträge, Codebasen oder Aufzeichnungen ins Modell geben, ist das nach der Verfügbarkeit der praxisrelevanteste Unterschied.

Wissenschaft, Mathe und Computerbedienung

Astra behauptet sich bei wissenschaftlicher Terminal-Arbeit und führt Terminal-Bench Science 0.1 mit mehr als 10 Punkten. Argon liegt bei LABBench 2, einem Biologie-Research-Benchmark, sowie bei RiemannBench in Mathe vorn. Bei der Computerbedienung führt Astra OSWorld-2.0, während Argon Agent's Last Exam gewinnt – diese Kategorie gehört also keinem allein.

Verfügbarkeit und Sicherheit

Astra ist das Modell, das du heute ausrollen kannst. Argon ist derzeit auf Googles Fairwind-Programm für vertrauenswürdige Cyberverteidiger sowie interne Teams beschränkt; Google sagt, zahlende API-Kunden und Google AI Ultra-Abonnenten sind als Nächstes dran – ohne Datum.

Argons Cyber-Story hat zwei Seiten. Google gibt es geprüften Verteidigern ohne Cyber-Schutzgeländer frei, und es liegt mit Astra auf Platz eins bei CWE-bench v1, das das Beheben realer Sicherheitslücken testet.

Für alle anderen gilt: Argon verweigert laut Google schädliche Cyber- und CBRN-Anfragen und läuft mit Monitoren, die die Ausführung stoppen können, wenn das Modell die Nutzerintention überschreitet.

Preise: Was du tatsächlich zahlst

Argon kostet zum Start ein Fünftel von Astra und im Standard weniger als die Hälfte, aber Google hat nicht gesagt, wie lange der Einführungspreis gilt.

Tokenpreise im Vergleich

Rate Gemini 4 Argon (Einführung) Gemini 4 Argon (Standard) GPT-6 Astra
Eingabe, pro 1 Mio. Token $2.00 $4.00 $10.00
Ausgabe, pro 1 Mio. Token $10.00 $20.00 $50.00
Gecachter Eingabelesezugriff, pro 1 Mio. Token $0.10 (95% Rabatt auf Eingabe) Nicht veröffentlicht $1.00
Aufpreis für langen Kontext Nicht veröffentlicht Nicht veröffentlicht Über 272K Eingabetoken: 2x Eingabe und Cache, 1,5x Ausgabe für die gesamte Anfrage

Der Faktor ist bei Eingabe und Ausgabe gleich: 0,2x Astra zum Einführungspreis und 0,4x zum Standardpreis. Beide Anbieter rechnen Reasoning als Ausgabe ab – das wiegt bei Argon stärker, da Google das Ausgabelimit gezielt auf 1 Mio. Token angehoben hat, damit es länger „denken“ kann.

Selbst zu Standardraten liegt Argon deutlich unter der Hälfte der Astra-Kosten. Offen bleibt die Frage langer Prompts, wo bisher nur Astra Preise veröffentlicht hat.

Was eine echte Last kostet

Workload Gemini 4 Argon (Einführung) Gemini 4 Argon (Standard) GPT-6 Astra
Ausgewogener Assistent: 1 Mio. in / 250K out $4.50 $9.00 $22.50
Retrieval, jede Anfrage unter 272K: 10 Mio. in / 1 Mio. out $30 $60 $150
Retrieval, jede Anfrage über 272K: 10 Mio. in / 1 Mio. out Nicht veröffentlicht Nicht veröffentlicht $275

Jede Summe ist (Volumen ÷ 1 Mio.) × Rate, addiert über Eingabe und Ausgabe, zu Standardraten.

  • Ausgewogener Assistent: Argon spart $18 pro Monat (80%) zum Einführungspreis und $13,50 (60%) zum Standardpreis.
  • Retrieval unter 272K: dieselben 80% bzw. 60% Ersparnis – in einer Größenordnung, in der es ins Gewicht fällt: $120 bzw. $90 pro Monat.
  • Retrieval über 272K: Astras Aufpreis treibt die Kosten auf $275. Google hat nicht gesagt, ob es bei Argon eine Langkontext-Stufe gibt – diese Zeile solltest du prüfen, sobald Argons Preisseite live ist.

Die Anbieter nutzen unterschiedliche Tokenizer, und keiner hat Tokenzahlen für eine gemeinsame Workload veröffentlicht. Sieh diese Summen daher als Tarifvergleich, nicht als Rechnung.

Wann du Gemini 4 Argon vs. GPT-6 Astra wählen solltest

Aktuell entscheidet die Verfügbarkeit, nicht die Benchmarks: Astra ist allgemein verfügbar, Argon nur für geprüfte Cyberverteidiger. Sobald Argon öffnet, macht sein Preisfaktor von 0,2x bis 0,4x es zum Standardkandidaten für Wissensarbeit.

Wähle Gemini 4 Argon, wenn ...

  • Deine Arbeit juristische Recherche, Finanzanalyse oder Business-Automatisierung ist. Das sind seine größten Vorsprünge in Googles Tabelle – und der Rechtsbereich ist die größte Lücke überhaupt.
  • Du sehr lange Eingaben fütterst. Es hält Reasoning über 256K bis 1 Mio. Token deutlich besser durch und liegt bei langen Videos vorn.
  • Preis bei Spitzenqualität zählt. Selbst zu Standardraten kostet es pro Token deutlich weniger als die Hälfte von Astra.

Wähle GPT-6 Astra, wenn ...

  • Du es heute brauchst. Astra ist in ChatGPT, der OpenAI API, Azure, Bedrock, GitHub Copilot und OpenRouter verfügbar, während Argon noch keine öffentliche API hat.
  • Deine härteste Arbeit Software Engineering oder wissenschaftliches Computing ist. Es liegt bei FrontierSWE v2 und Terminal-Bench Science jeweils mit mehr als 10 Punkten vor Argon.
  • Du Computer-Use-Agenten in Desktop-Apps betreibst. Es führt OSWorld-2.0, auch wenn Argon Agent's Last Exam gewinnt – teste an deinen eigenen Aufgaben.

Fazit

Wenn du diese Woche ein Spitzenmodell brauchst, ist GPT-6 Astra die Option. Wenn deine Arbeit Recht, Finanzen oder Langdokument-Analyse ist und du warten kannst, plane, Gemini 4 Argon am Tag der Öffnung zu testen. Wir sagen dir genau dann Bescheid – melde dich dafür zu The Median, unserem wöchentlichen Newsletter, an:

Dieser Vergleich, Argon gegen Astra, ist spannend. Google hat Argon mit einer Benchmark-Tabelle gestartet, die zeigt, dass es OpenAI in den meisten Zeilen schlägt – zu einem Preis unterhalb von Astra. Gleichzeitig gibt es für die meisten noch keine Möglichkeit, es zu nutzen.

Google setzt darauf, dass der Vorsprung hält, bis der Zugang kommt.

FAQs

Ist Gemini 4 Argon besser als GPT-6 Astra?

In Googles eigener Benchmark-Tabelle erzielt Gemini 4 Argon in 14 von 19 Benchmarks höhere Werte als GPT-6 Astra – mit den größten Vorsprüngen in Recht, Finanzen, Business-Automatisierung und langem Kontext. GPT-6 Astra führt bei FrontierSWE v2, Terminal-Bench Science 0.1, OSWorld-2.0 und Terminal-bench 4.0. Alle Werte stammen von Google, unabhängige Tests stehen also noch aus.

Kann ich Gemini 4 Argon schon nutzen?

Nicht, es sei denn, du bist im Fairwind-Programm von Google für vertrauenswürdige Cyberverteidiger. Google sagt, zahlende API-Kunden und Google AI Ultra-Abonnenten bekommen als Nächstes Zugang, hat aber weder ein Datum genannt noch eine API-Model-ID veröffentlicht.

Was kostet Gemini 4 Argon im Vergleich zu GPT-6 Astra?

Gemini 4 Argon startet mit $2 pro eine Million Eingabetoken und $10 pro eine Million Ausgabetoken und steigt danach auf $4 bzw. $20. GPT-6 Astra kostet $10 bzw. $50, also liegt Argon zum Einführungspreis bei einem Fünftel und im Standard bei 40% von Astra. Wie lange die Einführungsphase dauert, hat Google nicht gesagt.

Welches ist besser fürs Coding, Gemini 4 Argon oder GPT-6 Astra?

Es ist gemischt. Gemini 4 Argon führt DeepSWE v1.1 und Vibe Code Bench in Googles Tabelle, während GPT-6 Astra bei FrontierSWE v2 rund 10 Punkte vorn liegt und Argon bei Terminal-bench 4.0 knapp übertrifft. Für die härtesten Engineering-Aufgaben hat Astra derzeit das stärkere veröffentlichte Ergebnis.

Wie hoch ist das Ausgabelimit von Gemini 4 Argon?

Google hat das Ausgabelimit von Gemini 4 Argon auf 1 Mio. Token erhöht – zuvor waren es 64K bei früheren Gemini-Modellen –, damit es lange Probleme in einem Durchlauf durchdenken kann. Bei GPT-6 Astra liegt das Maximum bei 128K Token.

Themen