Google kondigde eind september Gemini 4 Argon aan. Argon is Google’s eerste Gemini 4-model en de nieuwe frontier. Het komt vier weken na OpenAI’s GPT-6 Astra, OpenAI’s nieuwe vlaggenschip sinds begin september.
In Google’s lanceringsoverzicht staat Argon op de meeste onderdelen boven Astra, voor een fractie van Astra’s prijs. Er is wel een belangrijke kanttekening die zwaarder weegt dan welke benchmark dan ook: Argon is nog niet algemeen beschikbaar. Google rolt het eerst uit naar gescreende securityteams, zonder datum voor ontwikkelaars of consumenten.
TL;DR
- In Google’s eigen benchmarktabel verslaat Gemini 4 Argon GPT-6 Astra op de meeste onderdelen, met name bij juridische, financiële en zakelijke workflowtaken.
- GPT-6 Astra behoudt de voorsprong bij de moeilijkste software-engineering, wetenschappelijk terminalwerk en computergebruik.
- Argons introductieprijs is een vijfde van die van Astra en de standaardprijs is nog steeds minder dan de helft.
- Maar je kunt Argon nog niet gebruiken: toegang is beperkt tot Google’s vertrouwde cyberverdedigers; betaalde API-klanten en AI Ultra-abonnees zijn daarna aan de beurt.
- Kies dus GPT-6 Astra als je vandaag een frontiermodel in productie nodig hebt.
Wat is Gemini 4 Argon?
Gemini 4 Argon is het nieuwe frontiermodel van Google DeepMind, aangekondigd eind september. Het is het eerste model in de Gemini 4-generatie.
Google heeft Argon gebouwd om diepgaand te redeneren over lang, meerstaps werk. Dat wordt ondersteund door een outputlimiet verhoogd naar 1M tokens, zodat het model in één keer een lastig probleem kan doorgronden.
Wat is GPT-6 Astra?
GPT-6 Astra is het vlaggenschipmodel van OpenAI, uitgebracht begin september. Het staat bovenaan de GPT-6-familie, boven GPT-6.1 Sol en GPT-6 Luna.
OpenAI positioneert het als hun meest capabele model voor het zwaarste werk, van complexe redenering en coderen tot computergebruik en onderzoek.
Gemini 4 Argon vs GPT-6 Astra: directe vergelijking
Van de 19 benchmarks in Google’s lanceringstabel scoort Argon hoger dan Astra op 14, wint Astra er 4 en is er één gelijkspel. Ze komen allemaal uit Google’s eigen tabel, dus lees ze als Google’s case voor Argon en niet als een onafhankelijke ranglijst. Ik heb die tabel iets ingekort om de bekendste, interessantste en meest relevante benchmarktests voor deze release te laten zien.
| Feature | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|
| Vals Index | 68.9% | 63.1% |
| AutomationBench | 51.3% | 41.4% |
| Vals Finance Agent v2 | 65.4% | 53.5% |
| Harvey's Legal Agent Benchmark | 19.6% | 5.4% |
| DeepSWE v1.1 | 77.9% | 74.1% |
| FrontierSWE v2 | 55.0% | 65.5% |
| Terminal-bench 4.0 | 57.4% | 58.2% |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% |
| OSWorld-2.0 (offline subset) | 69.2% | 72.6% |
| Max output tokens | 1M | 128K |
| Availability | Alleen vertrouwde cyberverdedigers | Algemeen beschikbaar |
De dimensies hieronder dragen de rest van de tabel.
Kenniswerk: juridisch, finance en zakelijke workflows
Hier is Argons voorsprong het grootst en hierop richtte Google de lancering.
Op Harvey’s Legal Agent Benchmark, die juridisch onderzoek en schrijven test, scoort Argon 19,6% tegenover Astra’s 5,4%. Dat is voor beide laag, maar meer dan drie keer zoveel voltooide taken is het grootste relatieve verschil in de hele tabel.
Dat patroon houdt stand bij financieel onderzoek en zakelijke automatisering, waar Argon zo’n 10 tot 12 punten voorligt. Als de claims standhouden zodra mensen het kunnen gebruiken, is Argon het sterkere model voor documentintensief juridisch en financieel werk.
Coden en software-engineering
Coden is verdeeld, en het hangt af van welk type engineering je bedoelt.
Argon leidt op DeepSWE v1.1, dat langetermijntaken in echte codebases test, en het zit nipt voor op Astra bij Vibe Code Bench, dat het bouwen van werkende apps beoordeelt.

Astra wint duidelijk op FrontierSWE v2, en de twee liggen binnen een punt op Terminal-bench 4.0.
Google’s eigen voorbeelden neigen naar grote migraties, waaronder C en C++ naar Rust in Google-codebases.
Voor de zwaarste engineeringbenchmark in de tabel ligt Astra echter nog steeds voor.
Lange context en visueel begrip
Argon loopt uit naarmate input langer wordt.
Op GraphWalks, dat redeneren over graafstructuren verspreid over een lange context test, liggen de twee dicht bij elkaar tot 128K tokens, maar van 256K tot 1M tokens scoort Argon hoger.
Argon leidt ook op LVBench voor begrip van lange video, terwijl grafieklezen op Chartography vrijwel gelijk is.
Voor iedereen die hele contracten, codebases of opnames in een model stopt, is dit het meest praktische verschil na beschikbaarheid.
Wetenschap, wiskunde en computergebruik
Astra houdt stand bij wetenschappelijk terminalwerk en leidt Terminal-Bench Science 0.1 met meer dan 10 punten. Argon leidt LABBench 2, een biologiebenchmark, en RiemannBench in wiskunde. Bij computergebruik leidt Astra OSWorld-2.0, terwijl Argon Agent’s Last Exam wint, dus geen van beide domineert deze categorie.
Beschikbaarheid en veiligheid
Astra is degene die je vandaag kunt inzetten. Argon is momenteel beperkt tot Google’s Fairwind-programma voor vertrouwde cyberverdedigers, plus Google’s interne teams, en Google zegt dat betaalde API-klanten en Google AI Ultra-abonnees daarna volgen, zonder datum te geven.
Argons cyberverhaal heeft ook twee kanten. Google levert het aan gescreende verdedigers zonder cyber-guardrails, en het deelt de eerste plaats met Astra op CWE-bench v1, die het oplossen van echte beveiligingslekken test.
Voor alle anderen geldt dat Argon schadelijke cyber- en CBRN-verzoeken zal weigeren en dat er monitors draaien die de uitvoering kunnen stoppen wanneer het model de intentie van de gebruiker overschrijdt.
Prijzen: wat je daadwerkelijk betaalt
Argon kost een vijfde van Astra tegen de introductieprijs en minder dan de helft bij de standaardprijs, maar Google heeft niet gezegd hoelang de introductieprijs duurt.
Token tarieven naast elkaar
| Tarief | Gemini 4 Argon (introductie) | Gemini 4 Argon (standaard) | GPT-6 Astra |
|---|---|---|---|
| Input, per 1M tokens | $2.00 | $4.00 | $10.00 |
| Output, per 1M tokens | $10.00 | $20.00 | $50.00 |
| Cached input read, per 1M tokens | $0.10 (95% korting op input) | Niet gepubliceerd | $1.00 |
| Toeslag lange context | Niet gepubliceerd | Niet gepubliceerd | Boven 272K inputtokens: 2x input en cache, 1,5x output voor de hele request |
De verhouding is uniform op input en output: 0,2x Astra bij introductietarieven en 0,4x bij standaardtarieven. Beide aanbieders rekenen redenering als output, wat zwaarder weegt voor Argon, omdat Google de outputlimiet naar 1M tokens heeft verhoogd zodat het langer kan “denken”.
Zelfs tegen standaardtarieven komt Argon ruim onder de helft van Astra’s kosten uit. De open vraag zijn lange prompts, waar tot nu toe alleen Astra prijzen voor heeft gepubliceerd.
Wat een echte workload kost
| Workload | Gemini 4 Argon (intro) | Gemini 4 Argon (standaard) | GPT-6 Astra |
|---|---|---|---|
| Gebalanceerde assistent: 1M in / 250K uit | $4.50 | $9.00 | $22.50 |
| Retrieval, elke request onder 272K: 10M in / 1M uit | $30 | $60 | $150 |
| Retrieval, elke request boven 272K: 10M in / 1M uit | Niet gepubliceerd | Niet gepubliceerd | $275 |
Elk totaal is (volume ÷ 1M) × tarief, opgeteld over input en output, tegen standaardtarieven.
- Gebalanceerde assistent: Argon bespaart $18 per maand (80%) tegen introductietarieven en $13,50 (60%) tegen standaardtarieven.
- Retrieval onder 272K: dezelfde 80% en 60% besparing, op een schaal waar het begint te tellen: $120 of $90 per maand.
- Retrieval boven 272K: Astra’s toeslag duwt de kosten naar $275. Google heeft niet aangegeven of Argon een lange-contexttier heeft, dus dit is de rij om te checken zodra Argons prijspagina live gaat.
De twee aanbieders gebruiken verschillende tokenizers en geen van beide heeft tokenaantallen gepubliceerd voor een gedeelde workload, dus beschouw deze totalen als een tariefvergelijking in plaats van een rekening.
Wanneer kies je Gemini 4 Argon vs GPT-6 Astra
Voor nu is de splitsing beschikbaarheid, niet benchmarks: Astra is algemeen beschikbaar en Argon is beperkt tot gescreende cyberverdedigers. Zodra Argon opengaat, zal de prijsverhouding van 0,2x tot 0,4x het de standaard maken om te testen voor kenniswerk.
Kies Gemini 4 Argon als...
- Je werk juridisch onderzoek, financiële analyse of zakelijke automatisering is. Dat zijn de grootste voorsprongen in Google’s tabel, en het juridische gat is het grootst van allemaal.
- Je het zeer lange inputs voert. Het houdt veel beter stand dan Astra bij redeneren over 256K tot 1M tokens en leidt op lange video.
- Prijs telt bij frontierkwaliteit. Zelfs tegen standaardtarieven kost het ruim minder dan de helft van Astra per token.
Kies GPT-6 Astra als...
- Je het vandaag nodig hebt. Astra zit in ChatGPT, de OpenAI API, Azure, Bedrock, GitHub Copilot en OpenRouter, terwijl Argon nog geen publieke API heeft.
- Je zwaarste werk software-engineering of wetenschappelijk rekenen is. Het leidt Argon op FrontierSWE v2 en Terminal-Bench Science elk met meer dan 10 punten.
- Je agenten voor computergebruik op desktop-apps draait. Het leidt OSWorld-2.0, al wint Argon Agent’s Last Exam, dus test op je eigen taken.
Slotgedachten
Heb je deze week een frontiermodel nodig, dan is GPT-6 Astra de optie. Als je werk juridisch, financieel of lang-documentanalyse is en je kunt wachten, plan dan om Gemini 4 Argon te testen op de dag dat het opengaat. We houden je precies op de hoogte wanneer dat is, als je je aanmeldt voor The Median, onze wekelijkse nieuwsbrief:
Deze vergelijking, Argon versus Astra, is een interessante. Google heeft Argon gelanceerd, samen met een benchmarktabel waaruit blijkt dat het OpenAI op de meeste onderdelen verslaat, met een prijs die Astra onderbiedt. Maar er is ook geen manier voor de meeste mensen om het te gebruiken.
Google gokt erop dat de voorsprong blijft tot de toegang er is.
Veelgestelde vragen
Is Gemini 4 Argon beter dan GPT-6 Astra?
In Google’s eigen benchmarktabel scoort Gemini 4 Argon hoger dan GPT-6 Astra op 14 van de 19 benchmarks, met de grootste voorsprongen bij juridisch, finance, zakelijke automatisering en lang-contextwerk. GPT-6 Astra leidt op FrontierSWE v2, Terminal-Bench Science 0.1, OSWorld-2.0 en Terminal-bench 4.0. Alle scores komen van Google, dus onafhankelijke tests zijn nog nodig.
Kan ik Gemini 4 Argon al gebruiken?
Niet, tenzij je in Google’s Fairwind-programma voor vertrouwde cyberverdedigers zit. Google zegt dat betaalde API-klanten en Google AI Ultra-abonnees daarna toegang krijgen, maar het heeft geen datum gegeven of een API-model-ID gepubliceerd.
Hoeveel kost Gemini 4 Argon vergeleken met GPT-6 Astra?
Gemini 4 Argon lanceert met een introductieprijs van $2 per miljoen inputtokens en $10 per miljoen outputtokens, oplopend naar $4 en $20 daarna. GPT-6 Astra kost $10 en $50, dus Argon is een vijfde van Astra’s prijs bij introductietarieven en 40% bij standaardtarieven. Google heeft niet gezegd hoelang de introductieperiode duurt.
Welke is beter voor coden, Gemini 4 Argon of GPT-6 Astra?
Het is verdeeld. Gemini 4 Argon leidt DeepSWE v1.1 en Vibe Code Bench in Google’s tabel, terwijl GPT-6 Astra ongeveer 10 punten voorligt op FrontierSWE v2 en nipt voorligt op Terminal-bench 4.0. Voor de zwaarste engineeringtaken heeft Astra momenteel het sterkere gepubliceerde resultaat.
Wat is de outputlimiet van Gemini 4 Argon?
Google heeft de outputlimiet van Gemini 4 Argon verhoogd naar 1M tokens, van 64K op eerdere Gemini-modellen, zodat het in één keer door lange problemen kan redeneren. De maximale output van GPT-6 Astra is 128K tokens.