Ga naar hoofdinhoud

Grok 4.6: Functies, benchmarks, prijzen en vergelijkingen

Het nieuwe model van SpaceXAI, Grok 4.6, evenaart de Intelligence Index-score van GPT-5.6 Sol tegen een lagere gemeten prijs. Bekijk benchmarks, agent-functies, prijzen en hoe het zich verhoudt tot Grok 4.5 en Claude Sonnet 5.
Bijgewerkt 21 aug 2026  · 13 min lezen

Verkennen met AI

ChatGPTClaudePerplexity

De meeste lezers kennen het lab achter Grok nog als xAI. SpaceXAI bracht op 12 augustus 2026 Grok 4.6 uit, iets meer dan een maand na Grok 4.5, met de focus op coderen, visueel webwerk en agent-taken die langer doorlopen.

De lanceringsdata ondersteunen geen simpele ranglijst. Grok leidt op enkele door SpaceXAI gekozen tests, terwijl GPT-5.6 Sol en Claude Fable 5 andere aanvoeren. Artificial Analysis zet Grok naast Sol tegen een lagere gemengde prijs, maar de upgrade begint ook later met antwoorden en kost meer per gemeten taak dan Grok 4.5.

Dit artikel volgt die afruil via de specificaties, prijzen, toegang en directe vergelijkingen met Sol en Claude. Onze Grok 4.5-bespreking richtte zich op laag tokenverbruik. Hier is de vraag of een hogere score de daadwerkelijke rekening verandert zodra gecachte input, redeneertokens en extra output worden meegerekend.

TL;DR: Grok 4.6

Mijn korte samenvatting: de winst van vijf punten is op zichzelf minder doorslaggevend dan de landingspagina doet vermoeden. Prijsdynamiek en taaktype bepalen of dit de modelkeuze verandert.

  • Bij high effort scoort Grok 4.6 61 op de Artificial Analysis Intelligence Index, numeriek gelijk aan Sol op max en twee punten achter Opus 5 op max.

  • Basistarieven voor input en output blijven $2 en $6 per miljoen tokens, maar gecachte input, de vertraging tot de eerste token en de gemeten taakprijs stijgen allemaal ten opzichte van Grok 4.5.

  • In AA-Briefcase gebruikte Grok minder beurten en inputtokens dan Opus 5; Sol leidt de terminaltests, terwijl Sonnet 5 twee keer zoveel context biedt zonder toeslag voor lange prompts.

De vergelijkingen hieronder houden de claims van de provider gescheiden van de resultaten van Artificial Analysis. Dat is belangrijk, want een model kan van positie veranderen wanneer het effort-niveau of de testopzet wijzigt.

Wat is Grok 4.6?

Grok 4.6 is SpaceXAI's eigen redeneermodel. De API en Cursor bieden niet dezelfde contextlimiet, en het hogere tarief voor lange context start ruim vóór de API-limiet. De tabel zet die beperkingen naast inputtypen, tools en de knowledge cutoff.

Specificatie

Grok 4.6

Contextvenster

500.000 tokens (API); 256.000 tokens in Cursor

Input / output

Tekst en afbeeldingen in; tekst uit

Reasoning effort

Low, medium, high (standaard), xhigh

Knowledge cutoff

1 februari 2026

Tools

Functieaanroepen, webzoekopdracht, X-zoekopdracht, code-uitvoering, collectiezoekopdracht (RAG), remote MCP

Standaard prijzen

$2 / miljoen inputtokens, $0,50 gecacht, $6 / miljoen output

Prijzen voor lange context

$4 / $1 / $12 zodra een prompt 200.000 tokens bereikt, toegepast op de hele aanvraag

SpaceXAI publiceert nog steeds geen parameter-aantal voor beide modellen. Het getal van 1,5 biljoen in sommige berichten kwam niet van SpaceXAI, dus dat is geen bevestigde specificatie.

Wat is nieuw in Grok 4.6?

SpaceXAI zegt dat dit geen nieuw model is dat vanaf nul is getraind. In plaats daarvan kreeg Grok 4.5 extra training, met extra aandacht voor AI-agent taken. De gemelde veranderingen vallen onder langere agent-runs, visuele builds en post-training.

Langere agent-taken

Volgens SpaceXAI blijft Grok 4.6 op koers tijdens lange taken met meerdere stappen, zoals onderzoek, werken over een codebase en het bouwen van een applicatie. Het model zou zijn werk vaker controleren in plaats van alles in één keer te doen.

Dat past bij een bredere verandering in modeltesten. Een goed eerste antwoord telt minder als het model eerdere beslissingen vergeet na meerdere tool-calls. Interne tests van GitHub vonden ook dat Grok 4.6 bleef redeneren en tools gebruiken bij langere taken.

De API heeft functies die bij die claim horen. Grok 4.6 kan redeneringssamenvattingen streamen, iets wat Grok 4.5 niet aanbiedt, en xAI raadt contextcompactie aan met een persistente prompt_cache_key voor lange agent-lussen. Compactie vat eerdere geschiedenis samen tot één item, maar gebruikt nog steeds tokens, en het verzoek moet in het contextvenster passen voordat compactie draait.

Visuele en interactieve webontwikkeling

SpaceXAI en Cursor melden allebei betere eerste pogingen bij visuele projecten. In één externe test bouwde Grok 4.6 een oude iPod Mini-productpagina om tot een 3D-site met een werkend kleurwiel en scrollanimatie. De demo werkte, maar één test bewijst de bredere claim niet.

Hoe Grok 4.6 is na-getraind

Als je alleen om benchmarks en prijzen geeft, sla deze subsectie dan over. Hij legt het verhaal van SpaceXAI uit over waar de winst vandaan kwam.

SpaceXAI draaide meer training dan voor Grok 4.5. Het gebruikte door AI gemaakte redeneer- en engineeringvoorbeelden, verwijderde zwakke voorbeelden met modelgebaseerde checks en gebruikte vervolgens reinforcement learning voor coderen, kantoortaken, webontwikkeling, kernel-tuning en computerontwerp. SpaceXAI zegt ook dat Grok 4.5 nieuwe trainingsvoorbeelden creëerde over verschillende redeneersettings en onderwerpen. Het bedrijf schrijft de winst toe aan meer training en striktere dataselectie, niet aan een nieuwe architectuur.

Externe teams kunnen die details niet verifiëren, en SpaceXAI heeft niet genoeg informatie gedeeld om de training te herhalen. Dit is het eigen verslag van het bedrijf van wat er veranderde, geen resultaat dat door iemand anders is gecontroleerd.

Grok 4.6-benchmarks: officiële en onafhankelijke resultaten

De lanceringstabel van SpaceXAI toont waar scores zijn gestegen, maar de concurrentiescores zijn "het beste van zelfgerapporteerde of openbaar beschikbare resultaten". Eén team heeft niet elk model onder dezelfde setup gedraaid. Reasoning effort is hieronder opgenomen omdat het de score beïnvloedt.

Benchmark

Grok 4.6 (high)

Grok 4.5 (high)

GPT-5.6 Sol (max)

Claude Fable 5 (max)

AA Intelligence Index

61

56

61

62

GDPVal-AA v2 (Elo)

1.753

1.526

1.728

1.741

DeepSWE 1.1

65,9%

54,0%

73,0%

70,0%

Terminal-Bench 3.0

26,0%

15,7%

34,6%

34,1%

APEX-Agents

57,5%

47,1%

56,7%

59,2%

CursorBench v3.2

69,9%

66,7%

67,2%

70,5%

Grok 4.6 verbetert ten opzichte van Grok 4.5 door de hele tabel heen. Sol’s grootste voorsprongen zitten op DeepSWE en Terminal-Bench, terwijl Fable 3 rijen aanvoert. Zelfs SpaceXAI’s eigen tabel wijst niet naar één winnaar.

Onafhankelijke benchmarkresultaten

Artificial Analysis draaide zijn eigen Intelligence Index over zes modellen in deze vergelijking. De resultaten liggen dicht bij de cijfers van SpaceXAI, maar zijn niet identiek.

Scatterplot van frontier-intelligentie versus gemengde prijs met Grok 4.6, Grok 4.5, GPT-5.6 Sol, Claude Opus 5, Claude Sonnet 5 en Gemini 3.7 Flash

Grok 4.6 tegenover vijf frontier-rivalen. Afbeelding door de auteur.

De grafiek plaatst Grok gelijk aan Sol qua intelligentie, maar veel lager qua gemengde prijs. Artificial Analysis berekent die prijs met een 7:2:1-mix van gecachte input, ongecachete input en output. Kosten per voltooide indextaak tonen dezelfde kloof: $0,84 voor Grok, $1,23 voor Sol en $2,34 voor Opus 5.

De tijd tot de eerste antwoords-token steeg van 14,62 seconden op Grok 4.5 naar 40,44 seconden, terwijl de kosten per taak toenamen van $0,36 naar $0,84. Grok 4.6 gebruikte ongeveer 20% meer outputtokens op dezelfde tests, dus een ongewijzigde lijstprijs betekent niet een ongewijzigde taakprijs. Kosten per voltooide taak geven een beter beeld dan alleen API-prijskaarten, omdat ze een deel van de extra redenering meenemen die nodig is om het werk af te ronden.

Vergeleken met GPT-5.6 Sol en Claude Sonnet 5 verstuurt Grok 4.6 zijn eerste antwoords-token eerder. Sol op max effort duurt 213,52 seconden, en Sonnet 5 184,48, tegenover Grok’s 40,44. Grok lijkt alleen traag naast modellen met lagere latentie zoals Gemini 3.7 Flash.

Hoe betrouwbaar zijn deze benchmarkvergelijkingen?

Ze zijn nuttig om relatieve sterktes te vinden, maar geen betrouwbare cross-modelranglijst. Reasoning effort verandert score en reactietijd: GPT-5.6 Sol scoorde 57 op high effort en 61 op max. Benchmarknamen kunnen ook naar verschillende versies verwijzen, dus xAI’s Terminal-Bench 3.0 en Artificial Analysis’ Terminal-Bench 2.1 zijn niet ver gelijkwaardig.

Wat is er veranderd ten opzichte van Grok 4.5?

Voor Grok 4.5-gebruikers is de beslissing niet of 4.6 in het abstract "beter" is. Het is of de hogere score opweegt tegen een ander latency- en tokenverbruiksprofiel. De tabel zet die veranderingen op dezelfde basislijn.

Maatstaf

Grok 4.5 (high)

Grok 4.6 (high)

AA Intelligence Index

56

61

Kosten per indextaak

$0,36

$0,84

Tijd tot eerste antwoords-token

14,62s

40,44s

Prijs gecachte input

$0,30 / M

$0,50 / M 

Outputtokens gebruikt om de index te draaien

60M

72M

Basisprijs input / output

$2 / $6

$2 / $6 (ongewijzigd)

Echter, "dezelfde prijs" beschrijft alleen het basistarief. Nog een verandering is relevant voor bestaande Grok 4.5-gebruikers: gecachte input steeg 67%, van $0,30 naar $0,50 per miljoen tokens. Dat hogere cachetarief vergroot de kloof tussen de prijskaart en de kosten van een voltooide taak.

Grok 4.6 versus de concurrentie

Nu we de vergelijking met zijn eigen voorganger hebben afgekaart, kijken we hoe Grok 4.6 zich verhoudt tot andere state-of-the-art-modellen van OpenAI en Anthropic.

Grok 4.6 vs GPT-5.6 Sol

De index-gelijkstand verbergt een duidelijke tweedeling. Sol ligt 7,1 punten voor op DeepSWE en 8,6 punten op Terminal-Bench, wat terminalzwaar coderen tot zijn sterkste geval maakt. Grok scoort hoger op de andere drie taakrijen.

OpenAI’s eigen tests trekken dat terminalresultaat door naar webbrowseren en computergebruik. Het blijft door de leverancier geselecteerd bewijs in plaats van een gecontroleerde vergelijking, maar wijst dezelfde kant op: Sol’s sterkste geval is werk dat afhankelijk is van een terminal, een browser of herhaalde tool-calls.

OpenAI previewde ook een Ultrafast-modus voor Sol die volgens hen tot 14 keer sneller draait. Er is nog geen gepubliceerde prijs, dus die hoort niet in de kostenvergelijking.

Grok 4.6 start op $2 input en $6 output per miljoen tokens. Het standaardtarief van Sol is $5 input en $30 output, vijf keer de outputprijs van Grok. Boven 272.000 tokens verdubbelt Sol de inputprijs en verhoogt de output naar $45.

Dat maakt niet elke Grok-taak vijf keer goedkoper. Gebruik van redeneertokens, cache-hits en het aantal beurten veranderen nog steeds de eindafrekening. Grok’s prijsvoordeel is het duidelijkst wanneer het tokenverbruik voorspelbaar is. Voor terminalzwaar werk kunnen Sol’s hogere benchmarkscores zwaarder wegen dan het prijsverschil op de kaart.

Grok 4.6 vs. Claude Sonnet 5

Sonnet 5 en Grok 4.6 starten allebei op $2 per miljoen inputtokens, wat hun prijzen makkelijk vergelijkbaar maakt. Sonnet 5 heeft standaard een contextvenster van 1 miljoen tokens, twee keer Grok’s 500.000, zonder hoger tarief voor lange prompts. Output kost $10 per miljoen tegenover $6 bij Grok.

Twee dagen voor de lancering van Grok 4.6 maakte Anthropic de $2/$10-prijzen permanent en liet een geplande verhoging naar $3/$15 varen. Dit is relevant bij vergelijking met een ouder prijsoverzicht, ook met een ouder overzicht van ons.

Op de Artificial Analysis-index scoort Sonnet 5 55 op max effort, zes punten onder Grok 4.6. Het gebruikte 300 miljoen outputtokens voor de tests tegenover 72 miljoen bij Grok, waardoor de kosten per taak op $1,72 uitkomen. Zijn tokenizer produceert ruwweg 30% meer tokens dan Sonnet 4.6 voor dezelfde tekst. Dat bemoeilijkt een prijsvergelijking tussen die twee Sonnet-versies. Sonnet 5 is ook niet Anthropic’s topmodel.

Grok 4.6 vs Claude Opus 5 en Fable 5

Opus 5, aan $5 input en $25 output, staat bovenaan de index met 63. Fable 5, aan $10 input en $50 output, scoort 62. Fable’s indexscore behoeft ook een kanttekening. Artificial Analysis registreerde safety fallbacks op sommige zwaardere prompts, dus de score weerspiegelt het model zoals mensen het kunnen gebruiken, niet een onbegrensde versie die Anthropic niet aanbiedt.

Op de AA-Briefcase-benchmark van Artificial Analysis voor lange agent-taken voltooide Grok 4.6 in ongeveer 53 beurten en gebruikte 0,5 miljard inputtokens. Opus 5 had circa 103 beurten en 2 miljard tokens nodig. Dit toont niet aan dat Grok het sterkere model is in het algemeen. Het laat zien dat Grok op deze testset minder stappen en minder inputtokens gebruikte, terwijl Claude leidde op de andere hierboven behandelde tests.

Prijzen van Grok 4.6

De drempel van 200.000 tokens per prompt is wat ik in de gaten zou houden: die verplaatst elke token in het verzoek naar de hogere schijf. De tabel bevat ook prioriteit en tool-kosten.

Post

Tarief

Inputtokens, onder 200K prompt

$2,00 / miljoen

Gecachte input, onder 200K prompt

$0,50 / miljoen

Outputtokens, onder 200K prompt

$6,00 / miljoen

Input / gecacht / output (boven 200K prompt)

$4,00 / $1,00 / $12,00

Snelle of prioritaire verwerking

2x standaardtarief

Webzoekopdracht, X-zoekopdracht, code-uitvoering

$5 per 1.000 calls

Toolkosten staan los van tokenkosten. Een verzoek dat het web doorzoekt en vervolgens code draait kan beide toolkosten maken vóórdat de uiteindelijke tekst wordt afgerekend. Er is geen aparte grok-4.6-fast modelnaam. De directe API heeft een prioriteitsoptie die tegen 2x wordt gefactureerd wanneer de response prioriteitsgebruik bevestigt. Cursor toont een aparte keuze "Grok 4.6 (Fast)" tegen hetzelfde 2x-tarief.

Cursor modelkeuze met Grok 4.6 met Fast-modus en extra-high reasoning ingeschakeld

Grok 4.6 Fast geselecteerd in Cursor. Afbeelding door de auteur.

Hoe krijg ik toegang tot Grok 4.6?

Grok 4.6 is first-party beschikbaar via: 

  • de SpaceXAI API
  • Cursor
  • Grok Build
  • Derde-partij gateways (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI)
  • Andere codingtools (GitHub Copilot, VS Code, JetBrains, Xcode en Eclipse)

De uitrol dekt Pro, Pro+, Max, Business en Enterprise-abonnementen. Business- en Enterprise-beheerders moeten het model inschakelen, want het staat standaard uit. Grok 4.6 wordt niet ondersteund op de Batch API van SpaceXAI, dus er is geen kortingstarief voor batches.

Eén enterprise-detail valt buiten modelbeschikbaarheid. Responses zijn standaard stateful, en SpaceXAI zegt dat de geschiedenis 30 dagen wordt bewaard. Onder Zero Data Retention kunnen teams geen opgeslagen response-ketens of uitgestelde completions gebruiken; xAI wijst in plaats daarvan op versleutelde reasoning replay en WebSocket Responses. Elke response bevat een header die aangeeft of ZDR actief was.

De lanceringsweek van Grok 4.6: modellen, Copilot en Cursor

Wat mij die week opviel, was hoe snel modellanceringen en distributiedeals zich rond Grok 4.6 clusterten.

Tijdlijn lancering Grok 4.6 die zes AI-product- en distributie-events groepeert in vier mijlpalen

De lanceringsweek van Grok 4.6, voorbij de benchmarks. Afbeelding door de auteur.

Grok Bot zette de toon vóór de modellancering. De vroege-bèta cloudagent werd gebundeld met SuperGrok Heavy voor $300 per maand of Cursor Ultra voor $200 per maand, in plaats van los verkocht, waardoor toegang aan premiumplannen werd gekoppeld. Grok 4.6 nam vervolgens dezelfde agentfocus mee naar de API, Cursor en Grok Build.

De lancering van Google’s Gemini 3.7 Flash en de Ultrafast-preview van OpenAI’s GPT-5.6 Sol maakten de week drukker. Tegelijkertijd zorgden de Copilot-uitrol en Cursor dat zich bij SpaceX voegt voor een bredere distributie van Grok. Cursor herleidde het proces naar de samenwerking met SpaceXAI eerder dat jaar en kaderde de stap in rond toegang tot de GPU’s van SpaceX in plaats van modelscores. In hun post staat dat die toegang zal helpen om modellen goedkoper te bouwen.

Mijn lezing van die week is dat SpaceXAI Grok in de tools wil plaatsen die mensen al gebruiken. Grok 4.5 werd gezamenlijk getraind met Cursor, en Grok 4.6 kwam vrijwel meteen in Copilot. Partnerdistributie is daarmee onderdeel van de release, geen bijzaak.

Wanneer moet je Grok 4.6 gebruiken?

Grok 4.6 past bij werk waar API-prijs en lange agent-taken zwaarder wegen dan first-token-latentie. Het past minder goed wanneer Sol’s hogere terminalscores of het grotere contextvenster van Sonnet 5 beter bij de taak aansluiten.

Grok 4.6 past wanneer:

  • API-prijs de primaire beperking is. Het onderbiedt Sol, Opus 5 en Fable 5 op lijstprijs en kosten per taak
  • Werk draait als lange, meerstaps agent-taken, waar de beurtenefficiëntie (minder beurten en inputtokens dan Opus 5 op AA-Briefcase) loont
  • De taak kenniswerk of juridische redenering is, waar het de benchmarktabel aanvoert
  • First-token-latentie niet uitmaakt. Een trage start valt weg over een lange run, maar bepaalt de hele ervaring in interactieve chat

Er zijn mogelijk betere alternatieven wanneer:

  • Het werk terminalzwaar coderen is → GPT-5.6 Sol (hogere DeepSWE- en Terminal-Bench-scores)
  • De taak een groot contextvenster vereist → Claude Sonnet 5 (1M context, geen toeslag voor lange prompts)
  • Je de laagste latentie voor interactief gebruik wilt → Gemini 3.7 Flash
  • Je puur op top-end intelligentie inkoopt → Opus 5 (63) of Fable 5 (62) staan bovenaan de index

Slotgedachten over Grok 4.6

Grok 4.6 landt in een ongemakkelijke middenpositie. Het stijgt vijf indexpunten en blijft onder Sol en Opus 5 qua lijstprijzen, maar start langzamer en kost meer per gemeten taak dan Grok 4.5. "Zelfde prijs, beter model" mist de helft van de release.

Wat ik nog wil zien, is een run van meerdere uren waarbij de codebase, tools en instructies blijven veranderen. Cursor en GitHub Copilot bieden nu die setting. Als correctie- en faalpercentages daar laag blijven, heeft de agent-trainingsclaim bewijs buiten een vaste test; zo niet, dan blijft de winst van vijf punten precies dat.

Voor lezers die bouwen op de xAI API behandelt onze Grok 4 API-tutorial de Python-client en de requestflow.

Grok 4.6 FAQ's

Vervangt Grok 4.6 Grok 4.5?

Niet officieel. SpaceXAI heeft geen uitfaseringsdatum voor Grok 4.5 aangekondigd en het model staat nog steeds vermeld in zowel de API als Cursor. Er is nog geen verplichte overstap naar 4.6.

Kan ik Grok 4.6 zelf hosten?

Nee. Zoals hierboven vermeld, zijn er geen open weights en geen gepubliceerd parameteraantal, dus er is niets te downloaden en op je eigen hardware te draaien. Elke toegangsroute, inclusief de directe API, loopt via de infrastructuur van SpaceXAI of een partner die deze doorverkoopt.

Hoe factureert GitHub Copilot Grok 4.6?

Copilot zet het gebruik van Grok 4.6 om in GitHub AI Credits tegen de lijstprijs van de provider, waarbij één cent gelijkstaat aan één credit. Gewone codeaanvullingen en volgende-bewerkingssuggesties worden niet in AI Credits gefactureerd. Modelgebruik in chat of agent-taken volgt de gebruiksregels van Copilot.

Is Grok 4.6 beschikbaar in de EU?

Ja, maar verwerkt in de VS. EU-gebruikers hebben toegang tot Grok 4.6 (de gedeelde Grok 4.5-basis voldeed aan de EU AI Act en ging in juli open voor EU-gebruikers, en 4.6 wordt in Cursor in de hele EU geleverd), maar er is geen EU-gegevensresidentie. Op de modelpagina van xAI staan alleen us-east-1 en us-west-2, dus verzoeken draaien in de VS. Bevestig per omgeving (API-console, Cursor, gateways) voordat je erop vertrouwt.

Werkt Grok 4.6 met de gegevensresidentie in de VS van Cursor?

Grok 4.6 is nu beschikbaar in Cursor (het heeft een eigen modelpagina), maar gegevensresidentie in de VS is een Enterprise-functie die alleen ondersteunde modellen dekt met enkele uitzonderingen. Bevestig dus dat 4.6 op de actuele lijst met ondersteunde modellen van Cursor staat voordat je erop vertrouwt.


Khalid Abdelaty's photo
Author
Khalid Abdelaty
LinkedIn

Ik ben een data-engineer en communitybouwer die werkt aan datapijplijnen, cloud en AI-tools, en tegelijkertijd praktische, impactvolle tutorials schrijft voor DataCamp en beginnende developers.

Onderwerpen

Leer AI met DataCamp!

Leerpad

AI-basisprincipes

10 Hr
Ontdek de basis van AI, leer hoe je AI slim kunt gebruiken voor je werk en duik in modellen zoals ChatGPT om je weg te vinden in de dynamische wereld van AI.
Bekijk detailsRight Arrow
Begin Met De Cursus
Meer zienRight Arrow
Gerelateerd

blog

AI vanaf nul leren in 2026: een complete gids van de experts

Ontdek alles wat je moet weten om in 2026 AI te leren, van tips om te beginnen tot handige resources en inzichten van industrie-experts.
Adel Nehme's photo

Adel Nehme

15 min

Meer ZienMeer Zien