Hoppa till huvudinnehållet

Grok 4.6: Funktioner, riktmärken, priser och jämförelser

SpaceXAI:s nya modell, Grok 4.6, matchar GPT‑5.6 Sols Intelligence Index‑poäng till ett lägre uppmätt pris. Se riktmärken, agentfunktioner, prissättning och hur den jämförs med Grok 4.5 och Claude Sonnet 5.
Uppdaterad 21 aug. 2026  · 13 min läsa

Utforska med AI

ChatGPTClaudePerplexity

De flesta läsare känner fortfarande labbet bakom Grok som xAI. SpaceXAI släppte Grok 4.6 den 12 augusti 2026, drygt en månad efter Grok 4.5, med fokus på kodning, visuellt webbarbete och agentuppgifter som körs längre.

Lanseringsdata ger inget enkelt förstaplacering. Grok leder vissa av SpaceXAI:s utvalda tester, medan GPT-5.6 Sol och Claude Fable 5 leder andra. Artificial Analysis placerar Grok bredvid Sol till ett lägre blandat pris, men uppgraderingen börjar också svara senare och kostar mer per uppmätt uppgift än Grok 4.5.

Den här artikeln följer den avvägningen genom modellens specifikationer, prissättning, åtkomst och direkta jämförelser med Sol och Claude. Vår Grok 4.5-bevakning fokuserade på låg tokenanvändning. Här är frågan om en högre poäng ändrar den faktiska fakturan när cachelagrat input, resonemangstoken och extra output räknas in.

TL;DR: Grok 4.6

Min korta läsning är att fempoängslyftet i sig betyder mindre än vad lanseringssidan antyder. Pris­beteende och uppgiftstyp avgör om det ändrar modellvalet.

  • Vid high ansträngning får Grok 4.6 61 på Artificial Analysis Intelligence Index, numeriskt lika med Sol vid max och två poäng bakom Opus 5 vid max.

  • Grundpriset för input och output ligger kvar på $2 respektive $6 per miljon token, men cachelagrat input, fördröjning till första token och uppmätt uppgiftskostnad ökar alla jämfört med Grok 4.5.

  • I AA-Briefcase använde Grok färre vändor och inputtoken än Opus 5; Sol leder terminal­testen, medan Sonnet 5 erbjuder dubbelt så stor kontext utan påslag för långa promptar.

Jämförelserna nedan håller leverantörspåståenden åtskilda från Artificial Analysis resultat. Det spelar roll eftersom en modell kan byta position när ansträngningsnivån eller testupplägget ändras.

Vad är Grok 4.6?

Grok 4.6 är SpaceXAI:s proprietära resonemangsmodell. API:et och Cursor exponerar inte samma kontextgräns, och den högre långkontext-tariffen börjar långt före API-gränsen. Tabellen ställer dessa begränsningar bredvid inputtyper, verktyg och kunskapsstoppdatumet.

Spec

Grok 4.6

Kontextfönster

500 000 token (API); 256 000 token i Cursor

Input / output

Text och bilder in; text ut

Resonemangsinsats

Low, medium, high (standard), xhigh

Kunskapsstopp

1 februari 2026

Verktyg

Funktionsanrop, webbsökning, X-sökning, kodkörning, kollektionssökning (RAG), fjärr‑MCP

Standardpriser

$2 / miljon inputtoken, $0,50 cachelagrat, $6 / miljon output

Priser för lång kontext

$4 / $1 / $12 när en prompt når 200 000 token, tillämpas på hela begäran

SpaceXAI publicerar fortfarande inget parameterantal för någon av modellerna. Siffran 1,5 biljoner i vissa rapporter kommer inte från SpaceXAI, så den är inte en bekräftad specifikation.

Vad är nytt i Grok 4.6?

SpaceXAI säger att detta inte är en ny modell tränad från grunden. I stället gav man Grok 4.5 mer träning, med extra fokus på AI‑agentuppgifter. De rapporterade förändringarna faller inom längre agentrundor, visuella byggen och efterträning.

Längre agentuppgifter

SpaceXAI säger att Grok 4.6 håller kursen under långa uppgifter med flera steg, såsom research, arbete över en kodbas och att bygga en applikation. Modellen uppges kontrollera sitt arbete oftare i stället för att göra allt i ett svep.

Det stämmer med en bredare förändring i modelltstning. Ett bra första svar betyder mindre om modellen glömmer tidigare beslut efter flera verktygsanrop. GitHubs interna tester fann också att Grok 4.6 fortsatte resonera och använda verktyg över längre uppgifter.

API:et har funktioner kopplade till det påståendet. Grok 4.6 kan strömma resonemangssammanfattningar, vilket Grok 4.5 inte exponerar, och xAI rekommenderar kontextkomprimering med en klistrig prompt_cache_key för långa agentloopar. Komprimering kortar ner tidigare historik till en post, men den använder fortfarande token, och begäran måste få plats i kontextfönstret innan komprimering körs.

Visuell och interaktiv webbutveckling

SpaceXAI och Cursor rapporterar båda bättre första försök i visuella projekt. I ett externt test byggde Grok 4.6 om en gammal iPod Mini-produktsida som en 3D‑sajt med fungerande färghjul och scrollanimation. Demon fungerade, men ett test kan inte bevisa det bredare påståendet.

Hur Grok 4.6 eftertränades

Om du bara bryr dig om riktmärken och pris kan du hoppa över det här avsnittet. Det förklarar SpaceXAI:s beskrivning av var förbättringen kom ifrån.

SpaceXAI körde mer träning än för Grok 4.5. Man använde AI‑skapade resonemangsexempel och ingenjörsexempel, tog bort svaga exempel med modellbaserade kontroller och använde sedan förstärkningsinlärning för kodning, kontorsuppgifter, webbutveckling, kernel‑tuning och dator­design. SpaceXAI säger också att Grok 4.5 skapade nya tränings­exempel över olika resonemangsinställningar och ämnen. Företaget tillskriver förbättringen mer träning och striktare datavalt, inte en ny arkitektur.

Externa team kan inte verifiera dessa detaljer, och SpaceXAI har inte delat tillräckligt med information för att upprepa träningen. Detta är företagets egen redogörelse för vad som ändrats, inte ett resultat verifierat av någon annan.

Grok 4.6-riktmärken: officiella och oberoende resultat

SpaceXAI:s lanseringstabell visar var poängen steg, men konkurrentpoängen är "bäst av självrapporterade eller offentligt tillgängliga resultat". Ett team körde inte varje modell under samma upplägg. Resonemangsinsats ingår nedan eftersom den påverkar poängen.

Riktmärke

Grok 4.6 (high)

Grok 4.5 (high)

GPT-5.6 Sol (max)

Claude Fable 5 (max)

AA Intelligence Index

61

56

61

62

GDPVal-AA v2 (Elo)

1 753

1 526

1 728

1 741

DeepSWE 1.1

65,9%

54,0%

73,0%

70,0%

Terminal-Bench 3.0

26,0%

15,7%

34,6%

34,1%

APEX-Agents

57,5%

47,1%

56,7%

59,2%

CursorBench v3.2

69,9%

66,7%

67,2%

70,5%

Grok 4.6 förbättras jämfört med Grok 4.5 genom hela tabellen. Sols största avstånd syns på DeepSWE och Terminal‑Bench, medan Fable leder 3 rader. Till och med SpaceXAI:s egen tabell pekar inte ut en ensam vinnare.

Oberoende riktmärkesresultat

Artificial Analysis körde sin egen Intelligence Index över sex modeller i denna jämförelse. Resultaten ligger nära SpaceXAI:s siffror, men är inte identiska.

Spridningsdiagram för gränsintelligens kontra blandat pris som jämför Grok 4.6, Grok 4.5, GPT-5.6 Sol, Claude Opus 5, Claude Sonnet 5 och Gemini 3.7 Flash

Grok 4.6 jämfört med fem konkurrenter i toppskiktet. Bild av författaren.

Diagrammet placerar Grok i nivå med Sol på intelligens, men mycket lägre på blandat pris. Artificial Analysis beräknar det priset med en 7:2:1‑mix av cachelagrat input, icke‑cachelagrat input och output. Kostnad per slutförd indexport visar samma gap: $0,84 för Grok, $1,23 för Sol och $2,34 för Opus 5.

Tiden till första svarstoken steg från 14,62 sekunder på Grok 4.5 till 40,44 sekunder, medan kostnaden per uppgift ökade från $0,36 till $0,84. Grok 4.6 använde cirka 20% fler outputtoken på samma tester, så ett oförändrat listpris betyder inte oförändrad uppgiftskostnad. Kostnad per färdig uppgift ger en bättre bild än enbart API‑prislistor eftersom den inkluderar en del av det extra resonemang som används för att slutföra arbetet.

Jämfört med GPT‑5.6 Sol och Claude Sonnet 5 skickar Grok 4.6 sin första svarstoken tidigare. Sol vid max ansträngning tar 213,52 sekunder, och Sonnet 5 tar 184,48, jämfört med Groks 40,44. Grok ser bara långsam ut bredvid modeller med lägre latens som Gemini 3.7 Flash.

Hur tillförlitliga är dessa riktmärkesjämförelser?

De är användbara för att hitta relativa styrkor, men inte en tillförlitlig modellöverskridande ranking. Resonemangsinsats ändrar poäng och svarstid: GPT‑5.6 Sol fick 57 vid high och 61 vid max. Riktmärkesnamn kan också avse olika versioner, så xAI:s Terminal‑Bench 3.0 och Artificial Analysis Terminal‑Bench 2.1 är inte jämförbara.

Vad ändrades från Grok 4.5?

För Grok 4.5‑användare är beslutet inte om 4.6 är "bättre" i abstrakt mening. Det är om den högre poängen uppväger en annan latens‑ och tokenanvändningsprofil. Tabellen lägger dessa förändringar på samma basline.

Mått

Grok 4.5 (high)

Grok 4.6 (high)

AA Intelligence Index

56

61

Kostnad per indexport

$0,36

$0,84

Tid till första svarstoken

14,62 s

40,44 s

Pris för cachelagrat input

$0,30 / M

$0,50 / M 

Outputtoken som användes för att köra indexet

60 M

72 M

Grundpris input / output

$2 / $6

$2 / $6 (oförändrat)

However, "samma pris" beskriver bara grundlistan. En förändring till spelar roll för befintliga Grok 4.5‑användare: cachelagrat input steg 67%, från $0,30 till $0,50 per miljon token. Den högre cachetariffen ökar gapet mellan prislistan och kostnaden för en färdig uppgift.

Grok 4.6 jämfört med konkurrenterna

Nu när vi har jämfört med föregångaren, låt oss se hur Grok 4.6 står sig mot andra toppmodeller från OpenAI och Anthropic.

Grok 4.6 vs GPT-5.6 Sol

Indexlikheten döljer en tydlig uppdelning. Sol leder Grok med 7,1 poäng på DeepSWE och 8,6 poäng på Terminal‑Bench, vilket gör terminaltung kodning till dess starkaste fall. Grok får högre poäng på de tre andra uppgiftsraderna.

OpenAI:s egna tester utvidgar det terminalresultatet till webbläsning och datoranvändning. De förblir leverantörsvalda bevis snarare än en kontrollerad jämförelse, men pekar åt samma håll: Sols starkaste fall är arbete som beror på en terminal, en webbläsare eller upprepade verktygsanrop.

OpenAI förhandsvisade också ett Ultrafast‑läge för Sol som enligt uppgift körs upp till 14 gånger snabbare. Det har inget publicerat pris ännu, så det hör inte hemma i kostnadsjämförelsen.

Grok 4.6 börjar på $2 för input och $6 för output per miljon token. Sols standardpris är $5 för input och $30 för output, fem gånger Groks outputpris. Över 272 000 token fördubblar Sol inputpriset och höjer output till $45.

Det betyder inte att varje Grok‑uppgift är fem gånger billigare. Resonemangstoken, cacheträffar och antal vändor ändrar fortfarande slutnotan. Groks prisfördel är tydligast när tokenanvändningen är förutsägbar. För terminaltungt arbete kan Sols högre riktmärkessiffror spela större roll än gapet i listpris.

Grok 4.6 vs. Claude Sonnet 5

Sonnet 5 och Grok 4.6 börjar båda på $2 per miljon inputtoken, vilket gör priserna lätta att jämföra. Sonnet 5 har ett kontextfönster på 1 miljon token som standard, dubbelt Groks 500 000, utan högre taxa för långa promptar. Output kostar $10 per miljon mot Groks $6.

Två dagar före Grok 4.6‑lanseringen gjorde Anthropic $2/$10‑priset permanent och slopade en planerad höjning till $3/$15. Detta spelar roll när man jämför mot en äldre prislista, inklusive en äldre av våra.

På Artificial Analysis index får Sonnet 5 55 vid max ansträngning, sex poäng under Grok 4.6. Den använde 300 miljoner outputtoken för testerna mot Groks 72 miljoner, vilket gav en kostnad per uppgift på $1,72. Dess tokenizer producerar ungefär 30% fler token än Sonnet 4.6 för samma text. Det gör en prisjämförelse mellan dessa två Sonnet‑versioner svårare. Sonnet 5 är inte heller Anthropics toppmodell.

Grok 4.6 vs Claude Opus 5 och Fable 5

Opus 5, på $5 input och $25 output, toppar indexet på 63. Fable 5, på $10 input och $50 output, får 62. Fables indexpoäng behöver också en not. Artificial Analysis noterade säkerhetsåterfall på vissa svårare promptar, så poängen speglar modellen som människor kan använda den, inte en obehindrad version som Anthropic inte erbjuder.

På Artificial Analysis AA‑Briefcase‑riktmärke för långa agentuppgifter slutförde Grok 4.6 på cirka 53 vändor och använde 0,5 miljarder inputtoken. Opus 5 tog cirka 103 vändor och 2 miljarder token. Detta visar inte att Grok är den starkare modellen överlag. Det visar att Grok använde färre steg och färre inputtoken på denna testuppsättning, medan Claude ledde på de andra testerna ovan.

Grok 4.6‑priser

Gränsen på 200 000 token i prompten är den del jag skulle hålla ögonen på: den flyttar varje token i begäran till den högre nivån. Tabellen inkluderar även prioritet och verktygsavgifter.

Post

Taxa

Inputtoken, under 200K prompt

$2,00 / miljon

Cachelagrat input, under 200K prompt

$0,50 / miljon

Outputtoken, under 200K prompt

$6,00 / miljon

Input / cache / output (över 200K prompt)

$4,00 / $1,00 / $12,00

Snabb eller prioriterad bearbetning

2× standardtaxan

Webbsökning, X‑sökning, kodkörning

$5 per 1 000 anrop

Verktygsavgifter är separata från tokenavgifter. En begäran som söker på webben och sedan kör kod kan få båda verktygsavgifterna innan den slutliga texten debiteras. Det finns inget separat grok-4.6-fast modellnamn. Det direkta API:et har ett prioritet­sval som debiteras 2× när svaret bekräftar prioritet. Cursor visar ett separat val "Grok 4.6 (Fast)" till samma 2×‑taxa.

Cursors modellväljare som visar Grok 4.6 med Fast‑läge och extra hög resonemangsnivå aktiverat

Grok 4.6 Fast valt i Cursor. Bild av författaren.

Hur får jag tillgång till Grok 4.6?

Grok 4.6 finns tillgänglig från första part via: 

  • SpaceXAI‑API:et
  • Cursor
  • Grok Build
  • Tredjeparts‑gateways (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI)
  • Andra kodverktyg (GitHub Copilot, VS Code, JetBrains, Xcode och Eclipse)

Utrullningen omfattar planerna Pro, Pro+, Max, Business och Enterprise. Administratörer för Business och Enterprise måste slå på modellen eftersom den är avstängd som standard. Grok 4.6 stöds inte i SpaceXAI:s Batch‑API, så det finns inget rabatterat batch­alternativ.

En företagsdetalj ligger utanför modelltillgänglighet. Svar är tillståndsbevarande som standard, och SpaceXAI säger att historiken lagras i 30 dagar. Under Zero Data Retention kan team inte använda lagrade svarskedjor eller uppskjutna slutföranden; xAI pekar i stället på krypterad resonemangsuppspelning och WebSocket‑svar. Varje svar inkluderar en header som visar om ZDR var aktivt.

Grok 4.6:s lanseringsvecka: modeller, Copilot och Cursor

Det som stack ut för mig den veckan var hur snabbt modell­lanseringar och distributionsavtal klustrade kring Grok 4.6.

Tidslinje för Grok 4.6-lansering som grupperar sex AI‑produkt- och distributionsevent i fyra milstolpar

Grok 4.6:s lanseringsvecka, bortom riktmärken. Bild av författaren.

Grok Bot satte tonen före modell­lanseringen. Den tidiga betan av molnagenten paketerades med SuperGrok Heavy för $300 i månaden eller Cursor Ultra för $200 i månaden i stället för att säljas separat, vilket knöt åtkomsten till premiumplaner. Grok 4.6 bar sedan med sig samma agentfokus in i API:et, Cursor och Grok Build.

Googles lansering av Gemini 3.7 Flash och OpenAI:s förhandsvisning av GPT‑5.6 Sol Ultrafast gjorde veckan mer tät. Samtidigt breddade Copilot‑utrullningen och Cursors inträde i SpaceX vidade Groks distribution. Cursor spårade processen tillbaka till sitt SpaceXAI‑partnerskap tidigare samma år och ramade in flytten kring tillgång till SpaceX GPU:er snarare än modellsiffror. Inlägget säger att den åtkomsten kommer hjälpa dem bygga modeller till lägre kostnad.

Min tolkning av den veckan är att SpaceXAI vill ha in Grok i de verktyg som folk redan använder. Grok 4.5 tränades gemensamt med Cursor, och Grok 4.6 flyttade in i Copilot nästan omedelbart. Det gör partnerdistribution till en del av släppet, inte en eftertanke.

När ska du använda Grok 4.6?

Grok 4.6 passar arbete där API‑pris och långa agentuppgifter betyder mer än latens till första token. Den passar sämre när Sols högre terminalsiffror eller Sonnet 5:s större kontextfönster matchar uppgiften bättre.

Grok 4.6 passar när:

  • API‑pris är en primär begränsning. Den undercut:ar Sol, Opus 5 och Fable 5 på listpris och kostnad per uppgift
  • Arbetet körs som långa agentuppgifter i flera steg, där dess effektivitet i vändor (färre vändor och inputtoken än Opus 5 på AA‑Briefcase) ger utdelning
  • Uppgiften är kunskapsarbete eller juridiskt resonemang, där den leder riktmärkestabellen
  • Latens till första token inte spelar roll. En långsam start försvinner i bruset över en lång körning, men präglar hela upplevelsen i interaktiv chatt

Det kan finnas bättre alternativ när:

  • Arbetet är terminaltung kodning → GPT‑5.6 Sol (högre DeepSWE‑ och Terminal‑Bench‑poäng)
  • Uppgiften kräver ett stort kontextfönster → Claude Sonnet 5 (1M kontext, inget påslag för långa promptar)
  • Du vill ha lägsta latens för interaktiv användning → Gemini 3.7 Flash
  • Du köper enbart på toppintelligens → Opus 5 (63) eller Fable 5 (62) toppar indexet

Slutliga tankar om Grok 4.6

Grok 4.6 landar i ett besvärligt mellanläge. Den kliver upp fem indexpoäng och ligger under Sol och Opus 5 på listade priser, men startar långsammare och kostar mer per uppmätt uppgift än Grok 4.5. "Samma pris, bättre modell" missar halva släppet.

Det jag fortfarande vill se är en fler­timmarskörning där kodbas, verktyg och instruktioner fortsätter att ändras. Cursor och GitHub Copilot ger nu den miljön. Om korrigerings‑ och felgrader förblir låga där, har agenttränings­påståendet bevis bortom ett fast test; om inte, förblir fempoängslyftet just det.

För läsare som bygger mot xAI‑API:et täcker vår Grok 4 API‑guide Python‑klienten och begärandeflödet.

Grok 4.6 vanliga frågor

Ersätter Grok 4.6 Grok 4.5?

Inte officiellt. SpaceXAI har inte meddelat något pensioneringsdatum för Grok 4.5, och den finns fortfarande listad både i API:et och i Cursor. Det finns ingen påtvingad flytt till 4.6 ännu.

Kan jag köra Grok 4.6 självhostat?

Nej. Som nämnts ovan finns det inga öppna vikter och inget publicerat parameterantal, så det finns inget att ladda ner och köra på din egen hårdvara. Varje åtkomstväg, inklusive direkt‑API, går genom SpaceXAI:s infrastruktur eller en partner som återförsäljer den.

Hur debiterar GitHub Copilot Grok 4.6?

Copilot omvandlar användningen av Grok 4.6 till GitHub AI Credits enligt leverantörens listpris, där en cent motsvarar en kredit. Vanliga kodkompletteringar och nästa‑redigering‑förslag debiteras inte i AI Credits. Modellanvändning i chatt eller agentuppgifter följer Copilots användningsregler.

Finns Grok 4.6 i EU?

Ja, men bearbetas i USA. EU‑användare kan komma åt Grok 4.6 (den delade Grok 4.5‑basen klarade EU:s AI‑förordning och öppnade för EU‑användare i juli, och 4.6 skeppas i Cursor över hela EU), men det finns ingen datalokalitet i EU. xAI:s modellsida listar bara us-east-1 och us-west-2, så begäranden körs i USA. Bekräfta per yta (API‑konsol, Cursor, gateways) innan du förlitar dig på det.

Fungerar Grok 4.6 med Cursors datalokalitet i USA?

Grok 4.6 finns nu i Cursor (den har en egen modellsida), men datalokalitet enbart i USA är en Enterprise‑funktion som bara täcker stödda modeller med vissa undantag. Så bekräfta att 4.6 finns på Cursors aktuella lista över stödda modeller innan du förlitar dig på det.

Ämnen

Lär dig AI med DataCamp!

track

AI-grunder

10 timmar
Upptäck grunderna i AI, lär dig att använda AI effektivt i arbetet och fördjupa dig i modeller som ChatGPT för att navigera i det dynamiska AI-landskapet.
Se detaljerRight Arrow
Starta Kursen
Se merRight Arrow