Programma
Per la maggior parte dei lettori, il laboratorio dietro Grok è ancora noto come xAI. SpaceXAI ha rilasciato Grok 4.6 il 12 agosto 2026, poco più di un mese dopo Grok 4.5, con un focus su coding, lavoro web visivo e attività di agenti che durano più a lungo.
I dati di lancio non supportano una classifica univoca. Grok guida alcuni dei test scelti da SpaceXAI, mentre GPT-5.6 Sol e Claude Fable 5 guidano altri. Artificial Analysis colloca Grok accanto a Sol a un prezzo medio inferiore, ma l’aggiornamento inizia anche a rispondere più tardi e costa di più per attività misurata rispetto a Grok 4.5.
Questo articolo segue questo scambio tra specifiche del modello, prezzi, accesso e confronti diretti con Sol e Claude. La nostra copertura di Grok 4.5 si è concentrata su un basso uso di token. Qui, la domanda è se un punteggio più alto cambi davvero il conto finale una volta considerati input in cache, token di ragionamento ed extra di output.
TL;DR: Grok 4.6
In breve, il guadagno di cinque punti conta meno, da solo, di quanto suggerisca la pagina di lancio. Il comportamento di prezzo e il tipo di attività decidono se cambia la scelta del modello.
-
Con impegno
high, Grok 4.6 segna 61 nell’Artificial Analysis Intelligence Index, numericamente pari a Sol amaxe due punti dietro Opus 5 amax. -
Le tariffe base di input e output restano a $2 e $6 per milione di token, ma input in cache, ritardo del primo token e costo per attività misurata aumentano rispetto a Grok 4.5.
-
In AA-Briefcase, Grok ha usato meno turni e token di input rispetto a Opus 5; Sol guida i test da terminale, mentre Sonnet 5 offre il doppio del contesto senza sovrapprezzo per prompt lunghi.
I confronti qui sotto tengono separate le affermazioni del provider dai risultati di Artificial Analysis. Conta perché un modello può cambiare posizione quando cambia il livello di impegno o l’impostazione del test.
Che cos’è Grok 4.6?
Grok 4.6 è il modello di ragionamento proprietario di SpaceXAI. L’API e Cursor non espongono lo stesso limite di contesto, e la tariffa più alta per contesti lunghi inizia ben prima del limite API. La tabella affianca questi vincoli ai tipi di input, agli strumenti e al knowledge cutoff.
|
Specifica |
Grok 4.6 |
|
500.000 token (API); 256.000 token in Cursor |
|
|
Input / output |
Testo e immagini in input; testo in output |
|
Impegno di ragionamento |
Low, medium, high (predefinito), xhigh |
|
Knowledge cutoff |
1 febbraio 2026 |
|
Strumenti |
Function calling, ricerca web, ricerca su X, esecuzione di codice, ricerca in raccolte (RAG), MCP remoto |
|
Prezzi standard |
$2 / milione token di input, $0,50 in cache, $6 / milione di output |
|
Prezzi per contesti lunghi |
$4 / $1 / $12 quando un prompt raggiunge 200.000 token, applicato all’intera richiesta |
SpaceXAI non pubblica ancora un conteggio dei parametri per nessuno dei due modelli. La cifra di 1,5 trilioni riportata in alcune fonti non proviene da SpaceXAI, quindi non è una specifica confermata.
Cosa c’è di nuovo in Grok 4.6?
SpaceXAI afferma che non si tratta di un nuovo modello addestrato da zero. Invece, ha dato a Grok 4.5 ulteriore addestramento, con attenzione extra alle attività degli agenti AI. I cambiamenti riportati riguardano esecuzioni più lunghe per gli agenti, progetti visivi e post-training.
Attività di agenti più lunghe
SpaceXAI afferma che Grok 4.6 rimane sulla traccia durante attività lunghe con più passaggi, come ricerca, lavoro su un codebase e creazione di un’applicazione. Il modello, a quanto riferito, verifica più spesso il proprio lavoro invece di fare tutto in un unico passaggio.
Questo riflette un cambiamento più ampio nei test dei modelli. Una buona prima risposta conta meno se il modello dimentica decisioni precedenti dopo diverse chiamate a strumenti. Anche i test interni di GitHub hanno riscontrato che Grok 4.6 ha mantenuto il ragionamento e l’uso degli strumenti su attività più lunghe.
L’API ha funzioni legate a questa affermazione. Grok 4.6 può trasmettere in streaming i riepiloghi del ragionamento, cosa che Grok 4.5 non espone, e xAI consiglia la compattazione del contesto con una prompt_cache_key persistente per loop di agenti lunghi. La compattazione accorcia la cronologia precedente in un solo elemento, ma utilizza comunque token, e la richiesta deve rientrare nella finestra di contesto prima che la compattazione venga eseguita.
Sviluppo web visivo e interattivo
SpaceXAI e Cursor riportano entrambi tentativi iniziali migliori su progetti visivi. In un test esterno, Grok 4.6 ha ricostruito una vecchia pagina prodotto dell’iPod Mini come sito 3D con una ruota colori funzionante e animazione allo scroll. La demo funzionava, ma un solo test non può provare l’affermazione più ampia.
Come è stato post-addestrato Grok 4.6
Se ti interessano solo benchmark e prezzi, salta questa sottosezione. Spiega il resoconto di SpaceXAI sull’origine del guadagno.
SpaceXAI ha eseguito più addestramento rispetto a Grok 4.5. Ha utilizzato esempi di ragionamento generati dall’AI ed esempi ingegneristici, ha rimosso esempi scadenti con controlli basati su modelli e poi ha usato il reinforcement learning per coding, attività da ufficio, sviluppo web, tuning del kernel e progettazione di computer. SpaceXAI afferma anche che Grok 4.5 ha creato nuovi esempi di addestramento su diverse impostazioni e materie di ragionamento. L’azienda attribuisce il guadagno a più addestramento e a una selezione dati più rigorosa, non a una nuova architettura.
Team esterni non possono verificare questi dettagli, e SpaceXAI non ha condiviso informazioni sufficienti per ripetere l’addestramento. Questo è il resoconto dell’azienda su ciò che è cambiato, non un risultato verificato da terzi.
Benchmark di Grok 4.6: risultati ufficiali e indipendenti
La tabella di lancio di SpaceXAI mostra dove i punteggi sono aumentati, ma i punteggi dei concorrenti sono "i migliori tra risultati auto-riportati o pubblicamente disponibili". Un unico team non ha eseguito ogni modello con lo stesso setup. L’impegno di ragionamento è incluso qui sotto perché influisce sul punteggio.
|
Benchmark |
Grok 4.6 (high) |
Grok 4.5 (high) |
GPT-5.6 Sol (max) |
Claude Fable 5 (max) |
|---|---|---|---|---|
|
AA Intelligence Index |
61 |
56 |
61 |
62 |
|
GDPVal-AA v2 (Elo) |
1.753 |
1.526 |
1.728 |
1.741 |
|
DeepSWE 1.1 |
65,9% |
54,0% |
73,0% |
70,0% |
|
Terminal-Bench 3.0 |
26,0% |
15,7% |
34,6% |
34,1% |
|
APEX-Agents |
57,5% |
47,1% |
56,7% |
59,2% |
|
CursorBench v3.2 |
69,9% |
66,7% |
67,2% |
70,5% |
Grok 4.6 migliora rispetto a Grok 4.5 in tutta la tabella. I maggiori distacchi di Sol compaiono su DeepSWE e Terminal-Bench, mentre Fable guida 3 righe. Anche la tabella di SpaceXAI non indica un unico vincitore.
Risultati di benchmark indipendenti
Artificial Analysis ha eseguito il proprio Intelligence Index su sei modelli in questo confronto. I suoi risultati sono vicini ai numeri di SpaceXAI, ma non identici.

Grok 4.6 rispetto a cinque rivali di frontiera. Immagine dell’autore.
Il grafico colloca Grok al livello di Sol per intelligenza, ma molto più in basso per prezzo medio. Artificial Analysis calcola quel prezzo con un mix 7:2:1 di input in cache, input non in cache e output. Il costo per attività completata nell’indice mostra lo stesso divario: $0,84 per Grok, $1,23 per Sol e $2,34 per Opus 5.
Il tempo al primo token di risposta è salito da 14,62 secondi su Grok 4.5 a 40,44 secondi, mentre il costo per attività è aumentato da $0,36 a $0,84. Grok 4.6 ha usato circa il 20% di token di output in più sugli stessi test, quindi un listino invariato non significa un costo per attività invariato. Il costo per attività completata offre una visione migliore rispetto ai soli listini API perché include parte del ragionamento extra usato per finire il lavoro.
Rispetto a GPT-5.6 Sol e Claude Sonnet 5, Grok 4.6 invia prima il suo primo token di risposta. Sol a impegno massimo impiega 213,52 secondi e Sonnet 5 impiega 184,48, contro i 40,44 di Grok. Grok sembra lento solo accanto a modelli a bassa latenza come Gemini 3.7 Flash.
Quanto sono affidabili questi confronti di benchmark?
Sono utili per trovare punti di forza relativi, ma non una classifica cross-modello affidabile. L’impegno di ragionamento cambia punteggio e tempi di risposta: GPT-5.6 Sol ha segnato 57 a high e 61 a max. Anche i nomi dei benchmark possono riferirsi a versioni diverse, quindi il Terminal-Bench 3.0 di xAI e il Terminal-Bench 2.1 di Artificial Analysis non sono comparabili.
Cosa è cambiato rispetto a Grok 4.5?
Per chi usa Grok 4.5, la decisione non è se 4.6 sia "migliore" in astratto. È se il punteggio più alto compensi un profilo diverso di latenza e uso dei token. La tabella mette questi cambiamenti sulla stessa base di confronto.
|
Misura |
Grok 4.5 (high) |
Grok 4.6 (high) |
|
AA Intelligence Index |
56 |
61 |
|
Costo per attività dell’indice |
$0,36 |
$0,84 |
|
Tempo al primo token di risposta |
14,62s |
40,44s |
|
Prezzo input in cache |
$0,30 / M |
$0,50 / M |
|
Token di output usati per eseguire l’indice |
60M |
72M |
|
Prezzo base input / output |
$2 / $6 |
$2 / $6 (invariato) |
Tuttavia, "stesso prezzo" descrive solo la tariffa base di listino. Un altro cambiamento conta per gli utenti di Grok 4.5: l’input in cache è salito del 67%, da $0,30 a $0,50 per milione di token. Quella tariffa di cache più alta aumenta il divario tra listino e costo di un’attività finita.
Grok 4.6 vs la concorrenza
Chiarito il confronto con il suo predecessore, vediamo ora come Grok 4.6 si confronta con altri modelli all’avanguardia di OpenAI e Anthropic.
Grok 4.6 vs GPT-5.6 Sol
Il pareggio nell’indice nasconde una divisione netta. Sol supera Grok di 7,1 punti su DeepSWE e di 8,6 punti su Terminal-Bench, rendendo il coding pesante da terminale il suo caso più forte. Grok segna più in alto nelle altre tre righe di attività.
I test di OpenAI estendono quel risultato al browsing web e all’uso del computer. Restano evidenze selezionate dal fornitore più che un confronto controllato, ma puntano nella stessa direzione: il caso più forte di Sol è il lavoro che dipende da un terminale, da un browser o da chiamate ripetute a strumenti.
OpenAI ha anche anticipato una modalità Ultrafast per Sol che, a suo dire, è fino a 14 volte più veloce. Non ha ancora un prezzo pubblicato, quindi non rientra nel confronto dei costi.
Grok 4.6 parte da $2 input e $6 output per milione di token. La tariffa standard di Sol è $5 input e $30 output, cinque volte il prezzo di output di Grok. Sopra i 272.000 token, Sol raddoppia il prezzo di input e porta l’output a $45.
Questo non rende ogni attività su Grok cinque volte più economica. L’uso di token di ragionamento, gli hit di cache e il numero di turni cambiano comunque il conto finale. Il vantaggio di prezzo di Grok è più chiaro quando l’uso di token è prevedibile. Per lavoro pesante da terminale, i punteggi più alti di Sol nei benchmark possono contare più del divario di listino.
Grok 4.6 vs. Claude Sonnet 5
Sonnet 5 e Grok 4.6 partono entrambi da $2 per milione di token di input, il che rende i prezzi facili da confrontare. Sonnet 5 ha una finestra di contesto da 1 milione di token di default, il doppio dei 500.000 di Grok, senza tariffa più alta per prompt lunghi. L’output costa $10 per milione contro i $6 di Grok.
Due giorni prima del lancio di Grok 4.6, Anthropic ha reso permanente il prezzo $2/$10 e ha annullato un aumento previsto a $3/$15. Questo conta quando si confronta con un listino più vecchio, incluso uno nostro.
Sull’indice di Artificial Analysis, Sonnet 5 segna 55 a impegno massimo, sei punti sotto Grok 4.6. Ha usato 300 milioni di token di output per i test contro i 72 milioni di Grok, portando il suo costo per attività a $1,72. Il suo tokenizer produce circa il 30% di token in più rispetto a Sonnet 4.6 per lo stesso testo. Questo rende più difficile il confronto di prezzo tra quelle due versioni di Sonnet. Sonnet 5 non è nemmeno il modello di punta di Anthropic.
Grok 4.6 vs Claude Opus 5 e Fable 5
Opus 5, a $5 input e $25 output, guida l’indice a 63. Fable 5, a $10 input e $50 output, segna 62. Anche il punteggio di Fable nell’indice richiede una nota. Artificial Analysis ha registrato fallback di sicurezza su alcuni prompt più difficili, quindi il punteggio riflette il modello come le persone possono usarlo, non una versione senza restrizioni che Anthropic non offre.
Sul benchmark AA-Briefcase di Artificial Analysis per attività lunghe di agenti, Grok 4.6 ha terminato in circa 53 turni e ha usato 0,5 miliardi di token di input. Opus 5 ha impiegato circa 103 turni e 2 miliardi di token. Questo non dimostra che Grok sia il modello più forte in assoluto. Mostra che Grok ha usato meno passaggi e meno token di input su questo set di test, mentre Claude ha guidato negli altri test sopra citati.
Prezzi di Grok 4.6
La soglia del prompt a 200.000 token è la parte che terrei d’occhio: sposta ogni token della richiesta al livello più alto. La tabella include anche priorità e tariffa per gli strumenti.
|
Voce |
Tariffa |
|
Token di input, prompt sotto 200K |
$2,00 / milione |
|
Input in cache, prompt sotto 200K |
$0,50 / milione |
|
Token di output, prompt sotto 200K |
$6,00 / milione |
|
Input / cache / output (prompt sopra 200K) |
$4,00 / $1,00 / $12,00 |
|
Elaborazione veloce o prioritaria |
2x tariffa standard |
|
Ricerca web, ricerca su X, esecuzione di codice |
$5 ogni 1.000 chiamate |
Le tariffe degli strumenti sono separate dalle tariffe dei token. Una richiesta che cerca sul web e poi esegue codice può incorrere in entrambe le tariffe degli strumenti prima che il testo finale venga fatturato. Non esiste un grok-4.6-fast separato. L’API diretta ha un’opzione di priorità fatturata a 2x quando la risposta conferma l’uso della priorità. Cursor mostra una scelta separata “Grok 4.6 (Fast)” alla stessa tariffa 2x.

Grok 4.6 Fast selezionato in Cursor. Immagine dell’autore.
Come posso accedere a Grok 4.6?
Grok 4.6 è disponibile in prima parte tramite:
- SpaceXAI API
- Cursor
- Grok Build
- Gateway di terze parti (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI)
- Altri strumenti di coding (GitHub Copilot, VS Code, JetBrains, Xcode ed Eclipse)
Il rollout copre i piani Pro, Pro+, Max, Business ed Enterprise. Gli amministratori Business ed Enterprise devono attivare il modello perché è disattivato per impostazione predefinita. Grok 4.6 non è supportato sulla Batch API di SpaceXAI, quindi non c’è un’opzione batch scontata.
Un dettaglio enterprise è fuori dalla disponibilità del modello. Le risposte sono stateful per impostazione predefinita e SpaceXAI afferma che la cronologia viene conservata per 30 giorni. Con Zero Data Retention, i team non possono usare catene di risposte archiviate o completamenti differiti; xAI indica invece replay del ragionamento crittografato e WebSocket Responses. Ogni risposta include un header che mostra se ZDR era attivo.
La settimana del lancio di Grok 4.6: modelli, Copilot e Cursor
Ciò che mi ha colpito in quella settimana è stata la rapidità con cui i lanci di modelli e gli accordi di distribuzione si sono concentrati attorno a Grok 4.6.

La settimana di lancio di Grok 4.6, oltre i benchmark. Immagine dell’autore.
Grok Bot ha dato il tono prima del lancio del modello. L’agente cloud in beta iniziale è stato incluso con SuperGrok Heavy a $300 al mese o con Cursor Ultra a $200 al mese, invece di essere venduto separatamente, legando l’accesso a piani premium. Grok 4.6 ha poi portato lo stesso focus sugli agenti in API, Cursor e Grok Build.
Il lancio di Gemini 3.7 Flash di Google e l’anteprima Ultrafast di GPT-5.6 Sol di OpenAI hanno reso la settimana più affollata. Allo stesso tempo, il rollout di Copilot e l’ingresso di Cursor in SpaceX hanno ampliato la distribuzione di Grok. Cursor ha ricondotto il processo alla sua partnership con SpaceXAI all’inizio di quell’anno e ha inquadrato la mossa intorno all’accesso alle GPU di SpaceX piuttosto che ai punteggi dei modelli. Il post afferma che quell’accesso lo aiuterà a costruire modelli a un costo inferiore.
La mia lettura di quella settimana è che SpaceXAI vuole Grok dentro gli strumenti che le persone già usano. Grok 4.5 è stato addestrato congiuntamente con Cursor, e Grok 4.6 è entrato in Copilot quasi subito. Questo rende la distribuzione tramite partner parte del rilascio, non un ripensamento.
Quando dovresti usare Grok 4.6?
Grok 4.6 si adatta a lavori dove il prezzo API e le lunghe attività da agente contano più della latenza del primo token. È meno adatto quando i punteggi più alti di Sol al terminale o la finestra di contesto più ampia di Sonnet 5 corrispondono meglio all’attività.
Grok 4.6 è indicato quando:
- Il prezzo API è un vincolo principale. Batte Sol, Opus 5 e Fable 5 su listino e costo per attività
- Il lavoro si svolge come attività lunghe e multi-step di agenti, dove la sua efficienza nei turni (meno turni e token di input rispetto a Opus 5 su AA-Briefcase) ripaga
- Il compito è knowledge work o ragionamento legale, dove guida la tabella dei benchmark
- La latenza del primo token non conta. Una partenza lenta è rumore su una corsa lunga, ma influenza tutta l’esperienza in chat interattiva
Potrebbero esserci alternative migliori quando:
- Il lavoro è coding pesante da terminale → GPT-5.6 Sol (punteggi DeepSWE e Terminal-Bench più alti)
- L’attività richiede una grande finestra di contesto → Claude Sonnet 5 (contesto 1M, nessun sovrapprezzo per prompt lunghi)
- Vuoi la latenza più bassa per uso interattivo → Gemini 3.7 Flash
- Stai acquistando solo in base all’intelligenza di vertice → Opus 5 (63) o Fable 5 (62) guidano l’indice
Considerazioni finali su Grok 4.6
Grok 4.6 atterra in un mezzo scomodo. Sale di cinque punti nell’indice e resta sotto Sol e Opus 5 sui prezzi di listino, ma parte più lentamente e costa di più per attività misurata rispetto a Grok 4.5. "Stesso prezzo, modello migliore" manca metà del quadro.
La parte che vorrei ancora vedere è un’esecuzione di più ore in cui codebase, strumenti e istruzioni continuano a cambiare. Cursor e GitHub Copilot ora offrono quel contesto. Se i tassi di correzione e fallimento restano bassi lì, l’affermazione sull’addestramento per agenti ha prove oltre un test fisso; altrimenti, il guadagno di cinque punti resta tale.
Per chi sviluppa contro l’API xAI, il nostro tutorial sull’API Grok 4 copre il client Python e il flusso delle richieste.
Grok 4.6 Domande frequenti
Grok 4.6 sostituisce Grok 4.5?
Non ufficialmente. SpaceXAI non ha annunciato una data di ritiro per Grok 4.5, ed è ancora elencato sia nell’API sia in Cursor. Non c’è ancora una migrazione forzata a 4.6.
Posso auto-ospitare Grok 4.6?
No. Come notato sopra, non ci sono pesi open e nessun conteggio dei parametri pubblicato, quindi non c’è nulla da scaricare ed eseguire sull’hardware proprio. Ogni via di accesso, API diretta inclusa, passa attraverso l’infrastruttura di SpaceXAI o un partner che la rivende.
Come fattura GitHub Copilot Grok 4.6?
Copilot converte l’uso di Grok 4.6 in GitHub AI Credits al prezzo di listino del fornitore, con un centesimo pari a un credito. I completamenti di codice normali e i suggerimenti per la modifica successiva non sono addebitati in AI Credits. L’uso del modello in chat o attività di agenti segue le regole di utilizzo di Copilot.
Grok 4.6 è disponibile nell’UE?
Sì, ma elaborato negli Stati Uniti. Gli utenti UE possono accedere a Grok 4.6 (la base condivisa Grok 4.5 ha superato l’AI Act UE ed è stata aperta agli utenti UE a luglio, e 4.6 è distribuito in Cursor in tutta l’UE), ma non c’è residenza dei dati nell’UE. La pagina del modello di xAI elenca solo us-east-1 e us-west-2, quindi le richieste vengono elaborate negli Stati Uniti. Conferma per ciascuna superficie (console API, Cursor, gateway) prima di farci affidamento.
Grok 4.6 funziona con la data residency USA di Cursor?
Grok 4.6 è ora disponibile in Cursor (ha una propria pagina modello), ma la data residency solo-USA è una funzione Enterprise che copre solo i modelli supportati con alcune esclusioni. Quindi conferma che 4.6 sia nell’elenco attuale dei modelli supportati di Cursor prima di farci affidamento.
Sono un data engineer e community builder: lavoro su pipeline dati, cloud e strumenti di AI, e scrivo tutorial pratici e ad alto impatto per DataCamp e per sviluppatori alle prime armi.


