Vai al contenuto principale

Grok 4.6 vs GPT-5.6 Sol: benchmark, prezzi e un test pratico

Grok 4.6 e GPT-5.6 Sol ottengono lo stesso 61 sull’Artificial Analysis Intelligence Index, quindi la vera decisione riguarda la forma dei costi, la dimensione del contesto e i turni per task.
Aggiornato 27 ago 2026  · 11 min leggi

Esplora con l'AI

ChatGPTClaudePerplexity

SpaceXAI ha rilasciato Grok 4.6 il 12 agosto 2026, circa un mese dopo che OpenAI ha reso la famiglia GPT-5.6 generalmente disponibile il 9 luglio. Entrambi i lanci puntano su qualcosa di simile: agenti a lunga esecuzione che seguono un compito su molti passaggi e primi tentativi più solidi sul lavoro interattivo. Grok 4.6 è arrivato dichiarando un pareggio con GPT-5.6 Sol sull’Artificial Analysis Intelligence Index, mettendo un modello da $6 per l’output accanto a uno da $20 e chiedendoti di cogliere la differenza.

In questo articolo, confronterò Grok 4.6 e GPT-5.6 Sol su coding agentico, knowledge work a lungo orizzonte, gestione del contesto, controlli di ragionamento e prezzo, per poi sottoporli a un unico compito di build impegnativo nello stesso agente di coding. Per approfondimenti sui singoli modelli, vedi la nostra guida a Grok 4.6 e la nostra guida a GPT-5.6 Sol, Terra e Luna.

TL;DR

  • Capacità simili: entrambi segnano 61 sull’Artificial Analysis Intelligence Index e ciascuno guida circa metà dei benchmark di coding pubblicati.
  • Il prezzo è dove divergono, e non con un multiplo piatto: Sol costa 2x in input ma 3,3x in output.
  • Entrambi i modelli applicano un sovrapprezzo ai prompt lunghi, e la soglia di Grok arriva prima, a 200.000 token contro i 272.000 di Sol.
  • Nel nostro test pratico di build, entrambi i modelli hanno consegnato una simulazione corretta e stabile. Sol ci è arrivato in 3 turni; Grok ne ha richiesti 14.
  • Scegli Grok 4.6 per loop con molto ragionamento e generazione; scegli GPT-5.6 Sol per una finestra da 1.050.000 token, ingegneria pesante da terminale o il minor numero di turni per arrivare all’artifact finito.

Cos’è Grok 4.6?

Grok 4.6 è il modello di punta di SpaceXAI per coding, compiti agentici e knowledge work, rilasciato il 12 agosto 2026. Si basa su Grok 4.5 con un focus su agenti a lunga esecuzione e lavori interattivi e visivi più ambiziosi, e SpaceXAI afferma che resta su compiti complessi per molti passaggi: fare ricerca su un argomento, lavorare su un codebase o trasformare un’idea in un’app funzionante. L’addestramento ha aggiunto dati curati di ragionamento generati dal modello e reinforcement learning agentico su ottimizzazione del kernel, sviluppo web e progettazione assistita dal computer.

La parte distintiva è il posizionamento di prezzo. Grok 4.6 mantiene le tariffe di punta di Grok 4.5 di $2 e $6 per 1M di token in input e output, guadagnando al contempo 5 punti sull’Artificial Analysis Intelligence Index, che Artificial Analysis nota essere insolito al frontier, dove i guadagni di capacità di solito arrivano con un aumento di prezzo.

Per vedere il modello in azione, il nostro tutorial sull’API di Grok 4.6 ti mostra come costruire passo dopo passo un agente che usa strumenti, e il nostro tutorial Grok Build costruisce un progetto di machine learning dentro l’agente di coding, dove 4.6 è ora il modello predefinito. Abbiamo anche trattato il compagno agente di SpaceXAI nel nostro pezzo su Grok Bot.

Cos’è GPT-5.6 Sol?

GPT-5.6 Sol è l’ammiraglia della famiglia GPT-5.6 di OpenAI, generalmente disponibile dal 9 luglio 2026, insieme a Terra per il lavoro quotidiano e Luna come livello più economico. OpenAI posiziona Sol tanto sull’efficienza quanto sulla pura capacità: risultati allo stato dell’arte su coding, knowledge work, cybersecurity e scienza usando meno token. Un uso del computer più solido gli permette di ispezionare e perfezionare un risultato renderizzato, anziché solo generare il codice che ci sta dietro.

Due manopole di capacità sono nuove. L’impostazione max concede al modello più tempo rispetto a xhigh per ragionare e rivedere, e ultra coordina quattro agenti in parallelo di default, scambiando spesa in token per un punteggio migliore in meno tempo di orologio. Su Terminal-Bench 2.1, Sol Ultra arriva al 91,9% contro l’88,8% del Sol base.

Per un lavoro pratico con questo modello, il nostro tutorial su Cursor Agent Mode costruisce una REST API con GPT-5.6 Sol, e la nostra guida a ChatGPT Work esegue un flusso di lavoro end-to-end di data science su GPT-5.6. Se vuoi un confronto diverso, lo abbiamo valutato anche contro l’ammiraglia di Anthropic in Claude Opus 5 vs GPT-5.6 Sol.

Grok 4.6 vs GPT-5.6 Sol: confronto diretto

La versione breve è che questi modelli sono pari per capacità e lontani per prezzo.

Grok 4.6 e Sol pari in intelligenza a un terzo del prezzo di output

A pari merito a 61 sull’Intelligence Index, si dividono i benchmark di coding, e Sol costa 3,3x in più sull’output.

Feature Grok 4.6 GPT-5.6 Sol
Released August 12, 2026 July 9, 2026
AA Intelligence Index 61 61
Input / output per 1M tokens $2 / $6 $4 / $20
Context window 500,000 tokens 1,050,000 tokens
Long-context threshold 200,000 tokens 272,000 tokens
Rates above that threshold $4 / $12 2x input, 1.5x output
Reasoning settings Low, medium, high, xhigh None through max, plus ultra
API model ID grok-4.6 gpt-5.6-sol
Knowledge cutoff February 1, 2026 February 16, 2026

Workflow di coding e agentici

La tabella di Cursor, Grok 4.6 su high contro GPT-5.6 Sol su max, non incorona un vincitore. Grok guida CursorBench v3.2 al 69,9% contro 67,2% e GDPval-AA v2 a 1753 Elo contro 1728. Sol prende DeepSWE v1.1, 73% contro 65,9%, e Terminal-Bench v3.0, 34,6% contro 26%.

Benchmark Grok 4.6 (high) GPT-5.6 Sol (max) Notes
AA Intelligence Index 61 61 Composito di nove benchmark; pari
CursorBench v3.2 69,9% 67,2% Harness agentico di Cursor
DeepSWE v1.1 65,9% 73% Lavoro a lungo orizzonte su codebase reali
Terminal-Bench v3.0 26% 34,6% Entrambi bassi; versione diversa dai valori 2.1 di OpenAI
FrontierCode v1.1 Extended 61,3% 60,6% Entro il rumore
APEX-Agents 57,5% 56,7% Entro il rumore

Leggi questi scarti con cautela:

  • Le impostazioni di sforzo non corrispondono: Grok su high, Sol su max.
  • Le righe di terze parti sono le migliori cifre auto-riferite o pubbliche, non un unico harness.
  • Terminal-Bench v3.0 nella tabella di Cursor non è Terminal-Bench 2.1 nel post di OpenAI (88,8% per Sol). Versioni diverse.

Grok è più forte in un loop da agente in IDE. Sol è più forte su lavoro a lungo orizzonte su repository e da riga di comando.

Knowledge work agentico a lungo orizzonte

Grok 4.6 guida AA-Briefcase, la suite privata di Artificial Analysis per knowledge work a lungo orizzonte, a 1577 Elo contro i 1502 di Sol. Su Harvey LAB, una valutazione di compiti legali, i numeri pubblicati sono 15,8% contro 2,5%, un divario di 6x dove entrambi ottengono punteggi bassi in termini assoluti, quindi trattalo come un segnale, non come una differenza consolidata.

Grok segna anche il 50,7% sul braccio bancario della suite di uso strumenti di Artificial Analysis. Il suo 88,4% su Terminal-Bench v2.1 è in linea con i modelli di punta, ma quella è la v2.1, non la riga v3.0 sopra.

Finestra di contesto e lavoro su contesti lunghi

Sol mantiene all’incirca il doppio della finestra: 1.050.000 token contro i 500.000 di Grok 4.6, più un tetto di output a 128.000 token che SpaceXAI non dichiara nel testo. Sopra i 500K non c’è un equivalente Grok.

Entrambi riprezzano i prompt lunghi prima di quei tetti, e la soglia di Grok arriva prima:

  • Grok 4.6: dopo 200.000 token a 2x in input e 2x in output sull’intera richiesta.
  • GPT-5.6 Sol: dopo 272.000 token a 2x in input e 1,5x in output sull’intera richiesta.

Tra 200.000 e 272.000, le tariffe di input si incontrano a $4. Grok resta più economico in output, con un margine più piccolo di quanto implichi la coppia di titoli.

Controlli dello sforzo di ragionamento

Sol espone più manopole: da none a max, più ultra, che esegue quattro agenti in parallelo. Grok 4.6 offre low, medium, high di default e xhigh. Abbassare Sol a none su una chiamata di classificazione economica è utile. Il salto di Ultra su Terminal-Bench 2.1 da 88,8% a 91,9% è reale, ma entrambi gli estremi fatturano a una tariffa di output 3,3x quella di Grok.

Superfici di strumenti integrate

Grok 4.6 include function calling, web search, ricerca su X ed esecuzione di codice. GPT-5.6 Sol aggiunge ricerca file, generazione di immagini, code interpreter, una shell hosted, apply patch, computer use e tool search sulla Responses API.

Sol ha anche il Programmatic Tool Calling: il modello scrive ed esegue un piccolo programma che coordina gli strumenti e filtra i risultati intermedi invece di far passare ogni risposta di strumento di nuovo attraverso il modello.

Prezzi: cosa paghi davvero

Il prezzo è la differenza più chiara, e la sua forma non è un multiplo piatto.

Tariffe per token affiancate

Rate Grok 4.6 GPT-5.6 Sol
Input, per 1M token $2.00 $4.00
Output, per 1M token $6.00 $20.00
Lettura di input in cache, per 1M token $0.50 $0.40
Soglia long-context 200,000 prompt token 272,000 input token
Sopra la soglia 2x input e output 2x input, 1.5x output
Variante fast, input / output $4.00 / $12.00 Non applicabile

Sol costa 2x in input e 3,3x in output, quindi il divario si amplia con tutto ciò che il modello scrive. I token di ragionamento vengono fatturati alla tariffa di output su entrambi. Le letture in cache sono vicine ($0,50 vs $0,40), ma SpaceXAI avverte che senza un prompt_cache_key sulla Responses API, spesso paghi l’input pieno su un server con cache fredda. Puoi approfondire nel nostro tutorial sull’API di Grok 4.6.

Quanto costa un carico di lavoro reale

La formula è (volume ÷ 1M) × tariffa, sommata tra input e output, a tariffe standard.

Workload Grok 4.6 GPT-5.6 Sol Difference
Generazione pesante: 1M in / 4M out $26 $84 +$58 (223%)
Retrieval, sotto soglia: 10M in / 1M out $26 $60 +$34 (131%)
Retrieval, sopra soglia: 10M in / 1M out $52 $110 +$58 (112%)

La generazione pesante è dove incide il divario sulle tariffe di output. Le due righe di retrieval condividono 10M in / 1M out e differiscono solo per il fatto che ciascuna richiesta stia sopra entrambe le soglie: quindi il delta tra loro è il sovrapprezzo. Il conto di Grok raddoppia da $26 a $52 su quella riga. Sol va da $60 a $110. Il premio relativo si restringe dal 131% al 112% anche se il divario in dollari cresce. Nessun vendor ha pubblicato conteggi di token per un carico condiviso, quindi tratta questi totali come un confronto di tariffe, non come una fattura.

Come si sono comportati Grok 4.6 e GPT-5.6 Sol

Abbiamo eseguito un compito di build impegnativo contro entrambi i modelli nello stesso agente di coding.

Il test

Abbiamo testato entrambi i modelli per creare una simulazione fisica in un singolo file, perché entrambi i vendor dichiarano prestazioni elevate nel lavoro interattivo e visivo. Stesso prompt, identico a livello di byte, incollato in una chat nuova in uno spazio di lavoro vuoto. Un tentativo ciascuno, niente retry, nessuna guida a metà corsa.

Build a single-file HTML page (inline CSS and JS, canvas, no build step, no external libraries, no network) that simulates a few dozen balls of varying sizes bouncing inside a slowly rotating square container, under gravity. The balls should collide with each other and with the container walls, and lose a little energy on each collision so the system settles rather than gaining energy over time. The container keeps rotating throughout, so the balls should slosh and re-pile as it turns.

Ship it as one working file named index.html that starts animating on load. Do not ask me clarifying questions, make reasonable assumptions and note them briefly in a comment at the top of the file.

Entrambi sono stati eseguiti dentro Cursor il 25 agosto 2026: Grok 4.6 su high reasoning, GPT-5.6 Sol su high reasoning. Il risultato li descrive come agenti, non come modelli nudi. La rete è stata negata a entrambi.

Cosa ha prodotto Grok 4.6

Grok ha consegnato un index.html funzionante che ha passato l’eseguibilità: file singolo, animazione all’avvio, nessun errore non intercettato in console, ancora in esecuzione dopo 30 secondi. Il contenimento ha retto mentre la scatola ruotava, le collisioni tra sfere sembravano plausibili e il sistema perdeva energia e si stabilizzava invece di accelerare.

Ci sono voluti 14 turni dell’assistente, con diversi cicli di autocorrezione. Ha anche chiesto l’accesso al browser per verificare il proprio lavoro, che abbiamo rifiutato secondo la regola del test.

Cosa ha prodotto GPT-5.6 Sol

Sol ha passato anch’esso l’eseguibilità e ha ottenuto lo stesso 5 sulla correttezza fisica e 5 sulla stabilità. Il suo contenitore ruota più lentamente di quello di Grok, il che rende più facile seguire il moto di rimescolamento e i nuovi accumuli, ed è questo l’unico asse su cui è passato avanti in qualità visiva.

Ha raggiunto quel risultato in 3 turni ed è stato in generale molto più veloce di Grok.

Risultati

I punteggi vanno da 1 a 5 per asse, valutati osservando ciascuna simulazione per 30 secondi contro un rubric scritto prima dell’esecuzione.

Measure Grok 4.6 (high) GPT-5.6 Sol (high)
Turns 14 3
Runnability Pass Pass
Physics correctness 5 5
Stability over time 5 5
Visual quality 4 5
Overall 3.5 5

Sull’artifact, è quasi un pareggio: entrambi hanno azzeccato la fisica e sono rimasti stabili. La separazione è nello sforzo. Sol è arrivato allo stesso risultato in 3 turni contro i 14 di Grok, ed è ciò che abbassa il voto complessivo di Grok a 3,5.

Ma ricorda: questo è n=1 su una build visiva, quindi leggilo come un singolo dato, non come un benchmark, e non dice nulla su codebase ampi o lunghe catene di retrieval.

Quando scegliere Grok 4.6 vs GPT-5.6 Sol

Dato che la capacità è vicina, la decisione si riduce alla forma del carico di lavoro, alla dimensione del contesto e a quanto ti importa dei turni rispetto al costo per token. Scegli Grok quando l’output è abbastanza economico da dominare il conto. Scegli Sol quando ti serve la finestra più grande o meno turni.

Scegli Grok per output economico, Sol per contesto grande e meno turni

Scegli Grok 4.6 se...

  • Il tuo workload scrive molto. A $6 per 1M di token in output contro i $20 di Sol, un mese ricco di generazione costa $26 invece di $84, e i token di ragionamento sono fatturati alla stessa tariffa di output.
  • I tuoi prompt restano sotto i 200.000 token. È lì che le tariffe da $2 e $6 di Grok si applicano per intero.
  • Il tuo lavoro da agente avviene dentro un IDE. Grok guida CursorBench v3.2 al 69,9% ed è il modello predefinito in Grok Build.
  • Conti più il costo per token del numero di turni.

Scegli GPT-5.6 Sol se...

  • Ti servono più di 500K token di contesto. La finestra da 1.050.000 token di Sol non ha equivalenti in Grok 4.6.
  • I tuoi agenti lavorano a lungo orizzonte su repository reali. Il 73% di Sol su DeepSWE v1.1 contro il 65,9% di Grok è il divario di coding più ampio in entrambe le direzioni.
  • I turni contano più del prezzo per token. Sol ha finito la nostra build di fisica in 3 turni contro i 14 di Grok.
  • Vuoi un controllo più fine dello sforzo. Sol va da none a max e aggiunge ultra.

Come iniziare con Grok 4.6 e GPT-5.6 Sol

Entrambi i modelli sono uno swap di stringa se già chiami un endpoint compatibile con OpenAI. Le stringhe sono grok-4.6 e gpt-5.6-sol. OpenAI inoltra anche l’alias gpt-5.6 a Sol.

Surface Grok 4.6 GPT-5.6 Sol
First-party API xAI API OpenAI API
Consumer app App Grok e Grok.com ChatGPT
Agenti di coding Grok Build (modello predefinito), Cursor (tutti i piani) Codex, Cursor
Gateway di modelli OpenRouter, Vercel, Cloudflare OpenRouter, Vercel, Cloudflare
ID modello API grok-4.6 gpt-5.6-sol

Usare Grok 4.6 e GPT-5.6 Sol in un agente di coding

In Cursor, entrambi i modelli sono nel selettore, ed è così che abbiamo eseguito il test di build. Il passaggio è una modifica nel selettore, non una riscrittura della config.

Tramite API, lo swap è una stringa. xAI fornisce un endpoint compatibile con OpenAI:

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["XAI_API_KEY"],
    base_url="https://api.x.ai/v1",  # drop this line for gpt-5.6-sol
)
response = client.responses.create(
    model="grok-4.6",  # swap for "gpt-5.6-sol"
    input="Find and fix the bug: function median(a){a.sort();return a[a.length/2]}",
)
print(response.output_text)

Per la configurazione completa, vedi il nostro tutorial sull’API di Grok 4.6, il nostro tutorial su Cursor Agent Mode e il nostro tutorial Grok Build.

Pensieri finali

Se il tuo conto è dominato da output e token di ragionamento, usa Grok 4.6. Un pareggio sull’Intelligence Index a meno di un terzo del prezzo di output è la scelta più semplice qui. Se ti serve una finestra da un milione di token o lavoro a lungo orizzonte su repository, usa GPT-5.6 Sol e accetta il premium. Controlla da che lato della soglia di 200.000 token di Grok cadono i tuoi prompt prima di cambiare.

Nel nostro test, le affermazioni di rilascio hanno retto: entrambi i modelli hanno superato con buoni risultati. Detto ciò, Sol è stato molto più veloce di Grok e ha richiesto solo circa il 20% dei turni di Grok, mostrando un divario significativo. Se vuoi imparare a usare bene questi modelli dentro un agente invece di leggerne, ti consiglio il nostro corso Software Development with Cursor.

Grok 4.6 vs GPT-5.6 Sol: FAQ

Grok 4.6 è migliore di GPT-5.6 Sol?

Nessuno dei due vince in modo netto. Sono pari a 61 sull’Artificial Analysis Intelligence Index, e ciascuno guida circa metà dei benchmark di coding pubblicati: Grok 4.6 prende CursorBench v3.2 (69,9% vs 67,2%) mentre GPT-5.6 Sol prende DeepSWE v1.1 (73% vs 65,9%) e Terminal-Bench v3.0 (34,6% vs 26%). Nel nostro test di build fisica in singolo file, entrambi hanno prodotto una simulazione corretta e stabile. La differenza è stata lo sforzo: Sol ha finito in 3 turni, Grok ne ha richiesti 14.

Quanto costano Grok 4.6 e GPT-5.6 Sol?

Grok 4.6 costa $2 per 1M di token in input e $6 per 1M di token in output. GPT-5.6 Sol costa $4 in input e $20 in output. Le letture di input in cache sono $0,50 per Grok e $0,40 per Sol. Il multiplo non è uniforme: Sol è 2x in input ma 3,3x in output, quindi il divario si allarga con tutto ciò che il modello scrive. Entrambi riprezzano anche i prompt lunghi, Grok da 200.000 token (a $4 in input e $12 in output) e Sol sopra 272.000 token di input (2x input, 1,5x output), applicati all’intera richiesta in entrambi i casi.

Quali sono gli ID modello API per Grok 4.6 e GPT-5.6 Sol?

Le stringhe sono grok-4.6 per SpaceXAI e gpt-5.6-sol per OpenAI. OpenAI inoltra anche l’alias gpt-5.6 a Sol. Poiché l’API di xAI è compatibile con OpenAI, passare da uno all’altro è una modifica di una sola stringa più lo swap della base URL a https://api.x.ai/v1.

Chi ha una finestra di contesto più grande, Grok 4.6 o GPT-5.6 Sol?

GPT-5.6 Sol gestisce 1.050.000 token contro i 500.000 di Grok 4.6, con un tetto di output a 128.000 token, mentre SpaceXAI non pubblica un limite di output testuale. Entrambi i modelli fanno pagare di più per i prompt lunghi, e la soglia di Grok arriva prima a 200.000 token contro i 272.000 di Sol. Tra queste due cifre, Grok è sovrapprezzato mentre Sol no, il che allinea la tariffa di input a $4 per 1M.

Come posso accedere a Grok 4.6 e GPT-5.6 Sol?

Accedi a Grok 4.6 tramite l’API xAI o Grok Build, e a GPT‑5.6 Sol tramite l’API OpenAI o Codex. Entrambi sono accessibili anche tramite Cursor e OpenRouter, o tramite gateway AI come Vercel o Cloudflare.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Tom è un data scientist e formatore tecnico. Scrive e gestisce i tutorial e i post del blog di DataCamp su data science. In precedenza, Tom ha lavorato nella data science presso Deutsche Telekom.

Argomenti

Impara l’AI con DataCamp!

Programma

Nozioni di base sull'intelligenza artificiale

10 h
Scopri le basi dell'intelligenza artificiale, impara a usarla al meglio per il lavoro e immergiti in modelli come ChatGPT per orientarti nel mondo dinamico dell'IA.
Vedi dettagliRight Arrow
Inizia Il Corso
Mostra altroRight Arrow
Correlato

blog

Tokenizzazione nel NLP: come funziona, sfide e casi d'uso

Guida al preprocessing NLP nel machine learning. Copriamo spaCy, i transformer di Hugging Face e come funziona la tokenizzazione in casi d'uso reali.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

I 15 migliori server MCP remoti che ogni AI builder dovrebbe conoscere nel 2026

Scopri i 15 migliori server MCP remoti che stanno trasformando lo sviluppo AI nel 2026. Scopri come migliorano automazione, ragionamento, sicurezza e velocità dei workflow.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Che cos'è Snowflake? Guida per principianti alla piattaforma dati cloud

Esplora le basi di Snowflake, la piattaforma dati cloud. Scopri la sua architettura, le sue funzionalità e come integrarla nelle tue pipeline di dati.
Tim Lu's photo

Tim Lu

12 min

Mostra AltroMostra Altro