Programma
Usa Claude Opus 5 quando decide la qualità: guida su Elo per lavoro di conoscenza (1.861 vs 1.753 su GDPval-AA v2), sull'AA Index (63 vs 61) e su righe di coding pubblicate come DeepSWE v1.1 (68,8% vs 65,9%).
Il 12 agosto 2026, SpaceXAI ha rilasciato Grok 4.6 con un focus su agenti di lunga durata e lavori interattivi e visivi più ambiziosi. Eguaglia GPT-5.6 Sol sull'Artificial Analysis Intelligence Index e ha un listino di $2 per milione di token in input e $6 per milione di token in output. Claude Opus 5 era già il modello di punta per l'uso quotidiano di Anthropic: predefinito su Claude Max, il modello più potente su Claude Pro, e a metà del prezzo di Claude Fable 5 a $5 / $25 per milione di token.
In questo articolo metterò a confronto Grok 4.6 e Claude Opus 5 su coding, lavoro di conoscenza, progetti visivi e prezzo. Per approfondimenti su ogni modello, vedi la nostra guida a Grok 4.6 e la nostra guida a Claude Opus 5.
Grok 4.6 è il modello di frontiera di SpaceXAI di agosto 2026, costruito su Grok 4.5 per agenti di lunga durata e lavori interattivi e visivi più ambiziosi. L'ID del modello API è grok-4.6. La finestra di contesto è di 500.000 token, con tariffa 2x una volta che il prompt supera i 200.000 token.
La descrizione di xAI enfatizza i primi passaggi su progetti visivi e interattivi, oltre a più auto-verifica su traiettorie lunghe. Artificial Analysis gli attribuisce 61 sull'Intelligence Index, in linea con GPT-5.6 Sol e dietro Claude Opus 5 (max, 63). È disponibile in Cursor e Grok Build, e sulle API di SpaceXAI oltre che su OpenRouter, Vercel e Cloudflare.
Per chiamarlo direttamente, segui il nostro tutorial sull'API di Grok 4.6. Se ti interessa più il wrapper dell'agente che la scheda del modello, abbiamo anche fatto girare Grok Build contro Claude Code su un dataset di churn truccato. Lo abbiamo anche confrontato con l'attuale modello di punta di OpenAI nella nostra guida Grok 4.6 vs GPT-5.6 Sol.
Claude Opus 5 è l'attuale modello di classe Opus di Anthropic, venduto come un affidabile daily driver che si avvicina a Claude Fable 5 a metà prezzo. L'ID del modello API è claude-opus-5. È il predefinito su Claude Max e il modello più forte su Claude Pro, allo stesso $5 / $25 per milione di token di Opus 4.8.
Anthropic riporta numeri all'avanguardia su Frontier-Bench v0.1 (43,3%) e GDPval-AA v2 (1.861 Elo), pur restando dietro Mythos 5 nello sfruttamento della cybersecurity. La modalità Fast gira a circa 2,5x la velocità predefinita per il doppio del prezzo base. Gli sviluppatori partono dalla Claude API; è elencato anche nei cataloghi cloud su Amazon Bedrock, Google Vertex AI e Azure AI Foundry.
Approfondiamo il lancio nella nostra guida a Claude Opus 5 e il percorso di richiesta nel nostro tutorial sull'API di Opus 5. Se stai scegliendo all'interno dello stack di Anthropic, vedi i nostri confronti su Opus 5 vs Fable 5 e Opus 5 vs Sonnet 5.

Sui compositi pubblicati da entrambi i laboratori, Opus 5 è leggermente avanti: 63 contro 61 sull'Artificial Analysis Intelligence Index, e 1861 contro 1753 Elo su GDPval-AA v2. Il listino non è paragonabile: Grok 4.6 costa $2/$6 per 1M token contro Opus 5 a $5/$25.
| Caratteristica | Grok 4.6 | Claude Opus 5 |
|---|---|---|
| AA Intelligence Index | 61 | 63 (max) |
| GDPval-AA v2 (Elo) | 1753 | 1861 |
| API input / output per 1M | $2 / $6 | $5 / $25 |
| Finestra di contesto | 500k | 1M |
| Sovrapprezzo long-context | 2x a ≥200k token nel prompt | Nessuno pubblicato |
| ID modello API | grok-4.6 |
claude-opus-5 |
Opus 5 guida le righe di coding pubblicate che entrambi condividono. In particolare, su DeepSWE v1.1, Opus 5 è al 68,8% contro il 65,9% di Cursor per Grok 4.6 High.
Un altro segnale è il risultato del nostro run Grok Build vs Claude Code: Grok 4.6 high contro Claude Opus 5 high, una conversazione ciascuno, su una tabella di churn con leak inseriti ad arte. Grok Build ha fornito meno risposte, ma più immediatamente utilizzabili. Claude Code è andato più a fondo, ma ha anche consegnato un bug nel formato del cruscotto.
Se già paghi i prezzi Anthropic per lavoro su repository, Opus 5 è la scelta pubblicata più sicura. Se vuoi un modello di coding di frontiera che non costi come tale, Grok 4.6 è la scelta su Cursor che lascerei davvero attiva.
Opus 5 guida sul lavoro di conoscenza: GDPval-AA v2 è 1861 per Opus 5 e 1753 per Grok 4.6. Artificial Analysis colloca comunque Grok dietro solo a Opus 5 in quell'area, con barre d'errore sovrapposte rispetto a Fable 5 e Qwen3.8 Max.
Il divario di efficienza è più ampio. Su AA-Briefcase, Grok 4.6 segna 1577, dietro alla famiglia Opus 5, ma conclude in circa 53 turni e ~0,5B token di input. Opus 5 (max) impiega circa 103 turni e ~2,0B token di input. Morale: Opus 5 vince il tabellone, mentre Grok 4.6 vince il budget di token.
Il punto di forza di SpaceXAI per Grok 4.6 è un primo passaggio più solido su progetti visivi e interattivi. Il lancio di Opus 5 di Anthropic è più cauto su questo fronte e più forte sulla verifica, oltre a "output visivi molto più forti" senza un numero pubblico contro Grok.
Per questo abbiamo eseguito un compito condiviso sullo shader. Entrambi i modelli hanno scritto vero GLSL, ma il risultato di Opus 5 ha rispettato il brief un po' meglio ed è stato più reattivo al movimento del cursore. Anche il risultato di Grok 4.6 aveva un bell'aspetto e lo ha fatto in meno turni.

Il prezzo di listino è il divario più netto in questo confronto. Grok 4.6 costa $2 in input e $6 in output per 1M token, mentre Opus 5 costa $5 e $25. Questo rende il modello Anthropic 2,5 volte più caro in input e oltre 4 volte in output, che è ovviamente una grossa differenza. Per esempio, un mese pesante in generazione a 1M in / 4M out è $26 su Grok 4.6 e $105 su Opus 5. Un assistente più bilanciato a 1M in / 250K out è $3,50 contro $11,25.
Queste sono le tariffe standard pubblicate, più gli extra che esistono per entrambi i modelli.
| Tariffa | Grok 4.6 | Claude Opus 5 |
|---|---|---|
| Input, per 1M token | $2.00 | $5.00 |
| Output, per 1M token | $6.00 | $25.00 |
| Lettura cache, per 1M token | $0.50 | $0.50 |
| Scrittura cache, per 1M token | $1.00 (≥200k riga) | $6.25 (5 minuti) / $10 (1 ora) |
| Variante Fast | $4 / $12 (2x) | $10 / $50 (2x; ~2,5x velocità) |
| Sovrapprezzo long-context | 2x a ≥200k token nel prompt ($4 / $1 / $12) | Nessuno pubblicato |
Il premio sull'output è quello che pesa. La modalità Fast è un overlay 2x su entrambe, non una terza forma. Opus 5 pubblica anche uno sconto batch del 50% ($2,50 / $12,50), che Grok 4.6 al momento non offre.
Formula una volta: (volume ÷ 1M) × tariffa, sommata tra input e output, a tariffe standard tranne la riga oltre-soglia, che usa il sovrapprezzo 2x di Grok. Numeri arrotondati al centesimo sotto i $10, altrimenti al dollaro più vicino.
| Carico | Grok 4.6 | Claude Opus 5 | Differenza |
|---|---|---|---|
| Assistente bilanciato: 1M in / 250K out | $3.50 | $11.25 | Opus 5 +$7.75 (221%) |
| Generazione pesante: 1M in / 4M out | $26 | $105 | Opus 5 +$79 (304%) |
| Retrieval, sotto soglia: 10M in / 1M out | $26 | $75 | Opus 5 +$49 (188%) |
| Retrieval, oltre soglia: 10M in / 1M out | $52 | $75 | Opus 5 +$23 (44%) |
Il retrieval sotto i 200k è una storia di tariffe di input ($26 vs $75). Detto ciò, il sovrapprezzo a 200k di Grok conta: se lo superi, lo stesso aggregato 10M / 1M diventa solo $52 vs $75. Il sovrapprezzo riduce il divario, ma non rende Opus 5 più economico.
I grafici dei vendor non ti diranno se un modello sa disegnare la scena che hai descritto. Abbiamo eseguito un compito di coding-agent condiviso dalla nostra batteria di test, poi raccolto le pagine.
Li abbiamo testati su quanto bene sanno creare una grafica shader a finestra intera che mostra un'aurora su un orizzonte montano, ospitata in p5.js, con mouse e tempo passati come uniform. Il test è ispirato ai prompt sugli shader di Ethan Mollick. Lo abbiamo tematizzato per rendere i risultati più confrontabili. Entrambi i modelli sono stati eseguiti una volta, senza retry, dentro Cursor con strumenti identici. Entrambi i modelli hanno usato la variante high reasoning.
Prompt verbatim:
Using p5.js (loaded from a CDN — that is the only external dependency allowed), build a single-file HTML page with a full-window animated shader. The scene: an aurora borealis rippling in curtains over a dark, silhouetted mountain horizon under a star-filled night sky. The aurora should react to the mouse — the curtains brighten and bend toward the cursor as it moves. Write the visual effect as a GLSL fragment shader; use p5 only to host the canvas, run the animation loop, and pass the mouse position and time into the shader as uniforms.
Ship it as one working file named index.html that starts animating on load. Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.
Grok 4.6 ha consegnato un index.html funzionante in 13 turni. L'effetto è un vero fragment shader GLSL con p5 che ospita solo la canvas. Le cortine si muovono in modo aurora-like, con una suddivisione in tre colori che sembra più gradevole del foglio perlopiù verde di Opus 5, più stelle lampeggianti sullo sfondo.
La pecca è il paesaggio. Le montagne si leggono come una silhouette da cartone, motivo per cui la corrispondenza estetica è 4 invece di 5. L'interattività con il cursore è mediocre: come si vede nel video sotto, la grafica è molto reattiva sull'asse x, ma poco su quello y.
Opus 5 ha passato anch'esso il test, sempre in vero GLSL. La corrispondenza estetica è azzeccata: tre catene montuose in diverse tonalità di grigio, cortine che si leggono come un'aurora, stelle lampeggianti. Il colore è perlopiù verde, che è il colore più comune delle aurore. Quindi è più corretto, anche se i tre colori di Grok a mio avviso sono più gradevoli. L'interattività del cursore è migliore rispetto allo shader di Grok, con le cortine che si piegano e si illuminano su entrambi gli assi.
Opus ha impiegato molti più turni di Grok, 46 in totale. Detto questo, 19 erano legati a richieste di permesso per eseguire comandi di verifica (non consentiti dalle regole del test), quindi solo 27 sono rilevanti per la pura creazione dello shader. Resta il fatto che Grok ha impiegato solo la metà dei turni di Opus.
| Misura | Grok 4.6 high | Claude Opus 5 high |
|---|---|---|
| Turni | 13 | 27 |
| Eseguibilità | pass | pass |
| Corrispondenza estetica | 4 | 5 |
| Competenza shader | 5 | 5 |
| Interattività con il cursore | 3 | 5 |
| Seguito della tecnica | 5 | 5 |
Opus 5 è più vicino al brief: montagne a strati e risposta del mouse su entrambi gli assi. Le cortine di Grok 4.6 sono più colorate e hanno comunque passato il test, ma le montagne sono troppo semplificate e il cursore guida soprattutto l'asse x.
Questo è n=1, non è un dato di token o costo, e sonda solo shader di scene descritte con GLSL reattivo al cursore, non coding su repository o lavoro di conoscenza.

Se decide il tabellone, Opus 5. Se decide la fattura, Grok 4.6 è il modello di frontiera che lascerei davvero attivo.
Scegli Grok 4.6 se...
Entrambi i modelli sono raggiungibili in vari modi. Le stringhe modello da usare sono grok-4.6 e claude-opus-5.
| Superficie | Grok 4.6 | Claude Opus 5 |
|---|---|---|
| App consumer | Grok Build; Cursor (desktop, web, iOS, CLI) | Claude Pro; predefinito su Claude Max |
| API first-party | Sì (SpaceXAI API) | Sì (Claude API) |
| Piattaforme cloud | Amazon Bedrock, Google Vertex AI, Azure AI Foundry | Amazon Bedrock, Google Vertex AI, Azure AI Foundry |
| Agenti di coding | Cursor, Grok Build | Claude Code, Cursor |
| Router di terze parti | OpenRouter, Vercel, Cloudflare | OpenRouter, Vercel, Cloudflare |
| ID modello API | grok-4.6 |
claude-opus-5 |
In Cursor, entrambi sono voci del selettore. Claude Code è nativo Anthropic; Grok Build legge un tree .claude/, che Claude Code non ricambierà per file .grok/. L'API è solo una sostituzione di stringa all'interno di ciascun SDK del vendor.
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-opus-5", # Grok 4.6 is grok-4.6 on the SpaceXAI SDK, not this client
max_tokens=1024,
messages=[{"role": "user", "content": "Refactor this function to reject leaked labels."}],
)
print(response.content[0].text)
La configurazione completa per ciascuna API è nelle nostre guide tutorial sull'API di Grok 4.6 e tutorial sull'API di Claude Opus 5. Se vuoi il prodotto agente più che l'ID del modello, inizia con Claude Code 101.
Se il lavoro è una scena visiva descritta o un agente per lavoro di conoscenza che valuterai sull'Elo, usa Claude Opus 5. Se il lavoro è un agente di coding di frontiera che valuterai anche sulla fattura, usa Grok 4.6.
Colpisce quanto poco decidano i benchmark. Due punti sull'AA Index, o cento Elo su GDPval-AA, sono un divario più stretto rispetto a quello del listino: $105 contro $26 per lo stesso mese pesante in generazione. I modelli sono vicini; le fatture no.
Se vuoi i concetti dietro questi agenti, ti consiglio lo skill track AI Fundamentals. Per il workflow nativo Claude, Claude Code 101 è il punto di partenza pratico.
Usa Grok 4.6 quando il vincolo è il costo dell'API. Costa $2/$6 per 1M token contro Opus 5 a $5/$25, quindi un mese pesante in generazione è $26 contro $105. Ha anche completato il nostro shader dell'aurora in metà dei turni di Opus con un buon risultato, e Artificial Analysis riporta meno turni e token di input rispetto a Opus 5 max su AA-Briefcase.
Usa Claude Opus 5 quando decide la qualità: guida su Elo per lavoro di conoscenza (1.861 vs 1.753 su GDPval-AA v2), sull'AA Index (63 vs 61) e su righe di coding pubblicate come DeepSWE v1.1 (68,8% vs 65,9%).
Grok 4.6 costa $2 in input e $6 in output per 1M token. Claude Opus 5 costa $5 e $25, lo stesso di Opus 4.8. Grok 4.6 applica un sovrapprezzo 2x ai prompt a 200k token o oltre; Opus 5 non pubblica un sovrapprezzo long-context. Le letture in cache sono $0,50 / 1M per entrambi alle tariffe standard.
Grok 4.6 è grok-4.6 sulla SpaceXAI API. Claude Opus 5 è claude-opus-5 sulla Claude API. Non sono intercambiabili tra SDK; ciascun ID appartiene al proprio client.
Sì, se il selettore degli agenti espone entrambi. Cursor elenca Grok 4.6 e Claude Opus 5 come modelli selezionabili, e la maggior parte dei soliti router e cataloghi cloud ospita entrambi, quindi raramente è il selettore il vincolo. L'asimmetria è negli agenti first-party: Claude Code è nativo Anthropic e non esegue Grok, mentre Grok Build legge un .claude/ tree, quindi la configurazione in stile Claude passa in quella direzione ma non al contrario.
Tom è un data scientist e formatore tecnico. Scrive e gestisce i tutorial e i post del blog di DataCamp su data science. In precedenza, Tom ha lavorato nella data science presso Deutsche Telekom.
Impara l'AI con DataCamp!
Programma
Corso
Corso

blog
Abid Ali Awan
15 min

blog
Abid Ali Awan
10 min
blog
Tim Lu
12 min