Programma
Se stai scegliendo il modello di fascia media da mettere dietro a un agente che gira tutto il giorno, i due candidati ovvi adesso sono GPT-5.6 Terra e Claude Sonnet 5. Entrambi sono il modello predefinito offerto gratuitamente dai rispettivi vendor, entrambi forniscono una finestra di contesto di circa 1M di token, ed entrambi si collocano entro un dollaro di differenza sui token in input.
In questo articolo confronterò GPT-5.6 Terra e Claude Sonnet 5 su agenti di coding e terminale, lavoro cognitivo, postura di cybersecurity, comportamento su contesti lunghi, superficie di controllo dell'API e prezzi, così potrai scegliere quello più adatto al tuo carico di lavoro. Per un approfondimento su ciascun modello, vedi le nostre guide alla famiglia GPT-5.6 e a Claude Sonnet 5.
TL;DR
- Terra è la scelta più solida per agenti di coding guidati dal terminale e pipeline con molti strumenti, dove le sue funzioni di efficienza sui token fanno la differenza.
- Sonnet 5 è la scelta più tranquilla per contesti lunghi e lavoro su documenti, perché le sue tariffe restano piatte su tutta la finestra.
- Scegli GPT-5.6 Terra se i tuoi agenti vivono in una shell, chiamano molti tool per turno o vuoi token di output più economici dopo agosto.
- Scegli Claude Sonnet 5 se invii prompt molto grandi, vuoi una fatturazione per token prevedibile o desideri deliberatamente un modello che rifiuta il lavoro di exploit.
Che cos'è GPT-5.6 Terra?
GPT-5.6 Terra è il livello intermedio della famiglia GPT-5.6 di OpenAI, arrivata alla disponibilità generale il 9 luglio 2026 insieme al top di gamma Sol e al livello più economico, Luna. OpenAI descrive Terra come l'opzione bilanciata per il lavoro di tutti i giorni e segnala che corrisponde all'incirca al livello "mini" delle precedenti famiglie GPT-5. Fornisce una finestra di contesto di 1.050.000 token, un tetto di output di 128.000 token e un cutoff di conoscenza al 16 febbraio 2026.
Due cose rendono Terra interessante e non solo economico. Eredita il Programmatic Tool Calling dalla Responses API, che consente al modello di scrivere ed eseguire piccoli programmi in memoria per coordinare gli strumenti, invece di far rimbalzare ogni risposta dello strumento attraverso il modello. E il 30 luglio 2026 OpenAI ha tagliato il prezzo di Terra del 20%, passando da $2,50/$15 al lancio a $2,00/$12 per 1M di token.
Abbiamo trattato l'intera famiglia nella nostra guida a GPT-5.6 Sol, Terra e Luna, e se vuoi vedere per cosa viene usato il livello di punta, il nostro articolo su come GPT-5.6 Sol ha aiutato a confutare la congettura di Maxwell è una buona lettura. C'è anche un confronto tra modelli di punta nella nostra comparativa Claude Opus 5 vs GPT-5.6 Sol.
Che cos'è Claude Sonnet 5?
Claude Sonnet 5 è il modello di fascia media di Anthropic, rilasciato il 30 giugno 2026, presentato come il Sonnet più agentico mai distribuito dall'azienda. Anthropic sostiene che pianifica, guida browser e terminali e funziona in modo autonomo a un livello che in precedenza richiedeva modelli di classe Opus, avvicinandosi a Opus 4.8 su ragionamento, uso di strumenti, coding e lavoro cognitivo a un prezzo inferiore.
È il modello predefinito sui piani Free e Pro, e arriva con una serie di vincoli deliberati: temperature, top_p e top_k sono stati rimossi, il thinking esteso manuale restituisce un errore 400 e il thinking adattivo è attivo per impostazione predefinita. Usa anche un nuovo tokenizer che produce circa il 30% di token in più per lo stesso testo rispetto a Sonnet 4.6, che Anthropic ha compensato con prezzi introduttivi fino al 31 agosto 2026.
Abbiamo analizzato i numeri del lancio nella nostra guida a Claude Sonnet 5 e lo abbiamo confrontato verso l'alto con il top di gamma di Anthropic in Claude Opus 5 vs Claude Sonnet 5.
GPT-5.6 Terra vs Claude Sonnet 5: confronto diretto
Ecco la fisionomia dei due modelli affiancati, prima di entrare nelle singole aree di capacità.
| Caratteristica | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|
| Vendor e rilascio | OpenAI, disponibilità generale 9 luglio 2026 | Anthropic, 30 giugno 2026 |
| Posizionamento | Fascia media | Fascia media |
| Finestra di contesto | 1.050.000 token | 1M di token |
| Output massimo | 128K token | 128K token |
| Prezzo per 1M di token | $2,00 in / $12,00 out | $3,00 in / $15,00 out ($2,00/$10,00 fino al 31 ago 2026) |
| Sovrapprezzo per contesti lunghi | 2x input, 1,5x output oltre 272K token di input | Nessuno pubblicato; piatto fino a 1M |
| Funzione distintiva | Programmatic Tool Calling nella Responses API | Thinking adattivo con livelli di impegno selezionabili |
| Postura cyber | Addestrato per il cyber; capacità difensive dietro Trusted Access | Non addestrato per il cyber; salvaguardie attive per default |
| Livello gratuito | Predefinito per utenti Free e Go in ChatGPT Work e Codex | Predefinito per i piani Free e Pro |
| ID modello API | gpt-5.6-terra |
claude-sonnet-5 |
Agenti di coding e terminale
Di solito, la divisione pende verso Anthropic per la programmazione in un repository e verso OpenAI per il lavoro da terminale.
Quest'ultima divisione rimane: su Terminal-Bench 2.1, Terra raggiunge l'87,4%, contro l'80,4% di Sonnet 5 nei materiali di lancio di Anthropic, un divario di 7 punti sui flussi di lavoro da riga di comando. Da notare che Terra supera anche Claude Opus 4.8 (78,9%) e Claude Fable 5 (83,1%) nella run dello stesso eval da parte di OpenAI.
Ma al momento, entrambi i modelli di fascia media concorrenti sono alla pari per il coding su repo. Su SWE-Bench Pro, che esegue fix multi-step su repository reali, OpenAI riporta Terra al 63,4% e Anthropic riporta Sonnet 5 al 63,2%.
| Benchmark | GPT-5.6 Terra | Claude Sonnet 5 | Note |
|---|---|---|---|
| SWE-Bench Pro | 63,4% | 63,2% | Dichiarati dai vendor su harness separati; di fatto pari |
| Terminal-Bench 2.1 | 87,4% | 80,4% | Dichiarati dal vendor; il maggior vantaggio pubblicato di Terra nel coding |
| Artificial Analysis Coding Agent Index v1.1 | 77,4 | Non pubblicato | Indice indipendente; Terra sopra Fable 5 a 77,2 |
La stessa narrazione di Anthropic supporta questa divisione. La storia di Sonnet 5 sul coding riguarda la capacità di portare a termine i compiti più che il punteggio massimo: i primi tester hanno descritto che finiva attività dove Sonnet 4.6 si fermava e controllava il proprio output senza essere richiesto.
Se il tuo agente vive in una shell, Terra ha il vantaggio. Se vive dentro una codebase a ragionare su un errore, i benchmark dicono che stai scegliendo tra due modelli della stessa classe.

Lavoro cognitivo e attività professionali
Entrambi i vendor riportano il GDPval-AA v2, una misura in stile Elo della qualità dell'output professionale, e i numeri sono abbastanza vicini da equivalersi. OpenAI colloca Terra a 1.593 Elo; Anthropic colloca Sonnet 5 a 1618. OpenAI valuta Claude Opus 4.8 a 1600 Elo su questo eval, mentre Anthropic valuta lo stesso modello a 1615, quindi un divario di 25 punti tra Terra e Sonnet 5 rientra nel rumore metodologico.
Dove Terra ha un claim non contestato è Agents' Last Exam, una valutazione di flussi di lavoro professionali di lunga durata in 55 campi. Terra segna il 50,4%, davanti a GPT-5.5 (46,9%), Claude Opus 4.8 (45,2%) e Claude Fable 5 (40,5%). Anthropic non ha riportato Sonnet 5 su quell'eval, quindi trattalo come terreno scelto da OpenAI, non come un verdetto.
L'uso del computer è l'unica area in cui sconsiglio del tutto un confronto diretto. OpenAI riporta Terra al 50,2% su OSWorld 2.0, mentre Anthropic riporta Sonnet 5 all'81,2% su OSWorld-Verified. Sono set di valutazione diversi con punteggi diversi, e Anthropic ha esplicitamente rivisto come esegue OSWorld-Verified per questo rilascio, quindi mettere fianco a fianco le due cifre non dice nulla.
Il vantaggio pratico di Terra in quest'area è il conteggio dei token. Notion ha riportato che molti agenti che eseguono GPT-5.5 rendono altrettanto bene su Terra a metà costo e con il 16% di token in meno, e Clio ha riportato che il Programmatic Tool Calling ha ridotto i token di prompt del 38% nell'analisi documentale multi-step senza perdita di qualità. Sono affermazioni partner-vendor, non misure indipendenti, ma sono specifiche su cosa è cambiato.
Cybersecurity: due scommesse opposte
Questo è il divario più ampio del confronto, ed è una scelta di design più che un accidente di capacità.
OpenAI ha addestrato la famiglia GPT-5.6 per il lavoro cyber: Terra ottiene il 91,8% nelle sfide Capture-the-Flag, il 57,7% su SEC-Bench Pro, il 52,9% su ExploitBench e il 23,2% su ExploitGym. Due di queste cifre battono GPT-5.5, il precedente top di gamma, che ha ottenuto il 45,8% su SEC-Bench Pro e il 47,9% su ExploitBench.
Anthropic ha scelto l'altra strada. Sonnet 5 non è stato deliberatamente addestrato su compiti di cybersecurity e, in una valutazione di sviluppo di exploit costruita con Mozilla su vulnerabilità di Firefox 147, non ha mai prodotto un exploit funzionante, segnando 0,0%. Anthropic distribuisce Sonnet 5 con salvaguardie cyber in tempo reale attive per impostazione predefinita e raccomanda Opus 4.8 per il lavoro cyber che richiede guardrail ridotti.
Per la maggior parte dei lettori, questo è un punto a favore di Sonnet 5, non una debolezza. Se stai costruendo un prodotto in cui un modello che tenta di generare exploit è una responsabilità, un modello che rifiuta in modo affidabile è una dipendenza più sicura. Se fai sicurezza difensiva, Terra rientra nel programma Daybreak Trusted Access for Cyber di OpenAI, e i singoli membri devono avere passkey con protezione hardware abilitate entro il 1° settembre per mantenere l'accesso ai modelli più capaci in ambito cyber.
Vale la pena segnalare anche il costo di frizione dal lato OpenAI. OpenAI afferma che le salvaguardie cyber di GPT-5.6 Sol bloccano circa 10 volte più attività potenzialmente dannose rispetto ai modelli precedenti, e ha aggiunto un'opzione di retry su un modello a capacità inferiore in ChatGPT e Codex proprio perché richieste innocue vengono bloccate. Thread su Reddit dal lato Anthropic riportano la stessa lamentela: Sonnet 5 blocca contenuti didattici di sicurezza innocui, quindi nessuno dei due vendor ha risolto il problema dell'overblocking.
Finestra di contesto e lavoro su contesti lunghi
Formalmente, i due sono uguali: Terra pubblica una finestra di contesto da 1.050.000 token con un tetto di output di 128.000 token, e Sonnet 5 fornisce una finestra da 1M con un tetto di output di 128K. Ciò che differisce è cosa succede quando la riempi davvero.
Terra ha pubblicato punteggi di retrieval lungo la finestra. Su OpenAI MRCR v2 8-needle, segna l'89,6% nella fascia 256K-512K e il 72,5% nella fascia 512K-1M, vicino ai 91,5% e 73,8% di Sol e ben sopra il 41,3% di Luna. Significa che puoi aspettarti che il modello trovi dettagli nascosti in circa 9 casi su 10 entro un documento da 512k, rendendolo un compagno molto affidabile per l'estrazione di conoscenza. Anthropic non ha pubblicato cifre comparabili di needle-retrieval per Sonnet 5 al lancio.
Il comportamento di fatturazione è la differenza più rilevante. I prompt oltre 272K token di input su Terra sono fatturati a 2x in input e 1,5x in output per l'intera richiesta, non solo per l'eccedenza. Sonnet 5 non ha un sovrapprezzo pubblicato per contesti lunghi, quindi le sue tariffe tengono sull'intera finestra. Metterò numeri nella sezione prezzi, perché lì si ribalta quale modello è più economico.
Superficie di controllo: effort, thinking e vincoli API
Entrambi i modelli espongono una manopola per lo sforzo di ragionamento, poi divergono nettamente su quanto altro ti è permesso toccare.
Sonnet 5 ha rimosso completamente temperature, top_p e top_k, e chiamate che li impostano restituiscono un errore 400. Anche il thinking esteso manuale restituisce un 400; hai il thinking adattivo attivo per default, oppure disattivi del tutto il thinking.
Sonnet 5 inoltre non supporta il Priority Tier sulla piattaforma Anthropic, il che conta se oggi il tuo team si affida a quello per garanzie di latenza su Opus o Sonnet 4.6. Anthropic ha alzato i rate limit su Chat, Cowork, Claude Code e la Claude Platform per assorbire l'uso di token più pesante che i livelli di effort più alti producono.
La superficie di Terra è più ampia in un'altra direzione. Le funzioni da conoscere:
-
Programmatic Tool Calling nella Responses API, che esegue programmi di coordinamento in memoria ed è compatibile con Zero Data Retention.
-
Una beta multi-agente nella Responses API, che consente al modello di eseguire subagent in parallelo e sintetizzare il loro lavoro in un'unica richiesta.
-
Impostazione di effort
max, attivabile da qualsiasi utente con accesso a GPT-5.6 in ChatGPT Work e Codex. -
Breakpoint di cache espliciti con una vita minima della cache di 30 minuti, letture di cache con sconto del 90% e scritture di cache a 1,25x la tariffa di input non in cache.
-
Function calling, structured outputs, hosted shell, code interpreter e computer use sulla Responses API, con fine-tuning non supportato.
Un'asimmetria da notare: l'impostazione ultra di OpenAI coordina quattro agenti in parallelo, ma ogni benchmark pubblicato su ultra appartiene a Sol, non a Terra. Non dare per scontato che il livello intermedio ottenga gli stessi guadagni multi-agente finché qualcuno non pubblica numeri Ultra per Terra.
Prezzi: quanto paghi davvero
Al momento Terra e Sonnet 5 sono entro un dollaro l'uno dall'altro sull'input, il che rende la forma del workload, non la tariffa di listino, la cosa che decide la bolletta.
Tariffe dei token affiancate
| Tariffa | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|
| Input, per 1M di token | $2,00 | $3,00 ($2,00 fino al 31 ago 2026) |
| Output, per 1M di token | $12,00 | $15,00 ($10,00 fino al 31 ago 2026) |
| Sovrapprezzo per contesti lunghi | 2x input, 1,5x output oltre 272K token di input | Nessuno pubblicato; piatto fino a 1M |
| Token di ragionamento | Nessuna tariffa separata pubblicata | Fatturati come token di output |
| Accesso livello gratuito | Predefinito per Free e Go in ChatGPT Work e Codex | Predefinito su piani Free e Pro |
Le tariffe $2,00/$12,00 di Terra riflettono il taglio del 20% applicato da OpenAI il 30 luglio 2026, in calo da $2,50/$15,00 al lancio. Le letture di input in cache su Terra costano $0,20 per 1M, e Anthropic supporta il prompt caching per Sonnet 5 senza indicare una tariffa specifica per Sonnet nei materiali di lancio.
Poiché Anthropic fattura i thinking token alla tariffa di output, eseguire Sonnet 5 a effort extra-alto è un moltiplicatore diretto sulla voce più costosa. È il modo più semplice per sforare un budget dimensionato sul volume in input.
Quanto costa un workload reale
La formula è semplice: (volume ÷ 1M) × tariffa, sommata tra input e output. Ho elaborato tre forme di workload a tariffe standard, scelte perché ognuna isola un meccanismo in cui questi due modelli differiscono davvero.
| Workload | GPT-5.6 Terra | Claude Sonnet 5 | Differenza |
|---|---|---|---|
| Generazione pesante: 1M in / 4M out | $50 | $63 | Sonnet 5 +$13 (26%) |
| Retrieval, sotto soglia: 10M in / 1M out, ogni richiesta sotto 272K | $32 | $45 | Sonnet 5 +$13 (41%) |
| Retrieval, sopra soglia: 10M in / 1M out, ogni richiesta sopra 272K | $58 | $45 | Terra +$13 (29%) |
La terza riga è il punto chiave. Non cambia nulla nel volume totale tra la seconda e la terza riga, solo la dimensione di ciascuna richiesta, e il sovrapprezzo a 272K di Terra trasforma un vantaggio di costo del 41% in una penalità del 29%. Se inserisci regolarmente 300K token di testo contrattuale o contesto di repository in una singola chiamata, il prezzo più basso di Terra è fuorviante.
La riga sulla generazione pesante si ribalta anche se acquisti prima di settembre. Alle tariffe introduttive di Sonnet 5 di $2,00/$10,00, quel workload costa $42 contro i $50 di Terra, quindi Sonnet 5 è $8 più economico finché le tariffe standard non entrano in vigore il 1° settembre 2026. Anthropic ha definito quella finestra introduttiva per rendere la migrazione da Sonnet 4.6 sostanzialmente neutrale sui costi, cosa da ricordare prima di costruirci un budget.

Perché lo stesso task costa importi diversi
Queste tariffe si traducono in una bolletta solo se entrambi i modelli consumano lo stesso numero di token per lo stesso lavoro, e di solito non è così. Terra e Sonnet 5 usano tokenizer diversi di vendor diversi, quindi un testo identico produce conteggi di token in input diversi per ciascun modello prima che rispondano.
Nessun vendor ha pubblicato un conteggio di token tra soggetti, quindi non posso fornirti una cifra corretta. Esistono claim dei predecessori che non dicono nulla su Terra contro Sonnet 5:
- Anthropic documenta che il nuovo tokenizer di Sonnet 5 produce circa il 30% di token in più rispetto a Sonnet 4.6, e
- Notion ha riportato che Terra usa il 16% di token in meno rispetto a GPT-5.5.
Il mio consiglio è di trattare la tabella sopra come un confronto di tariffe più che una previsione, e di misurare i tuoi conteggi di token su un campione rappresentativo prima di impegnarti. Il cambio di tokenizer di Sonnet 5 in particolare ha colto di sorpresa i team al lancio, con la recensione di Simon Willison e consulenze cloud che lo segnalano come la principale sorpresa di migrazione.
Quando scegliere GPT-5.6 Terra vs Claude Sonnet 5
Ecco come si articola la decisione negli scenari in cui mi aspetto che si trovino la maggior parte dei lettori.
| Caso d'uso | Consigliato | Perché |
|---|---|---|
| Agenti di coding da terminale e CLI | GPT-5.6 Terra | 87,4% su Terminal-Bench 2.1 contro l'80,4% di Sonnet 5. |
| Fix di bug a livello di repository | Entrambi | 63,4% vs 63,2% su SWE-Bench Pro è una parità; scegli in base a prezzo ed ecosistema. |
| Contesto molto ampio (300K+ token) | Claude Sonnet 5 | Nessun sovrapprezzo per contesti lunghi, mentre Terra addebita 2x input oltre 272K. |
| Pipeline con molti tool e molte chiamate per turno | GPT-5.6 Terra | Il Programmatic Tool Calling ha ridotto i token di prompt del 38% nei workflow documentali di Clio. |
| Sicurezza difensiva e triage delle vulnerabilità | GPT-5.6 Terra | 91,8% su Capture-the-Flag e accesso tramite Trusted Access for Cyber. |
| Prodotti in cui la generazione di exploit è una responsabilità | Claude Sonnet 5 | Ha segnato 0,0% sullo sviluppo di exploit per Firefox e ha salvaguardie cyber attive per default. |
| Workload di generazione pesante prima di settembre 2026 | Claude Sonnet 5 | Le tariffe introduttive $2/$10 battono Terra di $8 su un mese da 1M in / 4M out. |
| Workload che richiedono parametri di campionamento personalizzati | GPT-5.6 Terra | Sonnet 5 rifiuta temperature, top_p e top_k con un errore 400. |
Scegli GPT-5.6 Terra se...
- I tuoi agenti vivono in una shell. Il divario di 7 punti su Terminal-Bench 2.1 è la differenza di coding più ampia pubblicata tra questi due modelli.
- Chiami molti tool per turno. Il Programmatic Tool Calling mantiene i dati intermedi fuori dal contesto del modello, e PlayCo ha riportato il 63,5% di token totali in meno e il 50,1% di turni di modello in meno su lavori di costruzione di scene strutturate.
- Fai sicurezza difensiva. Il 57,7% di Terra su SEC-Bench Pro e il 52,9% su ExploitBench sono di un'altra classe rispetto al rifiuto deliberato di Sonnet 5.
- Hai bisogno di token di output più economici. Dopo agosto 2026, la tariffa di Sonnet 5 passa a $15 per 1M contro i $12 di Terra.
- Vuoi numeri documentati di retrieval su contesti lunghi, come il 72,5% su MRCR v2 nella fascia 512K-1M.
Scegli Claude Sonnet 5 se...
- I tuoi prompt o i file di contesto sono grandi. La tariffazione piatta fino a 1M di token batte la soglia a 272K di Terra, e la differenza è un cambio del 29% su un mese da 10M input.
- Vuoi un modello che rifiuta il lavoro cyber per design. La stessa Anthropic valuta che Sonnet 5 abbia capacità cyber sostanzialmente peggiori di Opus 4.8 e Mythos 5, che per la maggior parte dei team di prodotto è il comportamento desiderato.
- Sei già nell'ecosistema Claude. Sonnet 5 è il predefinito su Free e Pro e gira in Claude Code.
- Vuoi una sola manopola invece di un pannello impostazioni. Thinking adattivo più livelli di effort è una superficie più piccola da gestire rispetto a effort più max più ultra più modalità di tool-calling.
Se il costo è il vincolo principale, i tre workload calcolati sono il modo più rapido per capire da che parte stai: $50 contro $63 in un mese di generazione pesante, $32 contro $45 su retrieval sotto soglia, e $58 contro $45 quando ogni richiesta supera i 272K token di input.
Come iniziare con GPT-5.6 Terra e Claude Sonnet 5
Entrambi i modelli sono generalmente disponibili oggi, ed entrambi sono i modelli che i vendor offrono gratuitamente, quindi provarli non costa altro che tempo.
| Superficie | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|
| App consumer e livello | ChatGPT Work: predefinito per Free e Go; selezionabile per Plus, Pro, Business, Enterprise | App Claude: predefinito su Free e Pro; disponibile per Max, Team, Enterprise |
| API proprietaria | OpenAI API, via Responses e Chat Completions | Claude API sulla Claude Platform |
| Piattaforme cloud | Amazon Bedrock (GA) e Microsoft Foundry (GA, incl. APAC Data Zone); non ancora disponibile su Google Vertex | Claude Platform su AWS e Claude in Microsoft Foundry; Google Vertex indicato come in arrivo |
| Agenti di coding | Codex: predefinito per Free e Go, selezionabile su Plus e superiori | Claude Code |
| ID modello API | gpt-5.6-terra |
claude-sonnet-5 |
La tua prima chiamata API
Si tratta di SDK diversi, quindi passare dall'uno all'altro è più che cambiare la stringa del modello. Entrambe le chiamate sono abbastanza brevi da rendere visibile a colpo d'occhio la differenza.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-terra", # swap for gpt-5.6-sol or gpt-5.6-luna
input="Refactor this pytest fixture to avoid module-level state.",
)
print(response.output_text)
from anthropic import Anthropic
client = Anthropic()
message = client.messages.create(
model="claude-sonnet-5", # no temperature/top_p/top_k on this model
max_tokens=1024,
messages=[{"role": "user", "content": "Refactor this pytest fixture to avoid module-level state."}],
)
print(message.content.text)
Se stai portando codice esistente di Anthropic, ricordati di rimuovere prima temperature, top_p, top_k e qualsiasi configurazione di thinking esteso manuale, poiché Sonnet 5 restituisce un 400 anziché ignorarli.
Per il percorso completo di setup dal lato Anthropic, la nostra guida completa alla Claude API va più in profondità di quanto abbia senso qui. Per iniziare dal lato GPT, il nostro corso Working with the OpenAI API è il posto migliore da cui partire.
Considerazioni finali
La versione in una frase: Terra è il miglior modello di fascia media per agenti da terminale e pipeline dense di strumenti, e Sonnet 5 è il migliore per prompt grandi e team che vogliono una superficie più piccola da gestire.
Trovo interessante che entrambi i vendor abbiano scelto la fascia media come predefinito gratuito, facendo poi scommesse opposte su ciò che un modello di fascia media dovrebbe rifiutare. OpenAI ha addestrato Terra per il lavoro cyber e ha messo la capacità più tagliente dietro la verifica dell'identità e passkey hardware. Anthropic ha addestrato Sonnet 5 a non farlo affatto, poi ha aggiunto salvaguardie sopra. Nessun approccio è chiaramente giusto, ed entrambi creano frizioni reali per il lavoro legittimo.
Se vuoi costruire le basi per fare queste scelte da solo invece di leggere la tabella dei benchmark di qualcun altro, ti consiglio di iniziare dalla nostra skill track AI Fundamentals.
FAQ
È meglio GPT-5.6 Terra o Claude Sonnet 5 per il coding?
Dipende dal tipo di lavoro di coding. Su SWE-Bench Pro, i due modelli sono di fatto alla pari al 63,4% (Terra) e 63,2% (Sonnet 5) per il bug fixing a livello di repository. Tuttavia, GPT-5.6 Terra è nettamente avanti su flussi di lavoro da terminale e CLI, con l'87,4% su Terminal-Bench 2.1 rispetto all'80,4% di Sonnet 5. Scegli Terra se i tuoi agenti girano in una shell; scegli uno dei due modelli per il reasoning generale su codebase.
Quanto costano GPT-5.6 Terra e Claude Sonnet 5?
GPT-5.6 Terra costa $2,00 per 1M di token in input e $12,00 per 1M di token in output (dopo un taglio del 20% il 30 luglio 2026). Claude Sonnet 5 costa $3,00/$15,00 a tariffe standard, con prezzi introduttivi di $2,00/$10,00 disponibili fino al 31 agosto 2026. Terra applica un sovrapprezzo per contesti lunghi (2x input, 1,5x output) per richieste che superano i 272K token di input, mentre Sonnet 5 applica tariffe piatte fino a 1M di token.
Qual è la finestra di contesto per GPT-5.6 Terra e Claude Sonnet 5?
GPT-5.6 Terra ha una finestra di contesto di 1.050.000 token con un tetto di output di 128.000 token. Claude Sonnet 5 ha una finestra di contesto da 1M di token con un tetto di output di 128K. Entrambe le finestre sono sufficientemente ampie per la maggior parte dei workload.
Claude Sonnet 5 può fare lavoro di cybersecurity?
Claude Sonnet 5 non è stato deliberatamente addestrato per compiti di cybersecurity. In una valutazione di sviluppo di exploit costruita con Mozilla su vulnerabilità di Firefox 147, ha segnato 0,0%. Anthropic lo distribuisce con salvaguardie cyber in tempo reale attive per impostazione predefinita. Per la maggior parte dei team di prodotto questo è un vantaggio, perché un modello che rifiuta in modo affidabile la generazione di exploit è una dipendenza più sicura. Se ti servono capacità cyber difensive, GPT-5.6 Terra ottiene il 91,8% su sfide Capture-the-Flag e il 57,7% su SEC-Bench Pro.
Quale modello è più economico per prompt oltre i 300K token?
Anche se GPT-5.6 Terra è in generale il modello più economico per la maggior parte dei workflow, Claude Sonnet 5 è più economico per prompt grandi. GPT-5.6 Terra applica un sovrapprezzo per contesti lunghi di 2x sull'input e 1,5x sull'output per l'intera richiesta quando l'input supera i 272K token. Sonnet 5 non ha un sovrapprezzo pubblicato per contesti lunghi, quindi le sue tariffe restano piatte fino a 1M di token.
Tom è un data scientist e formatore tecnico. Scrive e gestisce i tutorial e i post del blog di DataCamp su data science. In precedenza, Tom ha lavorato nella data science presso Deutsche Telekom.
