Vai al contenuto principale

Claude Sonnet 5 vs. GPT-5.6: benchmark, prezzi e accesso

Sonnet 5 è disponibile ora a prezzo scontato. GPT-5.6 ottiene numeri migliori in Terminal-Bench-2.1 ma non è ancora generalmente disponibile. Ecco il quadro completo.
Aggiornato 29 set 2026  · 7 min leggi

Esplora con l'AI

ChatGPTClaudePerplexity

Questa settimana sia Anthropic che OpenAI hanno nuove uscite sul tavolo, ma i due lanci sono a stadi diversi.

GPT-5.6 è stato presentato, ma è bloccato dietro un'anteprima limitata. E mentre GPT-5.6 non è generalmente disponibile, Claude Sonnet 5 è stato rilasciato oggi ed è attivo su tutti i piani Claude — con un prezzo API introduttivo che, per ora, è addirittura inferiore a quello del modello di fascia media di GPT-5.6, Terra.

Ecco cosa sappiamo di ciascun modello, come si confrontano e dove i numeri si sovrappongono.

Che cos'è Claude Sonnet 5?

Claude Sonnet 5 è l'ultimo modello di fascia media di Anthropic, presentato come il modello Sonnet più agentico finora. L'idea è che riduca gran parte del divario con i modelli di classe Opus in termini di pianificazione e uso degli strumenti, rimanendo significativamente più economico.

Anthropic afferma che Sonnet 5 rappresenta un notevole passo avanti rispetto a Sonnet 4.6 in ragionamento, coding e uso degli strumenti, e che le sue prestazioni ora si avvicinano in diversi test agentici a quelle di Opus 4.8, inclusi BrowseComp (ricerca agentica) e OSWorld-Verified (uso del computer).

Opus 4.8 resta in testa per accuratezza pura, soprattutto alle impostazioni di impegno più alte, ma Sonnet 5 offre agli sviluppatori un'opzione con un miglior rapporto prezzo/prestazioni. I modelli di fascia media di Anthropic hanno dimostrato in passato di performare oltre la loro categoria quando una nuova generazione arriva prima che il successivo aggiornamento di Opus colmi il divario. Sembra passato molto tempo ormai, ma Claude Sonnet 3.5 superò in realtà il vecchio Claude Opus 3 in diversi benchmark nel 2024.

Sonnet 5 utilizza anche un tokenizer aggiornato, il che significa che lo stesso testo in input può mappare a più token rispetto a prima (circa 1,0–1,35× a seconda del contenuto).

Che cos'è GPT-5.6?

GPT-5.6 non è un singolo modello. È una famiglia di tre modelli, organizzata con un nuovo schema di denominazione in cui il numero indica la generazione e il nome indica il livello di capacità:

  • Sol è il modello di punta. È l'unico livello con accesso a due nuovi controlli: un'impostazione di impegno di ragionamento max e la ultra mode, che suddivide un compito in un pool di sub-agent.

  • Terra è il modello quotidiano e bilanciato — grossomodo paragonabile a GPT-5.5 per qualità complessiva a circa metà del prezzo.

  • Luna è il livello a basso costo, pensato per carichi di lavoro sensibili alla latenza.

Con l'annuncio, OpenAI mette in evidenza miglioramenti in coding, biologia e cybersecurity. La notizia principale riguarda le prestazioni su diversi benchmark interessanti, tra cui soprattutto Terminal-Bench 2.1, ma anche GeneBench v1, un benchmark di genomica a lungo orizzonte, e due benchmark di sviluppo exploit (ExploitBench e ExploitGym).

Confronto dei benchmark tra Claude Sonnet 5 e GPT-5.6

Dagli annunci rispettivi, Sonnet 5 e GPT-5.6 non condividono un singolo benchmark comune con numeri da entrambe le parti.

Sebbene Anthropic abbia pubblicato alcuni numeri concreti per Sonnet 5 nel post di lancio e nella system card, finora OpenAI ha confermato un solo punteggio di benchmark per GPT-5.6: Terminal-Bench 2.1. Ecco cosa è effettivamente agli atti per ciascuna parte, affiancato:

Benchmark Claude Sonnet 5 GPT-5.6 Sol GPT-5.6 Sol Ultra GPT-5.6 Terra GPT-5.6 Luna
Terminal-Bench 2.1 Non pubblicato 88,8% 91,9% 82,5% 84,3%
SWE-bench Pro 63,2% Non pubblicato — Non pubblicato Non pubblicato
OSWorld-Verified (uso del computer) 81,2% Non pubblicato — Non pubblicato Non pubblicato
Humanity's Last Exam (con strumenti) 57,4% Non pubblicato — Non pubblicato Non pubblicato

Terminal-Bench 2.1 è l'unica riga in cui GPT-5.6 ha pubblicato qualcosa, e Sonnet 5 non ha un punteggio pubblicato da inserire lì. Forse è strategico, perché GPT-5.6 si è comportato bene. 

Sui benchmark in cui Sonnet 5 ha numeri — SWE-bench Pro, OSWorld-Verified, Humanity's Last Exam — GPT-5.6 semplicemente non ha ancora scoperto le carte, quindi non c'è nulla da confrontare.

La conclusione onesta è che un vero confronto di benchmark tra Sonnet 5 e GPT-5.6 ancora non esiste. Ogni azienda ha pubblicato un insieme diverso di valutazioni.

Allargando lo sguardo: dove si colloca ciascun modello nel panorama

Dato che Sonnet 5 e GPT-5.6 non si sovrappongono direttamente, vale la pena fare un passo indietro e guardare come i punteggi pubblicati di ciascuno si confrontano con il resto del campo — Opus 4.8, il sospeso Fable 5, GPT-5.5 e Gemini 3.1 Pro. Questo non risolve Sonnet 5 vs. GPT-5.6, ma mostra dove ciascuno si posiziona rispetto allo stesso set di concorrenti:

Benchmark Claude Opus 4.8 Claude Fable 5 (pre-sospensione) GPT-5.5 Gemini 3.1 Pro GPT-5.6 Sol Ultra
Terminal-Bench 2.1 78,9% 83,4% 88,0% 70,7% 91,9%
SWE-bench Pro 69,2% 80,3% 58,6% — Non pubblicato
Humanity's Last Exam (senza strumenti) 49,8% 59,0% — 44,4% Non pubblicato

Un paio di cose: su Terminal-Bench 2.1, il 91,9% di GPT-5.6 Sol Ultra supera ogni modello Claude registrato, incluso Opus 4.8 al 78,9%. Quindi OpenAI non stava esagerando quando vantava il punteggio di GPT-5.6 su Terminal-Bench 2.1.

Fable 5 è ancora in testa a Opus 4.8 e GPT-5.5 su SWE-bench Pro e Humanity's Last Exam, anche se sospeso. I suoi numeri non sono ancora stati superati da nessuno, incluso GPT-5.6 (che non ha pubblicato un punteggio SWE-bench o HLE per il confronto). Il 63,2% di Sonnet 5 su SWE-bench Pro (dalla tabella sopra) si collocherebbe sopra il 58,6% di GPT-5.5 ma sotto Opus 4.8 e Fable 5 — un proxy molto approssimativo, dato che si sta leggendo tra generazioni di modelli diverse su tabelle separate di due aziende.

Prezzi di Claude Sonnet 5 e GPT-5.6

Modello Input (per 1M token) Output (per 1M token)
Claude Sonnet 5 (intro, fino al 31 ago 2026) $2.00 $10.00
Claude Sonnet 5 (standard) $3.00 $15.00
GPT-5.6 Sol $5.00 $30.00
GPT-5.6 Terra $2.50 $15.00
GPT-5.6 Luna $1.00 $6.00

A prezzo di listino, il prezzo introduttivo di Sonnet 5 si colloca tra GPT-5.6 Terra e Luna, e ben al di sotto di Sol. Ma è il prezzo introduttivo il dato più interessante: a $2/$10, Sonnet 5 in realtà batte i $2,50/$15 di GPT-5.6 Terra, almeno per l'estate finché non ci sarà un aumento.

Per chiarezza, la questione dei prezzi è un po' più sfumata di un semplice calcolo a spanne. Anthropic segnala che il prezzo introduttivo di Sonnet 5 è calibrato per essere all'incirca neutro sui costi rispetto ai conteggi di token più alti del nuovo tokenizer. E OpenAI, dal canto suo, introduce un caching dei prompt più prevedibile per GPT-5.6 e modelli successivi, con le scritture in cache fatturate a 1,25× la tariffa di input non in cache e le letture in cache che mantengono uno sconto del 90%. 

Perché lanciare con un prezzo introduttivo scontato invece di fissare da subito la tariffa standard? La spiegazione del tokenizer copre in parte la scelta, ma la tempistica si allinea anche con ciò che vediamo: un campo affollato e in rapido movimento. Nelle ultime settimane, Sakana AI ha rilasciato Fugu, un orchestrator che effettua il routing su un pool di modelli d'avanguardia e sostiene di avvicinarsi ai sistemi di classe Mythos di Anthropic a una frazione del costo. Quindi prezzare Sonnet 5 a $2/$10 fino alla fine di agosto dà ad Anthropic un modello agentico davvero economico e ampiamente disponibile da indicare mentre GPT-5.6 è ancora bloccato in anteprima. Essere il modello che le persone possono effettivamente usare, a un prezzo basso, è un vero vantaggio competitivo.

Disponibilità di Claude Sonnet 5 e GPT-5.6

Claude Sonnet 5 è disponibile oggi, ovunque. È il modello predefinito nei piani Free e Pro, accessibile su Max, Team ed Enterprise, e attivo in Claude Code e sulla Claude Platform via API (model string claude-sonnet-5). Potresti aver notato Claude Sonnet 5 nella finestra di chat ancora prima di vedere l'annuncio. 

chat di claude sonnet 5

GPT-5.6 non è generalmente disponibile. Durante l'anteprima, è accessibile solo tramite API e Codex a un gruppo selezionato di partner. OpenAI afferma che arriverà una disponibilità più ampia, ma non ha fornito una data. 

Considerazioni finali

Sul singolo benchmark sovrapposto, il livello di punta di GPT-5.6 riporta punteggi più alti dell'attuale top di gamma di Claude, Opus 4.8, il che suggerisce che OpenAI potrebbe avere un vero vantaggio di capacità una volta che GPT-5.6 sarà distribuito ampiamente. Ma Sonnet 5 non è davvero il diretto concorrente di Sol o Terra sul piano delle capacità — è un modello di fascia media che compete su prestazioni agentiche per dollaro e, su quel fronte, è disponibile, ha un prezzo aggressivo e funziona oggi.


Josef Waples's photo
Author
Josef Waples

Sono uno scrittore e editor di data science, con contributi a articoli di ricerca su riviste scientifiche. Sono particolarmente interessato ad algebra lineare, statistica, R e affini. Inoltre, gioco anche parecchio a scacchi! 

Argomenti
Intelligenza artificiale

Impara con DataCamp

Corso

Introduzione ai modelli Claude

3 h
14.6K
Scopri come usare Claude con l'API di Anthropic per risolvere problemi del mondo reale e creare app basate sull'intelligenza artificiale.
Vedi dettagliRight Arrow
Inizia Il Corso
Mostra altroRight Arrow