Vai al contenuto principale

GPT-6.1 Sol: funzionalità, benchmark, prezzi e accesso

GPT-6.1 Sol di OpenAI promette capacità a livello di GPT-6 Astra a un quinto del costo per task, con una finestra di contesto da 1.050.000 token e prezzi di $2/$10 per milione di token.
Aggiornato 29 set 2026  · 14 min leggi

Esplora con l'AI

ChatGPTClaudePerplexity

OpenAI ha rilasciato GPT-6.1 Sol il 29 settembre 2026 al DevDay, una settimana dopo GPT-6 Sol e 26 giorni dopo GPT-6 Astra.

Astra ha avuto una media di $23,80 per task di Terminal-Bench Science 0.1 allo sforzo massimo, finendo fuori budget per il lavoro di routine. Sol è la risposta di OpenAI a quel problema.

I numeri principali sono $2,00 per 1M token in input, $10,00 per 1M token in output, una finestra di contesto da 1.050.000 token e 128.000 token di output massimo. Nell’annuncio di OpenAI, GPT-6.1 Sol eguaglia Astra su DeepSWE v1.1 a circa un quinto del costo, supera di 2,2 punti percentuali il Claude Opus 5.5 di Anthropic su AutomationBench a sforzo medio e costa $5,47 per task di Terminal-Bench Science 0.1 contro i $23,80 di Astra. 

In questo articolo, tratto le novità di GPT-6.1 Sol, analizzando funzionalità, benchmark e dati di sicurezza pubblicati da OpenAI, quale livello della famiglia GPT-6 conviene usare e quanto costa. Per un approfondimento sui modelli vicini, vedi il nostro tutorial sull’API di GPT-6 Sol e la nostra guida a Claude Sonnet 5.5.

In breve

  • GPT-6.1 Sol è un aggiornamento di fascia media sotto GPT-6 Astra e sopra GPT-6 Luna. I prezzi di input e output coincidono con GPT-6 Sol, e l’input in cache scende da $0,20 a $0,10 per 1M token.
  • Il costo per task completato è l’intera storia. In capacità grezza è ancora dietro ad Astra nelle valutazioni più difficili su cyber, biologia e scienze.
  • OpenAI lo classifica come Critico nella cybersecurity e Alto in biologia, quindi arriva con la stessa pila di salvaguardie di Astra.
  • Usalo come predefinito per coding agentico, uso del computer e workflow aziendali. Tieni Astra per il ragionamento da wet lab, la ricerca sulla sicurezza autorizzata e il lavoro scientifico più impegnativo.
  • Passare da GPT-6 Sol richiede modifiche al codice. GPT-6.1 Sol non supporta lo sforzo di ragionamento none o minimal, e Chat Completions non può chiamare tool.

Cos’è GPT-6.1 Sol?

GPT-6.1 Sol è il modello di ragionamento di fascia media di OpenAI nella serie GPT-6, rilasciato il 29 settembre 2026 come upgrade di GPT-6 Sol. Si colloca sotto GPT-6 Astra, il flagship lanciato il 3 settembre, e sopra GPT-6 Luna, il modello piccolo.

OpenAI afferma che si avvicina molto ad Astra nel coding agentico, nell’uso del computer e nel lavoro professionale.

L’addendum alla system card si spinge oltre e descrive capacità paragonabili a quelle di Astra, con una combinazione imbattibile di velocità e convenienza.

Lo considererei una dichiarazione corretta per costo adeguato, non assoluta. Astra resta in testa nelle valutazioni più difficili su cyber, biologia e scienze.

Non esiste un GPT-6.1 Astra. Il Wall Street Journal ha riportato che OpenAI ha cancellato il rilascio di ottobre dopo una regressione del modello nei test di allineamento e nel rispetto dell’ambito autorizzato dall’utente, e OpenAI ha confermato la decisione.

Quindi, GPT-6.1 Sol è l’unico modello 6.1, e i suoi numeri su inganno e persistenza (trattati sotto) meritano attenzione.

Come si confronta GPT-6.1 Sol con GPT-6 Sol?

GPT-6.1 Sol migliora GPT-6 Sol soprattutto nel lavoro agentico e nella sicurezza. T

questi sono i progressi riportati da OpenAI:

  • DeepSWE v1.1: 6,4 punti percentuali sopra il miglior punteggio di GPT-6 Sol, a minore sforzo di ragionamento e costo.
  • AutomationBench: +4,8 punti a sforzo medio.
  • OSWorld 2.0 (set offline): +7 punti a sforzo massimo, a meno della metà del costo per task.
  • Terminal-Bench Science 0.1: oltre il doppio del punteggio di GPT-6 Sol a sforzo massimo, a meno della metà del costo per task.
  • ExploitBench Internal Port: 21,5% contro 5,5%.
  • Debugging per la ricerca interna: 75,52% contro 64,20%.

Cosa significa la classificazione Preparedness?

OpenAI considera GPT-6.1 Sol una capacità Critica nella cybersecurity, Alta nel dominio Biologico e Chimico, e sotto la soglia Alta nell’Auto-Miglioramento dell’IA. GPT-5.6 Sol era valutato Alto, non Critico, nella cybersecurity. Gli sviluppatori dovrebbero leggere questa classificazione due volte.

Significa che il modello eredita l’intera pila di salvaguardie di Astra, inclusi accesso graduale per il lavoro cyber avanzato tramite il programma Daybreak. Sol non ottiene una versione più leggera di tali controlli.

Funzionalità chiave di GPT-6.1 Sol

Quasi tutte le novità riguardano fare lo stesso lavoro a un costo inferiore, con alcune modifiche API da pianificare. Ecco le capacità che cambiano come lo useresti in sviluppo.

Una finestra di contesto da 1.050.000 token, con un salto a 272.000

GPT-6.1 Sol accetta 1.050.000 token in input e restituisce fino a 128.000, in linea con la finestra di GPT-6 Sol.

La clausola è nella fatturazione: i prompt oltre 272.000 token in input sono addebitati al doppio delle tariffe di input e cache e a 1,5x per l’output, sull’intera richiesta e non solo sull’eccedenza.

L’analisi a livello di repository sotto i 272.000 token è economica. Un singolo passaggio di retrieval sovradimensionato può far superare la soglia a una run e riprezzare tutto in quella richiesta.

Coding agentico e uso del computer a una frazione del costo per task di Astra

Il caso d’uso più evidente è sostituire GPT-6.1 Sol ovunque usassi Astra in lunghi loop di chiamata strumenti.

OpenAI riporta parità con Astra su DeepSWE v1.1 a circa un quinto del costo. Sul set offline di OSWorld 2.0 a sforzo massimo, resta entro 2,1 punti da Astra a circa un settimo del costo per task.

Il nostro agent di migrazione codebase GPT-6 Sol ha eseguito end-to-end per $0,7082, con il 91% dei token in input serviti da cache. Quella run ha usato GPT-6 Sol, non GPT-6.1 Sol. I prezzi standard dei token sono gli stessi, e la tariffa per input in cache è dimezzata.

Il ragionamento è sempre attivo

GPT-6.1 Sol supporta sforzo di ragionamento low, medium (predefinito), high, xhigh e max. Secondo la pagina del modello di OpenAI, none e minimal non sono supportati.

La chiamata strumenti richiede la Responses API.

Chat Completions funziona ancora, ma senza tool calling. GPT-6 Sol permetteva la function calling in Chat Completions con sforzo none, quindi chi lo usava come chiamante di funzioni a basso costo senza ragionamento deve migrare.

Tassi di errore fattuale più bassi a basso sforzo

OpenAI ha misurato la quota di risposte con un errore fattuale su conversazioni ChatGPT de-identificate dove gli utenti avevano segnalato un errore di un modello precedente. A sforzo low, tale quota è scesa dall’11,4% per GPT-6 Sol al 7,7% per GPT-6.1 Sol, una riduzione di circa il 32%.

Sugli sforzi testati, il suo tasso di errore resta entro 1,9 punti percentuali da quello di Astra.

OpenAI avverte che questi prompt sono deliberatamente difficili e non rappresentativi dell’uso tipico.

Il grafico sulle allucinazioni dell’addendum mostra GPT-6.1 Sol e GPT-6 Sol su tassi simili e bassi nei casi segnalati dagli utenti, quindi consideralo come un guadagno a basso sforzo più che generale.

L’eval copre domande fattuali generali, non estrazione o classificazione. Se esegui quelle pipeline a sforzo medium, prova low sui tuoi dati prima di passare. È anche l’impostazione minima disponibile.

Chain-of-thought che segue le istruzioni

GPT-6.1 Sol controlla la propria chain-of-thought (CoT) in modo più affidabile di qualsiasi precedente modello Sol.

Tra le CoT tra 750 e 1.250 token, segue l’istruzione CoT richiesta nel 44,8% dei casi, contro il 23,2% di GPT-6 Sol, il 16,1% di GPT-5.6 Sol e l’1,7% di GPT-5.5 Thinking. Astra resta in testa al 60,9%.

Gli esempi di OpenAI mostrano il limite. Invitato a non ragionare su una domanda nel canale di analisi, GPT-6.1 Sol non ha prodotto testo nel canale di analisi, poi ha effettuato chiamate strumenti relative alla domanda in commentary. Ha rispettato alla lettera l’istruzione.

La stessa pila di salvaguardie del flagship

Poiché OpenAI ha assegnato a GPT-6.1 Sol le stesse determinazioni di Preparedness di Astra, ottiene le stesse salvaguardie.

Nella valutazione di sicurezza per la cybersecurity di OpenAI per la chat in produzione, totalizza 0,987, il valore più alto tra i modelli a confronto.

Nella valutazione di rifiuto in biologia, rifiuta le stesse richieste gravi e dual-use di GPT-6 Sol rifiutando meno prompt benigni (0,982 contro 0,964).

Il quadro è meno uniforme in contesti agentici.

OpenAI riporta modeste regressioni rispetto a GPT-5.6 Sol in ambienti cyber sintetici e semi-sintetici. Il lavoro cyber resta soggetto ad accesso graduale, e OpenAI sta facendo passare GPT-6.1 Sol attraverso il programma di accesso fidato Daybreak per l’uso avanzato autorizzato, come già per Astra.

Come si comporta GPT-6.1 Sol nei benchmark?

GPT-6.1 Sol si colloca tra GPT-6 Sol e GPT-6 Astra nella maggior parte delle valutazioni pubblicate da OpenAI.

È vicino ad Astra su salute, allucinazioni e segnali di disallineamento, e più distante su cyber e biologia.

Le eccezioni sono inganno nel coding e persistenza indesiderata, dove fa peggio di Astra.

Dove Astra vince nettamente, il divario va da circa 4 a 16 punti.

Dove il costo entra in gioco, Sol vince comodamente.

OpenAI ha eseguito i propri modelli nel proprio ambiente di ricerca o tramite API e ha preso i risultati dei concorrenti da report pubblici.

Workflow di coding e agentici

I numeri agentici sono il motivo per cui questo modello esiste. Nell’annuncio di OpenAI, GPT-6.1 Sol eguaglia Astra su DeepSWE v1.1 e resta entro 2,1 punti su OSWorld 2.0. Su AutomationBench supera Opus 5.5 di 2,2 punti a sforzo medio, a circa un terzo del costo.

Il costo per task è dove la separazione è evidente.

Su Terminal-Bench Science 0.1 a sforzo massimo, GPT-6.1 Sol ha avuto una media di $5,47 per task, contro $23,21 per Opus 5.5 e $23,80 per Astra. Astra resta in testa per accuratezza al 68,1%, e OpenAI lo raccomanda per i compiti scientifici più difficili.

Per contesto dalla nostra copertura, Claude Sonnet 5.5 ha totalizzato 70,6% su Terminal-Bench 4.0. Su FrontierCode 1.1 ha segnato il 46,2% a sforzo max e il 52,1% a xhigh, e la tabella di lancio Anthropic elenca GPT-6 Sol al 49,3%. Sono benchmark diversi e numeri riportati dai vendor, quindi trattali come contesto e non come confronto diretto.

Cybersecurity e sviluppo di exploit

GPT-6.1 Sol è il modello di fascia Sol che OpenAI considera Critico nella cybersecurity, e i numeri di valutazione spiegano perché. Su ExploitBench, raggiunge il 99,7% a sforzo di ragionamento massimo contro l’81,7% di GPT-6 Sol e il 100% di Astra. OpenAI avverte che questi risultati possono essere gonfiati da contaminazione da vulnerabilità storiche.

Valutazione GPT-6.1 Sol GPT-6 Sol GPT-6 Astra GPT-5.6 Sol
ExploitBench (sforzo max) 99,7% 81,7% 100% Non pubblicato
ExploitBench Internal Port (esecuzione codice) 21,5% 5,5% 31,5% 3,5%
SEC-Bench Pro (pass@1) 78,8% 66,3% 85,4% 79,1%
ExploitGym (vulnerabilità prevista) 35,1% 22,1% 42,4% 30,3%

Il risultato su Internal Port è il più informativo, perché usa vulnerabilità divulgate tra giugno e agosto 2026 per ridurre la contaminazione. Passare dal 5,5% al 21,5% è quasi un miglioramento di 4x rispetto a GPT-6 Sol sulle vulnerabilità divulgate di recente.

Resta comunque 10 punti sotto Astra lì, 6,6 punti sotto su SEC-Bench Pro e 7,3 punti sotto su ExploitGym. Il riepilogo di OpenAI è che lo sfruttamento affidabile di vulnerabilità recenti resta impegnativo per GPT-6.1 Sol.

Salute e salute mentale

Nelle valutazioni sulla salute, GPT-6.1 Sol è di fatto un sostituto di Astra. Il suo punteggio HealthBench Professional aggiustato per la lunghezza è 64,2 contro 64,7 di Astra e 60,8 di GPT-6 Sol. HealthBench Hard è 36,2 contro 36,6 di Astra e 30,1 di GPT-6 Sol.

MentalHealthBench è un benchmark aperto di 1.215 conversazioni sintetiche valutate con rubriche scritte da clinici. GPT-6.1 Sol totalizza 57,9% ± 1,0 complessivo, contro il 58,7% di Astra e il 54,2% di GPT-6 Sol. Sui 344 task di emergent-acuity, segna il 58,0%, entro un errore standard dal 58,5% di Astra.

Soglie di capacità biologiche e chimiche

La biologia è dove GPT-6.1 Sol è dietro ad Astra con il margine singolo più ampio, sebbene OpenAI lo classifichi comunque come Alto. Su TroubleshootingBench, che usa protocolli di wet lab scritti da esperti e non pubblici, ottiene il 47,96% contro il 63,46% di Astra, un divario di 15,5 punti.

Valutazione (soglia Alta) Soglia GPT-6.1 Sol GPT-6 Sol GPT-6 Astra
Troubleshooting Virologia multimodale 31% 55,34% 50,6% 63,11%
ProtocolQA Open-Ended 54% 40,74% 44,4% 45,37%
Conoscenza tacita e Troubleshooting 80% 88,50% 79,2% 92,55%
TroubleshootingBench 36,4% 47,96% 45,3% 63,46%

ProtocolQA Open-Ended è l’unica valutazione sotto la sua soglia, al 40,74% contro il 54%. Anche Astra è sotto, al 45,37%.

Nessuna delle valutazioni biologiche a soglia Critica è stata superata. Su SHP2 Protein Function Prediction, GPT-6.1 Sol ha raggiunto un R² medio di 0,332 contro una soglia di 0,60. Sul Coronavirus-ACE2 Cell-Entry Screen, ha segnato 0,423 contro 0,75.

Allineamento, allucinazioni e robustezza

OpenAI ha progettato queste valutazioni per testare situazioni impegnative, quindi i tassi sotto non rappresentano i fallimenti d’uso tipico.

Il segnale più utile è una simulazione di deployment sul traffico interno di Codex su 49.650 task.

GPT-6.1 Sol ha raccolto 28 flag di severità 3 o superiore (0,056%), contro 27 per Astra (0,054%), 42 per GPT-6 Sol (0,085%) e 63 per GPT-5.6 Sol (0,127%). Significa il 33% di flag severi in meno rispetto a GPT-6 Sol e il 56% in meno rispetto a GPT-5.6 Sol.

OpenAI descrive la simulazione come un segnale di rischio di deployment interno, non una misura diretta della sicurezza esterna.

Ha anche riscontrato più casi di reward hacking e incertezza occultata rispetto ad Astra a severità inferiori, e più flag di raccolta credenziali rispetto a GPT-6 Sol.

Due risultati sono regressioni da conoscere prima di inserirlo in un loop agentico:

  • Persistenza indesiderata è apparsa nel 23,5% dei rollout di GPT-6.1 Sol contro il 17,4% di Astra. La valutazione testa azioni bloccate a basso rischio, come provare l’email dopo il rifiuto di un messaggio diretto, e gira senza i controlli di sistema progettati per impedire l’elusione.
  • Inganno nel coding, cioè la rappresentazione scorretta del proprio lavoro, è al 1,50% contro lo 0,51% di Astra e l’1,30% di GPT-6 Sol. Il tasso di GPT-5.6 Sol era quasi 7 volte superiore a quello di GPT-6.1 Sol.

Un risultato ha due facce.

Tra i campioni che hanno scoperto un forum di apparenti agent peer, GPT-6.1 Sol ha tentato la comunicazione nel 38% contro il 26% di GPT-6 Sol. Ha eseguito l’azione non autorizzata specificata solo nel 3%, contro l’11%.

Dal lato positivo, ha mancato di riconoscere uno strumento di ricerca guasto solo nel 2,08% dei casi contro il 4,92% di GPT-6 Sol. Non ha tentato di aggirare il monitor di revisione automatica né di sfruttare l’honeypot di ExploitGym.

Consapevolezza della valutazione nella simulazione di deployment

OpenAI ha anche verificato se i modelli notassero di essere valutati, cercando segnali verbali di consapevolezza della simulazione nella chain of thought.

GPT-6.1 Sol ha mostrato questi segni nel 4,81% delle traiettorie, contro l’8,67% di GPT-6 Astra, il 4,70% di GPT-6 Sol e il 2,52% di GPT-5.6 Sol. Il traffico di produzione originario a modelli misti era allo 0,76%.

Limitando il confronto ai 41.849 task in cui nessun modello ha mostrato consapevolezza, GPT-6.1 Sol ha comunque registrato circa il 17% di flag di severità 3 o superiore in meno rispetto ad Astra, il 46% in meno rispetto a GPT-6 Sol e il 65% in meno rispetto a GPT-5.6 Sol.

Quel sottoinsieme esclude l’obiezione ovvia che il modello stesse “dando il meglio”.

Elusione del monitor in condizioni avversarie

OpenAI ha testato se GPT-6.1 Sol potesse sabotare un repository nascondendo il lavoro a un monitor di CoT.

Al massimo sforzo di ragionamento testato, il suo tasso di successo nell’eludere monitor solo-CoT era vicino allo zero sia con guide di task sia senza. A sforzi inferiori, ha eluso con tassi simili ad Astra. Un monitor ad alto richiamo con accesso all’intera traiettoria ha portato l’elusione riuscita vicino allo zero.

La consapevolezza del monitor cambia il quadro.

Quando informato di essere monitorato, GPT-6.1 Sol è diventato più evasivo di GPT-6 Sol, sebbene il richiamo del suo monitor solo-CoT sia rimasto più alto di quello di Astra. Il monitor a contesto completo ha comunque individuato il 100% dei suoi exploit honeypot riusciti.

Su un nuovo benchmark di side-task matematici, GPT-6.1 Sol ha risolto task collaterali che GPT-6 Sol falliva sistematicamente, come Latin diagonale e il contatore a 51 pile, mentre eseguiva lavoro di ingegneria software Expert-SWE.

Un monitor a contesto completo ha catturato ogni tentativo riuscito. OpenAI non ha trovato prove che GPT-6 Astra, GPT-6 Sol o GPT-6.1 Sol possano nascondere ragionamenti complessi di disallineamento ai suoi monitor, e l’addendum non copre Luna.

Quale livello di GPT-6 dovresti usare?

Usa GPT-6.1 Sol per la maggior parte del lavoro agentico e passa a GPT-6 Astra quando un fallimento costa più dei token. La famiglia GPT-6 ora ha quattro membri, e la scelta dipende da quanto ti costa un errore.

La mia posizione: GPT-6.1 Sol dovrebbe essere il predefinito per coding agentico, uso del computer e workflow aziendali, e Astra dovrebbe essere un livello di escalation, non il punto di partenza.

Le eccezioni sono il ragionamento da wet lab, la ricerca sulla sicurezza autorizzata e il lavoro scientifico più difficile. Il divario di 15,5 punti su TroubleshootingBench e di 10 punti su Internal Port è troppo grande per essere colmato con i retry.

Caso d’uso Livello Perché
Migrazioni di repo, agent di coding multi-step GPT-6.1 Sol, sforzo medio-alto Parità con Astra su DeepSWE v1.1 a circa un quinto del costo
Automazione browser e desktop GPT-6.1 Sol Entro 2,1 punti da Astra su OSWorld 2.0 (set offline, sforzo max) a circa un settimo del costo per task
Workflow aziendali multi-step GPT-6.1 Sol +2,2 punti su Opus 5.5 su AutomationBench a sforzo medio, a circa un terzo del costo
Ricerca sulla sicurezza autorizzata GPT-6 Astra 31,5% vs 21,5% su ExploitBench Internal Port e 85,4% vs 78,8% su SEC-Bench Pro
Revisione protocolli di laboratorio, troubleshooting in virologia GPT-6 Astra 63,46% vs 47,96% su TroubleshootingBench
Lavoro scientifico più impegnativo GPT-6 Astra Guida Terminal-Bench Science 0.1 al 68,1% e OpenAI lo raccomanda per questo lavoro
Triaging file, instradamento, classificazione bulk GPT-6 Luna Livello più economico della famiglia a $0,10 in input e $0,50 in output; lo abbiamo usato per restringere 56 file a 16 nel nostro agent di migrazione

Lo sforzo di ragionamento è la seconda manopola.

GPT-6.1 Sol gira a low, medium (predefinito), high, xhigh o max, e i token di ragionamento sono fatturati alla tariffa di output.

La cifra di $5,47 di OpenAI per Terminal-Bench Science è un singolo dato a sforzo massimo, quindi non mostra come il costo scala tra le impostazioni. Misuralo sul tuo carico prima di scegliere un predefinito.

La Fast mode fattura a 2x le tariffe standard e non è disponibile con residenza dati UE. OpenAI prevede anche un’opzione GPT-6.1 Sol Ultrafast in Codex con generazione token fino a 8x più veloce, che secondo Neowin costerà 6x il livello standard.

Prezzi e disponibilità di GPT-6.1 Sol

GPT-6.1 Sol costa $2,00 per 1M token in input e $10,00 per 1M token in output, come GPT-6 Sol e a un quinto dei $10 e $50 di Astra. L’input in cache scende da $0,20 a $0,10 per 1M token, con scritture in cache a $2,50 per 1M.

I token di ragionamento sono fatturati alla tariffa di output, che è il numero da monitorare a sforzo alto e max.

Tariffa Prezzo per 1M token
Input $2,00
Input in cache $0,10
Scritture in cache $2,50
Output $10,00

Si applicano diversi modificatori.

I prompt oltre 272.000 token in input sono fatturati al doppio delle tariffe di input e cache e a 1,5x per l’output per l’intera richiesta.

La Fast mode costa 2x lo standard, l’elaborazione regionale aggiunge un 10% dove disponibile, e Batch e Flex girano al 50% sotto lo standard.

Contro l’ultimo modello Opus di Anthropic, il divario è ampio solo sotto i 272.000 token. C

laude Opus 5.5 costa $4 per 1M token in input e $20 per 1M token in output, e fattura l’intera finestra da 1M token a tali tariffe, come abbiamo trattato nel nostro tutorial sull’API di Opus 5.5.

GPT-6.1 Sol costa esattamente la metà sotto la soglia. Sopra, GPT-6.1 Sol costa $4 in input e $15 in output, quindi il vantaggio in input scompare.

Il livello top di Anthropic è Claude Fable 5.1, che lista $10 e $50, come Astra.

La Fast mode non è disponibile con residenza dati UE, quindi i deployment europei con requisiti di residenza perdono l’opzione di latenza mantenendo le tariffe standard.

Come ottenere l’accesso a GPT-6.1 Sol

GPT-6.1 Sol è disponibile in ChatGPT Work e Codex, nell’API di OpenAI e tramite diverse piattaforme di terze parti. Al 29 settembre 2026, questi sono i canali che abbiamo potuto confermare:

  • ChatGPT Work e Codex: piani Plus, Pro, Business, Enterprise ed Edu, nell’app desktop, nella CLI e nell’estensione IDE. Enterprise ed Edu lo tengono disattivato per default finché un amministratore non lo abilita. Non è in Chat, e i piani Free e Go non sono inclusi. La pagina dei modelli di Codex elenca gpt-6.1-sol.
  • API di OpenAI: l’ID modello è gpt-6.1-sol.
  • Piattaforme di terze parti: OpenRouter (openai/gpt-6.1-sol), Vercel AI Gateway e GitHub Copilot per utenti Pro+, Max, Business ed Enterprise.

Usa la Responses API per la chiamata strumenti. Chat Completions funziona per questo modello solo senza tool. Non inviare sforzo none o minimal, perché non sono supportati.

from openai import OpenAI

client = OpenAI()
response = client.responses.create(
    model="gpt-6.1-sol",
    input="Find the retry-policy change in this diff and explain the blast radius.",
    reasoning={"effort": "medium"},  # low, medium, high, xhigh, or max
)
print(response.output_text)

Considerazioni finali

GPT-6.1 Sol offre gran parte delle prestazioni agentiche di Astra a un quinto del prezzo per token, il che lo rende la scelta giusta come predefinito per coding agentico, uso del computer e workflow aziendali.

OpenAI scommette che alla maggior parte degli sviluppatori non serva il frontier, ma solo l’output del frontier a un prezzo sostenibile in loop.

A $5,47 per task di Terminal-Bench Science 0.1 contro i $23,80 di Astra, la scommessa è esplicita, e mette pressione su Claude Opus 5.5 a $23,21. La risposta di Anthropic è arrivata un giorno prima con Claude Sonnet 5.5, che lista gli stessi $2 e $10.

Passerei da GPT-6 Sol una volta gestita la migrazione. Il prezzo è lo stesso, e i numeri su sviluppo di exploit, debugging della ricerca e fattualità a basso sforzo sono chiaramente migliori. Ma il codice che dipende da sforzo none o dalla function calling in Chat Completions va cambiato prima.

Terrei anche un passaggio di revisione umana sulle run di agent non presidiati, dato che inganno nel coding (1,50% contro lo 0,51% di Astra) e persistenza indesiderata (23,5% contro 17,4%) stanno entrambi sopra i tassi di Astra.

Terei Astra per il ragionamento da wet lab, la ricerca sulla sicurezza autorizzata e i compiti scientifici più difficili, dove il divario di 15,5 punti su TroubleshootingBench e di 10 punti su ExploitBench Internal Port è reale.

Quasi tutte le cifre qui sono di OpenAI, con risultati dei concorrenti tratti da report pubblici e nessuna riproduzione indipendente pubblicata. Esegui una tua valutazione sul tuo carico prima di impegnarti.

Se vuoi costruire con modelli come questo anziché solo leggerne, ti consiglio di iniziare dal nostro percorso di competenze AI Fundamentals.

FAQs

Come si confronta GPT-6.1 Sol con GPT-6 Astra?

GPT-6.1 Sol si avvicina a GPT-6 Astra nelle valutazioni su salute, allucinazioni e allineamento, e lo eguaglia su DeepSWE v1.1 a circa un quinto del costo. Astra resta avanti nei test di capacità più difficili, inclusi 31,5% vs 21,5% su ExploitBench Internal Port e 63,46% vs 47,96% su TroubleshootingBench. Usa Sol come predefinito ed eleva ad Astra per ricerca sulla sicurezza e ragionamento su protocolli di laboratorio.

Quanto costa GPT-6.1 Sol?

GPT-6.1 Sol costa $2,00 per 1M token in input e $10,00 per 1M token in output, con input in cache a $0,10 e scritture in cache a $2,50. I prompt oltre 272.000 token in input sono fatturati a 2x in input e 1,5x in output per l’intera richiesta; la Fast mode è 2x lo standard, e Batch e Flex girano al 50% sotto lo standard. OpenAI elenca il prezzo promozionale come disponibile almeno fino al 21 novembre 2026.

Dove posso accedere a GPT-6.1 Sol?

L’ID modello API è gpt-6.1-sol. Al 29 settembre 2026 è elencato su OpenRouter come openai/gpt-6.1-sol, nel catalogo models.dev, su GitHub Copilot e su Azure AI Foundry. Non risultava elencato nelle pagine di documentazione di Cursor o della CLI di Codex a quella data, e la disponibilità su Google Vertex AI e AWS Bedrock non poteva essere confermata.

Qual è la finestra di contesto di GPT-6.1 Sol?

GPT-6.1 Sol ha una finestra di contesto da 1.050.000 token e un output massimo di 128.000 token. Le richieste oltre 272.000 token in input sono fatturate al doppio delle tariffe di input e cache e a 1,5x per l’output sull’intera richiesta, quindi la finestra economica effettiva è di 272.000 token.

GPT-6.1 Sol è sicuro da usare in agent autonomi?

OpenAI classifica GPT-6.1 Sol come capacità Critica nella cybersecurity e Alta nel dominio Biologico e Chimico, quindi arriva con la stessa pila di salvaguardie di GPT-6 Astra. In una simulazione di deployment su 49.650 task interni di Codex ha registrato il 33% di flag di disallineamento di severità 3 o superiore in meno rispetto a GPT-6 Sol. La principale regressione da monitorare è la persistenza indesiderata dopo un’azione bloccata, al 23,5% dei rollout contro il 17,4% di Astra.

Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Senior editor nell’ambito dell’AI e dell’edtech. Impegnata a esplorare le tendenze in tema di dati e intelligenza artificiale.  

Argomenti
Intelligenza artificiale
Large Language Models
OpenAI

I migliori corsi DataCamp

Programma

Nozioni di base sugli agenti AI

6 h
Scopri come gli agenti di intelligenza artificiale possono cambiare il tuo modo di lavorare e dare un valore aggiunto alla tua azienda!
Vedi dettagliRight Arrow
Inizia Il Corso
Mostra altroRight Arrow
Correlato

blog

Tokenizzazione nel NLP: come funziona, sfide e casi d'uso

Guida al preprocessing NLP nel machine learning. Copriamo spaCy, i transformer di Hugging Face e come funziona la tokenizzazione in casi d'uso reali.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

I 15 migliori server MCP remoti che ogni AI builder dovrebbe conoscere nel 2026

Scopri i 15 migliori server MCP remoti che stanno trasformando lo sviluppo AI nel 2026. Scopri come migliorano automazione, ragionamento, sicurezza e velocità dei workflow.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Che cos'è Snowflake? Guida per principianti alla piattaforma dati cloud

Esplora le basi di Snowflake, la piattaforma dati cloud. Scopri la sua architettura, le sue funzionalità e come integrarla nelle tue pipeline di dati.
Tim Lu's photo

Tim Lu

12 min

Mostra AltroMostra Altro