Google ha annunciato Gemini 4 Argon alla fine di settembre. Argon è il primo modello Gemini 4 di Google ed è la nuova frontiera. Arriva quattro settimane dopo GPT-6 Astra di OpenAI, il nuovo modello di punta lanciato a inizio settembre.
La tabella di lancio di Google mette Argon davanti ad Astra nella maggior parte delle voci, a una frazione del prezzo di Astra. C’è però un dettaglio che conta più di qualsiasi benchmark: Argon non è ancora generalmente disponibile. Google lo sta distribuendo prima a team di cybersecurity verificati, senza una data per sviluppatori o consumatori.
TL;DR
- Nella tabella benchmark di Google, Gemini 4 Argon batte GPT-6 Astra nella maggior parte delle voci, soprattutto in ambito legale, finanziario e nei flussi di lavoro aziendali.
- GPT-6 Astra mantiene il vantaggio nei compiti più difficili di ingegneria del software, nel lavoro scientifico da terminale e nell’uso del computer.
- Il prezzo di lancio di Argon è un quinto di quello di Astra, e il prezzo standard resta comunque meno della metà.
- Ma non puoi ancora usare Argon: l’accesso è limitato ai difensori informatici fidati di Google; a seguire, clienti API a pagamento e abbonati a AI Ultra.
- Quindi, scegli GPT-6 Astra se ti serve un modello di frontiera in produzione oggi.
Che cos’è Gemini 4 Argon?
Gemini 4 Argon è il nuovo modello di frontiera di Google DeepMind, annunciato a fine settembre. È il primo modello della generazione Gemini 4.
Google ha progettato Argon per sostenere un ragionamento profondo su lavori lunghi e multi-step. Questo è supportato da un limite di output portato a 1M token, così il modello può risolvere un problema complesso in un’unica passata.
Che cos’è GPT-6 Astra?
GPT-6 Astra è il modello di punta di OpenAI, rilasciato a inizio settembre. È in cima alla famiglia GPT-6 sopra GPT-6.1 Sol e GPT-6 Luna.
OpenAI lo posiziona come il suo modello più capace per il lavoro più impegnativo, dal ragionamento complesso e il coding all’uso del computer e alla ricerca.
Gemini 4 Argon vs GPT-6 Astra: confronto diretto
Dei 19 benchmark nella tabella di lancio di Google, Argon ottiene un punteggio più alto di Astra in 14, Astra ne vince 4 e uno è un pareggio. Sono tutti presi dalla tabella di Google, quindi leggili come l’argomentazione di Google a favore di Argon, non come una classifica indipendente. Ho ridotto quella tabella per mostrare quelli che considero i test più noti, interessanti e rilevanti per questo lancio.
| Feature | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|
| Vals Index | 68,9% | 63,1% |
| AutomationBench | 51,3% | 41,4% |
| Vals Finance Agent v2 | 65,4% | 53,5% |
| Harvey's Legal Agent Benchmark | 19,6% | 5,4% |
| DeepSWE v1.1 | 77,9% | 74,1% |
| FrontierSWE v2 | 55,0% | 65,5% |
| Terminal-bench 4.0 | 57,4% | 58,2% |
| Terminal-Bench Science 0.1 | 57,6% | 68,1% |
| OSWorld-2.0 (offline subset) | 69,2% | 72,6% |
| Max output tokens | 1M | 128K |
| Availability | Solo difensori informatici fidati | Generalmente disponibile |
Ogni dimensione qui sotto riprende il resto della tabella.
Knowledge work: ambito legale, finanza e flussi di lavoro aziendali
È qui che il vantaggio di Argon è più ampio, ed è qui che Google ha puntato il lancio.
Su Harvey's Legal Agent Benchmark, che valuta ricerca e redazione legale, Argon segna il 19,6% contro il 5,4% di Astra. È un punteggio basso per entrambi, ma completare più del triplo dei task è il divario relativo più grande dell’intera tabella.
Lo schema si conferma nella ricerca finanziaria e nell’automazione aziendale, dove Argon è avanti di circa 10–12 punti. Se questi risultati reggeranno quando sarà usabile da tutti, Argon sarà il modello più forte per il lavoro documentale in ambito legale e finanziario.
Coding e ingegneria del software
Nel coding è un testa a testa, e dipende da che tipo di ingegneria intendi.
Argon è avanti su DeepSWE v1.1, che testa compiti a lungo orizzonte su codebase reali, e supera di poco Astra su Vibe Code Bench, che valuta la costruzione di app funzionanti.

Astra vince nettamente su FrontierSWE v2, e i due sono distanti meno di un punto su Terminal-bench 4.0.
Gli esempi forniti da Google puntano a grandi migrazioni, incluso il passaggio da C e C++ a Rust su codebase di Google.
Sul benchmark di ingegneria più difficile in tabella, però, Astra è ancora davanti.
Lungo contesto e comprensione visiva
Argon prende il largo man mano che gli input si allungano.
Su GraphWalks, che testa il ragionamento su strutture a grafo distribuite in un contesto lungo, i due sono vicini fino a 128K token, ma tra 256K e 1M token Argon segna di più.
Argon è avanti anche su LVBench per la comprensione di video lunghi, mentre la lettura di grafici su Chartography è quasi un pareggio.
Per chi inserisce interi contratti, codebase o registrazioni in un modello, questa è la differenza più pratica dopo la disponibilità.
Scienza, matematica e uso del computer
Astra tiene il passo nel lavoro scientifico da terminale, guidando Terminal-Bench Science 0.1 di oltre 10 punti. Argon è avanti su LABBench 2, un benchmark per la ricerca in biologia, e su RiemannBench in matematica. Nell’uso del computer, Astra guida OSWorld-2.0 mentre Argon guida Agent's Last Exam, quindi nessuno domina la categoria.
Disponibilità e sicurezza
Astra è quello che puoi distribuire oggi. Argon è al momento limitato al Fairwind Program di Google per i difensori informatici fidati, oltre ai team interni di Google, e Google afferma che i clienti API a pagamento e gli abbonati a Google AI Ultra saranno i prossimi, senza fornire una data.
La storia cyber di Argon ha anche due facce. Google lo rilascia a difensori verificati senza barriere specifiche per il cyber, e pareggia Astra al primo posto su CWE-bench v1, che testa la correzione di vulnerabilità di sicurezza reali.
Per tutti gli altri, Google afferma che Argon rifiuterà richieste dannose in ambito cyber e CBRN e che esegue monitoraggi in grado di interrompere l’esecuzione quando il modello supera l’intento dell’utente.
Prezzi: quanto paghi davvero
Argon costa un quinto di Astra al prezzo introduttivo e meno della metà al prezzo standard, ma Google non ha indicato quanto durerà il prezzo di lancio.
Tariffe per token a confronto
| Rate | Gemini 4 Argon (introduttivo) | Gemini 4 Argon (standard) | GPT-6 Astra |
|---|---|---|---|
| Input, per 1M token | $2,00 | $4,00 | $10,00 |
| Output, per 1M token | $10,00 | $20,00 | $50,00 |
| Lettura input in cache, per 1M token | $0,10 (95% di sconto sull’input) | Non pubblicato | $1,00 |
| Sovrapprezzo per contesto lungo | Non pubblicato | Non pubblicato | Oltre 272K token di input: 2x input e cache, 1,5x output per l’intera richiesta |
Il multiplo è uniforme su input e output: 0,2x Astra alle tariffe introduttive e 0,4x a quelle standard. Entrambi i vendor fatturano il ragionamento come output, cosa che incide di più su Argon, dato che Google ha portato il limite di output a 1M token proprio per farlo "pensare" più a lungo.
Persino alle tariffe standard, Argon resta ben sotto la metà del costo di Astra. La questione aperta riguarda i prompt lunghi, dove solo Astra ha pubblicato i prezzi.
Quanto costa un carico di lavoro reale
| Workload | Gemini 4 Argon (intro) | Gemini 4 Argon (standard) | GPT-6 Astra |
|---|---|---|---|
| Assistant bilanciato: 1M in / 250K out | $4,50 | $9,00 | $22,50 |
| Retrieval, ogni richiesta sotto 272K: 10M in / 1M out | $30 | $60 | $150 |
| Retrieval, ogni richiesta sopra 272K: 10M in / 1M out | Non pubblicato | Non pubblicato | $275 |
Ogni totale è (volume ÷ 1M) × tariffa, sommati tra input e output, alle tariffe standard.
- Assistant bilanciato: Argon fa risparmiare 18 $ al mese (80%) alle tariffe introduttive e 13,50 $ (60%) a quelle standard.
- Retrieval sotto 272K: lo stesso risparmio dell’80% e 60%, su una scala in cui inizia a pesare: 120 $ o 90 $ al mese.
- Retrieval sopra 272K: il sovrapprezzo di Astra porta il costo a 275 $. Google non ha detto se Argon preveda una fascia per contesti lunghi, quindi questa è la riga da controllare quando la pagina prezzi di Argon sarà online.
I due vendor usano tokenizer diversi e nessuno ha pubblicato conteggi di token su un carico di lavoro condiviso, quindi considera questi totali un confronto di tariffe più che una fattura.
Quando scegliere Gemini 4 Argon vs GPT-6 Astra
Per ora, la discriminante è la disponibilità, non i benchmark: Astra è generalmente disponibile, mentre Argon è limitato a difensori cyber verificati. Quando Argon si aprirà, il suo multiplo di prezzo tra 0,2x e 0,4x lo renderà il default da testare per il knowledge work.
Scegli Gemini 4 Argon se…
- Il tuo lavoro è ricerca legale, analisi finanziaria o automazione aziendale. Sono i suoi vantaggi più ampi nella tabella di Google, e il divario nel legale è il più grande in assoluto.
- Gli passi input molto lunghi. Regge molto meglio di Astra nel ragionamento tra 256K e 1M token, e guida sui video lunghi.
- Il prezzo conta a qualità di frontiera. Anche alle tariffe standard, costa ben meno della metà di Astra per token.
Scegli GPT-6 Astra se…
- Ti serve oggi. Astra è in ChatGPT, OpenAI API, Azure, Bedrock, GitHub Copilot e OpenRouter, mentre Argon non ha ancora un’API pubblica.
- Il tuo lavoro più difficile è ingegneria del software o calcolo scientifico. È davanti ad Argon su FrontierSWE v2 e Terminal-Bench Science di oltre 10 punti ciascuno.
- Esegui agenti per l’uso del computer su app desktop. È avanti su OSWorld-2.0, anche se Argon vince su Agent's Last Exam, quindi testa sui tuoi task.
Considerazioni finali
Se ti serve un modello di frontiera questa settimana, l’opzione è GPT-6 Astra. Se il tuo lavoro è legale, finanza o analisi di documenti lunghi e puoi aspettare, pianifica di testare Gemini 4 Argon il giorno in cui si aprirà. Ti terremo aggiornato su quando accadrà, se ti iscrivi a The Median, la nostra newsletter settimanale:
Questo confronto, Argon contro Astra, è interessante. Google ha lanciato Argon con una tabella di benchmark che mostra come superi OpenAI in gran parte delle voci, con un prezzo inferiore ad Astra. Ma al momento non c’è modo per la maggior parte delle persone di usarlo.
Google scommette che il suo vantaggio reggerà fino all’arrivo dell’accesso.
FAQ
Gemini 4 Argon è migliore di GPT-6 Astra?
Nella tabella benchmark di Google, Gemini 4 Argon ottiene un punteggio più alto di GPT-6 Astra in 14 su 19 benchmark, con i maggiori vantaggi in ambito legale, finanza, automazione aziendale e lavoro a lungo contesto. GPT-6 Astra è avanti su FrontierSWE v2, Terminal-Bench Science 0.1, OSWorld-2.0 e Terminal-bench 4.0. Tutti i punteggi provengono da Google, quindi servono ancora test indipendenti.
Posso già usare Gemini 4 Argon?
Non a meno che tu non faccia parte del Fairwind Program di Google per difensori informatici fidati. Google afferma che i clienti API a pagamento e gli abbonati a Google AI Ultra avranno accesso in seguito, ma non ha fornito una data né pubblicato un ID modello API.
Quanto costa Gemini 4 Argon rispetto a GPT-6 Astra?
Gemini 4 Argon debutta a 2 $ per milione di token di input e 10 $ per milione di token di output, salendo poi a 4 $ e 20 $. GPT-6 Astra costa 10 $ e 50 $, quindi Argon è a un quinto del prezzo di Astra alle tariffe introduttive e al 40% a quelle standard. Google non ha indicato quanto durerà il periodo introduttivo.
Qual è migliore per il coding, Gemini 4 Argon o GPT-6 Astra?
È un testa a testa. Gemini 4 Argon è avanti su DeepSWE v1.1 e Vibe Code Bench nella tabella di Google, mentre GPT-6 Astra guida FrontierSWE v2 di circa 10 punti e supera di poco Argon su Terminal-bench 4.0. Per i task di ingegneria più difficili, al momento Astra ha il risultato pubblicato più forte.
Qual è il limite di output di Gemini 4 Argon?
Google ha portato il limite di output di Gemini 4 Argon a 1M token, rispetto ai 64K dei precedenti modelli Gemini, così può ragionare su problemi lunghi in un’unica passata. Il massimo output di GPT-6 Astra è 128K token.