Corso
Nota: Poche settimane dopo il lancio di Gemini 3.7 Flash, Google ha presentato Gemini 3.8 Flash. Guardalo in azione nel nostro tutorial sull'API di Gemini 3.8 Flash.
Google ha rilasciato Gemini 3.7 Flash, il suo modello di fascia Flash più capace finora, pensato espressamente per coding e workflow agentici. Il lancio arriva mentre il modello di punta di Google, Gemini 3.5 Pro, è ancora in ritardo: Reuters lo ha segnalato come un banco di prova per capire se DeepMind riesca a tenere il passo con Anthropic e OpenAI.
I numeri in evidenza sono aggressivi. Gemini 3.7 Flash totalizza il 43,6% su FrontierCode 1.1 Main (in salita dal 34,4% di 3.6 Flash), raggiunge 1588 Elo su Code Arena per lo sviluppo web e viene proposto a un prezzo introduttivo di $0,75 per 1M token in input e $3,75 per 1M token in output, metà del costo iniziale di 3.6 Flash.
In questo articolo coprirò tutte le novità di Gemini 3.7 Flash, analizzando le funzionalità, i benchmark e impostando test pratici che puoi eseguire tu stesso. Per approfondire i modelli rivali con cui compete, vedi le nostre guide su GPT-5.6 Terra vs Claude Sonnet 5 e su come imparare a usare Claude.
In breve
- Gemini 3.7 Flash è il modello Flash più capace di Google, pensato per coding e workflow agentici, con una finestra di contesto da 1M token.
- Prezzo introduttivo: $0,75/1M token in input e $3,75/1M in output fino al 31 dicembre 2026, poi $1,50/$7,50 standard.
- Supera FrontierCode 1.1 (43,6%), GDP.pdf (34,0%), Harvey LAB-AA (90,7%) e GDM-MRCR long context (97,0%) rispetto a Claude Sonnet 5 e GPT-5.6 Terra.
- GPT-5.6 Terra resta in testa su DeepSWE, Terminal-bench e le valutazioni agentiche OSWorld.
- Disponibile tramite Gemini API, Google Antigravity, Gemini Enterprise e Gemini Spark.
Cos'è Gemini 3.7 Flash?
Gemini 3.7 Flash è il modello tuttofare di fascia media di Google, posizionato come il suo modello Flash più capace per coding complesso, workflow agentici ed esecuzione affidabile su più passaggi. Segue Gemini 3.6 Flash, arrivato tre settimane prima, e Google attribuisce il salto di qualità al feedback degli sviluppatori e a modifiche algoritmiche.
Il modello è generalmente disponibile tramite la Gemini API con una finestra di contesto da 1M token (1.048.576 token in input) e un limite di 65.536 token in output. Accetta input in testo, immagini, video, audio e PDF e restituisce solo testo. Google espone livelli di ragionamento regolabili basso, medio e alto, anche se l'API restituisce un errore se richiedi l'impostazione non supportata minimal.
Il dato di benchmark più indicativo è DeepSWE v1.1, una valutazione di ingegneria del software a lungo orizzonte, dove 3.7 Flash ottiene il 65,3% contro il 34,4% del suo predecessore su FrontierCode e appena il 48,6% per 3.6 Flash su DeepSWE stesso. Si tratta di un grande guadagno in una sola generazione per un modello che è anche sceso di prezzo, fatto insolito.
Cosa c'è di nuovo in Gemini 3.7 Flash?
La storia qui è un modello Flash più capace a un prezzo più basso, con migliore aderenza alle istruzioni e meno babysitting nei loop agentici. Ecco i cambiamenti che contano di più per chi lo usa sul campo.
Coding e risoluzione dei problemi più solidi
Puoi affidare a Gemini 3.7 Flash attività più difficili di debugging e refactoring e aspettarti maggiore accuratezza al primo tentativo. Google riporta il 43,6% su FrontierCode 1.1 Main per qualità di codice pronta alla produzione, in salita dal 34,4% di 3.6 Flash, e il 65,3% su DeepSWE v1.1 per l'ingegneria del software a lungo orizzonte.
Per gli ingegneri in attività, la lettura pratica è: meno tentativi. Secondo Google, il modello si adatta meglio agli ostacoli e segue le istruzioni con più fedeltà, riducendo la supervisione manuale che rende i modelli economici costosi in tempo reale.
Generazione più rapida di web app e UI
Gemini 3.7 Flash genera layout funzionali e web app complete di funzionalità con meno prompt rispetto a 3.6 Flash. Nella classifica web development di Code Arena ottiene 1588 Elo contro 1538 di 3.6 Flash e 1541 di Claude Sonnet 5.
Il modello può anche rispettare un input di riferimento nella generazione della UI, sia che il riferimento sia uno screenshot, un'immagine o un design system completo. Se gli fornisci un mockup di una pagina prezzi, punta a riprodurre l'aderenza al design invece di improvvisare un layout generico.
Esecuzione agentica multi-step migliore
Il modello investe più sforzo in pianificazione e chiamate agli strumenti, che è dove di solito i modelli economici cedono. Su AutomationBench, una valutazione privata per workflow aziendali reali, 3.7 Flash ottiene il 30,4% contro il 17,0% di 3.6 Flash e il 10,7% di Claude Sonnet 5.
Gli strumenti integrati disponibili tramite l'API includono caching, esecuzione di codice, ricerca file, function calling, search grounding, grounding con Google Maps, output strutturati e contesto da URL. L'uso del computer è presente ma contrassegnato come anteprima, quindi non ci costruirei ancora agenti di produzione.
Lavoro su documenti e conoscenza migliorato
Gemini 3.7 Flash gestisce ambiti ad alta densità informativa come finanza, diritto e bioscienze con un migliore ragionamento e comprensione dei documenti. Sul benchmark GDP.pdf per la comprensione esperta di PDF ottiene il 34,0% contro il 22,0% di 3.6 Flash e su Harvey LAB-AA per workflow legali complessi arriva al 90,7%.
Se il tuo lavoro prevede di estrarre risposte strutturate da corpose relazioni annuali o contratti, questa è la release da testare. Il modello produce ancora solo testo, quindi non genererà i grafici che legge: li descriverà o riassumerà.
Prezzo più basso per scalare gli agenti
Il prezzo introduttivo dimezza il costo di gestione di agenti basati su Flash rispetto alle tariffe di lancio di 3.6 Flash. Fino al 31 dicembre 2026, paghi $0,75 per 1M token in input e $3,75 per 1M token in output.
- Input: $0,75 per 1M token (introduttivo), che sale a $1,50 per 1M il 1° gennaio 2027
- Output: $3,75 per 1M token (introduttivo), che sale a $7,50 per 1M il 1° gennaio 2027
Per confronto, Claude Sonnet 5 è a $2,00 in input e $10,00 in output nella tabella benchmark di Google, e GPT-5.6 Terra a $2,00 in input e $12,00 in output. Sul prezzo per token puro, 3.7 Flash batte entrambi di largo margine.
Benchmark di Gemini 3.7 Flash
La tabella dei benchmark di Google confronta Gemini 3.7 Flash con 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra e Muse Spark 1.2. Il pattern è costante: 3.7 Flash supera il suo predecessore in quasi tutte le valutazioni e se la gioca con rivali più costosi, anche se GPT-5.6 Terra lo supera in diverse valutazioni agentiche di coding.
Gemini 3.7 Flash rispetto al campo in sintesi
Ecco come si allineano i numeri chiave sui quattro modelli nella tabella benchmark di Google.
| Metrica | Gemini 3.7 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|
| Prezzo input / 1M | $0,75 | $2,00 | $2,00 |
| Prezzo output / 1M | $3,75 | $10,00 | $12,00 |
| FrontierCode 1.1 Main | 43,6% | 42,7% | 41,3% |
| DeepSWE v1.1 | 65,3% | 53,8% | 69,6% |
| Terminal-bench 2.1 | 85,8% | 80,4% | 87,4% |
| GDP.pdf | 34,0% | 28,0% | 24,7% |
| GDM-MRCR v2 (128k) | 97,0% | 81,5% | 93,5% |
FrontierCode 1.1 Main
FrontierCode 1.1 Main misura la qualità del codice di produzione, quindi premia il codice corretto e pronto per essere rilasciato, non solo sintatticamente valido.
Gemini 3.7 Flash ottiene il 43,6%, davanti a Claude Sonnet 5 al 42,7%, GPT-5.6 Terra al 41,3% e al suo predecessore 3.6 Flash al 34,4%.
Per un modello di fascia Flash, superare entrambi i rivali di frontiera sulla qualità del codice di produzione è il risultato più sorprendente di questo rilascio, soprattutto a un terzo del loro costo per token.
DeepSWE v1.1
DeepSWE v1.1 testa l'ingegneria del software a lungo orizzonte, cioè attività multi-file che richiedono contesto sostenuto su molti passaggi.
Qui, 3.7 Flash ottiene il 65,3%, un grande salto dal 48,6% di 3.6 Flash, ma GPT-5.6 Terra è in testa al 69,6% e Claude Sonnet 5 segue al 53,8%.
Il succo: 3.7 Flash ha colmato gran parte del divario con Terra nel coding a lungo orizzonte ma non l'ha superato. Se ti serve il massimo assoluto nel coding agentico multi-file, Terra vince ancora in quella valutazione specifica.
Terminal-bench 2.1 e 3.0
Terminal-bench misura il coding agentico da terminale, in cui il modello guida una riga di comando per completare i task.
Su Terminal-bench 2.1, 3.7 Flash ottiene l'85,8% contro il 78,0% di 3.6 Flash e l'80,4% di Claude Sonnet 5, anche se GPT-5.6 Terra guida con l'87,4%.
Il più recente Terminal-bench 3.0 per capacità agentiche generali è più difficile per tutti: 3.7 Flash ottiene il 14,9%, ben sopra 3.6 Flash al 5,4%, circa alla pari con Claude Sonnet 5 al 14,6% e dietro Terra al 20,8%.
Questi valori assoluti bassi sono un utile bagno di realtà su quanta strada debba ancora fare l'affidabilità generale degli agenti.
GDP.pdf e Harvey LAB-AA
GDP.pdf testa la comprensione esperta di documenti PDF, mentre Harvey LAB-AA testa workflow legali complessi.
Gemini 3.7 Flash guida entrambi: 34,0% su GDP.pdf contro 28,0% di Claude Sonnet 5 e 24,7% di GPT-5.6 Terra, e 90,7% su Harvey LAB-AA contro 90,1% di Sonnet 5 e 85,2% di Terra.
Se il tuo carico di lavoro è l'analisi legale o finanziaria basata su documenti, qui il modello più economico in tabella è anche il più accurato, combinazione rara.
GDM-MRCR v2 long context
GDM-MRCR v2 (8-needle) misura il recupero su contesti lunghi, testando se il modello riesce a trovare più informazioni sepolte all'interno di un input esteso.
Alla media 128k, 3.7 Flash ottiene il 97,0%, davanti a 3.6 Flash al 91,8%, a Claude Sonnet 5 all'81,5% e a GPT-5.6 Terra al 93,5%.
Con una finestra di contesto da 1M token e il miglior recupero 8-needle in tabella, 3.7 Flash è una scelta forte per pipeline che inseriscono grandi documenti o trascrizioni lunghe in una singola chiamata.
Quando abbiamo confrontato Terra e Sonnet 5, il recupero su contesti lunghi era uno dei differenziatori più netti tra loro, e 3.7 Flash ora si colloca sopra entrambi in questa fascia.
Dove GPT-5.6 Terra resta in testa
Vale la pena essere onesti sulle sconfitte.
GPT-5.6 Terra batte Gemini 3.7 Flash su DeepSWE v1.1 (69,6% vs 65,3%), Terminal-bench 2.1 (87,4% vs 85,8%), Terminal-bench 3.0 (20,8% vs 14,9%) e OSWorld-2.0 per l'uso agentico del computer (50,2% vs 47,9%).
Il pattern è che Terra mantiene un piccolo vantaggio sulle valutazioni agentiche e di coding da terminale più difficili, mentre 3.7 Flash vince su qualità del codice di produzione, comprensione dei documenti e recupero su contesti lunghi. Quale convenga dipende dal fatto che il tuo collo di bottiglia sia l'affidabilità dell'agente o il costo.

Prezzi e disponibilità di Gemini 3.7 Flash
Gemini 3.7 Flash è generalmente disponibile ora tramite diverse superfici Google.
L'ID del modello API è gemini-3.7-flash e puoi iniziare a sviluppare in Google AI Studio, Android Studio o nell'ambiente agent-first Google Antigravity.
- Sviluppatori: Gemini API tramite Google AI Studio e Android Studio; workflow agentici in Google Antigravity
- Imprese: Gemini Enterprise Agent Platform e app Gemini Enterprise
- Privati: Gemini Spark, l'agente personale 24/7 nell'app Gemini, per gli abbonati Google AI Pro e Ultra in oltre 160 paesi
Il prezzo è di $0,75 per 1M token in input e $3,75 per 1M token in output fino al 31 dicembre 2026. Dal 1° gennaio 2027 si applicano le tariffe standard di $1,50 in input e $7,50 in output. Nota che generazione audio, generazione di immagini e Live API non sono supportati da questo modello, e l'uso del computer è solo in anteprima.
Considerazioni finali
Gemini 3.7 Flash mostra un Google che rilascia rapidamente e taglia i prezzi mentre il suo modello di punta Gemini 3.5 Pro resta in ritardo.
Rilasciare un modello Flash migliorato tre settimane dopo 3.6 Flash, a metà del costo per token, suona come la strategia di un'azienda che vuole vincere sulla fascia media, dove si concentra gran parte dei volumi di produzione.
Onestamente, penso che questo sia il modello giusto se il tuo carico di lavoro riguarda comprensione di documenti, codice web e app di produzione o recupero su contesti lunghi, ambiti in cui supera nettamente Claude Sonnet 5 e GPT-5.6 Terra costando una frazione.
Se il tuo collo di bottiglia è il coding agentico da terminale più difficile, Terra mantiene ancora un leggero vantaggio su DeepSWE e Terminal-bench, e pagheresti di più per quel tetto prestazionale.
Con il rimpasto della leadership di DeepMind e il ritardo del modello Pro, Google punta su Flash per dimostrare di poter ancora competere. Nella tabella benchmark appena pubblicata, quell'argomento regge in gran parte per un modello di fascia media.
Se vuoi fare pratica con modelli di questo tipo, ti consiglio di iniziare dal nostro percorso di competenze AI Fundamentals per costruire le basi prima di collegare Gemini 3.7 Flash alle tue pipeline di agenti.
FAQ
In che modo Gemini 3.7 Flash si confronta con Gemini 3.6 Flash?
Gemini 3.7 Flash migliora 3.6 Flash in quasi tutti i benchmark pubblicati da Google, tra cui FrontierCode 1.1 Main (43,6% vs 34,4%), DeepSWE v1.1 (65,3% vs 48,6%), comprensione di documenti GDP.pdf (34,0% vs 22,0%) e AutomationBench (30,4% vs 17,0%). Arriva anche a metà del prezzo per token di lancio di 3.6 Flash. I due modelli condividono la stessa finestra di contesto da 1M token.
Dove posso accedere a Gemini 3.7 Flash?
Gli sviluppatori possono usarlo tramite la Gemini API in Google AI Studio e Android Studio, oppure nell'ambiente orientato agli agenti Google Antigravity, con l'ID modello gemini-3.7-flash. Le imprese lo ottengono tramite la Gemini Enterprise Agent Platform e l'app Gemini Enterprise. I privati possono accedervi tramite Gemini Spark per gli abbonati Google AI Pro e Ultra in oltre 160 paesi.
Quanto costa Gemini 3.7 Flash?
Fino al 31 dicembre 2026, il prezzo introduttivo è di $0,75 per 1M token in input e $3,75 per 1M token in output. Dal 1° gennaio 2027, il prezzo standard sale a $1,50 per 1M token in input e $7,50 per 1M token in output. Questo batte Claude Sonnet 5 e GPT-5.6 Terra, che nella tabella benchmark di Google sono a $2,00 in input.
Quali standard di sicurezza segue Gemini 3.7 Flash?
Gemini 3.7 Flash arriva con salvaguardie Frontier Safety aggiornate contro l'uso improprio nei domini Chimico, Biologico, Radiologico e Nucleare (CBRN) e nella cyber-offense. Google riferisce che si comporta in modo simile a 3.6 Flash nelle valutazioni di sicurezza e tono, con rifiuti ingiustificati bassi. Ha inoltre soddisfatto le soglie di sicurezza dei minori di Google durante il red teaming.
Gemini 3.7 Flash è migliore di GPT-5.6 Terra per il coding?
Dipende dal task. Gemini 3.7 Flash è in testa per la qualità del codice di produzione su FrontierCode 1.1 (43,6% vs 41,3%), mentre GPT-5.6 Terra guida su DeepSWE v1.1 per il coding a lungo orizzonte (69,6% vs 65,3%), Terminal-bench 2.1 (87,4% vs 85,8%) e l'uso agentico del computer in OSWorld. Terra mantiene un leggero vantaggio sulle valutazioni agentiche più difficili, ma 3.7 Flash costa una frazione.
Senior editor nell’ambito dell’AI e dell’edtech. Impegnata a esplorare le tendenze in tema di dati e intelligenza artificiale.
