Vai al contenuto principale

Gemini Omni: un unico modello per testo, immagini, audio e video

Uno sguardo iniziale al modello any-to-any di Google DeepMind — cosa fa, cosa c'è di nuovo e come accedervi.
Aggiornato 29 set 2026  · 7 min leggi

Scopri con l'IA

ChatGPTClaudePerplexity

Il tanto atteso evento Google I/O non ha deluso. Dopo un po' di preambolo e insieme a Gemini 3.5 Flash e Gemini Spark, il vero protagonista: Gemini Omni, una nuova famiglia di modelli di IA nativamente multimodali, "any-to-any", il che significa che elaborano quello che vuoi: testo, immagini, audio e video in simultanea. In altre parole, Nano Banana, ma per il video. (È così che Google stessa ne ha parlato.)

Il modello iniziale è Omni Flash. Introduce il montaggio video conversazionale per creare media coerenti a partire da asset singoli. Quindi puoi montare e remixare video attraverso conversazioni, senza usare software di editing.

Che cos'è Gemini Omni?

Capiamo più nel dettaglio di cosa si tratta Omni.

Gemini Omni è il primo modello generativo per media nativamente multimodale di Google DeepMind. La prima variante della famiglia è Gemini Omni Flash, già disponibile

  • nell'app Gemini,
  • in Google Flow e
  • su YouTube Shorts

Omni accetta qualsiasi combinazione di testo, immagini, audio e video come input e produce un video. La chiave è che non c'è alcun passaggio tra sistemi diversi: è tutto un unico modello.

Finora Google gestiva uno stack separato: Veo per il video, Imagen per le immagini e sistemi separati per l'audio. Omni unisce tutto in un solo modello (da qui il nome!) che sa ragionare tra modalità diverse. In pratica, questo si traduce in montaggi più coerenti e meno artefatti di pipeline.

Prima di farmi prendere la mano, inquadriamolo in termini di funzionalità chiave.

Funzionalità principali di Gemini Omni

Quello che mi colpisce è il processo. Sia l'editing conversazionale sia l'uso di schizzi come blueprint sono funzioni che conosciamo dagli strumenti di generazione immagini come Nano Banana 2 o ChatGPT Images 2.0 di OpenAI, ma Omni le porta anche nella generazione video.

Montaggio video conversazionale

La funzione di punta è il montaggio video conversazionale. Dai a Omni una clip (una che hai generato o girato con il telefono) e la modifichi parlandoci. "Abbassa le luci." "Cambia l'inquadratura in spalla dietro di lei." "Rendi il violino invisibile." Ogni istruzione resta valida nei turni successivi. La scena evolve, non si azzera.

Fisica del mondo reale e conoscenza del mondo

Google lo ha sottolineato al lancio. Omni ha una comprensione intuitiva di gravità, energia cinetica e dinamica dei fluidi. Nel mio test iniziale, il video generato non sembrava riflettere la fisica del mondo reale – ma, di nuovo, questa è la versione Flash, e ci aspettiamo che arrivi presto un modello Omni Pro più competitivo rispetto a strumenti come Seedance 2.0.

Da schizzi e disegni a video

Puoi trasformare scarabocchi in riprese realistiche, usando lo schizzo solo come guida al movimento e non come riferimento visivo finale. Sarà utile in pre-produzione. Piacerà anche ai bambini, per i loro disegni.

Filigrana SynthID e credenziali dei contenuti C2PA

Ogni output di Omni include due livelli di provenienza.

  • SynthID è una filigrana invisibile incorporata direttamente nei pixel al momento della generazione. È impercettibile agli spettatori. Ed è progettata per resistere a ritagli, filtri e ricodifica.
  • Le credenziali dei contenuti C2PA affiancano la filigrana come un manifesto crittografico firmato allegato al file. Anche se rimuovi i metadati, il segnale a livello di pixel resta.

Vale la pena precisarlo: SynthID è specifico di Google. Solo i modelli di Google la incorporano, quindi "non con filigrana" non significa "creato da umano" — significa solo "non da un modello Google". Dato quanto facilmente Omni può remixare riprese reali, una provenienza robusta su ogni output inizia a sembrare meno un nice-to-have e più un requisito minimo.

Test di Gemini Omni Flash

Ho testato le capacità di generazione video di Omni Flash in due categorie diverse: fisica del mondo reale e trasferimento di stile.

Testare fisica e conoscenza del mondo

Ecco il mio prompt: 

A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.

La nota diceva che ci sarebbero voluti alcuni minuti, ma in realtà ci sono voluti solo dieci secondi circa. 

Forse sono pignolo, ma sono rimasto un po' deluso. L'angolazione del vaso di terracotta era sbagliata nell'ultimo fotogramma rispetto a quello precedente. Ha cambiato traiettoria e sembrava un aereo con un altro tipo di propulsione dietro. 

Testare movimento e trasferimento di stile

Ora prendo il risultato di quell'ultimo test e vedo se riesco a renderlo completamente diverso. Cosa ho fatto: ho fatto uno screenshot di quell'ultimo video (quindi ho caricato un'immagine) e poi ho chiesto un video in un nuovo stile. 

Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.

Questo video ha richiesto molto più tempo per essere generato. Ma ne è valsa la pena. All'improvviso, il glitch di fisica non contava più perché lo stile arazzo consentiva imperfezioni, e il risultato era divertente. Questa volta il trabucco ha lanciato al contrario.

Dove si colloca Gemini Omni nei benchmark

Meglio dirlo subito: Google non ha pubblicato benchmark numerici insieme al lancio di Omni. L'annuncio di DeepMind ha messo in primo piano affermazioni sulle capacità, come comprensione della fisica, conoscenza del mondo, editing conversazionale, ma non ha fornito punteggi a confronto su valutazioni standardizzate.

Benchmark indipendenti di terze parti non arriveranno per almeno qualche settimana.

Cosa significa per il quadro competitivo: al momento, il leader pubblico sull'Artificial Analysis Video Arena (il più vicino che la generazione video ha a una classifica standard del settore) è Seedance 2.0 di ByteDance, con un Elo di 1.269 per text-to-video e 1.351 per image-to-video. 

Detto ciò, ecco i benchmark da tenere d'occhio quando saranno disponibili:

  • VBench 2.0: valuta fisica, ragionamento di buon senso, fedeltà umana e controllabilità su 18 dimensioni.
  • Artificial Analysis Video Arena: classifiche head-to-head in stile Elo basate sulle preferenze umane. 
  • VABench: valutazione congiunta audio-video. Rilevante in particolare perché Omni genera audio sincronizzato in modo nativo.

Come accedere a Gemini Omni: prezzi e piani

L'accesso al momento è incluso nei livelli consumer di IA di Google negli Stati Uniti:

  • AI Plus a $7,99/mese
  • AI Pro a $19,99/mese e
  • AI Ultra a $249,99/mese

Le quote di crediti scalano in base al livello: Plus ottiene 200 crediti IA mensili, Pro ne ottiene 1.000.

L'accesso via API è "in arrivo nelle prossime settimane". Ne parleremo più nel dettaglio non appena potremo provarlo.

Conclusione

Finora, lo stack dei media generativi è stato una staffetta. Il testo va a un modello, l'output passa a un modello per immagini, che passa uno still a un modello video, che passa i frame a un modello audio. Ogni passaggio è un punto in cui coerenza o qualità possono perdersi. La grande promessa di Omni è che ragiona su testo, immagini, video e audio nella stessa forward pass. 

Un modello Omni a piena capacità, che sospettiamo sia rivolto alle aziende, è sicuramente in lavorazione. 


Josef Waples's photo
Author
Josef Waples

Sono uno scrittore e editor di data science, con contributi a articoli di ricerca su riviste scientifiche. Sono particolarmente interessato ad algebra lineare, statistica, R e affini. Inoltre, gioco anche parecchio a scacchi! 

Domande frequenti su Gemini Omni

Che cos'è Gemini Omni e come funziona?

Gemini Omni è il modello video di IA di Google DeepMind che crea e modifica video a partire da input di testo, immagini, audio o video tramite conversazioni naturali.

Cosa puoi fare con Gemini Omni?

Modificare stili video, sostituire personaggi con immagini di riferimento, cambiare angolazioni della camera, sincronizzare testo e suono con l'azione, trasformare schizzi in riprese e combinare più input in un'unica scena.

Come si accede a Gemini Omni?

È disponibile nell'app Gemini, in Google Flow e su YouTube Shorts. È necessario un abbonamento a Google AI, con funzionalità che variano per livello e area geografica.

Puoi modificare i video di Gemini Omni con prompt successivi?

Sì. Omni supporta l'editing multi-turn, quindi puoi affinare dettagli, ambienti e angolazioni della camera passo dopo passo mantenendo la scena coerente.

Come puoi capire se un video è stato creato con Gemini Omni?

Ogni output include una filigrana invisibile SynthID e le Credenze dei Contenuti C2PA, verificabili nell'app Gemini (il supporto per Chrome e Search arriverà a breve).

Argomenti
Intelligenza artificiale
AI generativa
Correlato

blog

I 15 migliori server MCP remoti che ogni AI builder dovrebbe conoscere nel 2026

Scopri i 15 migliori server MCP remoti che stanno trasformando lo sviluppo AI nel 2026. Scopri come migliorano automazione, ragionamento, sicurezza e velocità dei workflow.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Tokenizzazione nel NLP: come funziona, sfide e casi d'uso

Guida al preprocessing NLP nel machine learning. Copriamo spaCy, i transformer di Hugging Face e come funziona la tokenizzazione in casi d'uso reali.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

Che cos'è Snowflake? Guida per principianti alla piattaforma dati cloud

Esplora le basi di Snowflake, la piattaforma dati cloud. Scopri la sua architettura, le sue funzionalità e come integrarla nelle tue pipeline di dati.
Tim Lu's photo

Tim Lu

12 min

Mostra AltroMostra Altro