Das viel gehypte Google I/O hat nicht enttäuscht. Nach etwas Vorlauf und neben Gemini 3.5 Flash und Gemini Spark kam das eigentliche Highlight: Gemini Omni, eine neue Familie nativ multimodaler „Any-to-any“-KI-Modelle. Heißt: Sie verarbeiten alles gleichzeitig — Text, Bild, Audio und Video. Anders gesagt: Nano Banana, aber für Video. (So hat es Google selbst beschrieben.)
Das erste Modell ist Omni Flash. Es führt konversationales Videoediting ein, um aus einzelnen Assets stimmige Medien zu erstellen. Du bearbeitest und remixt Videos per Unterhaltung — nicht mit Schnittsoftware.
Was ist Gemini Omni?
Schauen wir uns genauer an, worum es bei Omni geht.
Gemini Omni ist das erste nativ multimodale generative Medienmodell von Google DeepMind. Die erste Variante in dieser Familie ist Gemini Omni Flash, das jetzt verfügbar ist
- in der Gemini-App,
- in Google Flow und
- in YouTube Shorts
Omni akzeptiert jede Kombination aus Text, Bildern, Audio und Video als Eingabe und erzeugt ein Video. Das Entscheidende: Es gibt keinen Staffellauf zwischen verschiedenen Systemen; alles läuft in einem Modell.
Bisher nutzte Google einen geteilten Stack: Veo für Video, Imagen für Bilder und getrennte Systeme für Audio. Omni bündelt das in einem Modell (daher der Name!), das über Modalitäten hinweg schlussfolgern kann. In der Praxis führt das zu stimmigeren Edits und weniger Pipeline-Artefakten.
Bevor ich ins Schwärmen gerate, ordnen wir das in Kernfunktionen ein.
Kernfunktionen von Gemini Omni
Auffällig ist vor allem der Prozess. Sowohl konversationales Editieren als auch Skizzen als Blaupausen kennen wir aus Bildgeneratoren wie Nano Banana 2 oder OpenAIs ChatGPT Images 2.0 — Omni bringt das jetzt auch in die Videogenerierung.
Konversationales Videoediting
Das Aushängeschild ist konversationales Videoediting. Du gibst Omni einen Clip (selbst generiert oder mit dem Handy gefilmt) und veränderst ihn, indem du einfach sprichst. „Dimme das Licht.“ „Ändere die Kameraperspektive auf über ihre Schulter.“ „Mach die Violine unsichtbar.“ Jede Anweisung bleibt über mehrere Runden bestehen. Die Szene entwickelt sich weiter, sie setzt sich nicht zurück.
Physik und Weltwissen
Darauf hat Google beim Launch Wert gelegt. Omni hat ein intuitives Verständnis von Schwerkraft, kinetischer Energie und Strömungsdynamik. In meinem ersten Test fühlte sich die generierte Szene nicht ganz nach realer Physik an – aber das ist die Flash-Version, und wir erwarten bald ein Omni Pro, das stärker mit Tools wie Seedance 2.0 konkurriert.
Von Skizzen und Zeichnungen zu Video
Du kannst Kritzeleien in realistisches Filmmaterial verwandeln — die Skizze dient nur als Bewegungsvorlage, nicht als finale visuelle Referenz. Das ist in der Pre-Production hilfreich. Kinder werden es für ihre Zeichnungen lieben.
SynthID-Wasserzeichen und C2PA-Content-Credentials
Jeder Omni-Output kommt mit zwei Ebenen an Herkunftsnachweisen.
- SynthID ist ein unsichtbares Wasserzeichen, direkt bei der Generierung in die Pixel eingebettet. Für Zuschauer nicht wahrnehmbar. Und es ist darauf ausgelegt, Zuschnitt, Filter und erneutes Encoding zu überstehen.
- C2PA-Content-Credentials liegen als signiertes kryptografisches Manifest neben der Datei. Selbst wenn die Metadaten entfernt werden, bleibt das Signal auf Pixelebene erhalten.
Wichtig: SynthID ist Google-spezifisch. Nur Googles eigene Modelle betten es ein, daher heißt „nicht Wasserzeichen-markiert“ nicht „menschgemacht“ — es heißt lediglich „nicht aus einem Google-Modell“. Da Omni reales Filmmaterial sehr leicht remixen kann, wirkt belastbare Herkunft bei jedem Output weniger wie ein Nice-to-have und mehr wie Pflichtprogramm.
Gemini Omni Flash im Test
Ich habe die Videogenerierung von Omni Flash in zwei Kategorien getestet: reale Physik und Stiltransfer.
Physik und Weltwissen testen
Das war mein Prompt:
A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.
Die Hinweismeldung kündigte ein paar Minuten an, tatsächlich dauerte es nur rund zehn Sekunden.

Vielleicht bin ich pingelig, aber ich war etwas enttäuscht. Der Winkel des Tongefäßes stimmte im späteren Frame im Verhältnis zum früheren nicht. Er änderte sich, und es sah aus wie ein Flugzeug mit einer anderen Art von Antrieb dahinter.
Bewegung und Stiltransfer testen
Jetzt nehme ich das letzte Ergebnis und versuche, es komplett zu verwandeln. Was ich gemacht habe: Ich habe einen Screenshot aus dem letzten Video genommen (also ein Bild hochgeladen) und dann um ein Video in einem neuen Stil gebeten.
Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.
Dieses Video brauchte deutlich länger in der Generierung. Aber das Warten hat sich gelohnt. Plötzlich spielte der Physikfehler keine Rolle mehr, weil der Tapisserie-Stil Unsauberkeiten zulässt — und das Ergebnis war witzig. Die Blide startete diesmal sogar rückwärts.
Wo Gemini Omni in Benchmarks steht
Wichtig vorweg: Google hat zum Omni-Start keine numerischen Benchmarks veröffentlicht. Die DeepMind-Ankündigung stellte Fähigkeiten wie Physikverständnis, Weltwissen und konversationales Editieren in den Vordergrund, lieferte aber keine direkten Vergleichswerte aus standardisierten Evaluierungen.
Unabhängige Benchmarks von Dritten werden frühestens in einigen Wochen vorliegen.
Für den Wettbewerbsüberblick heißt das: Aktuell führt auf der Artificial Analysis Video Arena (dem bislang nächstgelegenen Branchen-Leaderboard für Videogenerierung) ByteDances Seedance 2.0 mit einem Elo von 1.269 bei Text-zu-Video und 1.351 bei Bild-zu-Video.
Das sind die Benchmarks, auf die es sich zu achten lohnt, sobald sie vorliegen:
- VBench 2.0: Bewertet Physik, Alltagslogik, Menschentreue und Steuerbarkeit über 18 Dimensionen.
- Artificial Analysis Video Arena: Elo-basierte Head-to-Head-Rankings nach menschlicher Präferenz.
- VABench: Gemeinsame Audio-Video-Evaluierung. Besonders relevant, da Omni nativ synchronisierten Audio-Output erzeugt.
Zugang zu Gemini Omni: Preise und Pläne
Aktuell ist der Zugang in den Consumer-KI-Tarifen von Google in den USA enthalten:
- AI Plus für 7,99 $/Monat
- AI Pro für 19,99 $/Monat und
- AI Ultra für 249,99 $/Monat
Die Credit-Kontingente skalieren mit dem Tarif: Plus erhält 200 monatliche KI-Credits, Pro 1.000.
API-Zugang ist „in den nächsten Wochen“ angekündigt. Wir berichten ausführlich, sobald wir selbst Hand anlegen können.
Fazit
Bislang war der generative Medien-Stack ein Staffellauf. Text geht in ein Modell, dessen Output an ein Bildmodell übergeben wird, das ein Standbild an ein Videomodell weiterreicht, das wiederum Frames an ein Audiomodell übergibt. Jeder Handoff ist eine potenzielle Leckstelle für Kohärenz oder Qualität. Omnis großes Versprechen: Es schlussfolgert über Text, Bild, Video und Audio im selben Forward-Pass.
Ein Omni-Modell mit vollem Funktionsumfang, mutmaßlich für Enterprise gedacht, ist mit hoher Wahrscheinlichkeit in Arbeit.

Gemini Omni: FAQs
Was ist Gemini Omni und wie funktioniert es?
Gemini Omni ist das KI-Videomodell von Google DeepMind, das per natürlicher Unterhaltung Videos aus Text-, Bild-, Audio- oder Videoeingaben erstellt und bearbeitet.
Was kannst du mit Gemini Omni machen?
Videostile bearbeiten, Figuren per Referenzbildern austauschen, Kameraperspektiven ändern, Text und Sound zur Aktion synchronisieren, Skizzen in Filmmaterial verwandeln und mehrere Eingaben zu einer Szene kombinieren.
Wie erhältst du Zugang zu Gemini Omni?
Es ist in der Gemini-App, in Google Flow und in YouTube Shorts verfügbar. Ein Google-KI-Abo ist erforderlich; Funktionsumfang variiert je nach Tarif und Region.
Kannst du Gemini-Omni-Videos mit Folgeprompts bearbeiten?
Ja. Omni unterstützt mehrstufiges Editieren, sodass du Details, Umgebungen und Kamerawinkel Schritt für Schritt verfeinern kannst, während die Szene konsistent bleibt.
Woran erkennst du, dass ein Video mit Gemini Omni erstellt wurde?
Jeder Output enthält ein unsichtbares SynthID-Wasserzeichen und C2PA-Content-Credentials, verifizierbar in der Gemini-App (Unterstützung in Chrome und der Suche folgt bald).