Weiter zum Inhalt

Gemini Omni: Ein Modell für Text, Bild, Audio und Video

Ein erster Blick auf das Any-to-any-Modell von Google DeepMind — was es kann, was neu ist und wie du darauf zugreifst.
Aktualisiert 23. Sept. 2026  · 7 Min. lesen

Entdecke KI

ChatGPTClaudePerplexity

Das viel gehypte Google I/O hat nicht enttäuscht. Nach etwas Vorlauf und neben Gemini 3.5 Flash und Gemini Spark kam das eigentliche Highlight: Gemini Omni, eine neue Familie nativ multimodaler „Any-to-any“-KI-Modelle. Heißt: Sie verarbeiten alles gleichzeitig — Text, Bild, Audio und Video. Anders gesagt: Nano Banana, aber für Video. (So hat es Google selbst beschrieben.)

Das erste Modell ist Omni Flash. Es führt konversationales Videoediting ein, um aus einzelnen Assets stimmige Medien zu erstellen. Du bearbeitest und remixt Videos per Unterhaltung — nicht mit Schnittsoftware.

Was ist Gemini Omni?

Schauen wir uns genauer an, worum es bei Omni geht.

Gemini Omni ist das erste nativ multimodale generative Medienmodell von Google DeepMind. Die erste Variante in dieser Familie ist Gemini Omni Flash, das jetzt verfügbar ist

  • in der Gemini-App,
  • in Google Flow und
  • in YouTube Shorts

Omni akzeptiert jede Kombination aus Text, Bildern, Audio und Video als Eingabe und erzeugt ein Video. Das Entscheidende: Es gibt keinen Staffellauf zwischen verschiedenen Systemen; alles läuft in einem Modell.

Bisher nutzte Google einen geteilten Stack: Veo für Video, Imagen für Bilder und getrennte Systeme für Audio. Omni bündelt das in einem Modell (daher der Name!), das über Modalitäten hinweg schlussfolgern kann. In der Praxis führt das zu stimmigeren Edits und weniger Pipeline-Artefakten.

Bevor ich ins Schwärmen gerate, ordnen wir das in Kernfunktionen ein.

Kernfunktionen von Gemini Omni

Auffällig ist vor allem der Prozess. Sowohl konversationales Editieren als auch Skizzen als Blaupausen kennen wir aus Bildgeneratoren wie Nano Banana 2 oder OpenAIs ChatGPT Images 2.0 — Omni bringt das jetzt auch in die Videogenerierung.

Konversationales Videoediting

Das Aushängeschild ist konversationales Videoediting. Du gibst Omni einen Clip (selbst generiert oder mit dem Handy gefilmt) und veränderst ihn, indem du einfach sprichst. „Dimme das Licht.“ „Ändere die Kameraperspektive auf über ihre Schulter.“ „Mach die Violine unsichtbar.“ Jede Anweisung bleibt über mehrere Runden bestehen. Die Szene entwickelt sich weiter, sie setzt sich nicht zurück.

Physik und Weltwissen

Darauf hat Google beim Launch Wert gelegt. Omni hat ein intuitives Verständnis von Schwerkraft, kinetischer Energie und Strömungsdynamik. In meinem ersten Test fühlte sich die generierte Szene nicht ganz nach realer Physik an – aber das ist die Flash-Version, und wir erwarten bald ein Omni Pro, das stärker mit Tools wie Seedance 2.0 konkurriert.

Von Skizzen und Zeichnungen zu Video

Du kannst Kritzeleien in realistisches Filmmaterial verwandeln — die Skizze dient nur als Bewegungsvorlage, nicht als finale visuelle Referenz. Das ist in der Pre-Production hilfreich. Kinder werden es für ihre Zeichnungen lieben.

SynthID-Wasserzeichen und C2PA-Content-Credentials

Jeder Omni-Output kommt mit zwei Ebenen an Herkunftsnachweisen.

  • SynthID ist ein unsichtbares Wasserzeichen, direkt bei der Generierung in die Pixel eingebettet. Für Zuschauer nicht wahrnehmbar. Und es ist darauf ausgelegt, Zuschnitt, Filter und erneutes Encoding zu überstehen.
  • C2PA-Content-Credentials liegen als signiertes kryptografisches Manifest neben der Datei. Selbst wenn die Metadaten entfernt werden, bleibt das Signal auf Pixelebene erhalten.

Wichtig: SynthID ist Google-spezifisch. Nur Googles eigene Modelle betten es ein, daher heißt „nicht Wasserzeichen-markiert“ nicht „menschgemacht“ — es heißt lediglich „nicht aus einem Google-Modell“. Da Omni reales Filmmaterial sehr leicht remixen kann, wirkt belastbare Herkunft bei jedem Output weniger wie ein Nice-to-have und mehr wie Pflichtprogramm.

Gemini Omni Flash im Test

Ich habe die Videogenerierung von Omni Flash in zwei Kategorien getestet: reale Physik und Stiltransfer.

Physik und Weltwissen testen

Das war mein Prompt: 

A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.

Die Hinweismeldung kündigte ein paar Minuten an, tatsächlich dauerte es nur rund zehn Sekunden. 

Vielleicht bin ich pingelig, aber ich war etwas enttäuscht. Der Winkel des Tongefäßes stimmte im späteren Frame im Verhältnis zum früheren nicht. Er änderte sich, und es sah aus wie ein Flugzeug mit einer anderen Art von Antrieb dahinter. 

Bewegung und Stiltransfer testen

Jetzt nehme ich das letzte Ergebnis und versuche, es komplett zu verwandeln. Was ich gemacht habe: Ich habe einen Screenshot aus dem letzten Video genommen (also ein Bild hochgeladen) und dann um ein Video in einem neuen Stil gebeten. 

Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.

Dieses Video brauchte deutlich länger in der Generierung. Aber das Warten hat sich gelohnt. Plötzlich spielte der Physikfehler keine Rolle mehr, weil der Tapisserie-Stil Unsauberkeiten zulässt — und das Ergebnis war witzig. Die Blide startete diesmal sogar rückwärts.

Wo Gemini Omni in Benchmarks steht

Wichtig vorweg: Google hat zum Omni-Start keine numerischen Benchmarks veröffentlicht. Die DeepMind-Ankündigung stellte Fähigkeiten wie Physikverständnis, Weltwissen und konversationales Editieren in den Vordergrund, lieferte aber keine direkten Vergleichswerte aus standardisierten Evaluierungen.

Unabhängige Benchmarks von Dritten werden frühestens in einigen Wochen vorliegen.

Für den Wettbewerbsüberblick heißt das: Aktuell führt auf der Artificial Analysis Video Arena (dem bislang nächstgelegenen Branchen-Leaderboard für Videogenerierung) ByteDances Seedance 2.0 mit einem Elo von 1.269 bei Text-zu-Video und 1.351 bei Bild-zu-Video. 

Das sind die Benchmarks, auf die es sich zu achten lohnt, sobald sie vorliegen:

  • VBench 2.0: Bewertet Physik, Alltagslogik, Menschentreue und Steuerbarkeit über 18 Dimensionen.
  • Artificial Analysis Video Arena: Elo-basierte Head-to-Head-Rankings nach menschlicher Präferenz. 
  • VABench: Gemeinsame Audio-Video-Evaluierung. Besonders relevant, da Omni nativ synchronisierten Audio-Output erzeugt.

Zugang zu Gemini Omni: Preise und Pläne

Aktuell ist der Zugang in den Consumer-KI-Tarifen von Google in den USA enthalten:

  • AI Plus für 7,99 $/Monat
  • AI Pro für 19,99 $/Monat und
  • AI Ultra für 249,99 $/Monat

Die Credit-Kontingente skalieren mit dem Tarif: Plus erhält 200 monatliche KI-Credits, Pro 1.000.

API-Zugang ist „in den nächsten Wochen“ angekündigt. Wir berichten ausführlich, sobald wir selbst Hand anlegen können.

Fazit

Bislang war der generative Medien-Stack ein Staffellauf. Text geht in ein Modell, dessen Output an ein Bildmodell übergeben wird, das ein Standbild an ein Videomodell weiterreicht, das wiederum Frames an ein Audiomodell übergibt. Jeder Handoff ist eine potenzielle Leckstelle für Kohärenz oder Qualität. Omnis großes Versprechen: Es schlussfolgert über Text, Bild, Video und Audio im selben Forward-Pass. 

Ein Omni-Modell mit vollem Funktionsumfang, mutmaßlich für Enterprise gedacht, ist mit hoher Wahrscheinlichkeit in Arbeit. 


Josef Waples's photo
Author
Josef Waples

Gemini Omni: FAQs

Was ist Gemini Omni und wie funktioniert es?

Gemini Omni ist das KI-Videomodell von Google DeepMind, das per natürlicher Unterhaltung Videos aus Text-, Bild-, Audio- oder Videoeingaben erstellt und bearbeitet.

Was kannst du mit Gemini Omni machen?

Videostile bearbeiten, Figuren per Referenzbildern austauschen, Kameraperspektiven ändern, Text und Sound zur Aktion synchronisieren, Skizzen in Filmmaterial verwandeln und mehrere Eingaben zu einer Szene kombinieren.

Wie erhältst du Zugang zu Gemini Omni?

Es ist in der Gemini-App, in Google Flow und in YouTube Shorts verfügbar. Ein Google-KI-Abo ist erforderlich; Funktionsumfang variiert je nach Tarif und Region.

Kannst du Gemini-Omni-Videos mit Folgeprompts bearbeiten?

Ja. Omni unterstützt mehrstufiges Editieren, sodass du Details, Umgebungen und Kamerawinkel Schritt für Schritt verfeinern kannst, während die Szene konsistent bleibt.

Woran erkennst du, dass ein Video mit Gemini Omni erstellt wurde?

Jeder Output enthält ein unsichtbares SynthID-Wasserzeichen und C2PA-Content-Credentials, verifizierbar in der Gemini-App (Unterstützung in Chrome und der Suche folgt bald).

Themen
Künstliche Intelligenz
Generative KI
Ähnlich

Blog

Die 36 wichtigsten Fragen und Antworten zum Thema generative KI für 2026

Dieser Blog hat eine ganze Reihe von Fragen und Antworten zu generativer KI, von den Grundlagen bis hin zu fortgeschrittenen Themen.
Hesam Sheikh Hassani's photo

Hesam Sheikh Hassani

15 Min.

Blog

Arten von KI-Agenten: Ihre Rollen, Strukturen und Anwendungen verstehen

Lerne die wichtigsten Arten von KI-Agenten kennen, wie sie mit ihrer Umgebung interagieren und wie sie in verschiedenen Branchen eingesetzt werden. Verstehe einfache reflexive, modellbasierte, zielbasierte, nutzenbasierte, lernende Agenten und mehr.

Tutorial

Python-Tutorial zum Verknüpfen von Zeichenfolgen

Lerne verschiedene Methoden zum Verknüpfen von Zeichenfolgen in Python kennen, mit Beispielen, die jede Technik zeigen.
DataCamp Team's photo

DataCamp Team

5 Min.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

5 Min.

Tutorial

30 coole Python-Tricks für besseren Code mit Beispielen

Wir haben 30 coole Python-Tricks zusammengestellt, mit denen du deinen Code verbesserst und deine Python-Kompetenzen ausbaust.
Kurtis Pykes 's photo

Kurtis Pykes

15 Min.

Tutorial

Python Datenstrukturen Tutorial

Mach dich mit Python-Datenstrukturen vertraut: Lerne mehr über Datentypen und primitive sowie nicht-primitive Datenstrukturen wie Strings, Listen, Stapel usw.
Sejal Jaiswal's photo

Sejal Jaiswal

24 Min.

Mehr AnzeigenMehr Anzeigen