Ga naar hoofdinhoud

Gemini Omni: één model voor tekst, beeld, audio en video

Een eerste blik op het any-to-any-model van Google DeepMind — wat het doet, wat er nieuw aan is en hoe je het gebruikt.
Bijgewerkt 2 okt 2026  · 7 min lezen

Verken met AI

ChatGPTClaudePerplexity

Het gehypete Google I/O-event stelde niet teleur. Na een korte inleiding en naast Gemini 3.5 Flash en Gemini Spark was de echte highlight: Gemini Omni, een nieuwe familie van native multimodale, "any-to-any" AI-modellen, wat betekent dat ze alles verwerken wat je maar kunt bedenken — tekst, beeld, audio en video tegelijk. Met andere woorden, Nano Banana, maar dan voor video. (Zo beschreef Google het zelf.)

Het eerste model is Omni Flash. Het introduceert conversationele videobewerking om samenhangende media te maken van losse assets. Je kunt dus video’s bewerken en remixen via gesprekken en niet met bewerkingssoftware.

Wat is Gemini Omni?

Laten we in meer detail bekijken waar Omni om draait.

Gemini Omni is het eerste natively multimodale generatieve mediamodel van Google DeepMind. De eerste variant in de familie is Gemini Omni Flash, die nu live is

  • in de Gemini-app,
  • Google Flow, en
  • YouTube Shorts

Omni accepteert elke combinatie van tekst, afbeeldingen, audio en video als input en produceert een video. Het belangrijkste is dat er geen doorgeven plaatsvindt tussen verschillende systemen; dit is allemaal één model.

Tot nu toe draaide Google een gesplitste stack: Veo voor video, Imagen voor afbeeldingen en aparte systemen voor audio. Omni voegt dat samen tot één model (vandaar de naam!) dat over modaliteiten heen kan redeneren. In de praktijk levert dat samenhangendere edits op en minder artefacten in de pipeline.

Voordat ik teveel doordraaf, laten we dit kaderen in termen van kernfuncties.

Belangrijkste kenmerken van Gemini Omni

Wat mij opvalt, is het proces. Zowel conversationele editing als het gebruik van schetsen als blauwdrukken kennen we van beeldgeneratietools zoals Nano Banana 2 of OpenAI’s ChatGPT Images 2.0, maar Omni brengt ze ook naar videogeneratie.

Conversationele videobewerking

De headline-capability is conversationele videobewerking. Je geeft Omni een clip (een die je hebt gegenereerd of eentje die je met je telefoon hebt geschoten) en je past hem aan door ertegen te praten. "Maak het licht gedimd." "Verander de camerapositie naar over haar schouder." "Maak de viool onzichtbaar." Elke instructie blijft behouden over beurten heen. De scène evolueert; hij reset niet.

Echte natuurkunde en wereldkennis

Google benadrukte dit bij de lancering. Omni heeft een intuïtief begrip van zwaartekracht, kinetische energie en vloeistofdynamica. In mijn eerste test voelde de gegenereerde video niet als echte fysica – maar goed, dit is de Flash-versie, en we verwachten dat er snel een Omni Pro-model volgt dat beter kan concurreren met tools als Seedance 2.0.

Van schetsen en tekeningen naar video

Je kunt krabbels omzetten in realistische beelden, waarbij de schets alleen als bewegingsgids dient en niet als definitieve visuele referentie. Dit is nuttig in pre-productie. Kinderen gaan dit ook geweldig vinden, voor hun tekeningen.

SynthID-watermerk en C2PA content credentials

Elke Omni-output wordt geleverd met twee lagen herkomst.

  • SynthID is een onzichtbaar watermerk dat bij de generatie direct in de pixels is ingebed. Het is niet waarneembaar voor kijkers. En het is ontworpen om croppen, filters en hercodering te overleven.
  • C2PA content credentials staan ernaast als een ondertekend cryptografisch manifest dat aan het bestand is gekoppeld. Verwijder je de metadata, dan blijft het signaal op pixelniveau alsnog behouden.

Belangrijk om te melden: SynthID is specifiek voor Google. Alleen Google’s eigen modellen embedden het, dus "geen watermerk" betekent niet "door een mens gemaakt" — het betekent alleen "niet van een Google-model." Gezien hoe gemakkelijk Omni echt beeldmateriaal kan remixen, begint duurzame herkomst op elke output minder een nice-to-have en meer een basisvereiste te lijken.

Gemini Omni Flash testen

Ik heb de videogeneratiemogelijkheden van Omni Flash getest in twee categorieën: echte fysica en stijltransfer.

Fysica en wereldkennis testen

Dit was mijn prompt: 

A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.

De melding zei dat het een paar minuten zou duren, maar in werkelijkheid was het maar zo’n tien seconden. 

Misschien ben ik kieskeurig, maar ik was een tikje teleurgesteld. De hoek van de kleipot klopte in het latere frame niet ten opzichte van het eerdere. De hoek veranderde en het leek op een vliegtuig met een andere vorm van voortstuwing erachter. 

Beweging en stijltransfer testen

Laat me nu het resultaat van die laatste test nemen en kijken of ik het volledig anders kan maken. Wat ik deed: ik nam een screenshot van die laatste video (ik uploadde dus een afbeelding) en vroeg vervolgens om een video in een nieuwe stijl. 

Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.

Deze video duurde veel langer om te genereren. Maar het was het wachten waard. Opeens maakte de fysica-glitch niets meer uit, omdat de gobelin-stijl ruimte liet voor imperfecties, en het resultaat was grappig. Het trebuchet werd dit keer wel achteruit gelanceerd.

Waar Gemini Omni staat op benchmarks

Belangrijk om meteen te zeggen: Google publiceerde geen numerieke benchmarks bij de Omni-lancering. De DeepMind-aankondiging zette in op capaciteitsclaims, zoals begrip van fysica, wereldkennis en conversationele editing, maar gaf geen head-to-head-scores op gestandaardiseerde evaluaties.

Onafhankelijke benchmarks van derden laten nog minstens enkele weken op zich wachten.

Wat dat betekent voor het competitieve landschap: op dit moment is de publieke leider op de Artificial Analysis Video Arena (het dichtstbijzijnde wat videogeneratie heeft bij een industry-standard leaderboard) ByteDance’s Seedance 2.0, met een Elo van 1.269 voor tekst-naar-video en 1.351 voor beeld-naar-video. 

Dat gezegd hebbende, dit zijn de benchmarks om in de gaten te houden zodra ze draaien:

  • VBench 2.0: beoordeelt fysica, alledaags redeneren, menselijke fideliteit en bestuurbaarheid over 18 dimensies.
  • Artificial Analysis Video Arena: Elo-achtige head-to-head-ranglijsten op basis van menselijke voorkeur. 
  • VABench: gezamenlijke audio-video-evaluatie. Specifiek relevant omdat Omni native gesynchroniseerde audio genereert.

Hoe je toegang krijgt tot Gemini Omni: prijzen en abonnementen

Toegang zit nu in de consumentgerichte AI-tiers van Google in de VS:

  • AI Plus voor $7,99 per maand
  • AI Pro voor $19,99 per maand, en
  • AI Ultra voor $249,99 per maand

Het aantal credits schaalt mee met de tier: Plus krijgt maandelijks 200 AI-credits, Pro krijgt 1.000.

API-toegang komt "binnen enkele weken." We schrijven hier uitgebreider over zodra we ermee aan de slag kunnen.

Conclusie

Tot nu toe was de generatieve mediastack een estafette. Tekst gaat naar het ene model, de output wordt doorgegeven aan een beeldmodel, dat een stilstaand beeld doorgeeft aan een videomodel, dat frames doorgeeft aan een audiomodel. Elke overdracht is een plek waar samenhang of kwaliteit kan weglekken. Omni’s grote claim is dat het over tekst, beeld, video en audio heen redeneert in dezelfde forward pass. 

Een Omni-model met volledige capabilities, waarvan we vermoeden dat het op de enterprise is gericht, is zeker in de maak. 


Josef Waples's photo
Author
Josef Waples

Ik ben een schrijver en editor op het gebied van data science en heb bijgedragen aan onderzoeksartikelen in wetenschappelijke tijdschriften. Ik ben vooral geïnteresseerd in lineaire algebra, statistiek, R en dergelijke. Ik speel ook best wat schaak! 

Gemini Omni: veelgestelde vragen

Wat is Gemini Omni en hoe werkt het?

Gemini Omni is het AI-videomodel van Google DeepMind dat video maakt en bewerkt op basis van tekst-, beeld-, audio- of video-invoer via natuurlijke conversatie.

Wat kun je doen met Gemini Omni?

Bewerk videostijlen, vervang personages met referentieafbeeldingen, verander cameraposities, synchroniseer tekst en geluid met actie, zet schetsen om in beeldmateriaal en combineer meerdere inputs tot één scène.

Hoe krijg je toegang tot Gemini Omni?

Het is beschikbaar in de Gemini-app, Google Flow en YouTube Shorts. Een Google AI-abonnement is vereist, met functies die per tier en regio verschillen.

Kun je Gemini Omni-video’s bewerken met vervolgprompts?

Ja. Omni ondersteunt multi-turn editing, zodat je details, omgevingen en cameraposities stap voor stap kunt verfijnen terwijl de scène consistent blijft.

Hoe kun je zien of een video met Gemini Omni is gemaakt?

Elke output bevat een onzichtbaar SynthID-watermerk en C2PA Content Credentials, verifieerbaar in de Gemini-app (met binnenkort ondersteuning in Chrome en Search).

Onderwerpen
Kunstmatige intelligentie
Generative AI