Beklentilerin yüksek olduğu Google I/O etkinliği hayal kırıklığı yaratmadı. Kısa bir girişin ardından, Gemini 3.5 Flash ve Gemini Spark ile birlikte asıl öne çıkan: Gemini Omni, yerel çok modlu, "her şeyden her şeye" yeni bir yapay zeka model ailesi. Yani metin, görsel, ses ve videoyu aynı anda işleyebiliyor. Başka bir deyişle, Nano Banana, ama video için. (Google da bunu böyle anlattı.)
İlk model Omni Flash. Tek tek varlıklardan tutarlı medya oluşturmaya yönelik konuşmaya dayalı video düzenlemeyi sunuyor. Yani videoları bir kurgu yazılımı kullanmadan, konuşarak düzenleyip remiksleyebiliyorsunuz.
Gemini Omni Nedir?
Omni'nin ne olduğuna biraz daha yakından bakalım.
Gemini Omni, Google DeepMind'in ilk yerel çok modlu üretici medya modeli. Ailenin ilk varyantı Gemini Omni Flash ve şu anda yayında
- Gemini uygulamasında,
- Google Flow'da ve
- YouTube Shorts'ta
Omni, girdi olarak metin, görseller, ses ve videonun herhangi bir kombinasyonunu kabul eder ve çıktı olarak video üretir. Buradaki kritik nokta, farklı sistemler arasında bir bayrak yarışı olmaması; her şey tek bir modelde gerçekleşiyor.
Bugüne kadar Google ayrık bir yığın çalıştırıyordu: video için Veo, görseller için Imagen ve ses için ayrı sistemler. Omni bunları tek bir modelde birleştiriyor (adı da buradan geliyor!) ve farklı kipler arasında akıl yürütebiliyor. Pratikte bu, daha tutarlı düzenlemeler ve daha az boru hattı artifaktı anlamına geliyor.
Daha fazla kaptırmadan, bunu temel özellikler üzerinden çerçeveleyelim.
Gemini Omni'nin Temel Özellikleri
Burada dikkatimi çeken süreç. Hem konuşmaya dayalı düzenleme hem de eskizleri taslak olarak kullanma, Nano Banana 2 veya OpenAI'nin ChatGPT Images 2.0 gibi görsel üretim araçlarından bildiğimiz özellikler; Omni bunları video üretimine de taşıyor.
Konuşmaya dayalı video düzenleme
Manşet niteliğindeki yetenek konuşmaya dayalı video düzenleme. Omni'ye bir klip veriyorsunuz (sizin ürettiğiniz ya da telefonunuzla çektiğiniz) ve onunla konuşarak değiştiriyorsunuz. "Işıkları kıs." "Kamera açısını omzunun üzerinden görünecek şekilde değiştir." "Kemanı görünmez yap." Her komut turlarda kalıcı oluyor. Sahne evriliyor; başa sarmıyor.
Gerçek dünya fiziği ve dünya bilgisi
Google lansmanda bunun altını çizdi. Omni, yerçekimi, kinetik enerji ve akışkanlar mekaniğine sezgisel bir kavrayışa sahip. İlk testimde üretilen video gerçek dünya fiziği gibi hissettirmedi – ancak bu Flash sürümü ve yakında Seedance 2.0 gibi araçlarla daha rekabetçi olacak bir Omni Pro modelinin gelmesini bekliyoruz.
Eskiz ve çizimlerden videoya
Karakalemleri, eskizi nihai görsel referans olarak değil yalnızca hareket rehberi olarak kullanarak gerçekçi çekimlere dönüştürebiliyorsunuz. Bu, prodüksiyon öncesinde faydalı olacak. Çocuklar da çizimleri için buna bayılacaktır.
SynthID filigran ve C2PA içerik kimlik bilgileri
Her Omni çıktısı iki katmanlı menşei bilgisiyle gelir.
- SynthID, üretim anında doğrudan piksellere gömülen görünmez bir filigrandır. İzleyiciler tarafından algılanamaz. Kırpmaya, filtrelere ve yeniden kodlamaya dayanacak şekilde tasarlanmıştır.
- C2PA içerik kimlik bilgileri ise dosyaya ekli, imzalı bir kriptografik bildiri olarak bunun yanında yer alır. Metaveriyi sıyırsanız bile piksel düzeyindeki sinyal kalır.
Not düşmeye değer: SynthID Google'a özgüdür. Yalnızca Google'ın kendi modelleri bunu gömer; dolayısıyla "filigransız" ifadesi "insan yapımı" anlamına gelmez — sadece "Google modelinden değil" anlamına gelir. Omni'nin gerçek çekimleri ne kadar kolay remiksleyebildiği düşünüldüğünde, her çıktıdaki dayanıklı menşei bilgisi güzel bir seçenek olmaktan çıkıp bir tür asgari gereksinim gibi görünmeye başlıyor.
Gemini Omni Flash'ı Test Etmek
Omni Flash'in video üretim yeteneklerini iki farklı kategoride test ettim: gerçek dünya fiziği ve stil transferi.
Fizik ve dünya bilgisini test etmek
İstemim şöyleydi:
A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.
Not, bunun birkaç dakika süreceğini söylüyordu ama gerçekte yaklaşık on saniye sürdü.

Belki titizim ama biraz hayal kırıklığına uğradım. Çamur kabının açısı, sonraki karede önceki kareye göre yanlıştı. Açı değişmişti ve arkadan farklı bir itişle giden bir uçağa benziyordu.
Hareket ve stil transferini test etmek
Şimdi, son testin sonucunu alıp tamamen farklı hale getirebilir miyim, ona bakayım. Yaptığım şey: Son videodan bir ekran görüntüsü aldım (yani bir görsel yükledim) ve ardından yeni bir stilde video istedim.
Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.
Bu videonun üretilmesi çok daha uzun sürdü. Ama beklemeye değdi. Bir anda, duvar halısı stili kusurlara izin verdiği için fiziksel tutarsızlık hiç önemli olmadı ve sonuç komikti. Bu kez trebuchet geriye doğru fırlattı.
Gemini Omni'nin Kıyaslamalardaki Yeri
En baştan belirtmek gerek: Google, Omni lansmanıyla birlikte sayısal kıyaslar yayımlamadı. DeepMind duyurusu, fizik anlayışı, dünya bilgisi, konuşmaya dayalı düzenleme gibi yetenek iddialarını öne çıkardı ancak standart değerlendirmelerde bire bir karşılaştırmalı puan vermedi.
Bağımsız üçüncü taraf kıyaslamalar en az birkaç hafta boyunca gelmeyecek.
Bu durum rekabet tablosu için şunu ifade ediyor: şu an itibarıyla, video üretiminin sektör standardına en yakın lider panosu olan Artificial Analysis Video Arena'da kamu lideri ByteDance'in Seedance 2.0 modeli; metinden videoya 1.269, görselden videoya 1.351 Elo puanıyla.
Tüm bunlar bir yana, çalıştıklarında takip etmeye değer kıyaslar şunlar:
- VBench 2.0: 18 boyutta fizik, sağduyu muhakemesi, insan gerçeğine yakınlık ve denetlenebilirliği değerlendirir.
- Artificial Analysis Video Arena: Elo tarzı bire bir insan tercih sıralamaları.
- VABench: ortak ses-video değerlendirmesi. Özellikle önemlidir çünkü Omni senkronize sesi yerel olarak üretir.
Gemini Omni'ye Erişim: Fiyatlandırma ve Planlar
Şu anda erişim, ABD'de Google'ın tüketici yapay zeka katmanları içinde yer alıyor:
- AI Plus ayda $7,99
- AI Pro ayda $19,99 ve
- AI Ultra ayda $249,99
Kredi tahsisleri katmana göre ölçekleniyor: Plus aylık 200, Pro 1.000 yapay zeka kredisi alıyor.
API erişimi "önümüzdeki birkaç hafta içinde geliyor." Buna eriştiğimizde daha ayrıntılı yazacağız.
Sonuç
Bugüne kadar üretici medya yığını bir bayrak yarışıydı. Metin bir modele gider, çıktısı görsel modeline devredilir, o da bir kareyi video modeline, o da kareleri ses modeline devrederdi. Her devir, tutarlılık ya da kalitenin sızabileceği bir noktaydı. Omni'nin büyük iddiası; metin, görsel, video ve ses üzerinde aynı ileri geçişte akıl yürütebilmesi.
Tam yetenekli bir Omni modelinin, muhtemelen kurumsal kullanıma yönelik, kesinlikle yolda olduğuna inanıyoruz.

Bilimsel dergilerde yayımlanan araştırma makalelerine katkıları olan bir veri bilimi yazarı ve editörüyüm. Özellikle lineer cebir, istatistik, R ve benzeri konularla ilgileniyorum. Aynı zamanda epey satranç da oynarım!
Gemini Omni SSS
Gemini Omni nedir ve nasıl çalışır?
Gemini Omni, doğal konuşma yoluyla metin, görsel, ses veya video girdilerinden video oluşturan ve düzenleyen Google DeepMind'in yapay zeka video modelidir.
Gemini Omni ile neler yapabilirsiniz?
Video stillerini düzenleyin, referans görsellerle karakterleri değiştirin, kamera açılarını değiştirin, metin ve sesi eylemle senkronize edin, eskizleri çekime dönüştürün ve birden fazla girdiyi tek bir sahnede birleştirin.
Gemini Omni'ye nasıl erişirsiniz?
Gemini uygulamasında, Google Flow'da ve YouTube Shorts'ta kullanılabilir. Bir Google AI aboneliği gerekir; özellikler katmana ve bölgeye göre değişir.
Gemini Omni videolarını takip istemleriyle düzenleyebilir misiniz?
Evet. Omni çok turlu düzenlemeyi destekler; böylece sahneyi tutarlı tutarken ayrıntıları, ortamları ve kamera açılarını adım adım iyileştirebilirsiniz.
Bir videonun Gemini Omni ile yapıldığını nasıl anlarsınız?
Her çıktı, görünmez bir SynthID filigranı ve C2PA İçerik Kimlik Bilgileri içerir; Gemini uygulamasında doğrulanabilir (yakında Chrome ve Arama desteği geliyor).