Lewati ke konten utama

Gemini Omni: Satu Model untuk Teks, Gambar, Audio, dan Video

Tinjauan awal model any-to-any dari Google DeepMind — apa yang dapat dilakukannya, apa yang baru, dan cara mengaksesnya.
Diperbarui 28 Sep 2026  · 7 mnt Baca

Jelajahi bersama AI

ChatGPTClaudePerplexity

Acara Google I/O yang begitu dinanti tidak mengecewakan. Setelah sedikit pengantar dan bersamaan dengan Gemini 3.5 Flash dan Gemini Spark, sorotan utamanya: Gemini Omni, keluarga baru model AI multimodal native "any-to-any", yang berarti dapat memproses apa pun — teks, gambar, audio, dan video secara bersamaan. Dengan kata lain, Nano Banana, tetapi untuk video. (Begitulah cara Google sendiri membahasnya.)

Model awalnya adalah Omni Flash. Ini memperkenalkan penyuntingan video berbasis percakapan untuk menciptakan media yang padu dari aset-aset terpisah. Jadi, Anda dapat mengedit dan meremiks video melalui percakapan, bukan dengan perangkat lunak pengeditan.

Apa itu Gemini Omni?

Mari pahami lebih rinci tentang Omni.

Gemini Omni adalah model media generatif multimodal native pertama dari Google DeepMind. Varian pertama dalam keluarga ini adalah Gemini Omni Flash, yang kini tersedia

  • Di dalam aplikasi Gemini,
  • Google Flow, dan
  • YouTube Shorts

Omni menerima kombinasi apa pun dari teks, gambar, audio, dan video sebagai masukan dan menghasilkan sebuah video. Kuncinya di sini adalah tidak ada relai yang terjadi di berbagai sistem; semuanya dikerjakan oleh satu model.

Selama ini, Google menjalankan tumpukan terpisah: Veo untuk video, Imagen untuk gambar, dan sistem terpisah untuk audio. Omni menggabungkannya menjadi satu model (karena itu namanya!) yang dapat menalar lintas modalitas. Secara praktik, ini berarti penyuntingan yang lebih koheren dan lebih sedikit artefak dari alur kerja berantai.

Sebelum terlalu jauh, mari bingkai ini dalam fitur-fitur kunci.

Fitur Utama Gemini Omni

Yang menonjol bagi saya adalah prosesnya. Baik penyuntingan berbasis percakapan maupun penggunaan sketsa sebagai cetak biru adalah fitur yang kita kenal dari alat pembangkit gambar seperti Nano Banana 2 atau ChatGPT Images 2.0 dari OpenAI, tetapi Omni membawanya juga ke pembuatan video.

Penyuntingan video berbasis percakapan

Kemampuan utamanya adalah penyuntingan video berbasis percakapan. Anda memberi Omni sebuah klip (yang Anda buat atau yang Anda rekam dengan ponsel), lalu Anda mengubahnya dengan berbicara. "Buat pencahayaannya lebih redup." "Ubah sudut kamera menjadi over the shoulder dari belakangnya." "Buat biolanya tak terlihat." Setiap instruksi bertahan lintas percakapan berikutnya. Adegan terus berkembang; tidak direset.

Fisika dunia nyata dan pengetahuan dunia

Google menekankan hal ini saat peluncuran. Omni memiliki pemahaman intuitif tentang gravitasi, energi kinetik, dan dinamika fluida. Dalam uji awal saya, video yang dihasilkan belum terasa seperti fisika dunia nyata — namun ini versi Flash, dan kami memperkirakan model Omni Pro akan segera menyusul dan lebih kompetitif dengan alat seperti Seedance 2.0.

Sketsa dan gambar menjadi video

Anda dapat mengubah coretan menjadi cuplikan realistis, menggunakan sketsa hanya sebagai panduan gerak alih-alih referensi visual final. Ini akan berguna dalam pra-produksi. Anak-anak juga akan menyukainya untuk gambar-gambar mereka.

Tanda air SynthID dan kredensial konten C2PA

Setiap keluaran Omni dilengkapi dua lapis asal-usul (provenance).

  • SynthID adalah tanda air tak kasatmata yang disisipkan langsung ke piksel saat generasi. Tidak terlihat oleh penonton. Dan dirancang untuk tetap ada meski dipangkas, diberi filter, atau dienkode ulang.
  • Kredensial konten C2PA menyertainya sebagai manifes kriptografis bertanda tangan yang terlampir pada file. Meskipun metadata dihapus, sinyal setingkat piksel tetap bertahan.

Perlu dicatat: SynthID khusus untuk Google. Hanya model Google sendiri yang menyisipkannya, jadi "tanpa tanda air" bukan berarti "buatan manusia" — itu hanya berarti "bukan dari model Google." Mengingat betapa mudahnya Omni meremiks cuplikan nyata, asal-usul yang tahan lama pada setiap keluaran semakin terlihat bukan sekadar nilai tambah, melainkan prasyarat.

Menguji Gemini Omni Flash

Saya menguji kemampuan pembuatan video Omni Flash dalam dua kategori berbeda: fisika dunia nyata dan transfer gaya.

Menguji fisika dan pengetahuan dunia

Ini adalah prompt saya: 

A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.

Pemberitahuannya mengatakan perlu beberapa menit, tetapi sebenarnya hanya sekitar sepuluh detik. 

Mungkin saya terkesan rewel, tetapi saya sedikit kecewa. Sudut kendi tanah liatnya salah di frame akhir dibandingkan dengan sebelumnya. Sudutnya berubah, dan terlihat seperti pesawat dengan jenis propulsi yang berbeda di belakangnya. 

Menguji gerak dan transfer gaya

Sekarang, mari ambil hasil uji terakhir itu dan lihat apakah saya bisa membuatnya benar-benar berbeda. Yang saya lakukan: saya mengambil tangkapan layar dari video terakhir itu (jadi, saya mengunggah sebuah gambar) lalu meminta sebuah video dalam gaya baru. 

Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.

Video ini memerlukan waktu lebih lama untuk dibuat. Tetapi sepadan dengan penantiannya. Tiba-tiba, gangguan fisika tidak penting sama sekali karena gaya permadani memungkinkan ketidaksempurnaan, dan hasilnya lucu. Kali ini trebuchet-nya memang melontar ke arah belakang.

Posisi Gemini Omni pada Tolok Ukur

Perlu dicatat sejak awal: Google tidak menerbitkan tolok ukur numerik bersamaan dengan peluncuran Omni. Pengumuman DeepMind menonjolkan klaim kapabilitas, seperti pemahaman fisika, pengetahuan dunia, dan penyuntingan percakapan, namun tidak menyediakan skor head-to-head pada evaluasi terstandar.

Tolok ukur independen pihak ketiga tidak akan tersedia setidaknya beberapa minggu.

Artinya bagi peta persaingan: hingga saat ini, pemimpin publik pada Artificial Analysis Video Arena (papan peringkat yang paling mendekati standar industri untuk pembuatan video) adalah Seedance 2.0 dari ByteDance, dengan Elo 1.269 untuk teks-ke-video dan 1.351 untuk gambar-ke-video. 

Dengan itu, berikut tolok ukur yang patut dipantau setelah dijalankan:

  • VBench 2.0: mengevaluasi fisika, penalaran nalar-sehat (commonsense), kesetiaan terhadap manusia, dan keterkendalian di 18 dimensi.
  • Artificial Analysis Video Arena: peringkat preferensi manusia head-to-head bergaya Elo. 
  • VABench: evaluasi gabungan audio-video. Penting secara khusus karena Omni secara native menghasilkan audio tersinkron.

Cara Mengakses Gemini Omni: Harga dan Paket

Akses saat ini berada di dalam tingkatan AI konsumen Google di AS:

  • AI Plus seharga $7,99/bulan
  • AI Pro seharga $19,99/bulan, dan
  • AI Ultra seharga $249,99/bulan

Alokasi kredit meningkat sesuai tingkatnya: Plus mendapat 200 kredit AI bulanan, Pro mendapat 1.000.

Akses API akan hadir "dalam beberapa minggu ke depan." Kami akan menulis lebih detail setelah kami dapat mengujinya.

Kesimpulan

Selama ini, tumpukan media generatif seperti lomba estafet. Teks masuk ke satu model, keluarannya diberikan ke model gambar, yang kemudian memberikan gambar diam ke model video, yang lalu memberikan frame ke model audio. Setiap estafet adalah titik potensi kebocoran koherensi atau kualitas. Klaim besar Omni adalah ia menalar lintas teks, gambar, video, dan audio dalam lintasan pemrosesan yang sama. 

Model Omni dengan kapabilitas penuh, yang kami duga ditujukan untuk perusahaan, hampir pasti sedang dikerjakan. 


Josef Waples's photo
Author
Josef Waples

Saya penulis dan editor data science dengan kontribusi pada artikel riset di jurnal ilmiah. Saya sangat tertarik pada aljabar linear, statistika, R, dan sejenisnya. Saya juga cukup sering bermain catur! 

FAQ Gemini Omni

Apa itu Gemini Omni dan bagaimana cara kerjanya?

Gemini Omni adalah model video AI dari Google DeepMind yang membuat dan menyunting video dari masukan teks, gambar, audio, atau video melalui percakapan alami.

Apa yang dapat dilakukan dengan Gemini Omni?

Menyunting gaya video, menukar karakter dengan gambar referensi, mengubah sudut kamera, menyelaraskan teks dan suara dengan aksi, mengubah sketsa menjadi cuplikan, dan menggabungkan banyak masukan menjadi satu adegan.

Bagaimana cara mengakses Gemini Omni?

Tersedia di aplikasi Gemini, Google Flow, dan YouTube Shorts. Diperlukan langganan Google AI, dengan fitur yang bervariasi menurut tingkat dan wilayah.

Bisakah Anda menyunting video Gemini Omni dengan prompt lanjutan?

Ya. Omni mendukung penyuntingan multi-giliran, sehingga Anda dapat menyempurnakan detail, lingkungan, dan sudut kamera selangkah demi selangkah sambil menjaga konsistensi adegan.

Bagaimana cara mengetahui apakah sebuah video dibuat dengan Gemini Omni?

Setiap keluaran menyertakan tanda air SynthID tak kasatmata dan Kredensial Konten C2PA, yang dapat diverifikasi di aplikasi Gemini (dukungan untuk Chrome dan Penelusuran segera hadir).

Topik
Kecerdasan Buatan
AI Generatif
Terkait

blogs

12 Alternatif ChatGPT Terbaik yang Bisa Anda Coba pada 2026

Artikel ini menyajikan daftar alternatif ChatGPT yang akan meningkatkan produktivitas Anda.
Javier Canales Luna's photo

Javier Canales Luna

14 mnt

blogs

40 Pertanyaan Wawancara DBMS Teratas di 2026

Kuasai pertanyaan wawancara basis data, dari konsep SQL dasar hingga skenario desain sistem tingkat lanjut. Panduan mendalam ini mencakup semua yang Anda perlukan untuk sukses di wawancara DBMS dan meraih peran berikutnya.
Dario Radečić's photo

Dario Radečić

15 mnt

blogs

Spaghetti Plot dan Jalur Badai

Temukan alasan mengapa Anda sebaiknya (tidak) menggunakan spaghetti plot untuk menyampaikan ketidakpastian jalur prediksi badai serta dampaknya terhadap interpretasi.
Hugo Bowne-Anderson's photo

Hugo Bowne-Anderson

13 mnt

blogs

Tutorial Korelasi di R

Dapatkan pengenalan dasar-dasar korelasi di R: pelajari lebih lanjut tentang koefisien korelasi, matriks korelasi, plotting korelasi, dan sebagainya.
David Woods's photo

David Woods

13 mnt

Lihat SelengkapnyaLihat Selengkapnya