मुख्य सामग्री पर जाएं

Gemini Omni: एक ही मॉडल से टेक्स्ट, इमेज, ऑडियो और वीडियो

Google DeepMind के any-to-any मॉडल की पहली झलक — यह क्या करता है, इसमें नया क्या है, और इसे कैसे एक्सेस करें।
अपडेट किया गया 25 सित॰ 2026  · 7 मि॰ पढ़ें

AI के साथ खोजें

ChatGPTClaudePerplexity

बहुचर्चित Google I/O इवेंट ने निराश नहीं किया। थोड़े से प्रास्तावना के बाद और Gemini 3.5 Flash तथा Gemini Spark के साथ, असली आकर्षण था: Gemini Omni — नैटिव मल्टीमोडल, "any-to-any" AI मॉडलों का नया परिवार, जिसका अर्थ है कि ये टेक्स्ट, इमेज, ऑडियो और वीडियो—जो आप कहें—को एक साथ प्रोसेस करते हैं। दूसरे शब्दों में, Nano Banana, पर वीडियो के लिए। (Google ने खुद इसे इसी तरह वर्णित किया।)

प्रारंभिक मॉडल है Omni Flash। यह व्यक्तिगत एसेट्स से एक संगठित मीडिया बनाने के लिए संवादात्मक वीडियो एडिटिंग पेश करता है। यानी आप एडिटिंग सॉफ़्टवेयर के बजाय बातचीत के जरिए वीडियो एडिट और रीमिक्स कर सकते हैं।

Gemini Omni क्या है?

आइए समझते हैं कि Omni वास्तव में है क्या।

Gemini Omni, Google DeepMind का पहला नैटिवली मल्टीमोडल जेनरेटिव मीडिया मॉडल है। इस परिवार का पहला वेरिएंट Gemini Omni Flash है, जो अब उपलब्ध है

  • Gemini ऐप के भीतर,
  • Google Flow में, और
  • YouTube Shorts पर

Omni टेक्स्ट, इमेज, ऑडियो और वीडियो के किसी भी संयोजन को इनपुट के तौर पर लेता है और आउटपुट में एक वीडियो देता है। महत्वपूर्ण बात यह है कि अलग-अलग सिस्टम्स के बीच कोई रिले नहीं होता; यह सब एक ही मॉडल में होता है।

अब तक, Google एक स्प्लिट स्टैक चलाता था: वीडियो के लिए Veo, इमेज के लिए Imagen, और ऑडियो के लिए अलग सिस्टम्स। Omni इन्हें समेटकर एक ही मॉडल में ले आता है (यही कारण है नाम का!) जो मल्टीमॉडल तर्क कर सकता है। व्यवहार में, इसका मतलब है अधिक सुसंगत एडिट्स और पाइपलाइन आर्टिफैक्ट्स में कमी।

आगे बढ़ने से पहले, इसे प्रमुख विशेषताओं के रूप में फ्रेम करते हैं।

Gemini Omni की प्रमुख विशेषताएँ

जो चीज़ सबसे अलग दिखती है, वह है प्रक्रिया। संवादात्मक एडिटिंग और स्केच को ब्लूप्रिंट के रूप में इस्तेमाल करना—ये फीचर्स हमें इमेज जेनरेशन टूल्स जैसे Nano Banana 2 या OpenAI के ChatGPT Images 2.0 से परिचित हैं—लेकिन Omni इन्हें वीडियो जेनरेशन में भी लाता है।

संवादात्मक वीडियो एडिटिंग

सबसे बड़ा आकर्षण है संवादात्मक वीडियो एडिटिंग। आप Omni को एक क्लिप देते हैं (जो आपने जेनरेट किया हो या फोन से शूट किया हो), और आप उससे बात करके बदलाव करते हैं। "लाइट्स को डिम कर दें।" "कैमरा एंगल को उसके कंधे के ऊपर से कर दें।" "वायलिन को अदृश्य कर दें।" हर निर्देश कई टर्न्स में कायम रहता है। सीन विकसित होता है; वो रीसेट नहीं होता।

वास्तविक दुनिया का भौतिकशास्त्र और विश्व-ज्ञान

लॉन्च पर Google ने इस पर जोर दिया। Omni को गुरुत्वाकर्षण, गतिज ऊर्जा और द्रव गतिकी की सहज समझ है। मेरी प्रारंभिक टेस्टिंग में, जनरेटेड वीडियो वास्तविक दुनिया के भौतिकशास्त्र जैसा नहीं लगा—लेकिन फिर, यह Flash वर्ज़न है, और हम उम्मीद करते हैं कि जल्द ही Omni Pro मॉडल आएगा, जो Seedance 2.0 जैसे टूल्स से अधिक टक्कर दे।

स्केच और ड्रॉइंग से वीडियो

आप डूडल्स को यथार्थपरक फुटेज में बदल सकते हैं—स्केच को अंतिम विजुअल रेफरेंस की बजाय सिर्फ मूवमेंट गाइड के रूप में उपयोग करते हुए। यह प्री-प्रोडक्शन में उपयोगी होगा। बच्चे भी इसे अपनी ड्रॉइंग्स के लिए पसंद करेंगे।

SynthID वॉटरमार्किंग और C2PA कंटेंट क्रेडेंशियल्स

हर Omni आउटपुट दो परतों की स्रोत-सत्यापन के साथ आता है।

  • SynthID एक अदृश्य वॉटरमार्क है जो जेनरेशन के समय सीधे पिक्सल्स में एम्बेड होता है। दर्शकों के लिए अप्रत्याक्ष। और इसे क्रॉपिंग, फ़िल्टर्स, और री-एन्कोडिंग के बाद भी टिके रहने के लिए डिज़ाइन किया गया है।
  • C2PA कंटेंट क्रेडेंशियल्स इसके साथ एक साइन किए हुए क्रिप्टोग्राफिक मैनिफेस्ट के रूप में फाइल से संलग्न होते हैं। मेटाडेटा हटा दें, तब भी पिक्सल-स्तर का सिग्नल बना रहता है।

ध्यान देने योग्य: SynthID Google-विशिष्ट है। केवल Google के अपने मॉडल ही इसे एम्बेड करते हैं, इसलिए "वॉटरमार्क नहीं" का अर्थ "मानव-निर्मित" नहीं होता—सिर्फ इतना कि "Google मॉडल से नहीं।" चूँकि Omni वास्तविक फुटेज को आसानी से रीमिक्स कर सकता है, इसलिए हर आउटपुट पर टिकाऊ स्रोत-सत्यापन अब एक अच्छी-से-हो चीज़ नहीं, बल्कि बुनियादी अपेक्षा जैसा दिखता है।

Gemini Omni Flash की टेस्टिंग

मैंने Omni Flash की वीडियो जेनरेशन क्षमताओं का दो श्रेणियों में परीक्षण किया: वास्तविक दुनिया का भौतिकशास्त्र और स्टाइल ट्रांसफ़र।

फिज़िक्स और वर्ल्ड-नॉलेज की टेस्टिंग

मेरा प्रॉम्प्ट यह था: 

A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.

नोट में कहा गया था कि इसमें कुछ मिनट लगेंगे, लेकिन वास्तव में इसमें सिर्फ़ दस सेकंड लगे। 

शायद मैं थोड़ी बारीकी पर ध्यान देता हूँ, पर मैं थोड़ा निराश हुआ। बाद के फ़्रेम में मिट्टी के बर्तन का एंगल, पहले वाले की तुलना में गलत था। एंगल बदल गया, और वह ऐसे लग रहा था मानो उसके पीछे किसी और तरह का प्रणोदन हो—जैसे एक हवाई जहाज़। 

मोशन और स्टाइल ट्रांसफ़र की टेस्टिंग

अब, आइए पिछले टेस्ट के नतीजे को लें और देखें कि क्या मैं इसे बिल्कुल अलग बना सकता हूँ। मैंने क्या किया: मैंने उस आख़िरी वीडियो का स्क्रीनशॉट लिया (यानी एक इमेज अपलोड की) और फिर उसी से एक नए स्टाइल में वीडियो माँगा। 

Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.

यह वीडियो जनरेट होने में काफी अधिक समय लगा। लेकिन इंतज़ार वाजिब था। अचानक, फिज़िक्स की गड़बड़ी मायने नहीं रखी, क्योंकि टेपेस्ट्री-स्टाइल में अपूर्णताएँ चल जाती हैं—और नतीजा मज़ेदार निकला। इस बार ट्रेबुशे ने पीछे की ओर लॉन्च किया।

बेंचमार्क्स पर Gemini Omni की स्थिति

शुरू में साफ़ कर दें: Google ने Omni लॉन्च के साथ संख्यात्मक बेंचमार्क प्रकाशित नहीं किए। DeepMind की घोषणा ने क्षमताओं—जैसे फिज़िक्स की समझ, विश्व-ज्ञान, संवादात्मक एडिटिंग—पर जोर दिया, लेकिन मानकीकृत इवैल्स पर सीधे-सीधे हेड-टू-हेड स्कोर साझा नहीं किए।

स्वतंत्र थर्ड-पार्टी बेंचमार्क्स आने में कम से कम कुछ सप्ताह लगेंगे।

प्रतिस्पर्धी परिदृश्य के लिए इसका अर्थ: फिलहाल, Artificial Analysis Video Arena (जो वीडियो जेनरेशन के लिए किसी हद तक इंडस्ट्री-स्टैंडर्ड लीडरबोर्ड जैसा है) पर सार्वजनिक लीडर ByteDance का Seedance 2.0 है, जिसका Elo स्कोर टेक्स्ट-टू-वीडियो पर 1,269 और इमेज-टू-वीडियो पर 1,351 है। 

यह सब कहते हुए, जब ये चलें तो देखने लायक बेंचमार्क्स ये हैं:

  • VBench 2.0: 18 आयामों में फिज़िक्स, कॉमन्सेंस रीजनिंग, ह्यूमन फ़िडेलिटी और कंट्रोलैबिलिटी का मूल्यांकन करता है।
  • Artificial Analysis Video Arena: Elo-स्टाइल हेड-टू-हेड ह्यूमन प्रेफ़रेंस रैंकिंग्स। 
  • VABench: संयुक्त ऑडियो-वीडियो मूल्यांकन। विशेष रूप से मायने रखता है क्योंकि Omni नैटिव रूप से सिंक्रोनाइज़्ड ऑडियो जेनरेट करता है।

Gemini Omni तक पहुँच: मूल्य और प्लान

अभी के लिए पहुँच, अमेरिका में Google के कंज़्यूमर AI टियरों के भीतर है:

  • AI Plus: $7.99/माह
  • AI Pro: $19.99/माह, और
  • AI Ultra: $249.99/माह

क्रेडिट आवंटन टियर के साथ स्केल होते हैं: Plus को 200 मासिक AI क्रेडिट मिलते हैं, Pro को 1,000।

API एक्सेस "अगले कुछ सप्ताहों में आ रहा है।" हमें हाथ लगते ही हम इस पर विस्तार से लिखेंगे।

निष्कर्ष

अब तक, जेनरेटिव मीडिया स्टैक एक रिले रेस जैसा रहा है। टेक्स्ट एक मॉडल के पास जाता है, आउटपुट किसी इमेज मॉडल को दिया जाता है, जो एक स्टिल को वीडियो मॉडल को देता है, जो फ़्रेम्स को ऑडियो मॉडल को देता है। हर हैंडऑफ़ वह जगह है जहाँ सुसंगति या गुणवत्ता रिस सकती है। Omni का बड़ा दावा यह है कि वह टेक्स्ट, इमेज, वीडियो और ऑडियो पर एक ही फॉरवर्ड पास में तर्क करता है। 

एक फुल-कैपेबिलिटी Omni मॉडल—जिसका लक्ष्य, हमारा अनुमान है, एंटरप्राइज़ है—निश्चित रूप से काम में है। 


Josef Waples's photo
Author
Josef Waples

मैं एक डेटा साइंस संपादक हूँ और वैज्ञानिक पत्रिकाओं में प्रकाशित शोध लेखों में योगदान दे चुका/चुकी हूँ। मुझे विशेष रूप से रैखिक बीजगणित, सांख्यिकी, R, और इसी तरह के विषयों में रुचि है।

Gemini Omni FAQs

Gemini Omni क्या है और यह कैसे काम करता है?

Gemini Omni, Google DeepMind का AI वीडियो मॉडल है जो नैचुरल बातचीत के जरिए टेक्स्ट, इमेज, ऑडियो या वीडियो इनपुट्स से वीडियो बनाता और एडिट करता है।

Gemini Omni से आप क्या कर सकते हैं?

वीडियो स्टाइल एडिट करें, रेफरेंस इमेजेज़ से पात्रों को बदलें, कैमरा एंगल बदलें, टेक्स्ट और साउंड को एक्शन से सिंक करें, स्केच को फुटेज में बदलें, और कई इनपुट्स को एक सीन में जोड़ें।

Gemini Omni तक पहुँच कैसे प्राप्त करें?

यह Gemini ऐप, Google Flow और YouTube Shorts में उपलब्ध है। Google AI सदस्यता आवश्यक है, और फीचर्स टियर व क्षेत्र के अनुसार बदलते हैं।

क्या आप फॉलो-अप प्रॉम्प्ट्स से Gemini Omni वीडियो एडिट कर सकते हैं?

हाँ। Omni मल्टी-टर्न एडिटिंग सपोर्ट करता है, इसलिए आप सीन को सुसंगत रखते हुए चरण-दर-चरण डिटेल्स, एनवायरनमेंट्स और कैमरा एंगल्स को परिष्कृत कर सकते हैं।

कैसे पता चलेगा कि कोई वीडियो Gemini Omni से बनाया गया है?

हर आउटपुट में अदृश्य SynthID वॉटरमार्क और C2PA कंटेंट क्रेडेंशियल्स शामिल होते हैं, जिन्हें Gemini ऐप में सत्यापित किया जा सकता है (Chrome और Search सपोर्ट जल्द आ रहा है)।

विषय
कृत्रिम बुद्धिमत्ता
जनरेटिव एआई