Accéder au contenu principal

Gemini Omni : un seul modèle pour le texte, l’image, l’audio et la vidéo

Un premier aperçu du modèle « any‑to‑any » de Google DeepMind — ce qu’il permet, ce qu’il apporte de nouveau et comment y accéder.
Actualisé 23 sept. 2026  · 7 min lire

Explorez l'IA

ChatGPTClaudePerplexity

L’événement très attendu Google I/O a tenu ses promesses. Après un peu de mise en bouche et aux côtés de Gemini 3.5 Flash et Gemini Spark, la véritable vedette : Gemini Omni, une nouvelle famille de modèles d’IA nativement multimodaux « any-to-any », autrement dit capables de traiter simultanément texte, image, audio et vidéo. En d’autres termes, Nano Banana, mais pour la vidéo. (C’est ainsi que Google l’a présenté.)

Le premier modèle s’appelle Omni Flash. Il introduit le montage vidéo conversationnel pour créer des médias cohérents à partir d’éléments disparates. Autrement dit, vous pouvez monter et remixer des vidéos par la conversation, sans logiciel de montage.

Qu’est-ce que Gemini Omni ?

Voyons plus précisément ce qu’Omni apporte.

Gemini Omni est le premier modèle de génération de médias nativement multimodal de Google DeepMind. La première déclinaison de la famille, Gemini Omni Flash, est déjà disponible

  • dans l’application Gemini,
  • dans Google Flow, et
  • sur YouTube Shorts

Omni accepte n’importe quelle combinaison de texte, d’images, d’audio et de vidéo en entrée, et produit une vidéo. L’essentiel, c’est qu’il n’y a aucun relais entre différents systèmes ; tout repose sur un seul et même modèle.

Jusqu’ici, Google utilisait une pile séparée : Veo pour la vidéo, Imagen pour les images, et des systèmes distincts pour l’audio. Omni unifie le tout dans un modèle unique (d’où son nom) capable de raisonner à travers les modalités. Concrètement, cela se traduit par des montages plus cohérents et moins d’artefacts de pipeline.

Avant d’aller plus loin, cadrons-le avec les fonctionnalités clés.

Fonctionnalités clés de Gemini Omni

Ce qui ressort, c’est le processus. Le montage conversationnel et l’usage de croquis comme plans directeurs existent déjà dans des outils d’image comme Nano Banana 2 ou ChatGPT Images 2.0 d’OpenAI, mais Omni les étend à la génération vidéo.

Montage vidéo conversationnel

La fonctionnalité phare, c’est le montage vidéo conversationnel. Vous donnez à Omni un clip (généré ou filmé avec votre téléphone) et vous le modifiez en lui parlant. « Baissez les lumières. » « Passez en caméra à l’épaule, derrière elle. » « Rendez le violon invisible. » Chaque instruction s’ajoute aux précédentes. La scène évolue, elle ne repart pas de zéro.

Physique du monde réel et connaissances générales

Google a insisté là‑dessus au lancement. Omni a une compréhension intuitive de la gravité, de l’énergie cinétique et de la dynamique des fluides. Lors de mon premier test, la physique ne m’a pas semblé totalement réaliste — mais rappelons qu’il s’agit de la version Flash, et qu’un modèle Omni Pro devrait suivre rapidement, plus compétitif face à des outils comme Seedance 2.0.

Du croquis au film

Vous pouvez transformer des gribouillis en prises de vue réalistes, en utilisant le croquis comme simple guide de mouvement plutôt que comme référence visuelle finale. Très utile en pré‑production. Les enfants vont adorer pour animer leurs dessins.

Filigrane SynthID et attestations de contenu C2PA

Chaque rendu Omni s’accompagne de deux couches de traçabilité.

  • SynthID est un filigrane invisible intégré directement dans les pixels au moment de la génération. Il est imperceptible pour les spectateurs et conçu pour résister au recadrage, aux filtres et au ré-encodage.
  • Les attestations C2PA se présentent comme un manifeste cryptographique signé, attaché au fichier. Même si vous supprimez les métadonnées, le signal au niveau des pixels reste présent.

Précision utile : SynthID est spécifique à Google. Seuls les modèles Google l’intègrent ; « sans filigrane » ne veut donc pas dire « produit par un humain », mais simplement « pas issu d’un modèle Google ». Vu la facilité avec laquelle Omni peut remixer des prises de vue réelles, une traçabilité robuste pour chaque sortie apparaît moins comme un plus et davantage comme un prérequis.

Test de Gemini Omni Flash

J’ai testé les capacités de génération vidéo d’Omni Flash dans deux catégories : la physique du monde réel et le transfert de style.

Tester la physique et les connaissances du monde

Voici mon prompt :

A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.

La note indiquait que cela prendrait quelques minutes, mais en réalité, cela n’a pris qu’une dizaine de secondes. 

Je chipote peut‑être, mais j’ai été un peu déçu. L’angle du pot en argile était incorrect sur la dernière image par rapport aux précédentes. Il a changé d’angle et donnait l’impression d’un avion avec une autre forme de propulsion. 

Tester le mouvement et le transfert de style

Maintenant, je reprends le résultat du test précédent pour voir si je peux le transformer totalement. Concrètement : j’ai pris une capture d’écran de cette dernière vidéo (donc j’ai importé une image) puis j’ai demandé une vidéo dans un nouveau style. 

Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.

Cette vidéo a mis bien plus de temps à se générer. Mais l’attente en valait la peine. D’un coup, le couac de physique n’avait plus d’importance : le style tapisserie tolère les imperfections, et le résultat était drôle. Le trébuchet a bien été lancé à l’envers cette fois.

Position de Gemini Omni sur les benchmarks

Précision d’emblée : Google n’a pas publié de chiffres de benchmark lors du lancement d’Omni. L’annonce de DeepMind mettait en avant des capacités — compréhension de la physique, connaissances générales, montage conversationnel — sans fournir de scores comparatifs sur des évaluations standardisées.

Des benchmarks indépendants tiers n’arriveront pas avant quelques semaines.

Conséquence sur le paysage concurrentiel : à ce jour, le leader public sur l’Artificial Analysis Video Arena (ce qui se rapproche le plus d’un classement de référence pour la génération vidéo) est Seedance 2.0 de ByteDance, avec un Elo de 1 269 en texte‑vers‑vidéo et 1 351 en image‑vers‑vidéo. 

Cela dit, voici les benchmarks à surveiller lorsqu’ils seront disponibles :

  • VBench 2.0 : évalue la physique, le raisonnement de bon sens, la fidélité humaine et la contrôlabilité sur 18 dimensions.
  • Artificial Analysis Video Arena : classements Elo en face‑à‑face selon les préférences humaines. 
  • VABench : évaluation conjointe audio‑vidéo. Important car Omni génère nativement un audio synchronisé.

Comment accéder à Gemini Omni : tarifs et formules

L’accès se fait pour l’instant via les offres d’IA grand public de Google aux États‑Unis :

  • AI Plus à 7,99 $/mois
  • AI Pro à 19,99 $/mois, et
  • AI Ultra à 249,99 $/mois

Les crédits alloués évoluent selon l’offre : Plus obtient 200 crédits IA mensuels, Pro en obtient 1 000.

L’accès API est « prévu dans les prochaines semaines ». Nous publierons une analyse détaillée dès que nous l’aurons testé.

Conclusion

Jusqu’ici, la génération de médias reposait sur un passage de relais. Le texte passe à un modèle, sa sortie est transmise à un modèle d’image, qui envoie une image fixe à un modèle vidéo, qui transmet des images à un modèle audio. Chaque relais est un point de fuite potentiel pour la cohérence ou la qualité. La grande promesse d’Omni, c’est de raisonner sur le texte, l’image, la vidéo et l’audio en un même passage avant. 

Un modèle Omni complet, vraisemblablement destiné aux entreprises, est sans aucun doute en préparation. 


Josef Waples's photo
Author
Josef Waples

Je suis rédacteur et éditeur dans le domaine de la science des données. Je suis particulièrement intéressé par l'algèbre linéaire, les statistiques, R, etc. Je joue également beaucoup aux échecs ! 

FAQ sur Gemini Omni

Qu’est-ce que Gemini Omni et comment fonctionne-t-il ?

Gemini Omni est le modèle vidéo d’IA de Google DeepMind qui crée et édite des vidéos à partir d’entrées texte, image, audio ou vidéo via une conversation naturelle.

Que pouvez-vous faire avec Gemini Omni ?

Modifier les styles vidéo, remplacer des personnages avec des images de référence, changer les angles de caméra, synchroniser texte et son avec l’action, transformer des croquis en séquences et combiner plusieurs entrées en une seule scène.

Comment accéder à Gemini Omni ?

Il est disponible dans l’app Gemini, Google Flow et YouTube Shorts. Un abonnement Google AI est requis, avec des fonctionnalités variables selon la formule et la région.

Pouvez-vous modifier les vidéos Gemini Omni avec des relances successives ?

Oui. Omni gère l’édition multi‑tours, ce qui vous permet d’affiner pas à pas les détails, les environnements et les angles de caméra tout en conservant la cohérence de la scène.

Comment savoir si une vidéo a été créée avec Gemini Omni ?

Chaque sortie inclut un filigrane invisible SynthID et des attestations de contenu C2PA, vérifiables dans l’app Gemini (avec une prise en charge prochaine dans Chrome et la Recherche).

Sujets
Intelligence artificielle
IA générative
Contenus associés

blog

Comprendre les TPU et les GPU dans l'IA : Un guide complet

L'essor du développement de l'intelligence artificielle (IA) a entraîné une augmentation notable de la demande en matière de calcul, d'où la nécessité de disposer de solutions matérielles robustes. Les unités de traitement graphique (GPU) et les unités de traitement tensoriel (TPU) sont devenues des technologies essentielles pour répondre à ces demandes.
Kurtis Pykes 's photo

Kurtis Pykes

9 min

blog

Types d'agents d'intelligence artificielle : Comprendre leurs rôles, leurs structures et leurs applications

Découvrez les principaux types d'agents d'intelligence artificielle, comment ils interagissent avec les environnements et comment ils sont utilisés dans les différents secteurs d'activité. Comprendre les agents réflexes simples, les agents basés sur un modèle, les agents basés sur un but, les agents basés sur l'utilité, les agents d'apprentissage, etc.

blog

ROI de l'IA en 2026 : pourquoi les compétences des équipes déterminent le retour sur investissement

Seuls 21 % des dirigeants font état d'un retour sur investissement « significatif » de leurs investissements dans l'IA.
Lynn Heidmann's photo

Lynn Heidmann

blog

Architecture de l'entrepôt de données : Tendances, outils et techniques

Apprenez l'essentiel de l'architecture d'un entrepôt de données, des composants clés aux meilleures pratiques, pour construire un système de données évolutif et efficace !
Kurtis Pykes 's photo

Kurtis Pykes

15 min

blog

Plus de 50 questions/réponses d’entretien AWS pour 2026

Un guide complet des questions d’entretien AWS de base, intermédiaires et avancées, avec des mises en situation inspirées de cas réels.
Zoumana Keita 's photo

Zoumana Keita

15 min

cursor ai code editor

Tutoriel

Cursor AI : Un guide avec 10 exemples pratiques

Apprenez à installer Cursor AI sur Windows, macOS et Linux, et découvrez comment l'utiliser à travers 10 cas d'utilisation différents.
Voir PlusVoir Plus