Ir al contenido principal

Gemini Omni: un único modelo para texto, imagen, audio y vídeo

Un primer vistazo al modelo any-to-any de Google DeepMind: qué hace, qué aporta y cómo acceder a él.
Actualizado 23 sept 2026  · 7 min leer

Explora con IA

ChatGPTClaudePerplexity

El esperado evento Google I/O no decepcionó. Tras un poco de preámbulo y junto a Gemini 3.5 Flash y Gemini Spark, llegó el verdadero protagonista: Gemini Omni, una nueva familia de modelos de IA nativos multimodales, "any-to-any", es decir, capaces de procesar a la vez lo que les pongas por delante: texto, imagen, audio y vídeo. En otras palabras, Nano Banana, pero para vídeo. (Así lo presentó la propia Google.)

El modelo inicial es Omni Flash. Introduce la edición de vídeo conversacional para crear piezas coherentes a partir de elementos sueltos. Es decir, puedes editar y remezclar vídeos conversando, sin necesidad de usar software de edición.

¿Qué es Gemini Omni?

Veamos con más detalle de qué va Omni.

Gemini Omni es el primer modelo generativo de medios nativamente multimodal de Google DeepMind. La primera variante de la familia es Gemini Omni Flash, que ya está disponible

  • dentro de la app de Gemini,
  • Google Flow, y
  • YouTube Shorts

Omni acepta cualquier combinación de texto, imágenes, audio y vídeo como entrada y produce un vídeo. La clave es que no hay relevos entre sistemas distintos; todo sucede en un único modelo.

Hasta ahora, Google funcionaba con una pila separada: Veo para vídeo, Imagen para imágenes y sistemas aparte para audio. Omni unifica todo en un solo modelo (de ahí el nombre) capaz de razonar entre modalidades. En la práctica, eso se traduce en ediciones más coherentes y menos artefactos de pipeline.

Antes de dejarnos llevar, enmarquémoslo en sus funciones clave.

Funciones clave de Gemini Omni

Lo que más me llama la atención es el proceso. Tanto la edición conversacional como el uso de bocetos como guías son funciones que ya conocemos de herramientas de generación de imágenes como Nano Banana 2 o ChatGPT Images 2.0 de OpenAI, pero Omni las lleva también a la generación de vídeo.

Edición de vídeo conversacional

La gran capacidad es la edición de vídeo conversacional. Le das a Omni un clip (uno generado o uno que hayas grabado con el móvil) y lo cambias hablándole. "Atenúa las luces". "Cambia el ángulo de cámara a sobre su hombro". "Haz invisible el violín". Cada instrucción se mantiene de un turno a otro. La escena evoluciona; no se reinicia.

Física del mundo real y conocimiento del mundo

Google hizo hincapié en esto durante el lanzamiento. Omni tiene una comprensión intuitiva de la gravedad, la energía cinética y la dinámica de fluidos. En mi prueba inicial, el vídeo generado no se sentía como física del mundo real; pero, de nuevo, esta es la versión Flash, y esperamos que pronto llegue un modelo Omni Pro más competitivo con herramientas como Seedance 2.0.

De bocetos y dibujos a vídeo

Puedes convertir garabatos en metraje realista usando el boceto solo como guía de movimiento, no como referencia visual final. Será útil en preproducción. Y a los peques les encantará para dar vida a sus dibujos.

Filigrana SynthID y credenciales de contenido C2PA

Cada salida de Omni incluye dos capas de procedencia.

  • SynthID es una marca de agua invisible incrustada directamente en los píxeles en el momento de la generación. Es imperceptible para quien ve el vídeo y está diseñada para resistir recortes, filtros y recodificaciones.
  • Las credenciales de contenido C2PA van junto a ella como un manifiesto criptográfico firmado adjunto al archivo. Aunque elimines los metadatos, la señal a nivel de píxel se mantiene.

Conviene señalar: SynthID es específica de Google. Solo los modelos de Google la insertan, así que "sin marca de agua" no significa "hecho por humanos"; solo significa "no generado por un modelo de Google". Dado lo fácil que le resulta a Omni remezclar metraje real, contar con una procedencia robusta en cada salida deja de ser un extra y pasa a ser imprescindible.

Pruebas con Gemini Omni Flash

Probé las capacidades de generación de vídeo de Omni Flash en dos categorías: física del mundo real y transferencia de estilo.

Probando física y conocimiento del mundo

Este fue mi prompt: 

A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.

El aviso decía que tardaría unos minutos, pero en realidad solo fueron unos diez segundos. 

Quizá me pongo exigente, pero me dejó un poco frío. El ángulo de la vasija de barro era incorrecto en el último fotograma respecto al anterior. Cambió la inclinación y parecía un avión con otro tipo de propulsión detrás. 

Probando movimiento y transferencia de estilo

Ahora, voy a tomar el resultado de la última prueba y ver si puedo transformarlo por completo. ¿Qué hice? Hice una captura del último vídeo (o sea, subí una imagen) y pedí un vídeo en un estilo nuevo. 

Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.

Este vídeo tardó bastante más en generarse. Pero mereció la pena. De repente, el fallo de física dejó de importar porque el estilo de tapiz permitía imperfecciones, y el resultado fue divertido. Eso sí, esta vez el trabuquete lanzó hacia atrás.

Dónde se sitúa Gemini Omni en los benchmarks

Aviso por adelantado: Google no publicó benchmarks numéricos junto al lanzamiento de Omni. El anuncio de DeepMind se centró en declaraciones de capacidades, como comprensión de física, conocimiento del mundo y edición conversacional, pero no ofreció puntuaciones comparativas en evaluaciones estandarizadas.

Los benchmarks independientes de terceros no llegarán hasta dentro de unas semanas.

¿Qué implica esto para la competencia? A día de hoy, el líder público en Artificial Analysis Video Arena (lo más parecido a una clasificación estándar del sector para generación de vídeo) es Seedance 2.0 de ByteDance, con un Elo de 1.269 en texto a vídeo y 1.351 en imagen a vídeo. 

Dicho esto, estos son los benchmarks a seguir cuando estén disponibles:

  • VBench 2.0: evalúa física, razonamiento de sentido común, fidelidad humana y controlabilidad en 18 dimensiones.
  • Artificial Analysis Video Arena: rankings cara a cara de preferencia humana al estilo Elo. 
  • VABench: evaluación conjunta de audio y vídeo. Importa especialmente porque Omni genera audio sincronizado de forma nativa.

Cómo acceder a Gemini Omni: precios y planes

El acceso, por ahora, está dentro de las suscripciones de IA para consumidores de Google en EE. UU.:

  • AI Plus por 7,99 $/mes
  • AI Pro por 19,99 $/mes, y
  • AI Ultra por 249,99 $/mes

Los créditos de IA escalan con el plan: Plus recibe 200 créditos mensuales, Pro recibe 1.000.

El acceso por API llegará "en las próximas semanas". Escribiremos más en detalle en cuanto podamos probarlo.

Conclusión

Hasta ahora, la pila de medios generativos funcionaba como una carrera de relevos. El texto va a un modelo, cuya salida se pasa a un modelo de imagen, que entrega un fotograma a un modelo de vídeo, que a su vez pasa frames a un modelo de audio. Cada relevo es un punto donde la coherencia o la calidad pueden perderse. La gran promesa de Omni es que razona sobre texto, imagen, vídeo y audio en la misma pasada. 

Un modelo Omni con todas las capacidades —que sospechamos irá orientado a empresa— está, con toda seguridad, en camino. 


Josef Waples's photo
Author
Josef Waples

Preguntas frecuentes sobre Gemini Omni

¿Qué es Gemini Omni y cómo funciona?

Gemini Omni es el modelo de vídeo con IA de Google DeepMind que crea y edita vídeo a partir de entradas de texto, imagen, audio o vídeo mediante conversación natural.

¿Qué puedes hacer con Gemini Omni?

Edita estilos de vídeo, sustituye personajes con imágenes de referencia, cambia ángulos de cámara, sincroniza texto y sonido con la acción, convierte bocetos en metraje y combina varias entradas en una sola escena.

¿Cómo se accede a Gemini Omni?

Está disponible en la app de Gemini, Google Flow y YouTube Shorts. Requiere una suscripción a Google AI, con funciones que varían según el plan y la región.

¿Puedes editar vídeos de Gemini Omni con indicaciones de seguimiento?

Sí. Omni admite edición en varias iteraciones, para que puedas afinar detalles, entornos y ángulos de cámara paso a paso manteniendo la coherencia de la escena.

¿Cómo saber si un vídeo se ha hecho con Gemini Omni?

Cada salida incluye una marca de agua invisible SynthID y credenciales de contenido C2PA, verificables en la app de Gemini (con compatibilidad en Chrome y Search próximamente).

Temas
Inteligencia Artificial
IA Generativa
Relacionado
An AI juggles tasks

blog

Cinco proyectos que puedes crear con modelos de IA generativa (con ejemplos)

Aprende a utilizar modelos de IA generativa para crear un editor de imágenes, un chatbot similar a ChatGPT con pocos recursos y una aplicación clasificadora de aprobación de préstamos y a automatizar interacciones PDF y un asistente de voz con GPT.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

Los 7 mejores generadores de vídeo con IA para 2026 con vídeos de ejemplo

Descubre los mejores generadores de vídeo con IA disponibles en la actualidad, entre los que se incluyen RunwayML, Synthesia, Colossyan, Pictory, DeepBrain AI, Invideo y los muy esperados Sora y Veo de DeepMind.
Dr Ana Rojo-Echeburúa's photo

Dr Ana Rojo-Echeburúa

9 min

blog

SAM 2: Primeros pasos con el modelo 2 de Segmentar cualquier cosa de Meta

El SAM 2 (Segment Anything Model 2) de Meta AI es el primer modelo unificado capaz de segmentar cualquier objeto tanto en imágenes como en vídeos en tiempo real.

blog

Todo lo que sabemos sobre GPT-5

Descubre cómo GPT-5 evolucionará hasta convertirse en un sistema unificado con funciones avanzadas, cuyo lanzamiento está previsto para el verano de 2025, basándose en la última hoja de ruta de OpenAI y en la historia de GPT.
Josep Ferrer's photo

Josep Ferrer

8 min

Tutorial

Visión GPT-4: Guía completa para principiantes

Este tutorial le presentará todo lo que necesita saber sobre GPT-4 Vision, desde cómo acceder a él hasta ejemplos prácticos del mundo real y sus limitaciones.
Arunn Thevapalan's photo

Arunn Thevapalan

12 min

Tutorial

Tutorial de la API de OpenAI Assistants

Una visión completa de la API Assistants con nuestro artículo, que ofrece una mirada en profundidad a sus características, usos en la industria, guía de configuración y las mejores prácticas para maximizar su potencial en diversas aplicaciones empresariales.
Zoumana Keita 's photo

Zoumana Keita

14 min

Ver MásVer Más