Pular para o conteúdo principal

Gemini Omni: um único modelo para texto, imagem, áudio e vídeo

Um primeiro olhar sobre o modelo any-to-any do Google DeepMind — o que ele faz, o que há de novo e como acessá-lo.
Actualizado 23 de set. de 2026  · 7 min leer

Explore com IA

ChatGPTClaudePerplexity

O aguardado evento Google I/O não decepcionou. Depois de uma introdução e dos anúncios do Gemini 3.5 Flash e do Gemini Spark, veio o grande destaque: Gemini Omni, uma nova família de modelos de IA nativamente multimodais, "any-to-any" — ou seja, que processam o que você imaginar, de texto, imagem e áudio a vídeo, de forma simultânea. Em outras palavras, Nano Banana, só que para vídeo. (Foi assim que o próprio Google apresentou.)

O modelo inicial é o Omni Flash. Ele traz edição de vídeo por conversa para criar mídias coesas a partir de ativos individuais. Em vez de usar um software de edição, você edita e faz remixes de vídeos conversando com o modelo.

O que é o Gemini Omni?

Vamos entender em mais detalhes do que se trata o Omni.

O Gemini Omni é o primeiro modelo generativo de mídia nativamente multimodal do Google DeepMind. A primeira variante da família é o Gemini Omni Flash, que já está disponível

  • no app Gemini,
  • no Google Flow e
  • no YouTube Shorts

O Omni aceita qualquer combinação de texto, imagens, áudio e vídeo como entrada e gera um vídeo. O ponto-chave é que não há repasse entre sistemas diferentes; tudo acontece em um único modelo.

Até agora, o Google operava com uma pilha separada: Veo para vídeo, Imagen para imagens e sistemas próprios para áudio. O Omni unifica tudo em um só modelo (daí o nome!) que consegue raciocinar entre modalidades. Na prática, isso se traduz em edições mais coerentes e menos artefatos de pipeline.

Antes que eu me empolgue, vamos enquadrar isso em termos de recursos principais.

Principais recursos do Gemini Omni

O que mais me chama atenção é o processo. Tanto a edição por conversa quanto o uso de esboços como guia são recursos conhecidos em ferramentas de geração de imagens, como o Nano Banana 2 ou o ChatGPT Images 2.0 da OpenAI, mas o Omni leva isso também para a geração de vídeo.

Edição de vídeo por conversa

O grande destaque é a edição de vídeo conversacional. Você passa um clipe para o Omni (um que você gerou ou gravou no celular) e faz mudanças falando com ele. "Deixe a iluminação mais baixa." "Mude o ângulo da câmera para sobre o ombro dela." "Deixe o violino invisível." Cada instrução permanece ativa ao longo das interações. A cena evolui; ela não é reiniciada.

Física do mundo real e conhecimento de mundo

O Google reforçou isso no lançamento. O Omni tem um entendimento intuitivo de gravidade, energia cinética e dinâmica de fluidos. No meu teste inicial, o vídeo gerado não pareceu obedecer perfeitamente à física real — mas, de novo, esta é a versão Flash, e esperamos que um Omni Pro chegue em breve e concorra melhor com ferramentas como o Seedance 2.0.

De esboços e desenhos para vídeo

Você pode transformar rabiscos em cenas realistas, usando o esboço apenas como guia de movimento, e não como referência visual final. Isso deve ser útil na pré-produção. As crianças também vão adorar ver seus desenhos ganhando vida.

Marcação SynthID e credenciais de conteúdo C2PA

Todo output do Omni vem com duas camadas de procedência.

  • O SynthID é uma marca d'água invisível embutida diretamente nos pixels no momento da geração. É imperceptível para quem assiste e foi projetada para resistir a cortes, filtros e reencodificação.
  • As credenciais de conteúdo C2PA acompanham o arquivo como um manifesto criptográfico assinado. Mesmo que os metadados sejam removidos, o sinal em nível de pixel permanece.

Vale o alerta: o SynthID é específico do Google. Só os modelos do próprio Google o inserem, então "sem marca d'água" não significa "feito por humano" — apenas que "não veio de um modelo do Google". Dado o quão facilmente o Omni pode remixar cenas reais, ter procedência robusta em cada output deixa de ser diferencial e vira o mínimo esperado.

Testando o Gemini Omni Flash

Testei os recursos de geração de vídeo do Omni Flash em duas frentes: física do mundo real e transferência de estilo.

Testando física e conhecimento de mundo

Esse foi o meu prompt: 

A medieval trebuchet launching a fired clay pot at a stone castle wall, shot in slow motion. The counterweight falls, the sling whips around, the pot arcs through the air and shatters against the stone, shards and embers scattering across the courtyard. Continuous handheld camera move, golden hour light, period-accurate construction and dress. Realistic sound design — wood creaking under tension, rope strain, the whoosh of the sling, the sharp crack of impact. No music.

O aviso dizia que levaria alguns minutos, mas na prática foram cerca de dez segundos. 

Talvez eu seja exigente, mas fiquei um pouco decepcionado. O ângulo do vaso de barro estava errado no último quadro, em relação ao anterior. Ele mudava de ângulo e parecia um avião com outro tipo de propulsão por trás. 

Testando movimento e transferência de estilo

Agora, peguei o resultado do último teste e tentei deixá-lo totalmente diferente. O que eu fiz: tirei um print do último vídeo (ou seja, enviei uma imagem) e pedi um vídeo em um novo estilo. 

Take the trebuchet clip and re-render the entire scene in the visual style of the Bayeux Tapestry from this reference image — flat embroidered figures, period-accurate threading colors (faded reds, ochres, blues, greens against undyed linen), narrow decorative borders top and bottom with stitched Latin captions, characteristic medieval proportions where soldiers and the trebuchet are roughly the same scale. Keep the original motion choreography intact: the counterweight falls, the sling whips around, the pot arcs through the air and shatters against the castle wall, all in the same timing and trajectory. The shatter moment should read as the embroidery itself unraveling — threads splaying outward on impact. Replace the original sound design with a single dulcimer or hurdy-gurdy underscore. No live-action foley.

Esse vídeo demorou bem mais para gerar. Mas valeu a espera. De repente, a falha de física deixou de importar porque o estilo de tapeçaria permite imperfeições — e o resultado ficou divertido. Desta vez, o trabuco foi lançado para trás.

Onde o Gemini Omni se posiciona nos benchmarks

Um ponto importante: o Google não publicou benchmarks numéricos junto com o lançamento do Omni. O anúncio do DeepMind destacou capacidades como entendimento de física, conhecimento de mundo e edição conversacional, mas não trouxe comparações diretas em avaliações padronizadas.

Benchmarks independentes de terceiros devem sair só daqui a algumas semanas.

O que isso significa para a disputa: até agora, o líder público na Artificial Analysis Video Arena (o mais próximo que a geração de vídeo tem de um ranking padrão do setor) é o Seedance 2.0, da ByteDance, com Elo de 1.269 em texto-para-vídeo e 1.351 em imagem-para-vídeo. 

Dito isso, estes são os benchmarks que vale acompanhar quando saírem:

  • VBench 2.0: avalia física, raciocínio de senso comum, fidelidade humana e controlabilidade em 18 dimensões.
  • Artificial Analysis Video Arena: rankings de preferência humana em confrontos diretos no estilo Elo. 
  • VABench: avaliação conjunta de áudio e vídeo. Importa especialmente porque o Omni gera áudio sincronizado de forma nativa.

Como acessar o Gemini Omni: preços e planos

O acesso, por enquanto, está dentro dos planos de IA para o consumidor do Google nos EUA:

  • AI Plus por US$ 7,99/mês
  • AI Pro por US$ 19,99/mês, e
  • AI Ultra por US$ 249,99/mês

A alocação de créditos cresce conforme o plano: o Plus recebe 200 créditos de IA mensais, o Pro recebe 1.000.

O acesso via API deve chegar "nas próximas semanas". Vamos publicar uma análise mais detalhada assim que testarmos.

Conclusão

Até agora, a pilha de mídia generativa funcionava como um revezamento. O texto vai para um modelo, que passa a saída para um modelo de imagem, que entrega um still para um modelo de vídeo, que passa os frames para um modelo de áudio. Cada passagem é uma chance de perder coerência ou qualidade. A grande proposta do Omni é raciocinar sobre texto, imagem, vídeo e áudio no mesmo passo de inferência. 

Um Omni com capacidades completas — que suspeitamos mirar o uso corporativo — certamente está a caminho. 


Josef Waples's photo
Author
Josef Waples

Perguntas frequentes sobre o Gemini Omni

O que é o Gemini Omni e como ele funciona?

O Gemini Omni é o modelo de vídeo com IA do Google DeepMind que cria e edita vídeos a partir de entradas de texto, imagem, áudio ou vídeo por meio de conversa natural.

O que dá para fazer com o Gemini Omni?

Editar estilos de vídeo, trocar personagens com imagens de referência, mudar ângulos de câmera, sincronizar texto e som com a ação, transformar esboços em filmagens e combinar várias entradas em uma única cena.

Como acessar o Gemini Omni?

Ele está disponível no app Gemini, no Google Flow e no YouTube Shorts. É necessário ter uma assinatura do Google AI, com recursos que variam por plano e região.

Dá para editar vídeos do Gemini Omni com prompts de acompanhamento?

Sim. O Omni permite edições em várias interações, então você pode refinar detalhes, ambientes e ângulos de câmera passo a passo mantendo a cena consistente.

Como saber se um vídeo foi feito com o Gemini Omni?

Todo vídeo inclui a marca d'água invisível SynthID e as credenciais de conteúdo C2PA, verificáveis no app Gemini (com suporte no Chrome e na Busca chegando em breve).

Temas
Inteligência Artificial
IA generativa
Relacionado

blog

SAM 2: Primeiros passos com o Segment Anything Model 2 do Meta

O SAM 2 (Segment Anything Model 2) da Meta AI é o primeiro modelo unificado capaz de segmentar qualquer objeto em imagens e vídeos em tempo real.

blog

Os 7 melhores geradores de vídeo com IA para 2026, com vídeos de exemplo

Conheça os melhores geradores de vídeo com IA disponíveis hoje, incluindo RunwayML, Synthesia, Colossyan, Pictory, DeepBrain AI, Invideo e os super esperados Sora e Veo da DeepMind.
Dr Ana Rojo-Echeburúa's photo

Dr Ana Rojo-Echeburúa

9 min

blog

Anthropic vs. OpenAI: Os Dois Gigantes da IA Comparados

Saiba como OpenAI e Anthropic lideram o desenvolvimento de IA com abordagens únicas. Explore produtos como o ChatGPT e os modelos inovadores que elas oferecem.
Khalid Abdelaty's photo

Khalid Abdelaty

15 min

blog

Tudo o que sabemos sobre o GPT-5

Saiba como o GPT-5 evoluirá para um sistema unificado com recursos avançados, visando um lançamento no verão de 2025, com base no mais recente roteiro da OpenAI e no histórico do GPT.
Josep Ferrer's photo

Josep Ferrer

8 min

blog

O que é IA multimodal?

Descubra a IA multimodal, uma das tendências mais promissoras da IA generativa.
Javier Canales Luna's photo

Javier Canales Luna

8 min

blog

A OpenAI anuncia o GPT-4 Turbo com visão: O que sabemos até o momento

Descubra a atualização mais recente da OpenAI, GPT-4 Turbo com visão, e seus principais recursos, incluindo o corte de conhecimento aprimorado, uma janela de contexto expandida, preço acessível e muito mais.
Richie Cotton's photo

Richie Cotton

7 min

Ver MaisVer Mais