Recursos e capacidades do Gemini Omni
O Gemini Omni é o primeiro modelo any-to-any do Google, anunciado no Google I/O 2026 em 19 de maio de 2026. A primeira versão, o Gemini Omni Flash, recebe texto, imagens e vídeo como entrada e gera vídeo com áudio sincronizado, ancorado no conhecimento de mundo do Gemini. Os clipes chegam a 10 segundos em 720p, em 16:9 ou 9:16, e você os refina por conversa em vez de gerar tudo de novo.
| Recurso | O que faz | Ideal para |
|---|---|---|
| Entrada any-to-any | Combina texto, imagens e vídeo em um prompt e raciocina sobre eles em um único plano, em vez de juntá-los | Briefings com várias referências, storyboards |
| Áudio nativo | Gera áudio sincronizado com cada clipe na mesma passagem, sem etapa de áudio separada | Cenas faladas, ambiente, música |
| Edição por conversa | Refine um clipe com pedidos simples em linguagem natural: trocar um objeto, reiluminar ou mudar a ação na mesma cena | Iterar um plano sem gerar de novo |
| Consistência de personagem e física | Mantém personagens, objetos e estilo entre edições, com gravidade, energia cinética e dinâmica de fluidos coerentes | Personagens recorrentes, movimento realista |
| Conhecimento do mundo real | Apoia-se na ancoragem do Gemini em história, ciência e cultura para que o detalhe da cena fique certo | Vídeos explicativos, detalhe preciso |
| Marca d'água SynthID | Uma marca d'água de procedência invisível em cada clipe, que resiste a recodificação e redimensionamento | Conteúdo com IA rastreável e identificável |
Entrada any-to-any
Um único prompt do Gemini Omni aceita texto, imagens e vídeo ao mesmo tempo. Em vez de juntar as entradas em sequência, o modelo raciocina sobre elas como um único briefing, então uma referência de retrato, uma foto de locação e um beat escrito moldam todos o mesmo plano gerado. Você também pode passar várias imagens de referência para levar sujeitos específicos à cena. O envio de referências de áudio separadas está em implantação e ainda não está disponível em todo lugar, e no app Gemini do Google você pode aparecer em vídeos com a sua própria voz por meio dos Avatars.
Áudio nativo
Cada clipe é gerado com o seu próprio áudio sincronizado na mesma passagem, então diálogo, efeitos, ambiente ou música voltam junto com o movimento, em vez de uma renderização muda. Descreva o som que você quer no mesmo prompt do plano, e o áudio fica no tempo da ação em vez de ser adicionado depois.
Edição por conversa
A edição é o prompt. Refine um clipe com pedidos simples em linguagem natural: "faça a escultura de bolhas", reilumine a cena, mude uma ação ou adicione um elemento, e o modelo mantém o resto do plano. Ele guarda o contexto entre as rodadas, então várias edições vão se somando na mesma cena, em vez de recomeçar do zero.
Consistência de personagem e física
Personagens, objetos e estilo se mantêm entre as edições por conversa, apoiados por uma compreensão melhor de forças como gravidade, energia cinética e dinâmica de fluidos. A consistência é maior quando você refina a mesma cena. Trocar de cena ou pedir grandes movimentos de câmera pode gerar deriva, então deixe mudanças pesadas para a própria geração.
Conhecimento do mundo real
O Gemini Omni ancora as cenas no conhecimento do Gemini sobre história, ciência e cultura, então o detalhe de época, o comportamento físico e as especificidades culturais ficam certos, em vez de escorregarem para uma textura genérica de IA. É essa ancoragem que o torna útil para vídeos explicativos e para qualquer plano em que os detalhes precisam estar corretos.
Marca d'água SynthID
Cada clipe carrega a marca d'água imperceptível SynthID do Google para procedência de IA. Ela vem ativada por padrão, é invisível para quem assiste e resiste a transformações comuns, como recodificação e redimensionamento, então o material gerado continua identificável ao longo de toda a cadeia de produção.
Exemplos de prompt do Gemini Omni

Noir cinematográfico
Detetive em um beco de Tóquio encharcado de chuva, brilho de lâmpada de sódio, noir em turquesa e âmbar
Edit prompt
Lançamento de produto
Tênis de vanguarda suspenso no ar sobre um pedestal de titânio, luz principal dura, clima de lançamento
Edit prompt
Explicativo de natureza
Gota congelada como uma coroa cristalina em uma folha orvalhada, macro em contraluz ao nascer do sol
Edit prompt
Apresentador avatar
Apresentador de estúdio elegante falando para a lente, luz de três pontos quente, bokeh de 85mm
Edit prompt
Passeio arquitetônico
Luz de fim de tarde atravessando uma vila de concreto brutalista, sombras longas, poeira flutuando
Edit prompt
Momento narrativo
Mulher junto a uma janela salpicada de chuva lendo uma carta, a preocupação cedendo lugar ao alívio
Edit promptComo tirar o melhor do Gemini Omni
O Gemini Omni recompensa um briefing que trata cada referência como parte de uma cena, nomeia o áudio e edita por conversa em vez de gerar tudo de novo. Algumas práticas concentram a maior parte da qualidade:
- Carregue todas as referências de uma vez. Texto, uma imagem e um vídeo podem ir no mesmo prompt, já que o modelo raciocina sobre eles em conjunto em vez de processá-los um a um. Adicione imagens de referência para levar um sujeito específico à cena.
- Sempre nomeie o áudio. Diálogo, efeitos sonoros, ambiente ou música em linguagem simples, para que o clipe volte com som no tempo do movimento, em vez de mudo.
- Edite por conversa. Quando um plano está quase lá, descreva a única mudança que você quer na próxima mensagem, em vez de recomeçar. A cena mantém personagens, luz e continuidade.
- Ajuste o beat a 10 segundos. Não há extensão de vídeo nem interpolação, então planeje uma única ação que se resolva dentro do clipe, em vez de contar com esticá-lo depois.
- Deixe as trocas de cena para a própria geração. A consistência é maior quando você refina a mesma cena; uma troca brusca de cena ou um grande movimento de câmera funciona melhor como um plano novo.
- Direcione a física que importa para você. Aponte o peso, a colisão ou como um fluido deve se mover, já que a física coerente é um ponto forte que vale a pena guiar.
Guia de prompt do Gemini Omni
Um bom prompt se lê como um breve briefing de plano, não como uma legenda. Duas coisas definem o resultado: uma lista clara do que o plano contém e palavras concretas no lugar de palavras vagas.
O que entra em um prompt
| Elemento | O que incluir | Exemplo |
|---|---|---|
| Sujeito | Quem ou o que está em quadro, descrito de forma concreta | uma apresentadora de estúdio em um blazer grafite em uma mesa de vidro |
| Movimento | O que se move, e como | ela se vira para a lente e gesticula |
| Câmera | Tipo de plano mais um movimento | plano médio, push-in lento |
| Áudio | Diálogo, efeitos, ambiente ou música | ela diz: 'Bem-vindo de volta'; tom de sala suave do estúdio |
| Formato | Duração e proporção | 10 segundos, 16:9 |
Editar por conversa
A edição é o prompt. Mantenha a cena, nomeie apenas a mudança e deixe todo o resto ser herdado da rodada anterior.
Mesma apresentadora e mesma mesa, mesma luz. Mude o blazer dela para verde-escuro e adicione um push-in lento nos últimos dois segundos. Mantenha o tom de sala de antes.
Prompts fracos vs. fortes
Nomeie a câmera, o movimento e o tempo dele, e o áudio, em vez de deixá-los ao acaso.
| Foco | Fraco | Forte |
|---|---|---|
| Câmera | Uma mulher em uma cidade à noite | Plano de perseguição com câmera na mão seguindo uma mulher por ruas molhadas de chuva, luzes de lojas refletindo no calçamento, profundidade de campo rasa |
| Movimento e tempo | A porta se abre e alguém entra | A porta se abre devagar, uma figura passa depois de um instante, então a câmera se acomoda em um plano médio |
| Áudio | Um chef empratando um prato | Close de um chef empratando um prato, vapor subindo. Áudio: chiado da frigideira, ambiente suave de cozinha e 'Service.' |
Erros comuns
- Deixar o prompt mudo: escreva sempre pelo menos um comando de som, já que o modelo gera áudio junto com o vídeo.
- Gerar de novo em vez de editar: quando um plano está quase lá, peça a única mudança por conversa, para que personagens e continuidade se mantenham.
- Contar com a extensão: não há extensão de vídeo, então mantenha uma ação dentro do clipe de 10 segundos.
- Texto denso na tela: a renderização de texto e o movimento muito complexo ainda são pontos fracos, então mantenha as legendas curtas ou adicione-as na pós-produção.

