Gemini Omni Flash: guia completo, prompts e recursos

Gemini Omni Flash: guia completo, prompts e recursos

O guia completo do Gemini Omni Flash no Morphic: o que o modelo any-to-any do Google faz, áudio nativo, edição por conversa, consistência de personagem e física, conhecimento do mundo real, marca d'água SynthID e prompts com exemplos.

Recursos e capacidades do Gemini Omni

O Gemini Omni é o primeiro modelo any-to-any do Google, anunciado no Google I/O 2026 em 19 de maio de 2026. A primeira versão, o Gemini Omni Flash, recebe texto, imagens e vídeo como entrada e gera vídeo com áudio sincronizado, ancorado no conhecimento de mundo do Gemini. Os clipes chegam a 10 segundos em 720p, em 16:9 ou 9:16, e você os refina por conversa em vez de gerar tudo de novo.

RecursoO que fazIdeal para
Entrada any-to-anyCombina texto, imagens e vídeo em um prompt e raciocina sobre eles em um único plano, em vez de juntá-losBriefings com várias referências, storyboards
Áudio nativoGera áudio sincronizado com cada clipe na mesma passagem, sem etapa de áudio separadaCenas faladas, ambiente, música
Edição por conversaRefine um clipe com pedidos simples em linguagem natural: trocar um objeto, reiluminar ou mudar a ação na mesma cenaIterar um plano sem gerar de novo
Consistência de personagem e físicaMantém personagens, objetos e estilo entre edições, com gravidade, energia cinética e dinâmica de fluidos coerentesPersonagens recorrentes, movimento realista
Conhecimento do mundo realApoia-se na ancoragem do Gemini em história, ciência e cultura para que o detalhe da cena fique certoVídeos explicativos, detalhe preciso
Marca d'água SynthIDUma marca d'água de procedência invisível em cada clipe, que resiste a recodificação e redimensionamentoConteúdo com IA rastreável e identificável

Entrada any-to-any

Um único prompt do Gemini Omni aceita texto, imagens e vídeo ao mesmo tempo. Em vez de juntar as entradas em sequência, o modelo raciocina sobre elas como um único briefing, então uma referência de retrato, uma foto de locação e um beat escrito moldam todos o mesmo plano gerado. Você também pode passar várias imagens de referência para levar sujeitos específicos à cena. O envio de referências de áudio separadas está em implantação e ainda não está disponível em todo lugar, e no app Gemini do Google você pode aparecer em vídeos com a sua própria voz por meio dos Avatars.

Áudio nativo

Cada clipe é gerado com o seu próprio áudio sincronizado na mesma passagem, então diálogo, efeitos, ambiente ou música voltam junto com o movimento, em vez de uma renderização muda. Descreva o som que você quer no mesmo prompt do plano, e o áudio fica no tempo da ação em vez de ser adicionado depois.

Edição por conversa

A edição é o prompt. Refine um clipe com pedidos simples em linguagem natural: "faça a escultura de bolhas", reilumine a cena, mude uma ação ou adicione um elemento, e o modelo mantém o resto do plano. Ele guarda o contexto entre as rodadas, então várias edições vão se somando na mesma cena, em vez de recomeçar do zero.

Consistência de personagem e física

Personagens, objetos e estilo se mantêm entre as edições por conversa, apoiados por uma compreensão melhor de forças como gravidade, energia cinética e dinâmica de fluidos. A consistência é maior quando você refina a mesma cena. Trocar de cena ou pedir grandes movimentos de câmera pode gerar deriva, então deixe mudanças pesadas para a própria geração.

Conhecimento do mundo real

O Gemini Omni ancora as cenas no conhecimento do Gemini sobre história, ciência e cultura, então o detalhe de época, o comportamento físico e as especificidades culturais ficam certos, em vez de escorregarem para uma textura genérica de IA. É essa ancoragem que o torna útil para vídeos explicativos e para qualquer plano em que os detalhes precisam estar corretos.

Marca d'água SynthID

Cada clipe carrega a marca d'água imperceptível SynthID do Google para procedência de IA. Ela vem ativada por padrão, é invisível para quem assiste e resiste a transformações comuns, como recodificação e redimensionamento, então o material gerado continua identificável ao longo de toda a cadeia de produção.

Exemplos de prompt do Gemini Omni

Um detetive em um beco de Tóquio encharcado de chuva sob o brilho de lâmpadas de sódio, noir em turquesa e âmbar

Noir cinematográfico

Detetive em um beco de Tóquio encharcado de chuva, brilho de lâmpada de sódio, noir em turquesa e âmbar

Edit prompt
Um tênis de vanguarda suspenso no ar sobre um pedestal de titânio sob uma luz principal dura

Lançamento de produto

Tênis de vanguarda suspenso no ar sobre um pedestal de titânio, luz principal dura, clima de lançamento

Edit prompt
Uma gota de água congelada como uma coroa cristalina em uma folha orvalhada, macro em contraluz ao nascer do sol

Explicativo de natureza

Gota congelada como uma coroa cristalina em uma folha orvalhada, macro em contraluz ao nascer do sol

Edit prompt
Um apresentador de estúdio elegante falando para a lente sob luz de três pontos quente com bokeh de 85mm

Apresentador avatar

Apresentador de estúdio elegante falando para a lente, luz de três pontos quente, bokeh de 85mm

Edit prompt
Luz de fim de tarde atravessando uma vila de concreto brutalista, com sombras longas e poeira flutuando

Passeio arquitetônico

Luz de fim de tarde atravessando uma vila de concreto brutalista, sombras longas, poeira flutuando

Edit prompt
Uma mulher junto a uma janela salpicada de chuva lendo uma carta, a preocupação cedendo lugar ao alívio

Momento narrativo

Mulher junto a uma janela salpicada de chuva lendo uma carta, a preocupação cedendo lugar ao alívio

Edit prompt

Como tirar o melhor do Gemini Omni

O Gemini Omni recompensa um briefing que trata cada referência como parte de uma cena, nomeia o áudio e edita por conversa em vez de gerar tudo de novo. Algumas práticas concentram a maior parte da qualidade:

  • Carregue todas as referências de uma vez. Texto, uma imagem e um vídeo podem ir no mesmo prompt, já que o modelo raciocina sobre eles em conjunto em vez de processá-los um a um. Adicione imagens de referência para levar um sujeito específico à cena.
  • Sempre nomeie o áudio. Diálogo, efeitos sonoros, ambiente ou música em linguagem simples, para que o clipe volte com som no tempo do movimento, em vez de mudo.
  • Edite por conversa. Quando um plano está quase lá, descreva a única mudança que você quer na próxima mensagem, em vez de recomeçar. A cena mantém personagens, luz e continuidade.
  • Ajuste o beat a 10 segundos. Não há extensão de vídeo nem interpolação, então planeje uma única ação que se resolva dentro do clipe, em vez de contar com esticá-lo depois.
  • Deixe as trocas de cena para a própria geração. A consistência é maior quando você refina a mesma cena; uma troca brusca de cena ou um grande movimento de câmera funciona melhor como um plano novo.
  • Direcione a física que importa para você. Aponte o peso, a colisão ou como um fluido deve se mover, já que a física coerente é um ponto forte que vale a pena guiar.

Guia de prompt do Gemini Omni

Um bom prompt se lê como um breve briefing de plano, não como uma legenda. Duas coisas definem o resultado: uma lista clara do que o plano contém e palavras concretas no lugar de palavras vagas.

O que entra em um prompt

ElementoO que incluirExemplo
SujeitoQuem ou o que está em quadro, descrito de forma concretauma apresentadora de estúdio em um blazer grafite em uma mesa de vidro
MovimentoO que se move, e comoela se vira para a lente e gesticula
CâmeraTipo de plano mais um movimentoplano médio, push-in lento
ÁudioDiálogo, efeitos, ambiente ou músicaela diz: 'Bem-vindo de volta'; tom de sala suave do estúdio
FormatoDuração e proporção10 segundos, 16:9

Editar por conversa

A edição é o prompt. Mantenha a cena, nomeie apenas a mudança e deixe todo o resto ser herdado da rodada anterior.

Edição de acompanhamento na mesma cena

Mesma apresentadora e mesma mesa, mesma luz. Mude o blazer dela para verde-escuro e adicione um push-in lento nos últimos dois segundos. Mantenha o tom de sala de antes.

Prompts fracos vs. fortes

Nomeie a câmera, o movimento e o tempo dele, e o áudio, em vez de deixá-los ao acaso.

FocoFracoForte
CâmeraUma mulher em uma cidade à noitePlano de perseguição com câmera na mão seguindo uma mulher por ruas molhadas de chuva, luzes de lojas refletindo no calçamento, profundidade de campo rasa
Movimento e tempoA porta se abre e alguém entraA porta se abre devagar, uma figura passa depois de um instante, então a câmera se acomoda em um plano médio
ÁudioUm chef empratando um pratoClose de um chef empratando um prato, vapor subindo. Áudio: chiado da frigideira, ambiente suave de cozinha e 'Service.'

Erros comuns

  • Deixar o prompt mudo: escreva sempre pelo menos um comando de som, já que o modelo gera áudio junto com o vídeo.
  • Gerar de novo em vez de editar: quando um plano está quase lá, peça a única mudança por conversa, para que personagens e continuidade se mantenham.
  • Contar com a extensão: não há extensão de vídeo, então mantenha uma ação dentro do clipe de 10 segundos.
  • Texto denso na tela: a renderização de texto e o movimento muito complexo ainda são pontos fracos, então mantenha as legendas curtas ou adicione-as na pós-produção.

Preços simples

Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.

Basic

$9/ mês
cobrado como $0 por ano

900 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Standard

$24/ mês
cobrado como $0 por ano

3200 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Pro

$45/ mês
cobrado como $0 por ano

6200 compartilhado mensal créditos

1 usuário

+ até 4 mais com custo adicional

Todos os modelos

Workflows

Pro Max

$170/ mês
cobrado como $0 por ano

24000 compartilhado mensal créditos

1 usuário

+ até 9 mais com custo adicional

Todos os modelos

Workflows

Enterprise

Para limites maiores

Personalizado

termos de preços e cobrança

Créditos de alto volume
Limites de vagas personalizados
Todos os modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

grátis para sempre

Até 20 créditos
apenas 1 usuário
Modelos limitados
Workflows

Perguntas frequentes

O que é o Gemini Omni?
O Gemini Omni é o primeiro modelo any-to-any do Google, anunciado no Google I/O 2026 em 19 de maio de 2026. A primeira versão, o Gemini Omni Flash, recebe texto, imagens e vídeo como entrada e gera vídeo com áudio sincronizado, ancorado no conhecimento de mundo do Gemini, com edição por conversa e marca d'água SynthID em cada clipe.
Quais entradas o Gemini Omni aceita?
O Gemini Omni aceita texto, imagens e vídeo em um único prompt e raciocina sobre eles como um único briefing, em vez de juntá-los em sequência. Você pode passar várias imagens de referência para levar sujeitos específicos a uma cena. O envio de referências de áudio separadas está em implantação e ainda não está disponível em todo lugar, e a saída de imagem e áudio está no roadmap.
O Gemini Omni gera áudio?
Sim. Cada clipe do Gemini Omni é gerado com o seu próprio áudio sincronizado na mesma passagem, então diálogo, efeitos, ambiente e música ficam no tempo do movimento em vez de serem adicionados depois. Descreva o som no mesmo prompt do plano.
Como funciona a edição por conversa no Gemini Omni?
Cada prompt depois do primeiro edita a mesma cena, em vez de iniciar uma nova geração. Descreva a única mudança que você quer, como um novo objeto, um fundo com nova iluminação ou uma ação diferente, e o plano mantém personagens, luz e continuidade. A consistência é maior quando você refina a mesma cena, em vez de trocar de cena ou pedir grandes movimentos de câmera.
Qual a duração dos clipes do Gemini Omni e em que resolução?
O Gemini Omni Flash gera clipes de até 10 segundos em 720p, em 16:9 ou 9:16. Não há extensão de vídeo nem interpolação, então planeje uma única ação que se resolva dentro do clipe. Cada clipe carrega por padrão a marca d'água imperceptível SynthID do Google.
Como uso o Gemini Omni no Morphic?
Abra o Morphic, mude a barra de prompt para o modo Video e escolha o Gemini Omni no seletor de modelos. Anexe texto, uma imagem, um vídeo ou uma mistura, descreva o plano e o áudio dele, depois rode o prompt. Para revisar o resultado, peça na próxima mensagem e a cena mantém o contexto anterior.