Gemini Omni
por Google DeepMind
O primeiro modelo any‑to‑any do Google.
Texto, imagens, áudio e vídeo entram, um único vídeo sai.

Principais recursos
Especificações técnicas
Omni Flash
Primeiro modelo da família Gemini Omni do Google
Video
Saída de imagem e áudio estão previstas no roteiro do Gemini Omni
Up to 10s
Clipes do Flash limitados a 10 segundos no lançamento, para ampliar o acesso
720p
O Gemini Omni Flash gera vídeo em 720p
Any mix
Texto, imagem, áudio e vídeo em um único prompt
Native
Áudio sincronizado gerado com cada clipe; voz via Avatars
SynthID
Marca d'água imperceptível de proveniência de IA em cada clipe
Google DeepMind
Posicionamento como sucessor do Veo para criação de vídeo any-to-any
Casos de uso
Storyboard multi-entrada
Uma foto de personagem, uma foto de locação, uma referência de música e uma ideia de cena entram; o modelo monta o plano e refina a partir daí.
Edição de vídeo conversacional
Edite qualquer clipe em linguagem natural: troque o figurino, mude o cenário ou reajuste o tempo de uma cena. O resto permanece estável.
Vídeo de marketing
Cortes de anúncio que respeitam as cores da marca, o formato do produto e o texto na tela. Uma foto, um briefing, um anúncio pronto.
Explicações educacionais
Visualize ciência, história e engenharia com física integrada. A ciência continua precisa, a imagem fica limpa.
Vídeo com apresentador
Um retrato mais uma referência de voz mantêm o mesmo apresentador em vídeos curtos, cursos e tutoriais.
Vídeos curtos para redes sociais
Clipes de 10 segundos encaixam no YouTube Shorts, Reels e TikTok. Gere variações e publique a que funcionar melhor.
Exemplos de prompts

Noir cinematográfico
Detetive em um beco chuvoso de Tóquio, luz de lâmpada de sódio, clima noir azul-petróleo e âmbar
Edit prompt
Lançamento de produto
Tênis de vanguarda suspenso no ar sobre um pedestal de titânio, luz dura, clima de lançamento
Edit prompt
Explicação da natureza
Gota congelada como uma coroa cristalina sobre uma folha orvalhada, macro contraluz ao amanhecer
Edit prompt
Apresentador avatar
Apresentador de estúdio olhando para a câmera, luz de três pontos quente, bokeh de 85mm
Edit prompt
Passeio arquitetônico
Luz dourada atravessando uma vila de concreto brutalista, sombras longas, poeira flutuante
Edit prompt
Momento de história
Mulher perto de uma janela com gotas de chuva lendo uma carta, a preocupação dando lugar ao alívio
Edit promptVisão geral
O Gemini Omni é o primeiro modelo multimodal any-to-any do Google, anunciado no Google I/O 2026, em 19 de maio de 2026. O primeiro lançamento, o Gemini Omni Flash, aceita texto, imagens, áudio e vídeo em um único prompt e gera um único vídeo, com edição conversacional, consistência de personagens, física precisa e marca d'água SynthID em cada clipe.
O que o Gemini Omni faz de diferente
Em vez de costurar as modalidades separadamente, o Gemini Omni raciocina sobre todas elas ao mesmo tempo. Um prompt com uma referência de retrato, uma foto de locação, uma amostra de voz e uma ideia de cena resulta em um único plano que reflete cada entrada de uma vez. Os prompts seguintes editam essa mesma cena, não uma nova, então personagens, iluminação e continuidade se mantêm entre os turnos.
O Gemini Omni no Morphic
No Morphic, o Gemini Omni fica no seletor de modelos de vídeo, ao lado do Veo 3.1, do Seedance 2.0, do Kling e do restante do catálogo de vídeo. Mude a barra de prompt para o modo Vídeo, escolha o Gemini Omni, anexe referências em qualquer combinação e continue editando a mesma cena com prompts seguintes.
Preços simples
Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.
Basic
1100 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Standard
3625 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Pro
6350 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Pro Max
24650 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Enterprise
Para limites maiores
Personalizado
termos de preços e cobrança

Free
Para experimentar
$0
grátis para sempre
Perguntas frequentes
ChatGPT Images 2.5
OpenAI
Detalhe mais nítido e edição que não bagunça o resto do quadro. O modelo de imagem da OpenAI, de setembro de 2026.
Lyria 3.5
Google DeepMind
O melhor modelo de música do Google. Músicas inteiras, com voz e letra.
MiniMax H3 Max Turbo
fal.ai
O nível rápido do H3 da fal. O dobro da velocidade, quase igual.
Inworld TTS 2
Inworld
Noventa e cinco vozes, 100+ idiomas. A fala começa em menos de um segundo.