Multimodal

Gemini Omni Flash 1.1

por Google DeepMind

O modelo de vídeo do Google: a edição é uma frase.
Agora em 4K e com cenas de 40 segundos.

Gemini Omni Flash 1.1

Principais recursos

Especificações técnicas

Gemini Omni

Segundo lançamento Omni Flash na família Omni do Google

5 tarefas

Texto, imagem, referência, edição e extensão

3 a 10s

Por geração; com extensões, chega a 40 segundos no total

Até 4K

360p e 720p nativos, 1080p e 4K por upscale

10 + 3

Dez imagens mais três clipes de vídeo de até 3s cada

Nativo

Diálogo, efeitos e música na mesma passada

16:9, 9:16

Horizontal e vertical em todas as resoluções

SynthID

Marca de origem invisível em todo clipe gerado

Casos de uso

Quadro dividido da mesma cena de café na calçada, fotorrealista à esquerda e anime à direita

Edições que você digita

Entregue um clipe e diga a mudança: trocar o tempo, virar anime, reescrever a placa. O resto do quadro fica como estava.

Uma mulher falando para a câmera no meio de uma frase, sob luz suave de janela

Personagens que falam

Escreva a fala e a personagem diz, com lip sync, numa voz que atravessa cada corte e cada edição seguinte.

Cartões de referência de um frasco, uma modelo e um cenário ao lado do quadro final do anúncio de perfume

Anúncios fiéis à referência

Uma foto do produto, um retrato da apresentadora e três segundos do movimento viram um anúncio só, com o produto fiel.

Tira de quatro quadros do mesmo ciclista passando por uma rua de padaria, um porto, um farol e a estrada da costa

Cenas que crescem até 40s

Gere o primeiro trecho e estenda de dez em dez segundos até 40, com o mesmo elenco, o mesmo cenário e a mesma trilha.

Uma escultura cinética de dominós empurrando uma bolinha de aço para uma pista de madeira curva

Explicações com física

Gravidade, fluidos e colisões seguem as regras do mundo real, e a base do Gemini em ciência e história cuida do detalhe.

Quadro de entrevista com um pescador em um porto de neblina e um letreiro escrito THE COAST ROAD

Texto escrito no quadro

O texto na tela volta legível, do letreiro à placa da loja, e a edição seguinte reescreve o que está escrito ali.

Exemplos de prompts

Feira noturna

Feira noturna sob chuva, vendedores gritando, panelas chiando

Edit prompt

Cortes no tempo

A cada dois segundos, corte para outro terraço na hora dourada

Edit prompt

Texto na tela

Um letreiro de lanchonete acende letra por letra: OPEN ALL NIGHT

Edit prompt

Plano contínuo

Uma pista de bolinhas numa oficina ensolarada, plano único

Edit prompt

Fala no plano

Uma alpinista sussurra a frase do cume contra o vento

Edit prompt

Close guiado pelo som

Close de café coado, cada gota e cada chiado audíveis

Edit prompt

Visão geral

O Gemini Omni Flash 1.1 é a segunda versão do modelo de vídeo multimodal do Google DeepMind, e a primeira com espaço para o plano crescer. Uma geração continua entre 3 e 10 segundos, com áudio nativo, mas a 1.1 traz os controles que faltavam na estreia: uma escada de resolução que vai do rascunho em 360p à entrega em 4K, referências de vídeo que guiam mesmo o resultado, um quadro final que transforma duas imagens em um movimento, e a extensão que leva o clipe a 40 segundos sem perder o elenco nem a trilha.

O que mudou no Gemini Omni Flash 1.1

O primeiro Omni Flash renderizava tudo em 720p e parava nos dez segundos. A 1.1 mantém esse núcleo rápido, que responde a conversa, e derruba os tetos em volta dele. A resolução virou escolha de cada geração: 360p para iterar barato, 1080p ou 4K quando a tomada está pronta para sair. A entrada de referências cresceu para dez imagens mais três clipes curtos, cada um com seu papel definido no prompt. E um clipe pronto deixou de ser o fim da linha: a extensão lê o último trecho gravado e continua a cena, dez segundos por vez, até quatro vezes o tamanho original.

Edição por conversa, sem regerar do zero

A maioria dos modelos de vídeo trata o prompt como um sorteio. O Omni Flash trata como a primeira frase de uma conversa. O modelo guarda a cena entre as rodadas, então “deixe a jaqueta vermelha”, “agora estenda o plano enquanto ela se vira” e “troque a placa para CLOSED” caem todas na mesma tomada, com rosto, roupa e voz intactos. Instruções curtas, uma mudança por vez, funcionam melhor. E as partes do quadro que você nunca citou são justamente as que não se mexem.

Gemini Omni Flash 1.1 no Morphic

No Morphic, o Gemini Omni fica no seletor de modelos de vídeo ao lado do Veo 3.1, do Seedance 2.5, do Kling e do resto do catálogo. Escreva o plano como um briefing que já inclui o áudio, anexe as imagens de referência do que precisa ficar igual e gere. A tomada cai no Canvas, onde o mesmo briefing pode rodar em outro modelo para uma leitura lado a lado. Siga refinando nas respostas seguintes, uma mudança de cada vez, e a cena guarda o contexto de uma rodada para a outra.

Preços simples

Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.

Basic

$9/ mês
cobrado como $0 por ano

1100 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Standard

$24/ mês
cobrado como $0 por ano

3625 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Pro

$45/ mês
cobrado como $0 por ano

6350 compartilhado mensal créditos

1 usuário

+ até 4 mais com custo adicional

Todos os modelos

Workflows

Pro Max

$170/ mês
cobrado como $0 por ano

24650 compartilhado mensal créditos

1 usuário

+ até 9 mais com custo adicional

Todos os modelos

Workflows

Enterprise

Para limites maiores

Personalizado

termos de preços e cobrança

Créditos de alto volume
Limites de vagas personalizados
Todos os modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

grátis para sempre

Até 20 créditos
apenas 1 usuário
Modelos limitados
Workflows

Perguntas frequentes

O que é o Gemini Omni Flash 1.1?
O Gemini Omni Flash 1.1 é a segunda versão do modelo de vídeo multimodal do Google, lançada no fim de agosto de 2026. Ele gera vídeo com áudio nativo sincronizado a partir de texto, imagens e referências de vídeo, e edita e estende material com instruções escritas em linguagem comum. A versão 1.1 acrescenta uma escada de resolução que vai até 4K, referências de vídeo que guiam de verdade, interpolação do primeiro ao último quadro e extensões que levam um clipe a 40 segundos.
O que mudou da primeira versão para o Gemini Omni Flash 1.1?
Quatro coisas. A resolução agora é escolhida de 360p a 4K, enquanto a primeira versão era fixa em 720p. A extensão de vídeo entrou em campo e faz o clipe crescer de dez em dez segundos até 40, contra uma única geração de dez segundos antes. As referências de vídeo passaram a guiar mesmo o resultado, com até três clipes de três segundos cada. E o modo de imagem para vídeo aceita um quadro final, então o modelo interpola entre duas imagens suas.
Em que resolução o Gemini Omni Flash 1.1 entrega?
São quatro opções: 360p, 720p, 1080p e 4K, em 16:9 ou 9:16. O modelo renderiza de forma nativa em 360p e 720p, e produz 1080p e 4K como upscale dessa geração. Na prática, você rascunha barato em 360p, fecha a tomada em 720p e só então pede a resolução de entrega, quando o plano já está do jeito certo.
Qual a duração de um vídeo do Gemini Omni Flash 1.1?
Uma geração vai de 3 a 10 segundos, com 8 segundos como padrão. Daí em diante, a extensão faz o clipe crescer de dez em dez segundos até 40 no total, mantendo personagens, movimento e áudio contínuos em cada emenda. A extensão só acrescenta no fim do clipe: ela não coloca material antes nem alonga o meio. Vale para o que o modelo gerou e também para um vídeo seu, desde que ele tenha dez segundos ou menos.
Os vídeos do Gemini Omni Flash 1.1 saem com marca d'água?
Não uma marca visível por cima da imagem. Todo clipe gerado carrega o SynthID, uma marca de origem invisível embutida no arquivo, que identifica o vídeo como gerado por IA para quem tiver a ferramenta de leitura. Para quem publica, é o melhor dos dois mundos: a imagem sai limpa, sem selo por cima, e a procedência viaja junto com o arquivo.
Que referências o Gemini Omni Flash 1.1 aceita?
Até dez imagens de referência e até três vídeos de referência de três segundos cada, junto com o prompt de texto. As imagens fixam uma personagem, um produto, um cenário ou um estilo, e as tags do prompt dizem o papel de cada uma. As referências em vídeo carregam uma aparência ou um movimento; o áudio delas é ignorado, e pedir que o modelo raciocine sobre vários vídeos inteiros de uma vez não é suportado.
Como funciona a edição por conversa no Gemini Omni Flash 1.1?
Cada prompt seguinte edita o resultado anterior em vez de gerar do zero, e o modelo guarda o estado da cena entre as rodadas. Instruções curtas funcionam melhor: “deixe o celular invisível, mantenha o resto igual” rende mais do que um parágrafo descrevendo o quadro inteiro. Como cada rodada parte da anterior, uma mudança por vez é o que segura personagens e movimento ao longo de uma sequência de edições.
O Gemini Omni Flash 1.1 gera áudio e diálogo?
Gera. O som sai na mesma passada da imagem: diálogo com lip sync, efeitos, ambiência e música no tempo da ação. Escreva o áudio que você quer dentro do prompt, porque quando o prompt não diz nada sobre som o modelo inventa a própria trilha. E uma fala é simples assim: escreva o que a personagem diz.
Dá para usar o Gemini Omni Flash 1.1 no Morphic?
Dá. Escolha o Gemini Omni no seletor de modelos de vídeo, escreva o plano com o som que você quer e gere. A tomada cai no Canvas, ao lado dos resultados de Veo, Seedance e Kling, para você comparar lado a lado. Os prompts seguintes editam a mesma cena, e as imagens de referência podem ir junto com o briefing.
O Gemini Omni Flash 1.1 é o mesmo que o Veo 4?
Não, e a confusão faz sentido: os dois vêm do Google DeepMind, e muita gente escreve sobre o Omni como sucessor da linha Veo. São modelos separados. O Veo é a família de vídeo cinematográfico, hoje no Veo 3.1; o Gemini Omni é a família multimodal, cujo primeiro modelo de vídeo é o Omni Flash, agora na versão 1.1. O Google não lançou nada chamado Veo 4, então toda menção a “Veo 4” é especulação ou apelido informal para o Omni.
Qual a diferença entre o Gemini Omni Flash 1.1 e o Veo 3.1?
O Veo 3.1 é afinado para fidelidade cinematográfica em um plano só; o Omni Flash 1.1 é afinado para iteração. O Omni é o que você dirige: ele edita a própria saída rodada a rodada, aceita referências de imagem e de vídeo misturadas, estende uma tomada até 40 segundos e segura a personagem e a voz no caminho. Para um plano de abertura único, o Veo ainda ganha no acabamento; para uma cena que você refina e faz crescer, o fluxo é o Omni Flash.