Gemini Omni Flash 1.1: guia completo, prompts e novidades

Gemini Omni Flash 1.1: guia completo, prompts e novidades

O guia completo do Gemini Omni Flash 1.1: as cinco tarefas, a fórmula do prompt, as tags de referência e de quadro, edição por texto, extensões até 40 segundos e direção de áudio, com exemplos.

Recursos e capacidades do Gemini Omni Flash 1.1

O modelo de vídeo multimodal do Google DeepMind, atualizado em agosto de 2026. Ele faz clipes de 3 a 10 segundos com áudio nativo e continua trabalhando neles: o prompt seguinte edita a mesma tomada, e as extensões levam o clipe a 40 segundos.

RecursoO que fazIdeal para
Edição por conversaO prompt seguinte muda a tomada; o que não for citado fica no lugarConsertar um plano sem regerar
Extensão de vídeoContinua o clipe de 10s em 10s, até 40s no totalCenas maiores que uma geração
Entrada por referência10 imagens e 3 clipes guiam uma geração, cada um com seu papelPersonagens, produtos e estilos recorrentes
Primeiro e último quadroInterpola entre duas imagens; a mesma imagem duas vezes vira loopTransições, loops, pares de storyboard
Áudio nativoFala com lip sync, efeitos, ambiência e música junto com a imagemCenas faladas, planos guiados pelo som
Escada de resoluçãoDe 360p a 4K; 1080p e 4K saem por upscaleRascunho barato, entrega em tamanho real
Texto na telaRenderiza o texto em inglês que você definir, até a placa do fundoTítulos, letreiros, legendas

Casos de uso do Gemini Omni Flash 1.1

Sequências de edição na mesma tomada

Mude a luz da sala, troque a jaqueta, reescreva a placa. Cada instrução cai no mesmo plano enquanto o resto do quadro se mantém.

A mesma sala de estar dividida em duas, luz chapada de meio-dia à esquerda e dourado do entardecer à direita

Cenas montadas por extensão

Comece com um trecho de dez segundos e faça crescer. O modelo lê os seus segundos finais e continua o movimento, o elenco e a trilha até 40 segundos.

Tira de quatro quadros de um balão listrado atravessando um vale alpino ao amanhecer

Do rascunho ao vídeo

Diga para usar o desenho apenas como guia. O modelo pega a silhueta e o percurso, depois reconstrói textura, luz e profundidade.

Um desenho a lápis de uma raposa saltando ao lado da mesma pose renderizada como uma raposa fotorrealista na floresta

Apresentadores que falam

Escreva a fala e a personagem entrega com lip sync, numa voz que continua sendo dela em toda edição posterior.

Um feirante falando com simpatia sobre caixas de laranja sob o sol do fim da tarde

Sequências no tempo certo

Um bloco de timecode transforma um prompt em uma sequência corte a corte: quadros de produto em rajada, ou uma batida a cada dois segundos.

Três quadros da mesma mulher de cachecol vermelho caminhando, olhando para trás e correndo

Loops perfeitos

Passe a mesma imagem como primeiro e último quadro e o clipe volta ao ponto de partida, pronto para rodar numa página de produto.

Um avião de papel fazendo uma volta traçada por um rastro de luz fechado em uma oficina escura

Passo 1: escolha a tarefa

Tudo o que o modelo faz cabe em uma de cinco tarefas. Diga qual é quando a intenção puder ser lida de outro jeito; fora isso, ela é deduzida do seu prompt e do material anexado.

TarefaO que fazUse quando
Text to videoGera um clipe a partir de um briefing escritoVocê começa do zero
Image to videoAnima uma imagem, ou interpola dois quadrosVocê tem o quadro e quer o movimento
Reference to videoMonta o plano a partir de imagens e clipes com tagUma personagem ou um estilo precisa atravessar
EditMuda um vídeo que já existeA tomada está certa e um elemento está errado
ExtendAcrescenta uma continuaçãoA tomada está certa e curta demais

Passo 2: escreva o prompt

O prompt é um briefing curto de plano, nesta ordem. Proporção, resolução e duração são configurações, não texto de prompt.

ElementoO que cobreObrigatório
Sujeito e açãoQuem está no quadro e o que fazSim
CenaLugar, hora do dia, clima, fundoOpcional
Câmera e luzTamanho do plano, movimento, lente, fonte de luzOpcional
ÁudioDiálogo, ambiência, efeitos, música ou silêncioMuito recomendado
Estrutura do planoTomada única, ou cortes e o tempo delesOpcional

Os exemplos deste guia ficam em inglês, o idioma em que o Google avalia o modelo. Um briefing pronto fica assim:

Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.

As cinco alavancas do prompt

AlavancaEscreva assimPor que importa
Estrutura do planoSingle continuous shot, no scene cuts. Or: every 2s cut to a new locationSem instrução, o modelo conta uma história em vários planos
ÁudioNo music, just room tone. Or a spoken line: she says, third one todayO silêncio precisa ser pedido, senão vem música inventada
TempoAfter 3 seconds, a woman enters. Or a timecode blockAs faixas de tempo são orçamento, não ponto de corte exato
Texto na telaA street sign that says MARKET LANETexto não definido vem inventado. Inglês renderiza, outros alfabetos não
GatilhosWhen the person touches the mirror, it ripples like liquidInstrução presa a um evento acerta mais que tempo abstrato

Para uma sequência corte a corte, escreva os tempos:

[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running

As negativas vão no próprio prompt, como no dialogue ou do not add captions. Não existe um campo separado de prompt negativo.

Passo 3: adicione referências e quadros

Dez imagens de referência e três vídeos de referência por geração. As tags dão um papel a cada arquivo, numerados a partir de zero na ordem de envio.

TagPapelExemplo
FIRST_FRAMEQuadro inicial<FIRST_FRAME> a woman is walking
LAST_FRAMEQuadro final, junto de um quadro inicial<FIRST_FRAME> <LAST_FRAME> a woman is walking
IMAGE_REF_0Referência: sujeito, produto ou estiloin the style of <IMAGE_REF_0>, a woman is walking
VIDEO_REF_0Referência de personagem ou objetothe person in <VIDEO_REF_0> is playing the violin
  • Anexe tudo de uma vez. Uma referência acrescentada no meio da conversa desestabiliza uma cena que estava firme.
  • Dê um só trabalho a cada referência. Estilo na primeira imagem, sujeito na segunda: melhor do que deixar o modelo adivinhar.
  • Mantenha os vídeos de referência curtos. Três segundos cada, aparência funciona melhor, o áudio deles é ignorado.
  • A mesma imagem como primeiro e último quadro devolve um loop sem emenda.

Passo 4: edite e estenda o resultado

A tomada gerada continua viva na conversa, e um vídeo seu de 10 segundos ou menos pode entrar nela. Tudo o que você descreve é algo que o modelo pode renderizar de novo, então descreva só a mudança.

EviteEscreva assim
In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its headAdd a cat that jumps onto his lap, he begins to pet it. Keep everything else the same.
Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadowsChange the lighting to be more dramatic. Keep everything else the same.
RegraDetalhe
Uma mudança por rodadaInstrução composta quebra a consistência cerca de duas vezes mais
Quatro edições por correntePassando disso, entra desvio. Reancore com: keep all character details exactly as they are, only change X
A extensão só acrescenta10s por vez, até 40s no total. Não coloca material antes nem estica o meio
O relógio da extensão reiniciaAfter 2s quer dizer dois segundos dentro do material novo
As referências podem ir juntoUma personagem nova entra na cena estendida a partir de uma imagem que você anexa

A instrução de extensão segue a mesma lógica, também em inglês:

Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.

Limites do Gemini Omni Flash 1.1

LimiteO que aconteceComo contornar
Texto não latinoGlifos japoneses e chineses saem como invenções convincentesMantenha o texto da tela em inglês, ou confira quadro a quadro
Cenas cheiasA partir de quatro sujeitos acompanhados, eles se fundem ou escapamFique em três
Sem edição de vozNão aceita envio de referência de áudio nem cirurgia de vozDirija a voz por texto; a consistência segura o resto
Limites de políticaMarcas reais e pessoas reconhecíveis são bloqueadas, por regiãoDeixe os elementos de marca genéricos

Preços simples

Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.

Basic

$9/ mês
cobrado como $0 por ano

1100 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Standard

$24/ mês
cobrado como $0 por ano

3625 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Pro

$45/ mês
cobrado como $0 por ano

6350 compartilhado mensal créditos

1 usuário

+ até 4 mais com custo adicional

Todos os modelos

Workflows

Pro Max

$170/ mês
cobrado como $0 por ano

24650 compartilhado mensal créditos

1 usuário

+ até 9 mais com custo adicional

Todos os modelos

Workflows

Enterprise

Para limites maiores

Personalizado

termos de preços e cobrança

Créditos de alto volume
Limites de vagas personalizados
Todos os modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

grátis para sempre

Até 20 créditos
apenas 1 usuário
Modelos limitados
Workflows

Perguntas frequentes

Como escrever um bom prompt no Gemini Omni Flash 1.1?
Escreva um briefing curto de plano: sujeito e ação, cenário, câmera, luz e o áudio que você quer, em frases simples. Por padrão, o Omni Flash monta uma mininarrativa com vários planos, então acrescente "single continuous shot, no scene cuts" quando quiser uma tomada só, sem corte. E descreva sempre o som, porque um prompt que não fala de áudio ganha uma trilha inventada pelo modelo.
Em que idioma escrever os prompts do Gemini Omni Flash 1.1?
Escreva o prompt em inglês. O Google avalia o modelo em inglês, e é nesse idioma que as instruções de plano, tempo e áudio se comportam de forma mais previsível, por isso todos os exemplos deste guia estão em inglês. Vale também para o texto que precisa aparecer na tela: escreva a palavra exata em inglês e ela volta legível, enquanto alfabetos não latinos continuam sendo o ponto fraco do modelo.
Como estender um vídeo no Gemini Omni Flash 1.1?
Peça a continuação: "extend this video" já resolve, e "the scene continues: the camera pans across the mountains" dá direção. Cada extensão acrescenta até dez segundos, num total de 40, usando os últimos dez segundos de material como contexto e misturando os quadros finais para a emenda passar como uma tomada só. A extensão só acrescenta no fim: ela não coloca material antes nem estica o meio.
O que significam as tags de um prompt do Gemini Omni Flash 1.1?
As tags ligam o material que você enviou a um papel. FIRST_FRAME e LAST_FRAME, entre sinais de menor e maior, definem o quadro inicial e o final. IMAGE_REF_0 e VIDEO_REF_0 marcam referências, contadas a partir de zero na ordem de envio. Passar a mesma imagem como primeiro e último quadro devolve um clipe em loop. Sem tags, o modelo deduz o papel de cada arquivo pelo prompt, o que resolve casos simples e fica ambíguo a partir de dois ou três arquivos.
Quantas referências o Gemini Omni Flash 1.1 aceita?
Até dez imagens de referência e até três vídeos de referência por geração, e um vídeo de referência precisa ter três segundos ou menos. As imagens carregam sujeitos, produtos, cenários ou estilos; as referências em vídeo funcionam melhor para uma aparência, e o áudio delas é ignorado. Anexe tudo antes da primeira geração, porque acrescentar referência no meio da conversa desestabiliza uma cena que estava se segurando bem.
Como dirigir o áudio e o diálogo no Gemini Omni Flash 1.1?
Descreva a trilha que você quer no mesmo prompt da imagem: "no music, just room tone", "a high energy techno beat" ou uma fala escrita por extenso para a personagem dizer. O diálogo volta com lip sync, numa voz que se mantém entre edições e extensões. O silêncio também precisa ser pedido, porque um prompt omisso costuma devolver música de fundo genérica.
O Gemini Omni Flash 1.1 escreve texto dentro do vídeo?
Escreve, e é um dos pontos mais fortes do modelo em inglês: placas, letreiros e animações de texto palavra a palavra voltam legíveis quando você soletra exatamente o que cada superfície diz. Defina até o texto de fundo, ou o modelo inventa o dele. Alfabetos não latinos são o ponto fraco, então confira quadro a quadro se precisar de texto em japonês ou chinês.
Como manter a personagem igual entre uma edição e outra no Gemini Omni Flash 1.1?
Faça uma mudança focada por rodada e deixe a memória de cena do modelo trabalhar: rosto, roupa e voz seguem sozinhos de uma resposta para a outra. Em sequências mais longas, reancore com "keep all character details and motion exactly as they are, only change the lighting" antes da mudança que você quer. Correntes de umas quatro edições se mantêm estáveis; passando disso, planeje uma geração nova com as referências reanexadas.