Recursos e capacidades do Gemini Omni Flash 1.1
O modelo de vídeo multimodal do Google DeepMind, atualizado em agosto de 2026. Ele faz clipes de 3 a 10 segundos com áudio nativo e continua trabalhando neles: o prompt seguinte edita a mesma tomada, e as extensões levam o clipe a 40 segundos.
| Recurso | O que faz | Ideal para |
|---|---|---|
| Edição por conversa | O prompt seguinte muda a tomada; o que não for citado fica no lugar | Consertar um plano sem regerar |
| Extensão de vídeo | Continua o clipe de 10s em 10s, até 40s no total | Cenas maiores que uma geração |
| Entrada por referência | 10 imagens e 3 clipes guiam uma geração, cada um com seu papel | Personagens, produtos e estilos recorrentes |
| Primeiro e último quadro | Interpola entre duas imagens; a mesma imagem duas vezes vira loop | Transições, loops, pares de storyboard |
| Áudio nativo | Fala com lip sync, efeitos, ambiência e música junto com a imagem | Cenas faladas, planos guiados pelo som |
| Escada de resolução | De 360p a 4K; 1080p e 4K saem por upscale | Rascunho barato, entrega em tamanho real |
| Texto na tela | Renderiza o texto em inglês que você definir, até a placa do fundo | Títulos, letreiros, legendas |
Casos de uso do Gemini Omni Flash 1.1
Sequências de edição na mesma tomada
Mude a luz da sala, troque a jaqueta, reescreva a placa. Cada instrução cai no mesmo plano enquanto o resto do quadro se mantém.

Cenas montadas por extensão
Comece com um trecho de dez segundos e faça crescer. O modelo lê os seus segundos finais e continua o movimento, o elenco e a trilha até 40 segundos.

Do rascunho ao vídeo
Diga para usar o desenho apenas como guia. O modelo pega a silhueta e o percurso, depois reconstrói textura, luz e profundidade.

Apresentadores que falam
Escreva a fala e a personagem entrega com lip sync, numa voz que continua sendo dela em toda edição posterior.

Sequências no tempo certo
Um bloco de timecode transforma um prompt em uma sequência corte a corte: quadros de produto em rajada, ou uma batida a cada dois segundos.

Loops perfeitos
Passe a mesma imagem como primeiro e último quadro e o clipe volta ao ponto de partida, pronto para rodar numa página de produto.

Passo 1: escolha a tarefa
Tudo o que o modelo faz cabe em uma de cinco tarefas. Diga qual é quando a intenção puder ser lida de outro jeito; fora isso, ela é deduzida do seu prompt e do material anexado.
| Tarefa | O que faz | Use quando |
|---|---|---|
| Text to video | Gera um clipe a partir de um briefing escrito | Você começa do zero |
| Image to video | Anima uma imagem, ou interpola dois quadros | Você tem o quadro e quer o movimento |
| Reference to video | Monta o plano a partir de imagens e clipes com tag | Uma personagem ou um estilo precisa atravessar |
| Edit | Muda um vídeo que já existe | A tomada está certa e um elemento está errado |
| Extend | Acrescenta uma continuação | A tomada está certa e curta demais |
Passo 2: escreva o prompt
O prompt é um briefing curto de plano, nesta ordem. Proporção, resolução e duração são configurações, não texto de prompt.
| Elemento | O que cobre | Obrigatório |
|---|---|---|
| Sujeito e ação | Quem está no quadro e o que faz | Sim |
| Cena | Lugar, hora do dia, clima, fundo | Opcional |
| Câmera e luz | Tamanho do plano, movimento, lente, fonte de luz | Opcional |
| Áudio | Diálogo, ambiência, efeitos, música ou silêncio | Muito recomendado |
| Estrutura do plano | Tomada única, ou cortes e o tempo deles | Opcional |
Os exemplos deste guia ficam em inglês, o idioma em que o Google avalia o modelo. Um briefing pronto fica assim:
Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.
As cinco alavancas do prompt
| Alavanca | Escreva assim | Por que importa |
|---|---|---|
| Estrutura do plano | Single continuous shot, no scene cuts. Or: every 2s cut to a new location | Sem instrução, o modelo conta uma história em vários planos |
| Áudio | No music, just room tone. Or a spoken line: she says, third one today | O silêncio precisa ser pedido, senão vem música inventada |
| Tempo | After 3 seconds, a woman enters. Or a timecode block | As faixas de tempo são orçamento, não ponto de corte exato |
| Texto na tela | A street sign that says MARKET LANE | Texto não definido vem inventado. Inglês renderiza, outros alfabetos não |
| Gatilhos | When the person touches the mirror, it ripples like liquid | Instrução presa a um evento acerta mais que tempo abstrato |
Para uma sequência corte a corte, escreva os tempos:
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
As negativas vão no próprio prompt, como no dialogue ou do not add captions. Não existe um campo separado de prompt negativo.
Passo 3: adicione referências e quadros
Dez imagens de referência e três vídeos de referência por geração. As tags dão um papel a cada arquivo, numerados a partir de zero na ordem de envio.
| Tag | Papel | Exemplo |
|---|---|---|
| FIRST_FRAME | Quadro inicial | <FIRST_FRAME> a woman is walking |
| LAST_FRAME | Quadro final, junto de um quadro inicial | <FIRST_FRAME> <LAST_FRAME> a woman is walking |
| IMAGE_REF_0 | Referência: sujeito, produto ou estilo | in the style of <IMAGE_REF_0>, a woman is walking |
| VIDEO_REF_0 | Referência de personagem ou objeto | the person in <VIDEO_REF_0> is playing the violin |
- Anexe tudo de uma vez. Uma referência acrescentada no meio da conversa desestabiliza uma cena que estava firme.
- Dê um só trabalho a cada referência. Estilo na primeira imagem, sujeito na segunda: melhor do que deixar o modelo adivinhar.
- Mantenha os vídeos de referência curtos. Três segundos cada, aparência funciona melhor, o áudio deles é ignorado.
- A mesma imagem como primeiro e último quadro devolve um loop sem emenda.
Passo 4: edite e estenda o resultado
A tomada gerada continua viva na conversa, e um vídeo seu de 10 segundos ou menos pode entrar nela. Tudo o que você descreve é algo que o modelo pode renderizar de novo, então descreva só a mudança.
| Evite | Escreva assim |
|---|---|
| In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its head | Add a cat that jumps onto his lap, he begins to pet it. Keep everything else the same. |
| Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadows | Change the lighting to be more dramatic. Keep everything else the same. |
| Regra | Detalhe |
|---|---|
| Uma mudança por rodada | Instrução composta quebra a consistência cerca de duas vezes mais |
| Quatro edições por corrente | Passando disso, entra desvio. Reancore com: keep all character details exactly as they are, only change X |
| A extensão só acrescenta | 10s por vez, até 40s no total. Não coloca material antes nem estica o meio |
| O relógio da extensão reinicia | After 2s quer dizer dois segundos dentro do material novo |
| As referências podem ir junto | Uma personagem nova entra na cena estendida a partir de uma imagem que você anexa |
A instrução de extensão segue a mesma lógica, também em inglês:
Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.
Limites do Gemini Omni Flash 1.1
| Limite | O que acontece | Como contornar |
|---|---|---|
| Texto não latino | Glifos japoneses e chineses saem como invenções convincentes | Mantenha o texto da tela em inglês, ou confira quadro a quadro |
| Cenas cheias | A partir de quatro sujeitos acompanhados, eles se fundem ou escapam | Fique em três |
| Sem edição de voz | Não aceita envio de referência de áudio nem cirurgia de voz | Dirija a voz por texto; a consistência segura o resto |
| Limites de política | Marcas reais e pessoas reconhecíveis são bloqueadas, por região | Deixe os elementos de marca genéricos |

