Funciones y capacidades de Gemini Omni Flash 1.1
El modelo de video multimodal de Google DeepMind, actualizado en agosto de 2026. Hace clips de 3 a 10 segundos con audio nativo y después sigue trabajando sobre ellos: un prompt siguiente edita la misma toma, y las extensiones la hacen crecer hasta 40 segundos.
| Función | Qué hace | Ideal para |
|---|---|---|
| Edición por conversación | Un prompt siguiente cambia la toma; lo que no mencionas se queda igual | Arreglar una toma sin volver a generarla |
| Extensión de video | Continúa el clip de 10 en 10 segundos, hasta 40 en total | Escenas más largas que una sola generación |
| Entrada de referencias | 10 imágenes y 3 clips guían una generación, cada uno con su papel | Personajes, productos y estilos que se repiten |
| Primer y último cuadro | Interpola entre dos imágenes fijas; la misma imagen dos veces cierra en loop | Transiciones, loops, pares de storyboard |
| Audio nativo | Voz con sincronía labial, efectos, ambiente y música junto con la imagen | Escenas habladas, tomas guiadas por el sonido |
| Escalera de resolución | De 360p a 4K; 1080p y 4K salen por upscale | Bocetos baratos, entrega a tamaño completo |
| Texto en pantalla | Renderiza el texto en inglés que le indiques, hasta los letreros del fondo | Títulos, rótulos inferiores, subtítulos |
Casos de uso de Gemini Omni Flash 1.1
Cadenas de edición sobre una toma
Cambia la luz de la sala, el abrigo, el letrero. Cada instrucción cae sobre la misma toma mientras el resto del cuadro se mantiene.

Escenas armadas por extensión
Abre con un tiempo de diez segundos y hazlo crecer. El modelo lee tus segundos finales y continúa el movimiento, el elenco y la música hasta 40 segundos.

Del boceto a la imagen filmada
Pídele que use el dibujo solo como guía. El modelo toma la silueta y el recorrido, y vuelve a construir textura, luz y profundidad.

Voceros que hablan a cámara
Escribes la línea y el personaje la dice con los labios sincronizados, en una voz que sigue siendo suya en cada edición posterior.

Secuencias con tiempos marcados
Un bloque de timecodes convierte un prompt en una secuencia corte por corte: cuadros de producto en ráfaga, o un tiempo cada dos segundos.

Loops perfectos
Pasa la misma imagen como primer y último cuadro y el clip vuelve a donde empezó, listo para correr en una ficha de producto.

Paso 1: elige la tarea
Todo lo que hace el modelo cae en una de cinco tareas. Nómbrala cuando la intención pueda malinterpretarse; si no, el modelo la deduce de tu prompt y de tus archivos.
| Tarea | Qué hace | Úsala cuando |
|---|---|---|
| Text to video | Genera un clip a partir de un brief escrito | Empiezas desde cero |
| Image to video | Anima una imagen fija, o interpola entre dos cuadros | Ya tienes el cuadro y te falta el movimiento |
| Reference to video | Arma la toma con imágenes y clips etiquetados | Un personaje o un estilo tiene que continuar |
| Edit | Cambia un video que ya existe | La toma está bien y hay un elemento que falla |
| Extend | Agrega una continuación | La toma está bien y se queda corta |
Paso 2: escribe el prompt
Un prompt es un brief de toma corto, en este orden. La proporción, la resolución y la duración son ajustes, no texto del prompt.
| Elemento | Qué cubre | Obligatorio |
|---|---|---|
| Sujeto y acción | Quién está en cuadro y qué hace | Sí |
| Escena | Locación, hora del día, clima, fondo | Opcional |
| Cámara y luz | Tamaño de plano, movimiento, lente, fuente de luz | Opcional |
| Audio | Diálogo, ambiente, efectos, música o silencio | Muy recomendado |
| Estructura de la toma | Una toma continua, o cortes y sus tiempos | Opcional |
Así se ve uno de esos briefs. Los ejemplos van en inglés, porque el inglés es la lengua en la que Google documenta y evalúa este modelo:
Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.
Las cinco palancas del prompt
| Palanca | Escribe esto | Por qué importa |
|---|---|---|
| Estructura de la toma | Single continuous shot, no scene cuts. O: every 2s cut to a new location | Si no lo pides, el modelo cuenta una historia repartida en varias tomas |
| Audio | No music, just room tone. O una línea hablada: she says, third one today | El silencio hay que pedirlo, o llega música inventada |
| Tiempos | After 3 seconds, a woman enters. O un bloque de timecodes | Los rangos son presupuestos, no puntos de corte exactos |
| Texto en pantalla | A street sign that says MARKET LANE | El texto sin definir se lo inventa. El inglés se renderiza; otros sistemas de escritura no |
| Disparadores | When the person touches the mirror, it ripples like liquid | Las instrucciones por evento caen más precisas que un tiempo abstracto |
Para una secuencia con tiempos fijos, escribe las marcas como bloque:
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
Las negaciones van dentro del mismo prompt, del tipo “no dialogue” o “do not add captions”. No existe un campo aparte para prompts negativos.
Paso 3: agrega referencias y cuadros
Diez imágenes de referencia y tres videos de referencia por generación. Las etiquetas le asignan su papel a cada archivo, numerados desde cero en el orden en que los subiste.
| Etiqueta | Papel | Ejemplo |
|---|---|---|
| FIRST_FRAME | Cuadro inicial | <FIRST_FRAME> a woman is walking |
| LAST_FRAME | Cuadro final, en pareja con un cuadro inicial | <FIRST_FRAME> <LAST_FRAME> a woman is walking |
| IMAGE_REF_0 | Referencia de sujeto, producto o estilo | in the style of <IMAGE_REF_0>, a woman is walking |
| VIDEO_REF_0 | Referencia de personaje u objeto | the person in <VIDEO_REF_0> is playing the violin |
- Adjunta todo desde el arranque. Una referencia que llega a media conversación desestabiliza una escena que venía firme.
- Dale un solo trabajo a cada referencia. El estilo de la primera imagen, el sujeto de la segunda: eso gana contra dejarlo a la adivinanza.
- Deja cortos los videos de referencia. Tres segundos cada uno, funcionan mejor para un parecido, y su audio se ignora.
- La misma imagen como primer y último cuadro devuelve un loop sin costura.
Paso 4: edita y extiende el resultado
Una toma generada sigue viva dentro de la conversación, y un material tuyo de 10 segundos o menos puede sumarse a ella. Todo lo que describes es algo que el modelo puede volver a renderizar, así que describe solo el cambio.
| Evita | Escribe mejor |
|---|---|
| In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its head | Add a cat that jumps onto his lap, he begins to pet it. Keep everything else the same. |
| Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadows | Change the lighting to be more dramatic. Keep everything else the same. |
| Regla | Detalle |
|---|---|
| Un cambio por turno | Las instrucciones compuestas rompen la consistencia casi el doble de seguido |
| Cuatro ediciones por cadena | Pasando eso se cuela la deriva. Vuelve a anclar con “keep all character details exactly as they are, only change X” |
| La extensión solo agrega al final | 10s por vez, hasta 40s en total. No puede poner nada antes ni estirar el medio |
| El reloj de la extensión vuelve a cero | “After 2s” significa dos segundos dentro del material nuevo |
| Las referencias pueden ir de acompañantes | Un personaje nuevo entra a la escena extendida desde una imagen que adjuntes |
Una extensión con dirección se lee así:
Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.
Límites de Gemini Omni Flash 1.1
| Límite | Qué pasa | Cómo sortearlo |
|---|---|---|
| Escrituras no latinas | Los glifos japoneses y chinos salen como invenciones convincentes | Deja el texto en pantalla en inglés, o revisa cada cuadro |
| Escenas cargadas | Con cuatro sujetos o más en seguimiento se mezclan o se van | Mantenlo en tres |
| Sin edición de voz | No admite subir audio de referencia ni retocar la voz | Dirige la voz por texto; la consistencia la sostiene |
| Bordes de la política | Marcas reales y personas reconocibles quedan bloqueadas, según la región | Deja genéricos los elementos de marca |

