Gemini Omni Flash 1.1: guía completa, prompts y novedades

Gemini Omni Flash 1.1: guía completa, prompts y novedades

La guía completa de Gemini Omni Flash 1.1: las cinco tareas, la fórmula del prompt, etiquetas de referencia y de cuadro, ediciones que escribes, extensiones de 40 segundos y dirección de audio, con ejemplos.

Funciones y capacidades de Gemini Omni Flash 1.1

El modelo de video multimodal de Google DeepMind, actualizado en agosto de 2026. Hace clips de 3 a 10 segundos con audio nativo y después sigue trabajando sobre ellos: un prompt siguiente edita la misma toma, y las extensiones la hacen crecer hasta 40 segundos.

FunciónQué haceIdeal para
Edición por conversaciónUn prompt siguiente cambia la toma; lo que no mencionas se queda igualArreglar una toma sin volver a generarla
Extensión de videoContinúa el clip de 10 en 10 segundos, hasta 40 en totalEscenas más largas que una sola generación
Entrada de referencias10 imágenes y 3 clips guían una generación, cada uno con su papelPersonajes, productos y estilos que se repiten
Primer y último cuadroInterpola entre dos imágenes fijas; la misma imagen dos veces cierra en loopTransiciones, loops, pares de storyboard
Audio nativoVoz con sincronía labial, efectos, ambiente y música junto con la imagenEscenas habladas, tomas guiadas por el sonido
Escalera de resoluciónDe 360p a 4K; 1080p y 4K salen por upscaleBocetos baratos, entrega a tamaño completo
Texto en pantallaRenderiza el texto en inglés que le indiques, hasta los letreros del fondoTítulos, rótulos inferiores, subtítulos

Casos de uso de Gemini Omni Flash 1.1

Cadenas de edición sobre una toma

Cambia la luz de la sala, el abrigo, el letrero. Cada instrucción cae sobre la misma toma mientras el resto del cuadro se mantiene.

La misma sala dividida en dos, con luz plana de mediodía a la izquierda y atardecer dorado a la derecha

Escenas armadas por extensión

Abre con un tiempo de diez segundos y hazlo crecer. El modelo lee tus segundos finales y continúa el movimiento, el elenco y la música hasta 40 segundos.

Tira de cuatro cuadros de un globo aerostático a rayas cruzando un valle alpino al amanecer

Del boceto a la imagen filmada

Pídele que use el dibujo solo como guía. El modelo toma la silueta y el recorrido, y vuelve a construir textura, luz y profundidad.

Un boceto a lápiz de un zorro saltando junto a la misma pose resuelta como un zorro fotográfico en el bosque

Voceros que hablan a cámara

Escribes la línea y el personaje la dice con los labios sincronizados, en una voz que sigue siendo suya en cada edición posterior.

Un vendedor de mercado hablando con calidez sobre cajas de naranjas bajo el sol de la tarde

Secuencias con tiempos marcados

Un bloque de timecodes convierte un prompt en una secuencia corte por corte: cuadros de producto en ráfaga, o un tiempo cada dos segundos.

Tres cuadros de la misma mujer con bufanda roja caminando, volteando y luego corriendo

Loops perfectos

Pasa la misma imagen como primer y último cuadro y el clip vuelve a donde empezó, listo para correr en una ficha de producto.

Un avión de papel volando un rizo trazado por una estela de luz cerrada en un taller en penumbra

Paso 1: elige la tarea

Todo lo que hace el modelo cae en una de cinco tareas. Nómbrala cuando la intención pueda malinterpretarse; si no, el modelo la deduce de tu prompt y de tus archivos.

TareaQué haceÚsala cuando
Text to videoGenera un clip a partir de un brief escritoEmpiezas desde cero
Image to videoAnima una imagen fija, o interpola entre dos cuadrosYa tienes el cuadro y te falta el movimiento
Reference to videoArma la toma con imágenes y clips etiquetadosUn personaje o un estilo tiene que continuar
EditCambia un video que ya existeLa toma está bien y hay un elemento que falla
ExtendAgrega una continuaciónLa toma está bien y se queda corta

Paso 2: escribe el prompt

Un prompt es un brief de toma corto, en este orden. La proporción, la resolución y la duración son ajustes, no texto del prompt.

ElementoQué cubreObligatorio
Sujeto y acciónQuién está en cuadro y qué hace
EscenaLocación, hora del día, clima, fondoOpcional
Cámara y luzTamaño de plano, movimiento, lente, fuente de luzOpcional
AudioDiálogo, ambiente, efectos, música o silencioMuy recomendado
Estructura de la tomaUna toma continua, o cortes y sus tiemposOpcional

Así se ve uno de esos briefs. Los ejemplos van en inglés, porque el inglés es la lengua en la que Google documenta y evalúa este modelo:

Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.

Las cinco palancas del prompt

PalancaEscribe estoPor qué importa
Estructura de la tomaSingle continuous shot, no scene cuts. O: every 2s cut to a new locationSi no lo pides, el modelo cuenta una historia repartida en varias tomas
AudioNo music, just room tone. O una línea hablada: she says, third one todayEl silencio hay que pedirlo, o llega música inventada
TiemposAfter 3 seconds, a woman enters. O un bloque de timecodesLos rangos son presupuestos, no puntos de corte exactos
Texto en pantallaA street sign that says MARKET LANEEl texto sin definir se lo inventa. El inglés se renderiza; otros sistemas de escritura no
DisparadoresWhen the person touches the mirror, it ripples like liquidLas instrucciones por evento caen más precisas que un tiempo abstracto

Para una secuencia con tiempos fijos, escribe las marcas como bloque:

[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running

Las negaciones van dentro del mismo prompt, del tipo “no dialogue” o “do not add captions”. No existe un campo aparte para prompts negativos.

Paso 3: agrega referencias y cuadros

Diez imágenes de referencia y tres videos de referencia por generación. Las etiquetas le asignan su papel a cada archivo, numerados desde cero en el orden en que los subiste.

EtiquetaPapelEjemplo
FIRST_FRAMECuadro inicial<FIRST_FRAME> a woman is walking
LAST_FRAMECuadro final, en pareja con un cuadro inicial<FIRST_FRAME> <LAST_FRAME> a woman is walking
IMAGE_REF_0Referencia de sujeto, producto o estiloin the style of <IMAGE_REF_0>, a woman is walking
VIDEO_REF_0Referencia de personaje u objetothe person in <VIDEO_REF_0> is playing the violin
  • Adjunta todo desde el arranque. Una referencia que llega a media conversación desestabiliza una escena que venía firme.
  • Dale un solo trabajo a cada referencia. El estilo de la primera imagen, el sujeto de la segunda: eso gana contra dejarlo a la adivinanza.
  • Deja cortos los videos de referencia. Tres segundos cada uno, funcionan mejor para un parecido, y su audio se ignora.
  • La misma imagen como primer y último cuadro devuelve un loop sin costura.

Paso 4: edita y extiende el resultado

Una toma generada sigue viva dentro de la conversación, y un material tuyo de 10 segundos o menos puede sumarse a ella. Todo lo que describes es algo que el modelo puede volver a renderizar, así que describe solo el cambio.

EvitaEscribe mejor
In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its headAdd a cat that jumps onto his lap, he begins to pet it. Keep everything else the same.
Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadowsChange the lighting to be more dramatic. Keep everything else the same.
ReglaDetalle
Un cambio por turnoLas instrucciones compuestas rompen la consistencia casi el doble de seguido
Cuatro ediciones por cadenaPasando eso se cuela la deriva. Vuelve a anclar con “keep all character details exactly as they are, only change X”
La extensión solo agrega al final10s por vez, hasta 40s en total. No puede poner nada antes ni estirar el medio
El reloj de la extensión vuelve a cero“After 2s” significa dos segundos dentro del material nuevo
Las referencias pueden ir de acompañantesUn personaje nuevo entra a la escena extendida desde una imagen que adjuntes

Una extensión con dirección se lee así:

Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.

Límites de Gemini Omni Flash 1.1

LímiteQué pasaCómo sortearlo
Escrituras no latinasLos glifos japoneses y chinos salen como invenciones convincentesDeja el texto en pantalla en inglés, o revisa cada cuadro
Escenas cargadasCon cuatro sujetos o más en seguimiento se mezclan o se vanMantenlo en tres
Sin edición de vozNo admite subir audio de referencia ni retocar la vozDirige la voz por texto; la consistencia la sostiene
Bordes de la políticaMarcas reales y personas reconocibles quedan bloqueadas, según la regiónDeja genéricos los elementos de marca

Precios simples

Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.

Basic

$9/ mes
facturado como $0 por año

1100 mensual créditos

1 usuario

Todos los modelos

Workflows

Standard

$24/ mes
facturado como $0 por año

3625 mensual créditos

1 usuario

Todos los modelos

Workflows

Pro

$45/ mes
facturado como $0 por año

6350 compartidos mensual créditos

1 usuario

+ hasta 4 más con costo adicional

Todos los modelos

Workflows

Pro Max

$170/ mes
facturado como $0 por año

24650 compartidos mensual créditos

1 usuario

+ hasta 9 más con costo adicional

Todos los modelos

Workflows

Enterprise

Para límites más altos

Personalizado

términos de precios y facturación

Créditos de alto volumen
Límites de asientos personalizados
Todos los modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

gratis para siempre

Hasta 20 créditos
Solo 1 usuario
Modelos limitados
Workflows

Preguntas frecuentes

¿Cómo escribo un buen prompt para Gemini Omni Flash 1.1?
Escribe un brief de toma corto: sujeto y acción, escena, cámara, luz y el audio que quieres, en frases simples. Omni Flash arma por defecto una mininarrativa de varias tomas, así que agrega “single continuous shot, no scene cuts” cuando busques una sola toma sin cortes. Describe siempre el sonido, porque un prompt que no dice nada del audio recibe una pista que el modelo inventa por su cuenta.
¿Cómo funcionan los prompts de edición en Gemini Omni Flash 1.1?
Cortos y al grano: “make the phone invisible, keep everything else the same”. Un prompt de edición demasiado descriptivo provoca cambios que no pediste, porque todo lo que describes es algo que el modelo puede volver a renderizar. Nombra el único cambio, cierra con “keep everything else the same” y haz un cambio por turno en vez de apilar tres en una sola frase.
¿Cómo extiendo un video con Gemini Omni Flash 1.1?
Pide la continuación: “extend this video” funciona, y “the scene continues: the camera pans across the mountains” le da dirección. Cada extensión suma hasta diez segundos, hasta 40 en total, usa los últimos diez segundos como contexto y funde los cuadros finales para que la unión se lea como una sola toma. La extensión solo agrega al final: no puede poner nada antes ni estirar el medio.
¿Qué significan las etiquetas de un prompt de Gemini Omni Flash 1.1?
Las etiquetas le asignan un papel a cada archivo que subes. FIRST_FRAME y LAST_FRAME entre paréntesis angulares fijan el cuadro inicial y el final; IMAGE_REF_0 y VIDEO_REF_0 marcan las referencias, numeradas desde cero en el orden en que las subiste. Pasar la misma imagen como primer y último cuadro devuelve un clip que cierra en loop. Sin etiquetas, el modelo deduce el papel de cada archivo a partir del prompt, lo que alcanza en casos simples y se vuelve ambiguo pasando dos o tres archivos.
¿En qué idioma conviene escribir los prompts de Gemini Omni Flash 1.1?
En inglés. Es la lengua en la que Google documenta y evalúa este modelo, así que un prompt en inglés es el que devuelve el resultado más fiel, y traducirlo sería un consejo que rinde menos. Escribe el brief en inglés y deja el español para tus notas de producción y para lo que le presentas al cliente. Vale igual para las instrucciones de edición y de extensión: cortas, en inglés, un cambio por turno.
¿Cómo dirijo el audio y los diálogos en Gemini Omni Flash 1.1?
Describe la pista que quieres en el mismo prompt que la imagen: “no music, just room tone”, “a high energy techno beat”, o la línea escrita tal cual para que el personaje la diga. El diálogo vuelve con sincronía labial y en una voz que se sostiene entre ediciones y extensiones. El silencio también hay que pedirlo, porque un prompt que no lo menciona suele volver con música de fondo genérica.
¿Gemini Omni Flash 1.1 puede escribir texto dentro del video?
Sí, y es uno de sus puntos fuertes en inglés: letreros, rótulos inferiores y animaciones palabra por palabra vuelven legibles cuando escribes con exactitud lo que dice cada superficie. Define hasta el texto del fondo, o el modelo se lo inventa. Los sistemas de escritura no latinos son el punto débil, así que revisa cada cuadro si el plano necesita japonés o chino.
¿Cómo mantengo a los personajes consistentes entre ediciones en Gemini Omni Flash 1.1?
Haz un solo cambio por turno y deja que la memoria de escena del modelo haga el resto: rostros, vestuario y voces se sostienen solos entre un turno y el siguiente. En cadenas largas, vuelve a anclar con “keep all character details and motion exactly as they are, only change the lighting” antes del cambio que buscas. Las cadenas de unas cuatro ediciones aguantan estables; pasando eso, conviene planear una generación nueva y volver a adjuntar tus referencias.