Multimodal

Gemini Omni Flash 1.1

de Google DeepMind

El modelo de video de Google que diriges escribiendo.
Ahora con 4K y escenas de 40 segundos.

Gemini Omni Flash 1.1

Funciones clave

Especificaciones técnicas

Gemini Omni

Segundo lanzamiento Omni Flash dentro de la familia Omni de Google

5 tareas

Texto, imagen, referencia, edición y extensión

De 3 a 10s

Por generación; con extensiones el total llega a 40 segundos

Hasta 4K

360p y 720p nativos, 1080p y 4K por upscale

10 + 3

Diez imágenes más tres clips de video de hasta 3s cada uno

Nativo

Diálogo, efectos y música en la misma pasada

16:9, 9:16

Horizontal y vertical en todas las resoluciones

SynthID

Marca de origen invisible en cada clip generado

Casos de uso

Cuadro dividido de la misma escena de café de calle, fotográfica a la izquierda y en anime a la derecha

Ediciones que escribes

Le pasas el clip y dices el cambio: otro clima, pásalo a anime, reescribe el letrero. El resto del cuadro queda como se filmó.

Una mujer hablando a cámara a mitad de la frase, con luz suave de ventana

Personajes que hablan

Escribes la línea y el personaje la dice, con los labios sincronizados y una voz que aguanta cada corte y cada edición posterior.

Tarjetas de referencia de un frasco, una modelo y una locación junto al cuadro final del anuncio de perfume

Fieles a la referencia

Una foto del producto, un retrato de la presentadora y tres segundos del movimiento se vuelven un solo spot fiel al producto.

Tira de cuatro cuadros del mismo ciclista pasando por una calle de panaderías, un puerto, un faro y la carretera de la costa

Escenas que crecen a 40s

Generas el primer tiempo y lo extiendes de diez en diez segundos hasta una escena de 40, con el mismo elenco, locación y música.

Una escultura cinética de fichas de dominó que empujan una canica de acero hacia una pista curva de madera

Explicaciones con física

Gravedad, fluidos y choques siguen las reglas del mundo real, y la base de Gemini en ciencia e historia cuida el detalle.

Cuadro de entrevista con un pescador en un puerto con neblina y un letrero inferior que dice THE COAST ROAD

Títulos dentro del cuadro

El texto en pantalla vuelve legible, del letrero inferior al rótulo de una tienda, y una edición posterior reescribe lo que dice.

Ejemplos de prompts

Mercado nocturno

Un mercado nocturno después de la lluvia, pregones y woks chisporroteando

Edit prompt

Cortes al ritmo

Cada dos segundos, corta a otra azotea en la hora dorada

Edit prompt

Texto en pantalla

Un letrero de fonda enciende letra por letra: OPEN ALL NIGHT

Edit prompt

Una sola toma

Una pista de canicas por un taller soleado, una toma sin cortes

Edit prompt

Línea hablada

Un escalador susurra la frase de la cumbre contra el viento

Edit prompt

Primer plano sonoro

Primer plano de un café de filtro, cada gota y cada silbido audibles

Edit prompt

Descripción general

Gemini Omni Flash 1.1 es la segunda versión del modelo de video multimodal de Google DeepMind, y la primera en la que una toma tiene espacio para crecer. Una generación sigue durando de 3 a 10 segundos con audio nativo, pero la 1.1 suma los controles que le faltaban a la primera: una escalera de resolución que va del boceto en 360p a la entrega en 4K, referencias en video que de verdad guían el resultado, un cuadro final que convierte dos imágenes fijas en un movimiento, y una extensión que lleva el clip a 40 segundos sin perder el elenco ni la música.

Qué trae de nuevo la versión 1.1

El primer Omni Flash renderizaba todo en 720p y se detenía a los diez segundos. La 1.1 conserva ese centro rápido y conversado, y quita los techos que lo rodeaban. La resolución ahora se elige en cada generación: 360p para iterar barato, y upscale a 1080p o 4K cuando la toma ya está lista para salir. La entrada de referencias crece a diez imágenes más tres clips cortos, cada uno con su papel marcado en el prompt. Y un clip terminado dejó de ser el final del camino: la extensión lee el último tramo de imagen y continúa la escena, de diez en diez segundos, hasta cuatro veces el largo original.

Edición por conversación, en vez de volver a tirar los dados

La mayoría de los modelos de video tratan el prompt como una palanca de máquina tragamonedas. Omni Flash lo trata como la primera frase de una sesión. El modelo sostiene la escena entre turnos, así que “pon el abrigo en rojo”, “ahora extiende la toma mientras ella se voltea” y “cambia el letrero a CLOSED” caen sobre la misma toma, con rostros, vestuario y voces intactos. Las instrucciones cortas, de un cambio por turno, rinden mejor. Y las partes del cuadro que nunca mencionas son justo las que no se mueven.

Gemini Omni Flash 1.1 en Morphic

En Morphic, Gemini Omni vive en el selector de modelos de video junto a Veo 3.1, Seedance 2.5, Kling y el resto del catálogo. Escribe la toma como un brief que ya incluye el audio, adjunta imágenes de referencia para todo lo que deba mantenerse igual, y genera. La toma cae en el Canvas, donde el mismo brief puede pasar por otro modelo para una lectura lado a lado. Después sigues refinando en los turnos siguientes, un cambio a la vez, y la escena conserva su contexto de un turno al otro.

Precios simples

Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.

Basic

$9/ mes
facturado como $0 por año

1100 mensual créditos

1 usuario

Todos los modelos

Workflows

Standard

$24/ mes
facturado como $0 por año

3625 mensual créditos

1 usuario

Todos los modelos

Workflows

Pro

$45/ mes
facturado como $0 por año

6350 compartidos mensual créditos

1 usuario

+ hasta 4 más con costo adicional

Todos los modelos

Workflows

Pro Max

$170/ mes
facturado como $0 por año

24650 compartidos mensual créditos

1 usuario

+ hasta 9 más con costo adicional

Todos los modelos

Workflows

Enterprise

Para límites más altos

Personalizado

términos de precios y facturación

Créditos de alto volumen
Límites de asientos personalizados
Todos los modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

gratis para siempre

Hasta 20 créditos
Solo 1 usuario
Modelos limitados
Workflows

Preguntas frecuentes

¿Qué es Gemini Omni Flash 1.1?
Gemini Omni Flash 1.1 es la segunda versión del modelo de video multimodal de Google, publicada a fines de agosto de 2026. Genera video con audio nativo sincronizado a partir de texto, imágenes y referencias en video, y edita o extiende el material con instrucciones en lenguaje común. La versión 1.1 suma una escalera de resolución hasta 4K, referencias en video que sí guían el resultado, interpolación del primer al último cuadro y extensiones que llevan un clip a 40 segundos.
¿Qué cambia en Gemini Omni Flash 1.1 frente a la primera versión?
Cuatro cosas. La resolución ahora se elige en cada generación, de 360p a 4K, donde la primera versión quedaba fija en 720p. La extensión de video ya funciona y hace crecer el clip de diez en diez segundos hasta 40, contra una sola generación de diez segundos antes. Las referencias en video pasaron a guiar el resultado de verdad, hasta tres clips de tres segundos cada uno. Y el modo de imagen a video acepta un cuadro final, así que el modelo interpola entre dos imágenes fijas que tú le des.
¿En qué resolución genera Gemini Omni Flash 1.1?
Cuatro opciones: 360p, 720p, 1080p y 4K, en 16:9 o 9:16. El modelo renderiza de forma nativa en 360p y 720p, y entrega 1080p y 4K como upscale de esa misma generación. En la práctica eso se vuelve un método: bocetear barato en 360p, cerrar la toma en 720p y recién entonces pedir la resolución de entrega, cuando la escena ya quedó como la querías.
¿Cuánto puede durar un video de Gemini Omni Flash 1.1?
Una generación corre de 3 a 10 segundos, con 8 segundos por defecto. De ahí en adelante la extensión hace crecer el clip de diez en diez segundos hasta 40 en total, y mantiene personajes, movimiento y audio continuos en cada unión. Le pides la continuación en lenguaje común, el modelo lee los últimos diez segundos como contexto y ajusta apenas los cuadros finales para que la unión no se note. Sirve tanto para lo que generó el propio modelo como para material que tú subas, siempre que ese archivo dure diez segundos o menos. La extensión solo agrega al final: no puede poner nada antes ni alargar el medio.
¿Qué referencias acepta Gemini Omni Flash 1.1?
Hasta diez imágenes de referencia y hasta tres videos de referencia de tres segundos cada uno, junto con el prompt de texto. Las imágenes fijan un personaje, un producto, una locación o un estilo, y las etiquetas del prompt le asignan su papel a cada una. Los videos de referencia cargan un parecido o un movimiento; el audio que traigan adentro se ignora, y pedirle al modelo que razone sobre varios videos completos a la vez no está soportado.
¿Cómo funciona la edición por conversación en Gemini Omni Flash 1.1?
Cada prompt siguiente edita el resultado anterior en lugar de generar desde cero, y el modelo guarda el estado de la escena entre turnos. Las instrucciones cortas rinden más: “haz invisible el celular, deja todo lo demás igual” gana contra un párrafo que describe el cuadro completo. Como cada turno parte del anterior, un solo cambio por turno es lo que sostiene personajes y movimiento a lo largo de una cadena de ediciones.
¿Gemini Omni Flash 1.1 genera audio y diálogo?
Sí. El sonido sale en la misma pasada que la imagen: diálogo con sincronía labial, efectos, ambiente y música al ritmo de la acción. Escribe en el prompt el audio que quieres, porque un prompt que no dice nada del sonido recibe una pista que el modelo inventa por su cuenta. Y una línea hablada es así de simple: escribe lo que dice el personaje.
¿Gemini Omni Flash 1.1 escribe texto dentro del video?
El texto en pantalla es uno de sus puntos fuertes en inglés, que es la lengua en la que Google evaluó el modelo: letreros, rótulos inferiores y animaciones palabra por palabra vuelven legibles cuando escribes con exactitud lo que dice cada superficie. Define hasta el texto del fondo, o el modelo se lo inventa. El punto débil declarado son los sistemas de escritura no latinos, así que si el cuadro tiene que llevar japonés o chino, revísalo cuadro por cuadro antes de publicar. Y si algo sale mal escrito, una edición posterior reescribe ese letrero sin regenerar la toma.
¿Puedo usar Gemini Omni Flash 1.1 en Morphic?
Sí. Elige Gemini Omni en el selector de modelos de video, escribe la toma con el sonido que quieres y genera. La toma cae en el Canvas, al lado de los resultados de Veo, Seedance y Kling, para compararlos lado a lado. Los prompts siguientes editan la misma escena, y las imágenes de referencia pueden ir junto con el brief.
¿Gemini Omni Flash 1.1 es lo mismo que Veo 4?
No, y la confusión se entiende: los dos salen de Google DeepMind y sobre Omni se escribe seguido como si fuera el sucesor de la línea Veo. Son modelos distintos. Veo es la familia de video cinematográfico, hoy en Veo 3.1; Gemini Omni es la familia multimodal, cuyo primer modelo de video es Omni Flash, ahora en la versión 1.1. Google no lanzó ningún modelo llamado Veo 4, así que cualquier mención a “Veo 4” es especulación o un apodo informal para Omni.
¿En qué se diferencia Gemini Omni Flash 1.1 de Veo 3.1?
Veo 3.1 está afinado para la fidelidad cinematográfica de una sola toma; Omni Flash 1.1 está afinado para iterar. Omni es el que diriges: edita su propio resultado turno a turno, acepta referencias de imagen y de video mezcladas, extiende una toma hasta 40 segundos y sostiene al personaje y su voz durante todo el camino. Para una toma de apertura única, Veo sigue ganando en acabado. Para una escena que refinas y haces crecer, el flujo es Omni Flash.