Gemini Omni Flash 1.1: generador de videos con IA

El modelo de video de Google, renovado. Escribe la toma y después dirígela.

Todos los modelos de video

Un solo espacio de trabajo

Hecho con Gemini Omni Flash 1.1

Funciones clave

Lo que genera Gemini Omni Flash 1.1

Escenas con sonido, desde una frase

Escribe la toma y el audio juntos y los dos vuelven a la vez: la acción, el ambiente del lugar y la línea que dice el personaje, con los labios sincronizados. El sonido que nombras es el sonido que recibes.

Una cocina de ramen llena de gente por la noche, con el vapor subiendo entre las lámparas colgantes mientras un cocinero sirve los fideos

Ediciones que escribes

Genera y después dirige: cambia la luz de la escena, el vestuario, el letrero. Cada instrucción cae sobre la misma toma mientras todo lo que no mencionaste queda tal como se filmó.

Cuadro dividido del mismo hombre en un puente de piedra bajo la lluvia, con abrigo gris a la izquierda e impermeable amarillo a la derecha

Escenas que crecen a 40 segundos

Arranca con un tiempo de diez segundos y extiéndelo de diez en diez. El modelo lee tus cuadros finales y continúa el movimiento, el elenco y la música, así que las uniones se leen como una sola toma.

Tira de cuatro cuadros de un tren rojo cruzando un viaducto de piedra al anochecer, rumbo a un pueblo iluminado

Personajes y productos fieles a la referencia

Hasta diez imágenes y tres clips cortos fijan quién y qué aparece en la toma. Un personaje conserva su rostro, su ropa y su voz desde la primera generación hasta la última edición.

Tarjetas de referencia de un reloj y una modelo junto al cuadro final de la campaña sobre lino oscuro

Genera un video en tres pasos

  1. 01

    Abre Morphic

    Regístrate y empieza a generar en un canvas visual libre e infinito.

  2. 02

    Escribe la toma con su sonido

    Sujeto, acción, cámara, luz y el audio. Di en qué momento pasa cada cosa, y si corre como una sola toma continua o con cortes.

  3. 03

    Genera y después dirige

    Afina la toma en los turnos siguientes: un cambio por turno, y extiéndela cuando la escena pida más aire.

Todo en Morphic

Tu stack de video completo

Precios simples

Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.

Basic

$9/ mes
facturado como $0 por año

1100 mensual créditos

1 usuario

Todos los modelos

Workflows

Standard

$24/ mes
facturado como $0 por año

3625 mensual créditos

1 usuario

Todos los modelos

Workflows

Pro

$45/ mes
facturado como $0 por año

6350 compartidos mensual créditos

1 usuario

+ hasta 4 más con costo adicional

Todos los modelos

Workflows

Pro Max

$170/ mes
facturado como $0 por año

24650 compartidos mensual créditos

1 usuario

+ hasta 9 más con costo adicional

Todos los modelos

Workflows

Enterprise

Para límites más altos

Personalizado

términos de precios y facturación

Créditos de alto volumen
Límites de asientos personalizados
Todos los modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

gratis para siempre

Hasta 20 créditos
Solo 1 usuario
Modelos limitados
Workflows

Preguntas frecuentes

¿Puedo usar un generador de videos con IA Gemini Omni Flash 1.1 ahora mismo?
Sí. Escribe la toma en la barra de prompt de arriba y genera: todo corre en el navegador, desde cualquier laptop, incluidas las que no traen GPU, y no hay nada que instalar. En Morphic, Gemini Omni convive con Veo 3.1, Seedance 2.5, Kling y el resto del catálogo de video, así que un mismo brief puede pasar por varios modelos y volver lado a lado en el Canvas.
¿Qué es Gemini Omni Flash 1.1?
Es la segunda versión del modelo de video multimodal de Google DeepMind, publicada a fines de agosto de 2026. Genera clips de 3 a 10 segundos con audio nativo a partir de texto, imágenes y referencias en video, y después sigue trabajando sobre ellos: los prompts siguientes editan la misma toma, y las extensiones la hacen crecer hasta 40 segundos. La versión 1.1 sumó la escalera de resolución hasta 4K, referencias en video que sí funcionan e interpolación del primer al último cuadro.
¿En qué se diferencia este generador de una herramienta de texto a video común?
La generación es una conversación, no un render de un solo tiro. Después de la primera toma dices qué cambiar, en lenguaje común, y el modelo lo aplica mientras el resto del cuadro sigue como se filmó: rostros, vestuario y voces se sostienen en cada turno. Un generador común te obliga a volver a tirar el clip entero y cruzar los dedos; este te deja quedarte con la toma y corregir el detalle.
¿El generador de videos Gemini Omni Flash 1.1 incluye sonido?
Sí, el sonido se genera en la misma pasada que la imagen: diálogo con sincronía labial, efectos, ambiente y música al ritmo de la acción. Escribe el audio dentro del brief igual que escribes lo visual, porque un prompt que no dice nada del sonido recibe una pista que el modelo elige por su cuenta. Hasta el silencio es algo que se pide.
¿Cuánto puede durar un video generado?
Una generación corre de 3 a 10 segundos. De ahí en adelante, la extensión continúa el clip de diez en diez segundos hasta 40 en total, y lee el último tramo de imagen para que el movimiento, los personajes y el audio sigan continuos en cada unión. Así una toma corta se vuelve una escena completa, sin pegar clips a mano.
¿En qué resolución genera Gemini Omni Flash 1.1?
Cuatro opciones, en 16:9 o 9:16: 360p para bocetos baratos, 720p nativo, y 1080p o 4K como upscale de esa toma. El método que rinde es iterar en resolución baja hasta que la escena quede, y recién ahí pedir una vez la resolución de entrega, en lugar de pagar 4K en cada intento.
¿Puede trabajar con mis imágenes y mis clips?
Sí. Anima una sola imagen fija, dale un primer y un último cuadro para que interpole entre los dos, o adjunta hasta diez imágenes de referencia y tres clips cortos que fijen un personaje, un producto, una locación o un estilo. La misma imagen usada como primer y último cuadro vuelve como un loop sin costura.
¿Sirve para video vertical en 9:16, para Reels y TikTok?
Sí. Las cuatro resoluciones salen en 16:9 o en 9:16, así que el vertical no es un recorte posterior: la toma se genera así desde el principio, con su audio adentro. Y como la escena queda viva en la conversación, ajustas el encuadre o el vestuario por prompt, y una extensión lleva esos diez segundos a cuarenta cuando el corte pide más aire.

También te puede gustar