Funciones y capacidades de Grok Imagine Video 1.5
| Función | Qué hace | Ideal para |
|---|---|---|
| Audio sincronizado nativo | Diálogo, efectos, ambiente y música se generan junto con el movimiento, en sincronía | Presentadores, anuncios de producto, clips musicales |
| Anima una imagen fija | Convierte una imagen fija en movimiento y conserva su luz, color y textura | Fotos, tomas de producto, ilustraciones |
| Extensión de video | Continúa desde el último fotograma para crear una secuencia más larga | Secuencias narrativas, tomas más largas |
| Generación guiada por referencia | Mantiene un personaje o estilo constante entre clips mediante imágenes de referencia | Personajes consistentes, series con estilo fijo |
| Seguimiento de prompt y control de cámara | El tipo de toma, el movimiento de cámara y el tiempo se respetan tal como se escriben | Previsualizaciones de storyboard, tomas precisas |
Audio sincronizado nativo
El audio se genera junto con el video en un solo paso: diálogo hablado con sincronización labial, efectos de sonido, ambiente y música. Describes el sonido en el mismo prompt que el movimiento, así que no hay un paso de audio aparte.
Anima una imagen fija
La imagen que subes se usa como primer fotograma, y el modelo anima a partir de ahí. La luz, el color y el detalle originales se conservan en vez de regenerarse, lo que es ideal para animar fotos, tomas de producto o ilustraciones terminadas.

Extensión de video
Un clip existente puede continuar desde su último fotograma para crear una toma más larga, manteniendo el mismo sujeto, la luz y el movimiento. Repite el paso para construir una secuencia de varias partes a partir de un clip inicial.

Generación guiada por referencia
Las imágenes de referencia guían el estilo y el personaje sin fijar el primer fotograma. El modelo traslada ese look a las nuevas tomas, lo que mantiene un personaje o estilo visual constante entre generaciones distintas.

Seguimiento de prompt sólido y control de cámara
El modelo sigue direcciones detalladas, incluido el tipo de toma, un movimiento de cámara específico como un dolly o un paneo, y el momento exacto en que ocurre una acción. Esto hace que una toma planeada sea más fácil de reproducir con precisión.
Especificaciones técnicas de Grok Imagine Video 1.5
| Especificación | Grok Imagine Video 1.5 |
|---|---|
| Proveedor | xAI |
| Modos | De imagen a video, de texto a video, de referencia a video, edición de video, extensión de video |
| Audio | Nativo, sincronizado (diálogo, efectos, ambiente, música) |
| Resolución | 480p o 720p |
| Duración | De 1 a 15 segundos |
| Fotogramas por segundo | 24 fps |
| Relaciones de aspecto | 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 1:1 |
Cómo sacarle el máximo provecho a Grok Imagine Video 1.5
El modelo premia un fotograma inicial sólido y una indicación clara enfocada en el movimiento. Unas pocas prácticas marcan la mayor parte de la diferencia en calidad:
- Empieza con una imagen fija. Genera o adjunta primero una imagen en 16:9 y después anímala. Un buen primer fotograma es la palanca más importante para el resultado.
- Mantén el prompt de movimiento corto y específico. Nombra la acción y un solo movimiento de cámara; deja que la imagen aporte la composición y el estilo.
- Nombra siempre el audio. Diálogo, efectos de sonido, ambiente o música, en lenguaje sencillo, para que el modelo genere sonido junto con el movimiento en vez de un clip silencioso.
- Una acción por clip. Concentra un solo momento en unos pocos segundos y usa la extensión de video para secuencias más largas.
- Para personajes que hablan, usa un retrato de frente con la boca en cuadro y mantén las líneas cortas para una sincronización labial limpia.
- Usa imágenes de referencia cuando un look o un personaje deba mantenerse constante entre clips.
Guía de prompts para Grok Imagine Video 1.5
Un buen prompt se lee como una breve indicación de toma, no como un pie de foto. Dos cosas definen el resultado: una lista clara de lo que contiene la toma y palabras concretas en vez de vagas.
Qué incluir en un prompt
| Elemento | Qué incluir | Ejemplo |
|---|---|---|
| Sujeto | Quién o qué está en cuadro, descrito de forma concreta | una presentadora con un suéter gris carbón |
| Movimiento | Qué se mueve y cómo | sonríe y mira a cámara |
| Cámara | Tipo de toma más un movimiento | plano medio, acercamiento lento |
| Audio | Diálogo, efectos, ambiente o música | dice: “Bienvenidos”; tono suave de sala |
| Duración | Duración del clip y relación de aspecto | 5 segundos, 16:9 |
Prompts débiles frente a prompts sólidos
Nombra la cámara, el movimiento y su tiempo, y el audio, en vez de dejarlos al azar.
| Enfoque | Débil | Sólido |
|---|---|---|
| Cámara | Una mujer en una ciudad de noche | Toma de seguimiento en cámara en mano siguiendo a una mujer por calles mojadas por la lluvia, reflejos de neón, poca profundidad de campo |
| Movimiento y tiempo | La puerta se abre y alguien entra | La puerta se abre lentamente, una figura entra tras una pausa y luego la cámara se estabiliza |
| Audio | Un chef emplatando un platillo | Primer plano de un chef emplatando un platillo, vapor subiendo. Audio: chisporroteo de la sartén, ambiente suave de cocina y “¡Servicio!” |
Ajustes que debes conocer
| Ajuste | Notas |
|---|---|
| Duración | De 1 a 15 segundos; mantén una acción por clip |
| Resolución | 480p o 720p |
| Relación de aspecto | Sigue tu imagen de entrada, o puedes fijar 16:9, 9:16 o 1:1 |
| Imágenes de referencia | Agrégalas para mantener un estilo o personaje entre clips |
| Secuencias más largas | Usa la extensión de video para continuar desde el último fotograma |
Errores comunes
- Dejar el prompt en silencio: escribe siempre al menos una indicación de sonido.
- Cámara vaga: “cinematográfico” no le dice nada al modelo; nombra la toma y el movimiento.
- Demasiado en un solo clip: una acción por clip, y luego extiende.
Preguntas frecuentes
Empieza con una imagen fija sólida en 16:9, mantén el prompt de movimiento corto y específico, nombra un solo movimiento de cámara e incluye siempre una indicación de audio. Mantén una acción por clip y usa la extensión de video para secuencias más largas.
Sí. El audio se genera de forma nativa junto con el video y se mantiene sincronizado con el movimiento. Una sola generación puede incluir diálogo con sincronización labial, efectos de sonido, ambiente y música, sin un paso de audio aparte.
Una imagen más un prompt de texto para convertir de imagen a video, o solo un prompt de texto para texto a video. También puedes pasar imágenes de referencia para guiar el estilo y el personaje, y continuar o modificar un clip existente con la extensión de video y la edición.
Los clips duran de 1 a 15 segundos a 480p o 720p, 24 fps. Para imagen a video, la relación de aspecto sigue tu imagen de entrada, y puedes fijar una relación para entrega horizontal, cuadrada o vertical.
Sí. Puedes escribir tu prompt en español y el modelo interpreta el diálogo, los efectos y las indicaciones de cámara igual que en inglés. Para el diálogo hablado, escribe las líneas exactamente como quieres que se escuchen y mantenlas cortas para una sincronización labial limpia.
