Happy Horse 1.1: guía completa, prompts y funciones

Happy Horse 1.1: guía completa, prompts y funciones

La guía completa de Happy Horse 1.1 en Morphic: qué hace el modelo de video con IA de Alibaba, sus especificaciones, audio nativo y lip-sync, referencia a video con hasta 9 sujetos, y cómo crear prompts con ejemplos.

Funciones y capacidades de Happy Horse 1.1

Happy Horse 1.1 es el modelo de video de Alibaba, disponible en fal y en Morphic. Genera video y audio juntos en una sola pasada, con lip-sync nativo en siete idiomas, y admite referencia a video con hasta nueve sujetos, nueve relaciones de aspecto y salida en 1080p.

FunciónQué haceIdeal para
Audio y video juntosGenera el clip y su audio sincronizado en una sola pasada, sin un paso de audio aparteEscenas de diálogo, clips musicales, bustos parlantes
Lip-sync multilingüeHabla y sincroniza labios en 7 idiomas, con formas de boca que siguen la fonéticaAnuncios localizados, presentadores multilingües
Referencia a video, hasta 9Lleva hasta nueve sujetos de referencia a una nueva escena, cada uno llamado por índiceEscenas de conjunto, series con personajes consistentes
Image-to-videoAnima un primer cuadro fijo hasta un clip en movimiento de 1080p con audioTomas de producto, key art, animación de fotos
Nueve relaciones de aspectoEntrega desde 16:9 y 9:16 hasta ultrawide 21:9, en nueve relacionesEntrega cinematográfica, vertical y cuadrada

Audio y video juntos en una sola pasada

Happy Horse genera la imagen y su sonido juntos, en vez de agregar el audio después. El diálogo hablado con lip-sync, el tono ambiente de sala, los efectos de sonido y la música salen de la misma generación, así que el movimiento y el sonido coinciden desde el primer cuadro. Describes el sonido en el mismo prompt que la acción.

Lip-sync nativo multilingüe

El modelo habla y sincroniza labios en inglés, mandarín, cantonés, japonés, coreano, alemán y francés. Las formas de boca siguen la fonética del idioma hablado en vez de ser aproximadas, lo que lo hace ideal para escenas de diálogo y versiones localizadas de la misma toma.

Referencia a video con hasta 9 sujetos

Pasa hasta nueve imágenes de referencia y refiérete a cada una por índice en el prompt, como character1 hasta character9, siguiendo el orden en que las subes. Con hasta nueve sujetos, un elenco completo puede mantenerse reconocible entre tomas. Describe cada sujeto, y luego la escena y la acción.

Image-to-video

Aporta un primer cuadro fijo, como una toma de producto o un cuadro de personaje, agrega un prompt que describa el movimiento y el sonido, y el modelo anima a partir de esa imagen manteniendo su iluminación y detalle. También corre text-to-video cuando no tienes una imagen de partida.

Nueve relaciones de aspecto

Entrega en nueve relaciones: 16:9, 9:16, 1:1, 4:3, 3:4, 21:9, 9:21, 5:4 y 4:5. El mismo marco de prompt produce un corte cinematográfico ultrawide y un corte vertical para redes sociales sin un workflow aparte por formato.

Especificaciones técnicas de Happy Horse 1.1

EspecificaciónHappy Horse 1.1
ProveedorAlibaba (disponible en fal)
ModosTexto a video, imagen a video, referencia a video
AudioNativo, sincronizado, con lip-sync multilingüe
Idiomas7 (inglés, mandarín, cantonés, japonés, coreano, alemán, francés)
Resolución720p o 1080p
Duración3 a 15 segundos (5 por defecto)
Relaciones de aspecto16:9, 9:16, 1:1, 4:3, 3:4, 21:9, 9:21, 5:4, 4:5
Imágenes de referenciaHasta 9 (character1 a character9)
Longitud del promptHasta 2,500 caracteres
LanzamientoJunio de 2026

Casos de uso de Happy Horse 1.1

Escenas de diálogo y busto parlante

Los personajes hablan con movimiento de labios sincronizado, tono de sala y timing, generados en una sola pasada. Escribe la línea en el prompt y el audio vuelve junto con el movimiento.

Escenas de conjunto con varios personajes

Lleva hasta nueve sujetos de imágenes de referencia a una sola escena, llamando a cada uno por índice para que todo el elenco se mantenga reconocible de toma en toma.

Videos musicales y clips de performance

Como el video y el audio se generan juntos, el movimiento cae en el beat desde la primera pasada. Arma un clip de performance con una banda sonora y movimiento sincronizado en una sola generación.

Cortes cinematográficos ultrawide

Usa la relación 21:9 para un cuadro cinematográfico panorámico, y entrega la misma escena como un vertical 9:16 a partir del mismo prompt.

Localización multilingüe de anuncios

Mantén la misma escena y los mismos personajes, y cambia el diálogo entre idiomas con lip-sync nativo, así un mismo tratamiento sale en varios mercados.

Cómo sacarle el máximo provecho a Happy Horse 1.1

Happy Horse premia un brief que nombre el movimiento y el sonido juntos, y un set limpio de imágenes de referencia cuando los personajes tienen que mantenerse consistentes. Unas pocas prácticas cargan la mayor parte de la calidad:

  • Nombra siempre el audio. Diálogo, efectos de sonido, ambiente o música en lenguaje simple, así el modelo genera sonido junto con el movimiento en vez de un clip mudo.
  • Escribe movimiento, no una foto. Describe cómo se mueven el sujeto y la cámara a lo largo del clip, no solo cómo se ve el cuadro en un instante.
  • Indexa tus referencias. Para referencia a video, refiérete a cada sujeto como character1, character2, y así sucesivamente, siguiendo el orden en que subes las imágenes de referencia.
  • Mantén las líneas cortas para un lip-sync limpio. Para personajes que hablan, usa un cuadro de frente con la boca visible y mantén cada línea hablada breve.
  • Un momento por clip. Concentra una sola acción en unos segundos en vez de amontonar varias en una generación.
  • Elige la relación de aspecto desde el inicio. Elige 21:9 para un corte cinematográfico o 9:16 para vertical, ya que el encuadre cambia cómo montas la acción.

Guía de prompts para Happy Horse 1.1

Un prompt fuerte se lee como un brief corto de toma, no como un pie de foto. Dos cosas determinan el resultado: una lista clara de qué contiene la toma, y palabras concretas en vez de palabras vagas.

Qué va en un prompt

ElementoQué incluirEjemplo
SujetoQuién o qué está en cuadro, descrito de forma concretaun presentador de noticias con traje azul marino en un escritorio de vidrio
MovimientoQué se mueve, y cómogira hacia una segunda cámara y hace un gesto
CámaraTipo de toma más un movimientoplano medio, push-in lento
AudioDiálogo, efectos, ambiente o músicadice, “Buenas noches”; tono suave de sala de estudio
FormatoDuración y relación de aspecto10 segundos, 16:9

Para referencia a video, refiérete a cada sujeto como character1, character2, y así sucesivamente, siguiendo el orden en que subes las imágenes de referencia. Para diálogo con tiempos, marca las líneas habladas contra la línea de tiempo del clip para que el lip-sync caiga donde quieres.

Referencia y diálogo con tiempos

character1 y character2 se sientan a una mesa de café, luz cálida de ventana. 0-4s: character1 dice en francés, "Tu as vu ça?"; 4-8s: character2 se ríe y responde, "Incroyable." Ambiente suave de café, cámara en mano suave.

Prompts débiles vs. prompts fuertes

Nombra la cámara, el movimiento y su tiempo, y el audio, en vez de dejarlos al azar.

EnfoqueDébilFuerte
CámaraUna mujer en una ciudad de nocheToma con cámara en mano siguiendo a una mujer por calles mojadas de lluvia, luces de tiendas reflejándose en el pavimento, poca profundidad de campo
Movimiento y tiempoLa puerta se abre y alguien entraLa puerta se abre lentamente, una figura entra tras una pausa, y luego la cámara se asienta en un plano medio
AudioUn chef emplatando un platilloPrimer plano de un chef emplatando un platillo, vapor subiendo. Audio: chisporroteo de sartén, ambiente suave de cocina y “¡Servicio!”

Errores comunes

  • Dejar el prompt en silencio: escribe siempre al menos una señal de sonido, ya que el modelo genera audio junto con el video.
  • Cámara vaga: “cinematográfico” no le dice nada al modelo; nombra la toma y el movimiento.
  • Referencias sin indexar: para referencia a video, etiqueta cada sujeto como character1, character2, en vez de “usa estas referencias”.
  • Demasiado en un clip: mantén una sola acción por clip, y mantén las líneas habladas cortas para un lip-sync limpio.

Precios simples

Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.

Basic

$9/ mes
facturado como $0 por año

900 mensual créditos

1 usuario

Todos los modelos

Workflows

Standard

$24/ mes
facturado como $0 por año

3200 mensual créditos

1 usuario

Todos los modelos

Workflows

Pro

$45/ mes
facturado como $0 por año

6200 compartidos mensual créditos

1 usuario

+ hasta 4 más con costo adicional

Todos los modelos

Workflows

Pro Max

$170/ mes
facturado como $0 por año

24000 compartidos mensual créditos

1 usuario

+ hasta 9 más con costo adicional

Todos los modelos

Workflows

Enterprise

Para límites más altos

Personalizado

términos de precios y facturación

Créditos de alto volumen
Límites de asientos personalizados
Todos los modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

gratis para siempre

Hasta 20 créditos
Solo 1 usuario
Modelos limitados
Workflows

Preguntas frecuentes

¿Cómo obtengo los mejores resultados con Happy Horse 1.1?
Nombra el audio en cada prompt, ya que Happy Horse 1.1 genera sonido junto con el video. Describe el movimiento en vez de un cuadro fijo, y da un tipo de toma con un solo movimiento de cámara. Para escenas con varios personajes, indexa cada sujeto como character1, character2, y mantén las líneas habladas cortas para un lip-sync limpio. Haz un borrador en 720p, y luego vuelve a generar la versión ganadora en 1080p.
¿Happy Horse 1.1 genera audio?
Sí. Happy Horse 1.1 genera audio junto con el video en una sola pasada, así que se mantiene sincronizado con el movimiento. Una generación puede incluir diálogo con lip-sync, efectos de sonido, ambiente y música, con lip-sync nativo en siete idiomas y sin un paso de audio aparte.
¿Cómo funciona la referencia a video en Happy Horse 1.1?
Pasa hasta nueve imágenes de referencia y refiérete a cada una por índice, como character1 hasta character9, siguiendo el orden en que las subes. Indica qué sujeto viene de qué imagen, y luego describe la escena y la acción. Happy Horse 1.1 lleva cada sujeto a la nueva escena, así que el elenco se mantiene reconocible de toma en toma.
¿Qué resoluciones, duraciones y relaciones de aspecto admite Happy Horse 1.1?
Happy Horse 1.1 entrega 720p o 1080p en clips de 3 a 15 segundos, con 5 segundos por defecto. Admite nueve relaciones de aspecto, incluidas 16:9, 9:16 y la ultrawide 21:9, además de 9:21, 5:4 y 4:5. Elige la relación primero, ya que el encuadre cambia cómo montas la acción.
¿Cómo uso Happy Horse 1.1 en Morphic?
Abre Morphic, cambia la barra de prompt al modo Video, y elige Happy Horse 1.1. Describe la escena, adjunta una imagen fija para image-to-video o hasta nueve imágenes de referencia para referencia a video, elige una resolución y una relación de aspecto, y luego ejecuta el prompt. El audio se genera en la misma pasada.