Happy Horse 1.1
par Alibaba
Le modèle vidéo d'Alibaba.
Audio synchronisé et synchronisation labiale native, générés en une seule passe.

Fonctionnalités clés
Spécifications techniques
1080p
Rendu en 1080p pour la livraison, ou 720p pour ébaucher plus vite.
3–15s
Chaque clip dure de 3 à 15 secondes, avec une valeur par défaut de 5 secondes.
7
Synchro labiale native dans sept langues, ajustée à la phonétique de chacune.
Jusqu'à 9
Apportez jusqu'à neuf sujets, chacun appelé par son index dans le prompt.
Cas d'utilisation
Scènes portées par le dialogue
Les personnages parlent dans l'une des 7 langues avec mouvement labial synchronisé, son d'ambiance et timing, générés ensemble en une seule passe.
Récits multi-personnages
Conservez jusqu'à neuf sujets issus d'images de référence et reportez-les de scène en scène, en appelant chacun par son index pour un ensemble qui reste reconnaissable.
Spots publicitaires et campagnes
Le contrôle par référence garde produit, talents et visuels de marque constants d'un plan à l'autre, avec audio et mouvement synchronisés.
Clips musicaux et performance
Vidéo et audio générés ensemble, le mouvement tombe sur le rythme dès la première passe, sans travail de synchro manuel ensuite.
Ultra-large et vertical
Livrez la même scène en montage cinématique 21:9 et en vertical 9:16 parmi neuf formats, sans flux séparé par format.
Localisation multilingue
Même scène, mêmes personnages, dialogue changé d'une langue à l'autre avec synchro labiale native, adapté aux campagnes mondiales.
Exemples de prompts
Scène de dialogue
Deux amis riant dans un café parisien, dialogue en français, caméra à l'épaule
Edit promptClip de performance
Violoncelliste sur un toit au coucher du soleil, partition orchestrale ample
Edit promptScène d'ensemble
Trois amis trinquent à un dîner sur le toit, verres qui s'entrechoquent, rires
Edit promptCinématique ultra-large
Randonneur solitaire sur une crête à l'aube, 21:9, vent et chants d'oiseaux
Edit promptAperçu
Happy Horse 1.1 est le modèle vidéo d'Alibaba, servi sur fal et disponible sur Morphic. Il génère la vidéo et l'audio conjointement en une seule passe, produisant des clips 1080p de 3 à 15 secondes avec une synchronisation labiale native dans sept langues. Son contrôle par référence à travers les entrées texte, image et référence convient aux scènes de dialogue, aux clips de performance et au travail narratif à personnages constants.
Reference-to-video et livraison
Happy Horse 1.1 reporte jusqu'à neuf sujets de référence dans une scène, chacun appelé par son index de character1 à character9, ce qui ouvre le travail d'ensemble et multi-personnages. Il livre dans neuf formats d'image, du 16:9 et 9:16 à l'ultra-large 21:9, plus 9:21, 5:4 et 4:5.
Happy Horse 1.1 sur Morphic
Sur Morphic, Happy Horse 1.1 se trouve dans le sélecteur de modèle vidéo aux côtés de Seedance 2.0, Veo, Kling et du reste du catalogue vidéo. Basculez la barre de prompt en mode Vidéo, choisissez Happy Horse 1.1, joignez une image fixe ou jusqu'à neuf images de référence, et générez un clip avec audio synchronisé en une seule passe.
Tarifs simples
Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.
Basic
1100 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Standard
3625 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Pro
6350 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Pro Max
24650 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Enterprise
Pour des limites plus élevées
Personnalisé
conditions de tarification et de facturation

Free
Pour expérimenter
$0
gratuit pour toujours
Questions fréquentes
ChatGPT Images 2.5
OpenAI
Le modèle d'image d'OpenAI, sorti en septembre 2026. Plus de détail, des retouches ciblées, plus de vitesse.
Lyria 3.5
Google DeepMind
Le meilleur modèle musical de Google. Des chansons entières, voix et paroles.
MiniMax H3 Max Turbo
fal.ai
Le palier rapide du H3 signé fal. Deux fois plus vite, rendu quasi égal.
Inworld TTS 2
Inworld
95 voix, plus de 100 langues. La voix part en moins d’une seconde.