Happy Horse 1.1: Funktionen und Fähigkeiten
Happy Horse 1.1 ist das Videomodell von Alibaba, bereitgestellt über fal und verfügbar auf Morphic. Es erzeugt Video und Audio gemeinsam in einem Durchgang, mit nativer Lippensynchronisation in sieben Sprachen, und unterstützt Reference-to-Video mit bis zu neun Subjekten, neun Seitenverhältnissen und 1080p-Ausgabe.
| Funktion | Was es kann | Am besten für |
|---|---|---|
| Gemeinsame Audio- und Videoerzeugung | Erzeugt den Clip und die synchronisierte Audiospur in einem Durchgang, ganz ohne separaten Audioschritt | Dialogszenen, Musikclips, Talking-Heads |
| Mehrsprachige Lippensynchronisation | Spricht und synchronisiert die Lippen in 7 Sprachen, mit Mundformen, die zur Phonetik passen | Lokalisierte Werbespots, mehrsprachige Präsentatoren |
| Reference-to-Video mit bis zu 9 Subjekten | Überträgt bis zu neun Referenzsubjekte in eine neue Szene, jedes über einen Index ansprechbar | Ensembleszenen, Serien mit konsistenten Charakteren |
| Image-to-Video | Animiert ein Standbild als erstes Frame zu einem bewegten 1080p-Clip mit Audio | Produktaufnahmen, Keyart, Foto-Animation |
| Neun Seitenverhältnisse | Liefert von 16:9 und 9:16 bis Ultrawide 21:9, in neun Verhältnissen | Kinoreife, vertikale und quadratische Auslieferung |
Gemeinsame Audio- und Videoerzeugung in einem Durchgang
Happy Horse erzeugt das Bild und seinen Ton gemeinsam, statt Audio nachträglich hinzuzufügen. Gesprochener Dialog mit Lippensynchronisation, Raumton, Soundeffekte und Musik entstehen alle in derselben Generierung, sodass Bewegung und Ton vom ersten Frame an zusammenpassen. Sie beschreiben den Ton im selben Prompt wie die Handlung.
Native mehrsprachige Lippensynchronisation
Das Modell spricht und synchronisiert die Lippen in Englisch, Mandarin, Kantonesisch, Japanisch, Koreanisch, Deutsch und Französisch. Die Mundformen folgen der Phonetik der gesprochenen Sprache, statt nur angenähert zu werden, was es für Dialogszenen und lokalisierte Versionen derselben Aufnahme geeignet macht.
Reference-to-Video mit bis zu 9 Subjekten
Übergeben Sie bis zu neun Referenzbilder und sprechen Sie jedes im Prompt über seinen Index an, als character1 bis character9, passend zur Reihenfolge, in der Sie sie bereitstellen. Mit bis zu neun Subjekten bleibt eine ganze Besetzung über mehrere Aufnahmen hinweg erkennbar. Beschreiben Sie zunächst jedes Subjekt, dann die Szene und die Handlung.
Image-to-Video
Stellen Sie ein Standbild als erstes Frame bereit, etwa eine Produktaufnahme oder ein Charakterbild, fügen Sie einen Prompt hinzu, der die Bewegung und den Ton beschreibt, und das Modell animiert ausgehend von diesem Bild weiter, während Beleuchtung und Detailgrad erhalten bleiben. Ohne Startbild läuft es auch als Text-to-Video.
Neun Seitenverhältnisse
Liefern Sie in neun Seitenverhältnissen: 16:9, 9:16, 1:1, 4:3, 3:4, 21:9, 9:21, 5:4 und 4:5. Dasselbe Prompt-Gerüst erzeugt einen ultrabreiten Kinoschnitt und einen vertikalen Social-Schnitt, ganz ohne separaten Workflow pro Format.
Happy Horse 1.1: Technische Daten
| Technische Daten | Happy Horse 1.1 |
|---|---|
| Anbieter | Alibaba (bereitgestellt über fal) |
| Modi | Text-to-Video, Image-to-Video, Reference-to-Video |
| Audio | Nativ, synchronisiert, mit mehrsprachiger Lippensynchronisation |
| Sprachen | 7 (Englisch, Mandarin, Kantonesisch, Japanisch, Koreanisch, Deutsch, Französisch) |
| Auflösung | 720p oder 1080p |
| Dauer | 3 bis 15 Sekunden (Standard 5) |
| Seitenverhältnisse | 16:9, 9:16, 1:1, 4:3, 3:4, 21:9, 9:21, 5:4, 4:5 |
| Referenzbilder | Bis zu 9 (character1 bis character9) |
| Prompt-Länge | Bis zu 2.500 Zeichen |
| Veröffentlicht | Juni 2026 |
Happy Horse 1.1: Anwendungsfälle
Dialogszenen und Talking-Head-Aufnahmen
Charaktere sprechen mit synchronisierten Lippenbewegungen, Raumton und Timing, alles in einem Durchgang erzeugt. Schreiben Sie die Zeile in den Prompt, und die Audiospur kommt passend zur Bewegung zurück.
Ensembleszenen mit mehreren Charakteren
Übertragen Sie bis zu neun Subjekte aus Referenzbildern in eine einzige Szene und sprechen Sie jedes über seinen Index an, damit die gesamte Besetzung von Aufnahme zu Aufnahme erkennbar bleibt.
Musikvideos und Performance-Clips
Da Video und Audio gemeinsam erzeugt werden, sitzt die Bewegung bereits im ersten Durchgang auf dem Beat. Bauen Sie einen Performance-Clip mit Score und synchronisierter Bewegung in einer einzigen Generierung.
Ultrabreite Kino-Schnitte
Nutzen Sie das Seitenverhältnis 21:9 für ein kinoreifes Breitbild, und liefern Sie dieselbe Szene aus demselben Prompt als vertikale 9:16-Version.
Mehrsprachige Werbelokalisierung
Behalten Sie Szene und Charaktere bei und tauschen Sie die Dialoge zwischen Sprachen mit nativer Lippensynchronisation aus, sodass ein Treatment in mehreren Märkten läuft.
So holen Sie das Beste aus Happy Horse 1.1 heraus
Happy Horse belohnt ein Briefing, das Bewegung und Ton gemeinsam benennt, sowie einen sauberen Satz Referenzbilder, wenn Charaktere konsistent bleiben müssen. Ein paar Praktiken machen den größten Teil der Qualität aus:
- Benennen Sie immer die Audiospur. Dialog, Soundeffekte, Umgebungsgeräusche oder Musik in klarer Sprache, damit das Modell Ton zusammen mit der Bewegung erzeugt statt eines stummen Clips.
- Beschreiben Sie Bewegung, kein Foto. Beschreiben Sie, wie sich Subjekt und Kamera über den Clip hinweg bewegen, nicht nur, wie das Bild in einem einzelnen Moment aussieht.
- Indexieren Sie Ihre Referenzen. Sprechen Sie bei Reference-to-Video jedes Subjekt als character1, character2 und so weiter an, passend zur Reihenfolge, in der Sie die Referenzbilder bereitstellen.
- Halten Sie Zeilen kurz für eine saubere Lippensynchronisation. Verwenden Sie bei sprechenden Charakteren ein frontales Bild mit sichtbarem Mund und halten Sie jede gesprochene Zeile kurz.
- Ein Beat pro Clip. Packen Sie eine einzelne Aktion in wenige Sekunden, statt mehrere in eine Generierung zu drängen.
- Legen Sie das Seitenverhältnis vorab fest. Wählen Sie 21:9 für einen kinoreifen Schnitt oder 9:16 für vertikal, denn der Bildausschnitt bestimmt, wie Sie die Handlung inszenieren.
Happy Horse 1.1: Prompt-Guide
Ein starker Prompt liest sich wie ein kurzes Einstellungs-Briefing, nicht wie eine Bildunterschrift. Zwei Dinge bestimmen das Ergebnis: eine klare Liste dessen, was die Einstellung enthält, und konkrete Formulierungen statt vager Angaben.
Was in einen Prompt gehört
| Element | Was hinein gehört | Beispiel |
|---|---|---|
| Subjekt | Wer oder was im Bild ist, konkret beschrieben | eine Nachrichtensprecherin in einem marineblauen Anzug an einem Glastisch |
| Bewegung | Was sich bewegt, und wie | sie dreht sich zu einer zweiten Kamera und gestikuliert |
| Kamera | Einstellungsgröße plus eine Bewegung | Halbtotale, langsamer Push-in |
| Audio | Dialog, Effekte, Umgebungsgeräusche oder Musik | sie sagt: „Guten Abend“; leiser Studio-Raumton |
| Format | Dauer und Seitenverhältnis | 10 Sekunden, 16:9 |
Referenz- und Dialogsyntax
Sprechen Sie bei Reference-to-Video jedes Subjekt als character1, character2 und so weiter an, passend zur Reihenfolge, in der Sie die Referenzbilder bereitstellen. Markieren Sie bei zeitgesteuertem Dialog die gesprochenen Zeilen entlang der Timeline des Clips, damit die Lippensynchronisation genau dort sitzt, wo Sie sie haben möchten.
character1 und character2 sitzen sich an einem Cafétisch gegenüber, warmes Fensterlicht. 0-4s: character1 sagt auf Französisch: „Tu as vu ça?“; 4-8s: character2 lacht und antwortet: „Incroyable.“ Sanfte Café-Atmosphäre, leichtes Handheld.
Schwache vs. starke Prompts
Benennen Sie die Kamera, die Bewegung mit ihrem Timing und den Ton, statt sie dem Zufall zu überlassen.
| Fokus | Schwach | Stark |
|---|---|---|
| Kamera | Eine Frau in einer Stadt bei Nacht | Handheld-Kamerafahrt, die eine Frau durch regennasse Straßen verfolgt, Schaufensterlichter spiegeln sich auf dem Asphalt, geringe Schärfentiefe |
| Bewegung und Timing | Die Tür öffnet sich, und jemand kommt herein | Die Tür schwingt langsam auf, eine Gestalt tritt nach einem kurzen Moment hindurch, dann geht die Kamera in eine Halbtotale über |
| Audio | Ein Koch richtet ein Gericht an | Nahaufnahme eines Kochs, der ein Gericht anrichtet, Dampf steigt auf. Audio: zischende Pfanne, leiser Küchenraumton und „Service.“ |
Häufige Fehler
- Den Prompt stumm lassen: Schreiben Sie immer mindestens einen Sound-Hinweis, da das Modell Audio zusammen mit dem Video erzeugt.
- Vage Kameraangaben: „Kinoreif“ sagt dem Modell nichts; benennen Sie die Einstellungsgröße und die Bewegung.
- Nicht indexierte Referenzen: Kennzeichnen Sie bei Reference-to-Video jedes Subjekt als character1, character2, statt „diese Referenzen verwenden“.
- Zu viel in einem Clip: Beschränken Sie sich auf eine Aktion pro Clip, und halten Sie gesprochene Zeilen kurz für eine saubere Lippensynchronisation.

