Happy Horse 1.1: Kompletter Guide, Prompts und Funktionen

Happy Horse 1.1: Kompletter Guide, Prompts und Funktionen

Der komplette Happy Horse 1.1 Guide auf Morphic: was das gemeinsame Audio-Video-Modell von Alibaba leistet, die technischen Daten, native Audioerzeugung und Lippensynchronisation sowie Reference-to-Video mit bis zu 9 Subjekten und Prompting mit Beispielen.

Happy Horse 1.1: Funktionen und Fähigkeiten

Happy Horse 1.1 ist das Videomodell von Alibaba, bereitgestellt über fal und verfügbar auf Morphic. Es erzeugt Video und Audio gemeinsam in einem Durchgang, mit nativer Lippensynchronisation in sieben Sprachen, und unterstützt Reference-to-Video mit bis zu neun Subjekten, neun Seitenverhältnissen und 1080p-Ausgabe.

FunktionWas es kannAm besten für
Gemeinsame Audio- und VideoerzeugungErzeugt den Clip und die synchronisierte Audiospur in einem Durchgang, ganz ohne separaten AudioschrittDialogszenen, Musikclips, Talking-Heads
Mehrsprachige LippensynchronisationSpricht und synchronisiert die Lippen in 7 Sprachen, mit Mundformen, die zur Phonetik passenLokalisierte Werbespots, mehrsprachige Präsentatoren
Reference-to-Video mit bis zu 9 SubjektenÜberträgt bis zu neun Referenzsubjekte in eine neue Szene, jedes über einen Index ansprechbarEnsembleszenen, Serien mit konsistenten Charakteren
Image-to-VideoAnimiert ein Standbild als erstes Frame zu einem bewegten 1080p-Clip mit AudioProduktaufnahmen, Keyart, Foto-Animation
Neun SeitenverhältnisseLiefert von 16:9 und 9:16 bis Ultrawide 21:9, in neun VerhältnissenKinoreife, vertikale und quadratische Auslieferung

Gemeinsame Audio- und Videoerzeugung in einem Durchgang

Happy Horse erzeugt das Bild und seinen Ton gemeinsam, statt Audio nachträglich hinzuzufügen. Gesprochener Dialog mit Lippensynchronisation, Raumton, Soundeffekte und Musik entstehen alle in derselben Generierung, sodass Bewegung und Ton vom ersten Frame an zusammenpassen. Sie beschreiben den Ton im selben Prompt wie die Handlung.

Native mehrsprachige Lippensynchronisation

Das Modell spricht und synchronisiert die Lippen in Englisch, Mandarin, Kantonesisch, Japanisch, Koreanisch, Deutsch und Französisch. Die Mundformen folgen der Phonetik der gesprochenen Sprache, statt nur angenähert zu werden, was es für Dialogszenen und lokalisierte Versionen derselben Aufnahme geeignet macht.

Reference-to-Video mit bis zu 9 Subjekten

Übergeben Sie bis zu neun Referenzbilder und sprechen Sie jedes im Prompt über seinen Index an, als character1 bis character9, passend zur Reihenfolge, in der Sie sie bereitstellen. Mit bis zu neun Subjekten bleibt eine ganze Besetzung über mehrere Aufnahmen hinweg erkennbar. Beschreiben Sie zunächst jedes Subjekt, dann die Szene und die Handlung.

Image-to-Video

Stellen Sie ein Standbild als erstes Frame bereit, etwa eine Produktaufnahme oder ein Charakterbild, fügen Sie einen Prompt hinzu, der die Bewegung und den Ton beschreibt, und das Modell animiert ausgehend von diesem Bild weiter, während Beleuchtung und Detailgrad erhalten bleiben. Ohne Startbild läuft es auch als Text-to-Video.

Neun Seitenverhältnisse

Liefern Sie in neun Seitenverhältnissen: 16:9, 9:16, 1:1, 4:3, 3:4, 21:9, 9:21, 5:4 und 4:5. Dasselbe Prompt-Gerüst erzeugt einen ultrabreiten Kinoschnitt und einen vertikalen Social-Schnitt, ganz ohne separaten Workflow pro Format.

Happy Horse 1.1: Technische Daten

Technische DatenHappy Horse 1.1
AnbieterAlibaba (bereitgestellt über fal)
ModiText-to-Video, Image-to-Video, Reference-to-Video
AudioNativ, synchronisiert, mit mehrsprachiger Lippensynchronisation
Sprachen7 (Englisch, Mandarin, Kantonesisch, Japanisch, Koreanisch, Deutsch, Französisch)
Auflösung720p oder 1080p
Dauer3 bis 15 Sekunden (Standard 5)
Seitenverhältnisse16:9, 9:16, 1:1, 4:3, 3:4, 21:9, 9:21, 5:4, 4:5
ReferenzbilderBis zu 9 (character1 bis character9)
Prompt-LängeBis zu 2.500 Zeichen
VeröffentlichtJuni 2026

Happy Horse 1.1: Anwendungsfälle

Dialogszenen und Talking-Head-Aufnahmen

Charaktere sprechen mit synchronisierten Lippenbewegungen, Raumton und Timing, alles in einem Durchgang erzeugt. Schreiben Sie die Zeile in den Prompt, und die Audiospur kommt passend zur Bewegung zurück.

Ensembleszenen mit mehreren Charakteren

Übertragen Sie bis zu neun Subjekte aus Referenzbildern in eine einzige Szene und sprechen Sie jedes über seinen Index an, damit die gesamte Besetzung von Aufnahme zu Aufnahme erkennbar bleibt.

Musikvideos und Performance-Clips

Da Video und Audio gemeinsam erzeugt werden, sitzt die Bewegung bereits im ersten Durchgang auf dem Beat. Bauen Sie einen Performance-Clip mit Score und synchronisierter Bewegung in einer einzigen Generierung.

Ultrabreite Kino-Schnitte

Nutzen Sie das Seitenverhältnis 21:9 für ein kinoreifes Breitbild, und liefern Sie dieselbe Szene aus demselben Prompt als vertikale 9:16-Version.

Mehrsprachige Werbelokalisierung

Behalten Sie Szene und Charaktere bei und tauschen Sie die Dialoge zwischen Sprachen mit nativer Lippensynchronisation aus, sodass ein Treatment in mehreren Märkten läuft.

So holen Sie das Beste aus Happy Horse 1.1 heraus

Happy Horse belohnt ein Briefing, das Bewegung und Ton gemeinsam benennt, sowie einen sauberen Satz Referenzbilder, wenn Charaktere konsistent bleiben müssen. Ein paar Praktiken machen den größten Teil der Qualität aus:

  • Benennen Sie immer die Audiospur. Dialog, Soundeffekte, Umgebungsgeräusche oder Musik in klarer Sprache, damit das Modell Ton zusammen mit der Bewegung erzeugt statt eines stummen Clips.
  • Beschreiben Sie Bewegung, kein Foto. Beschreiben Sie, wie sich Subjekt und Kamera über den Clip hinweg bewegen, nicht nur, wie das Bild in einem einzelnen Moment aussieht.
  • Indexieren Sie Ihre Referenzen. Sprechen Sie bei Reference-to-Video jedes Subjekt als character1, character2 und so weiter an, passend zur Reihenfolge, in der Sie die Referenzbilder bereitstellen.
  • Halten Sie Zeilen kurz für eine saubere Lippensynchronisation. Verwenden Sie bei sprechenden Charakteren ein frontales Bild mit sichtbarem Mund und halten Sie jede gesprochene Zeile kurz.
  • Ein Beat pro Clip. Packen Sie eine einzelne Aktion in wenige Sekunden, statt mehrere in eine Generierung zu drängen.
  • Legen Sie das Seitenverhältnis vorab fest. Wählen Sie 21:9 für einen kinoreifen Schnitt oder 9:16 für vertikal, denn der Bildausschnitt bestimmt, wie Sie die Handlung inszenieren.

Happy Horse 1.1: Prompt-Guide

Ein starker Prompt liest sich wie ein kurzes Einstellungs-Briefing, nicht wie eine Bildunterschrift. Zwei Dinge bestimmen das Ergebnis: eine klare Liste dessen, was die Einstellung enthält, und konkrete Formulierungen statt vager Angaben.

Was in einen Prompt gehört

ElementWas hinein gehörtBeispiel
SubjektWer oder was im Bild ist, konkret beschriebeneine Nachrichtensprecherin in einem marineblauen Anzug an einem Glastisch
BewegungWas sich bewegt, und wiesie dreht sich zu einer zweiten Kamera und gestikuliert
KameraEinstellungsgröße plus eine BewegungHalbtotale, langsamer Push-in
AudioDialog, Effekte, Umgebungsgeräusche oder Musiksie sagt: „Guten Abend“; leiser Studio-Raumton
FormatDauer und Seitenverhältnis10 Sekunden, 16:9

Referenz- und Dialogsyntax

Sprechen Sie bei Reference-to-Video jedes Subjekt als character1, character2 und so weiter an, passend zur Reihenfolge, in der Sie die Referenzbilder bereitstellen. Markieren Sie bei zeitgesteuertem Dialog die gesprochenen Zeilen entlang der Timeline des Clips, damit die Lippensynchronisation genau dort sitzt, wo Sie sie haben möchten.

Referenz und zeitgesteuerter Dialog

character1 und character2 sitzen sich an einem Cafétisch gegenüber, warmes Fensterlicht. 0-4s: character1 sagt auf Französisch: „Tu as vu ça?“; 4-8s: character2 lacht und antwortet: „Incroyable.“ Sanfte Café-Atmosphäre, leichtes Handheld.

Schwache vs. starke Prompts

Benennen Sie die Kamera, die Bewegung mit ihrem Timing und den Ton, statt sie dem Zufall zu überlassen.

FokusSchwachStark
KameraEine Frau in einer Stadt bei NachtHandheld-Kamerafahrt, die eine Frau durch regennasse Straßen verfolgt, Schaufensterlichter spiegeln sich auf dem Asphalt, geringe Schärfentiefe
Bewegung und TimingDie Tür öffnet sich, und jemand kommt hereinDie Tür schwingt langsam auf, eine Gestalt tritt nach einem kurzen Moment hindurch, dann geht die Kamera in eine Halbtotale über
AudioEin Koch richtet ein Gericht anNahaufnahme eines Kochs, der ein Gericht anrichtet, Dampf steigt auf. Audio: zischende Pfanne, leiser Küchenraumton und „Service.“

Häufige Fehler

  • Den Prompt stumm lassen: Schreiben Sie immer mindestens einen Sound-Hinweis, da das Modell Audio zusammen mit dem Video erzeugt.
  • Vage Kameraangaben: „Kinoreif“ sagt dem Modell nichts; benennen Sie die Einstellungsgröße und die Bewegung.
  • Nicht indexierte Referenzen: Kennzeichnen Sie bei Reference-to-Video jedes Subjekt als character1, character2, statt „diese Referenzen verwenden“.
  • Zu viel in einem Clip: Beschränken Sie sich auf eine Aktion pro Clip, und halten Sie gesprochene Zeilen kurz für eine saubere Lippensynchronisation.

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$9/ Monat
abgerechnet als $0 pro Jahr

900 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3200 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6200 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Pro Max

$170/ Monat
abgerechnet als $0 pro Jahr

24000 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Wie erhalte ich mit Happy Horse 1.1 die besten Ergebnisse?
Benennen Sie die Audiospur in jedem Prompt, denn Happy Horse 1.1 erzeugt den Ton zusammen mit dem Video. Beschreiben Sie eine Bewegung statt eines Standbilds, und geben Sie eine Einstellungsgröße mit einer Kamerabewegung an. Bei Szenen mit mehreren Charakteren indexieren Sie jedes Subjekt als character1, character2, und halten Sie gesprochene Zeilen kurz für eine saubere Lippensynchronisation. Erstellen Sie zunächst einen Entwurf in 720p und rendern Sie den besten Take dann in 1080p neu.
Erzeugt Happy Horse 1.1 auch Audio?
Ja. Happy Horse 1.1 erzeugt Audio zusammen mit dem Video in einem einzigen Durchgang, sodass es synchron zur Bewegung bleibt. Eine Generierung kann lippensynchronen Dialog, Soundeffekte, Umgebungsgeräusche und Musik enthalten, mit nativer Lippensynchronisation in sieben Sprachen und ohne separaten Audioschritt.
Wie funktioniert Reference-to-Video bei Happy Horse 1.1?
Übergeben Sie bis zu neun Referenzbilder und sprechen Sie jedes über seinen Index an, als character1 bis character9, passend zur Reihenfolge, in der Sie sie bereitstellen. Geben Sie an, welches Subjekt aus welchem Bild stammt, und beschreiben Sie dann die Szene und die Handlung. Happy Horse 1.1 überträgt jedes Subjekt in die neue Szene, sodass eine Besetzung von Aufnahme zu Aufnahme wiedererkennbar bleibt.
Welche Auflösungen, Längen und Seitenverhältnisse unterstützt Happy Horse 1.1?
Happy Horse 1.1 liefert 720p oder 1080p in Clips von 3 bis 15 Sekunden, mit 5 Sekunden als Standard. Es unterstützt neun Seitenverhältnisse, darunter 16:9, 9:16 und Ultrawide 21:9, sowie 9:21, 5:4 und 4:5. Wählen Sie zuerst das Seitenverhältnis, denn der Bildausschnitt bestimmt, wie Sie die Handlung inszenieren.
Wie nutze ich Happy Horse 1.1 auf Morphic?
Öffnen Sie Morphic, stellen Sie die Prompt-Leiste auf den Video-Modus um, und wählen Sie Happy Horse 1.1 aus. Beschreiben Sie die Szene, hängen Sie ein Standbild für Image-to-Video oder bis zu neun Referenzbilder für Reference-to-Video an, wählen Sie Auflösung und Seitenverhältnis, und starten Sie den Prompt. Audio wird im selben Durchgang erzeugt.