Happy Horse 1.1: guia completo, prompts e recursos

Happy Horse 1.1: guia completo, prompts e recursos

Guia completo do Happy Horse 1.1 no Morphic: o que o modelo de áudio e vídeo conjunto da Alibaba faz, suas especificações, áudio nativo e lip-sync, referência para vídeo com até 9 personagens, e como criar prompts com exemplos.

Recursos e capacidades do Happy Horse 1.1

O Happy Horse 1.1 é o modelo de vídeo da Alibaba, servido no fal e disponível no Morphic. Ele gera vídeo e áudio juntos em uma única passagem, com lip-sync nativo em sete idiomas, e aceita referência para vídeo com até nove personagens, nove proporções de tela e saída em 1080p.

RecursoO que fazMelhor para
Áudio e vídeo conjuntosGera o clipe e o áudio sincronizado em uma única passagem, sem uma etapa separada de áudioCenas de diálogo, clipes musicais, apresentadores falando
Lip-sync multilíngueFala e sincroniza os lábios em 7 idiomas, com formatos de boca que seguem a fonéticaAnúncios localizados, apresentadores multilíngues
Referência para vídeo, até 9Leva até nove personagens de referência para uma nova cena, cada um chamado pelo índiceCenas com elenco, séries com personagens consistentes
Imagem para vídeoAnima um primeiro quadro estático em um clipe em movimento de 1080p com áudioFotos de produto, key art, animação de fotos
Nove proporções de telaEntrega de 16:9 e 9:16 até o ultrawide 21:9, em nove proporçõesEntrega cinematográfica, vertical e quadrada

Áudio e vídeo juntos em uma única passagem

O Happy Horse gera a imagem e o som juntos, em vez de adicionar áudio depois. Diálogo falado com lip-sync, tom ambiente, efeitos sonoros e música saem todos da mesma geração, então o movimento e o som se alinham desde o primeiro quadro. Você descreve o som no mesmo prompt que a ação.

Lip-sync nativo multilíngue

O modelo fala e sincroniza os lábios em inglês, mandarim, cantonês, japonês, coreano, alemão e francês. Os formatos de boca seguem a fonética do idioma falado em vez de serem aproximados, o que o torna ideal para cenas de diálogo e versões localizadas do mesmo plano.

Referência para vídeo com até 9 personagens

Envie até nove imagens de referência e refira-se a cada uma pelo índice no prompt, como character1 até character9, seguindo a ordem em que você as envia. Com até nove personagens, um elenco completo pode se manter reconhecível entre os planos. Descreva cada personagem e depois a cena e a ação.

Imagem para vídeo

Forneça um primeiro quadro estático, como uma foto de produto ou um quadro de personagem, adicione um prompt descrevendo o movimento e o som, e o modelo anima a partir dessa imagem mantendo sua iluminação e seus detalhes. Ele também roda texto para vídeo quando você não tem uma imagem inicial.

Nove proporções de tela

Entregue em nove proporções: 16:9, 9:16, 1:1, 4:3, 3:4, 21:9, 9:21, 5:4 e 4:5. A mesma estrutura de prompt produz um corte cinematográfico ultrawide e um corte vertical para redes sociais sem um workflow separado por formato.

Especificações técnicas do Happy Horse 1.1

EspecificaçãoHappy Horse 1.1
ProvedorAlibaba (servido no fal)
ModosTexto para vídeo, imagem para vídeo, referência para vídeo
ÁudioNativo, sincronizado, com lip-sync multilíngue
Idiomas7 (inglês, mandarim, cantonês, japonês, coreano, alemão, francês)
Resolução720p ou 1080p
DuraçãoDe 3 a 15 segundos (padrão de 5)
Proporções de tela16:9, 9:16, 1:1, 4:3, 3:4, 21:9, 9:21, 5:4, 4:5
Imagens de referênciaAté 9 (character1 a character9)
Tamanho do promptAté 2.500 caracteres
Lançamentojunho de 2026

Casos de uso do Happy Horse 1.1

Cenas de diálogo e apresentador falando

Os personagens falam com movimento labial sincronizado, tom ambiente e timing, tudo gerado em uma única passagem. Escreva a fala no prompt e o áudio vem junto com o movimento.

Cenas de elenco com vários personagens

Leve até nove personagens de imagens de referência para uma única cena, chamando cada um pelo índice para que todo o elenco fique reconhecível de plano a plano.

Videoclipes e clipes de performance

Como o vídeo e o áudio são gerados juntos, o movimento cai no tempo certo desde a primeira passagem. Monte um clipe de performance com trilha sonora e movimento sincronizado em uma única geração.

Cortes cinematográficos ultrawide

Use a proporção 21:9 para um quadro cinematográfico widescreen, depois entregue a mesma cena em 9:16 vertical a partir do mesmo prompt.

Localização de anúncios multilíngues

Mantenha a mesma cena e os mesmos personagens e troque o diálogo entre idiomas com lip-sync nativo, para que um único tratamento chegue a vários mercados.

Como tirar o melhor proveito do Happy Horse 1.1

O Happy Horse recompensa um briefing que nomeia o movimento e o som juntos, além de um conjunto limpo de imagens de referência quando os personagens precisam se manter consistentes. Algumas práticas carregam a maior parte da qualidade:

  • Sempre nomeie o áudio. Diálogo, efeitos sonoros, ambiente ou música em linguagem simples, para que o modelo gere som junto com o movimento em vez de um clipe mudo.
  • Escreva o movimento, não uma foto. Descreva como o personagem e a câmera se movem ao longo do clipe, não apenas como o quadro parece em um único instante.
  • Indexe suas referências. Para referência para vídeo, refira-se a cada personagem como character1, character2, e assim por diante, seguindo a ordem em que você envia as imagens de referência.
  • Mantenha as falas curtas para um lip-sync limpo. Para personagens falando, use um quadro de frente com a boca visível e mantenha cada fala breve.
  • Um momento por clipe. Concentre uma única ação em poucos segundos, em vez de lotar várias em uma única geração.
  • Escolha a proporção antes. Opte por 21:9 para um corte cinematográfico ou 9:16 para vertical, já que o enquadramento muda a forma como você monta a ação.

Guia de prompts do Happy Horse 1.1

Um prompt forte se lê como um breve briefing de plano, não como uma legenda. Duas coisas conduzem o resultado: uma lista clara do que o plano contém, e uma linguagem concreta no lugar de termos vagos.

O que entra em um prompt

ElementoO que incluirExemplo
PersonagemQuem ou o que está no quadro, descrito de forma concretaa news anchor in a navy suit at a glass desk
MovimentoO que se move, e comohe turns to a second camera and gestures
CâmeraTipo de plano mais um movimentomedium shot, slow push-in
ÁudioDiálogo, efeitos, ambiente ou músicahe says, 'Good evening'; soft studio room tone
FormatoDuração e proporção de tela10 seconds, 16:9

Para referência para vídeo, refira-se a cada personagem como character1, character2, e assim por diante, seguindo a ordem em que você envia as imagens de referência. Para diálogo com tempo marcado, indique as falas na linha do tempo do clipe para que o lip-sync caia onde você quer.

Referência e diálogo com tempo marcado

character1 and character2 sit across a café table, warm window light. 0-4s: character1 says in French, "Tu as vu ça?"; 4-8s: character2 laughs and replies, "Incroyable." Soft café ambience, gentle handheld.

Prompts fracos vs fortes

Nomeie a câmera, o movimento e seu tempo, e o áudio, em vez de deixá-los ao acaso.

FocoFracoForte
CâmeraA woman in a city at nightHandheld tracking shot following a woman through rain-slicked streets, shop lights reflecting on the pavement, shallow depth of field
Movimento e tempoThe door opens and someone walks inThe door swings open slowly, a figure steps through after a beat, then the camera settles into a medium shot
ÁudioA chef plating a dishClose-up of a chef plating a dish, steam rising. Audio: pan sizzle, soft kitchen ambience, and 'Service.'

Erros comuns

  • Deixar o prompt mudo: sempre escreva pelo menos uma indicação sonora, já que o modelo gera áudio junto com o vídeo.
  • Câmera vaga: "cinematic" não diz nada ao modelo; nomeie o plano e o movimento.
  • Referências sem índice: para referência para vídeo, identifique cada personagem como character1, character2, em vez de "use essas referências".
  • Excesso em um clipe: mantenha uma ação por clipe, e mantenha as falas curtas para um lip-sync limpo.

Preços simples

Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.

Basic

$9/ mês
cobrado como $0 por ano

900 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Standard

$24/ mês
cobrado como $0 por ano

3200 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Pro

$45/ mês
cobrado como $0 por ano

6200 compartilhado mensal créditos

1 usuário

+ até 4 mais com custo adicional

Todos os modelos

Workflows

Pro Max

$170/ mês
cobrado como $0 por ano

24000 compartilhado mensal créditos

1 usuário

+ até 9 mais com custo adicional

Todos os modelos

Workflows

Enterprise

Para limites maiores

Personalizado

termos de preços e cobrança

Créditos de alto volume
Limites de vagas personalizados
Todos os modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

grátis para sempre

Até 20 créditos
apenas 1 usuário
Modelos limitados
Workflows

Perguntas frequentes

Como obter os melhores resultados no Happy Horse 1.1?
Nomeie o áudio em todo prompt, já que o Happy Horse 1.1 gera som junto com o vídeo. Descreva o movimento em vez de um quadro estático, e dê um tipo de plano com um movimento de câmera. Para cenas com vários personagens, indexe cada um como character1, character2, e mantenha as falas curtas para um lip-sync limpo. Faça o rascunho em 720p e depois rode o melhor resultado em 1080p.
O Happy Horse 1.1 gera áudio?
Sim. O Happy Horse 1.1 gera áudio junto com o vídeo em uma única passagem, então o som se mantém sincronizado com o movimento. Uma geração pode incluir diálogo com lip-sync, efeitos sonoros, ambiente e música, com lip-sync nativo em sete idiomas e sem uma etapa separada de áudio.
Como funciona a referência para vídeo no Happy Horse 1.1?
Envie até nove imagens de referência e refira-se a cada uma pelo índice, como character1 até character9, seguindo a ordem em que você as envia. Diga qual personagem vem de qual imagem, e depois descreva a cena e a ação. O Happy Horse 1.1 leva cada personagem para a nova cena, de forma que o elenco se mantém reconhecível de plano a plano.
Quais resoluções, durações e proporções de tela o Happy Horse 1.1 suporta?
O Happy Horse 1.1 gera em 720p ou 1080p em clipes de 3 a 15 segundos, com padrão de 5 segundos. Ele suporta nove proporções de tela, incluindo 16:9, 9:16 e o ultrawide 21:9, além de 9:21, 5:4 e 4:5. Escolha a proporção antes, já que o enquadramento muda a forma como você monta a ação.
Como usar o Happy Horse 1.1 no Morphic?
Abra o Morphic, mude a barra de prompt para o modo de vídeo, e escolha o Happy Horse 1.1. Descreva a cena, anexe uma imagem estática para imagem para vídeo ou até nove imagens de referência para referência para vídeo, escolha uma resolução e uma proporção de tela, e rode o prompt. O áudio é gerado na mesma passagem.