Recursos e capacidades do MiniMax H3
O MiniMax H3, também chamado de Hailuo 3.0 ou Hailuo 03, é o modelo de vídeo multimodal de peso aberto da MiniMax. Em vez de um modelo para gerar, outro para editar e um terceiro para seguir referência, o H3 lê texto, imagem, vídeo e áudio como um único contexto. O resultado é um clipe audiovisual pronto, ideal para quem produz anúncios, Reels ou vídeos para YouTube sem depender de várias ferramentas separadas.
| Recurso | O que faz | Melhor para |
|---|---|---|
| Referência omni | Lê até 9 imagens, 3 vídeos e 3 áudios como um único briefing | Fixar rosto, movimento e voz ao mesmo tempo |
| Áudio estéreo nativo | Gera diálogo, efeitos e ambientação junto com a imagem | Dramas, anúncios e vinhetas que precisam de som |
| Edição por instruções | Muda só o elemento que você nomear e mantém o resto do quadro | Corrigir um take bom sem regerar tudo |
| Clonagem e transferência de voz | Dá a um personagem uma voz tirada de uma gravação de referência | Dublagem, refazer uma fala, trocar de idioma |
| Vários planos em um clipe | Vários planos dentro de uma única geração de 5 a 15 segundos | Sequências de abertura, cobertura de contraplano |
| 2K a 24fps | Lado curto de 1440 pixels no ritmo em que o cinema é filmado | Entregar sem precisar de um upscaling |
Referência omni
É a parte que muda o seu jeito de trabalhar. Uma única geração aceita até 9 imagens, 3 vídeos e 3 áudios, com um teto de 12 arquivos. Cada referência pode ter um papel diferente: uma imagem fixa o personagem, outra define o cenário, um vídeo carrega o movimento ou o ritmo da edição, e um áudio traz a voz. Vídeo e áudio de referência duram de 2 a 15 segundos cada um, somando até 15 segundos no total. O áudio nunca viaja sozinho: precisa vir acompanhado de pelo menos uma imagem ou um vídeo.
Áudio estéreo nativo
O som não é uma etapa extra. Cada geração devolve áudio estéreo produzido na mesma passagem que a imagem, então a cena já volta com a fala dita, os passos batendo no chão e o ambiente soando como um ambiente de verdade. Isso também quer dizer que você dirige o áudio, em vez de só aceitar o que vier. Por isso, um briefing que nomeia os instrumentos, os efeitos sonoros e o momento exato de cada deixa traz um resultado bem diferente de um prompt que não fala nada sobre som.
Edição por instruções
Quando um clipe está quase perfeito, menos por um detalhe, basta nomear esse detalhe. Você pode trocar um personagem, remover um objeto, substituir o fundo, reiluminar a cena do dia para a noite, adicionar um efeito ou mudar uma fala. Só o elemento indicado se move, e o resto do quadro fica parado. Várias mudanças cabem em uma única instrução, o que torna a edição bem mais rápida do que gerar tudo de novo na torcida para que as partes boas sobrevivam.
Clonagem e transferência de voz
Uma gravação de referência dá a um personagem uma voz que ele não tinha antes. Uma fala enviada por você substitui o que foi dito em cena, com a atuação ajustada para combinar com o novo áudio. Junto com uma imagem de identidade, isso já basta para manter um personagem reconhecível ao longo de uma sequência, tanto no rosto quanto na voz.
Enquadramento e acabamento
Seis proporções estão disponíveis nas gerações de texto para vídeo e com referência, de 21:9 a 9:16, além de um modo automático que deixa o H3 escolher quando as referências já estão definindo o plano. As gerações de primeiro e último quadro simplesmente seguem a proporção da imagem enviada. A saída é 1440p a 24 quadros por segundo, com 1440 pixels no lado curto, então um master em 21:9 fica perto de 2976 por 1248. Um modo de 768p está anunciado como próximo passo, com upscale para 1440p, o que deve virar um jeito natural de rascunhar assim que chegar.
Casos de uso do MiniMax H3
Filmes de marca e comerciais
Anúncios e filmes de marca premium, com um conjunto de referências fixando o talento, o produto e a assinatura final. A textura fílmica é especificada no prompt, e não deixada ao acaso.

Drama vertical e diálogo
Dramas curtos em formato 9:16, montados com planos fechados e corte em contraplano. Como a fala é gerada na mesma passagem que a imagem, a atuação e a entonação chegam juntas, prontas para publicar.

Vinhetas e motion design
Peças gráficas de abertura em que a tipografia funciona como uma camada própria: os créditos digitam na tela, os diagramas se montam sozinhos, e a deixa musical entra no tempo que você indicar, e não depois.

Produto e e-commerce
Filmes de produto construídos a partir de uma foto real do objeto, indo de uma revelação completa até um close macro e um plano aberto parado. A imagem do produto fixa a forma, enquanto a câmera e a luz é que vendem.

Conceitos de interface e jogos
Menus, HUDs e demonstrações de interação com o tempo marcado batida por batida ao longo do clipe. Os painéis deslizam, uma seleção é confirmada e o mundo carrega na ordem que você escreveu, e não na que o modelo imaginou.

Trabalho estilizado e animado
Recorte de papel, stop-motion e personagens estilizados. Uma referência de identidade mantém o design ao longo dos planos, então o personagem preserva o figurino, as proporções e o acabamento de um corte para o outro.

Como tirar o máximo proveito do MiniMax H3
O H3 recompensa um briefing que parece papelada de produção, não uma frase solta. O campo de prompt aceita até 7.000 caracteres, e os próprios exemplos de referência do modelo usam quase todo esse espaço. Alguns hábitos já garantem a maior parte da qualidade:
- Dê uma função para cada referência. "Imagem 1 define o clima e a textura fílmica, Imagem 2 é o talento, Imagem 3 é o produto" funciona melhor do que anexar quatro imagens e torcer.
- Escreva os tempos de cada momento. Dividir o clipe em blocos, dos 0 aos 2 segundos, dos 2 aos 5 segundos e assim por diante, dá ao modelo uma ordem clara a seguir ao longo dos 15 segundos.
- Diga o que não pode mudar. Nomear os elementos travados, uma máscara que fica fixa, um rosto que mantém o cabelo e o figurino, é o que evita que o clipe derive no meio do caminho.
- Escreva as negativas de forma explícita. Sem legenda, sem marca d'água, sem roupa moderna, sem fusões suaves: o modelo segue as restrições quando elas são ditas com clareza.
- Dirija o som como uma trilha própria. Nomeie os instrumentos, os efeitos específicos e o momento exato de cada deixa, já que o áudio é gerado junto com a imagem de qualquer forma.
- Nomeie as transições. Uma cortina, um corte seco, um whip pan, um match cut em uma forma: listar cada uma mantém o ritmo da edição, em vez de deixar tudo genericamente suave.
- Descreva a captura, não só a cena. Tremor de câmera na mão, respiração de exposição, foco automático que demora e grão de filme são o que separa um visual que parece filmado de um que parece renderizado.
- Especifique a animação da tipografia. Dê ao texto uma entrada, uma duração e uma lista do que evitar, e os títulos param de girar e quicar sem controle.
- Edite nomeando o alvo. Para um ajuste, diga o que muda e o que fica igual. Gerar o plano inteiro de novo arrisca perder o take que você já tinha gostado.
- Administre bem as referências. Doze arquivos é o teto, vídeo e áudio de referência somam até 15 segundos no total cada um, e o áudio só vale se vier acompanhado de uma imagem ou de um vídeo.
Para a lista completa de especificações, veja a página do modelo MiniMax H3.
Guia de prompts do MiniMax H3
Um bom briefing para o H3 é montado em cinco blocos. Passe por eles antes de enviar, e as partes que o modelo teria que adivinhar já ficam decididas.
| Bloco | Inclua | Exemplo |
|---|---|---|
| Papéis | O que cada referência anexada representa | Imagem 1 fixa a varanda com vista para o mar, Imagem 2 é a apresentadora |
| Tempos | A ação ao longo do clipe, com os tempos marcados | Dos 0 aos 5s ela grava o story, dos 5 aos 11s solta a frase de efeito |
| Visual | Estilo, paleta, luz e textura fílmica | Luz de fim de tarde, cores quentes, grão de filme |
| Som | Diálogo, efeitos, música e o momento em que entram | Barulho do mar ao fundo o tempo todo, uma batida quando o texto trava na tela |
| Limites | O que está travado e o que não pode aparecer | Manter o figurino, sem legenda, sem marca d'água |
Prompts fracos vs. prompts fortes
A diferença quase sempre está na especificidade sobre tempo, papel de cada referência e som.
| Foco | Fraco | Forte |
|---|---|---|
| Papel das referências | Use essas imagens | Imagem 1 fixa a textura fílmica, Imagem 2 é a protagonista, Imagem 3 é a garrafa que ela ergue |
| Tempo | Ela pega a garrafa | Dos 0 aos 5s ela anda entre os bancos, dos 5 aos 10s ergue a garrafa contra a luz, dos 10 aos 15s a coloca de volta |
| Som | Adicione uma música | Um gotejar de irrigação e o trânsito lá embaixo o tempo todo, uma nota longa de violoncelo quando a luz atravessa |
Erros comuns
- Anexar referências sem dizer para que cada uma serve, obrigando o modelo a adivinhar qual imagem conduz a cena.
- Descrever um quadro parado em vez de uma ação que se desenrola ao longo de todo o clipe.
- Deixar o áudio sem descrição no prompt e depois tratar o som que volta como se fosse um defeito do modelo.
- Enviar uma referência de áudio sozinha, o que é rejeitado a menos que uma imagem ou um vídeo venha junto.
- Gerar o plano inteiro de novo para corrigir um único objeto, quando uma instrução de edição preservaria o resto do take.

