Recursos e capacidades do Flux 3
O Flux 3 é o modelo multimodal de base da Black Forest Labs. Em vez de usar um modelo separado para cada tipo de saída, ele aprende imagem, vídeo e áudio ao mesmo tempo. Um único prompt já devolve um plano em movimento, com som, que se comporta como o mundo real.
A Black Forest Labs anunciou o Flux 3 em 23 de julho de 2026 e liberou a geração de vídeo para todo mundo em 4 de agosto de 2026. Os clipes duram de 5 a 20 segundos, em HD 720p ou Full HD 1080p, em qualquer uma das sete proporções disponíveis, de 21:9 até 9:16, com áudio gerado junto com os quadros por padrão. Tudo abaixo segue o guia de prompts publicado pela Black Forest Labs.
| Recurso | O que faz | Ideal para |
|---|---|---|
| Vídeo com áudio nativo | Gera o clipe e o som sincronizado em uma única passada | Cenas com som, diálogo, efeitos |
| Física real | O movimento obedece à massa e à inércia; o som combina com o impacto | Filme de produto, ação, explicativos |
| Keyframes | Interpola um plano por até 10 imagens fixadas | Transições controladas, storyboards |
| Continuação de vídeo | Estende um clipe já existente a partir dos últimos quadros | Cenas mais longas, salvar uma boa tomada |
| Diálogo multilíngue | Fala mais de 13 idiomas em cena, com sincronia labial | Vídeo localizado, apresentadores, anúncios |
| Geração de múltiplos planos | Monta vários ângulos dentro de uma única geração | Curtas, anúncios, revelações |
| Modo rascunho | Pré-visualização rápida, seguida de uma renderização final igual a ela | Testar direções antes de decidir |
Vídeo com áudio nativo
O destaque é que imagem e som chegam juntos. O Flux 3 gera cada clipe com áudio nativo sincronizado na mesma passada. Um impacto, um passo ou uma fala já vêm ligados à ação, em vez de entrar depois, numa camada separada. Nomeie o som que você quer no prompt e defina um idioma quando a cena tiver diálogo.
Física real
O Flux 3 aprende movimento, massa e som como um sistema só. Peso, inércia e colisões seguem regras reais, e os materiais mantêm o aspecto conforme a câmera se move. Descreva como o movimento evolui ao longo do plano, e a física vai parecer filmada, não simulada.
Keyframes e continuação
Duas formas de controlar o movimento. Fixe imagens como keyframes e o Flux 3 interpola um plano contínuo entre elas: uma imagem define o quadro de abertura, duas fixam um início e um fim, e até dez, marcadas em pontos no tempo, transformam o clipe num storyboard que o modelo precisa seguir em ordem. Ou entregue uma filmagem que você já tem, e a continuação retoma a partir dos últimos quadros, carregando o movimento, o comportamento de câmera e a trilha de áudio pela emenda, sem corte.
Diálogo multilíngue e tipografia
Coloque a fala entre aspas, nomeie o idioma e descreva a entonação, e o Flux 3 fala em cena com sotaque e sincronia labial correspondentes. Os idiomas com suporte incluem inglês e seus dialetos, chinês, espanhol, francês, alemão, japonês, português, russo, italiano, indonésio, turco, hindi e panjabi. Assim, um diálogo em português já sai com entonação natural, sem precisar de uma dublagem à parte. A tipografia renderiza como parte da cena e se mantém firme mesmo com a câmera em movimento, então títulos e letreiros sobrevivem ao movimento.
Casos de uso do Flux 3
Cenas com áudio nativo
O clipe já volta com o som sincronizado. Um efeito ou uma fala acontece junto com a ação, sem aquela tomada muda que você precisa consertar depois.
Filme de produto e de marca
Reflexos, peso e materiais permanecem fiéis conforme a câmera se move. Uma rotação, uma queda ou um giro de produto parece filmado de verdade, não simulado.
Sequências de múltiplos planos
Monte vários ângulos dentro de uma única geração, ou estenda um clipe com continuação, mantendo o mesmo personagem em todos os cortes.

Vídeo localizado
Diálogo multilíngue e texto preciso na tela deixam uma cena sair em vários idiomas, incluindo português, sem precisar de uma passada separada de título ou de voz.

Rascunho, depois versão final
Pré-visualize uma direção rápido e barato, avalie o resultado, e depois renderize a versão aprovada em qualidade final, com os mesmos assuntos, composição e movimento.

Explicativos com física real
Gravidade, colisões e movimento seguem regras reais, então imagens de como algo funciona ficam precisas e continuam limpas.
Como fazer prompt no Flux 3
Dirija uma cena, não descreva uma pilha de objetos. A orientação da Black Forest Labs é nomear o que acontece, como os assuntos se movem, como a câmera se comporta e o que o plano soa, usando substantivos e verbos concretos que uma câmera realmente veja. Adjetivos vagos deixam o resultado por conta da sorte.
Escolha um formato de prompt
O Flux 3 aceita quatro formatos, e o objetivo não é escrever mais. Comece curto para explorar, e alongue só onde precisar de controle.
| Formato | Use quando | Exemplo |
|---|---|---|
| Frase curta | Explorar rápido, um assunto claro, aceitar acasos felizes | Uma raposa vermelha saltando pela neve fresca, teleobjetiva |
| Linha em linguagem natural | Padrão do dia a dia para um plano único | Um travelling baixo de uma raposa correndo pelo mato molhado ao amanhecer |
| Campos rotulados | Ajustar uma alavanca de cada vez sem mexer no resto | Plano de câmera: aberto, ângulo baixo. Assunto: um cavaleiro atravessa um rio |
| Timestep | A ação precisa acertar um ponto exato | 0,0–1,5s plano aberto fixo de um porto. 1,5–3,0s começa um push-in lento |
A linha em formato de frase única tem uma estrutura confiável, vale decorar: [câmera] de [assunto] [ação] em [ambiente], seguida do detalhe visual e de movimento de apoio. Mantenha os pontos do timestep alcançáveis, dois ou três para um clipe de cinco segundos, e marque um corte seco sempre que o ângulo mudar.
Monte um CASTLE para trabalhos com vários planos
Quando o visual e a história precisam se manter firmes por vários planos, a Black Forest Labs documenta um esquema de seis partes. As seis partes formam a sigla CASTLE, em inglês (o nosso jeito de lembrar o esquema deles, não um nome oficial), e é a forma mais rápida de perceber o que está faltando num prompt longo.
| Elemento | O que colocar | |
|---|---|---|
| C | Resumo geral (Core) | Uma linha cobrindo toda a sequência: quem, onde e o arco da história |
| A | Áudio (Audio) | Por plano: a paisagem sonora, renderizada em sincronia com os quadros |
| S | Assunto (Subject) | Mantido idêntico, palavra por palavra, entre os planos, para a identidade não variar |
| T | Linha do tempo (Timeline) | Por plano, com tempo marcado: o movimento de câmera e a ação do assunto |
| L | Estética (Look) | O acabamento geral: nível de realismo, paleta de cores e granulação |
| E | Ambiente (Environment) | Por plano: cenário, qualidade da luz e profundidade de campo |
Preencha cada parte na ordem que fizer sentido pra você, depois monte o prompt na sequência documentada pela Black Forest Labs: resumo geral, ambiente, assunto, linha do tempo, áudio, estética. Manter a descrição do assunto idêntica, byte a byte, entre os planos é o que evita um personagem mudar de um corte para o outro. É o truque de continuidade mais barato do guia.
Nomeie o som que você quer
O áudio é gerado junto com a imagem, então uma cena que já sugere som dá mais material para o modelo trabalhar do que uma cena abstrata. Passos, impactos, chuva, motores e multidões rendem bem. São quatro camadas, e raramente você precisa das quatro.
| Camada | O que descrever | Exemplo |
|---|---|---|
| Fala | Quem fala, as palavras exatas entre aspas, e como | O mecânico diz: “Já pode testar.” Tom tranquilo, direto |
| Ambientação | O som do lugar | Chuva batendo na janela, conversa baixa de restaurante |
| Efeitos | Sons ligados a ações visíveis | Uma xícara de cerâmica bate no pires |
| Música | Estilo, ritmo e onde entra na mixagem | Um piano esparso sob a cena, baixo na mixagem |
Dois hábitos resolvem a maior parte do trabalho. Nomeie uma fonte de som, em vez de pedir silêncio, porque “ambiente silencioso” pode virar um vazio sem áudio, enquanto “chuva na janela” dá ao modelo algo para renderizar. E, para uma fala, diga se quem fala está em cena ou é uma narração em voz off, porque, sem isso, uma frase entre aspas pode virar texto escrito na tela.
Dirija a voz, não o clima
“Profissional, calorosa e envolvente” sempre produz a mesma locução de comercial polida. Âncoras concretas funcionam melhor: idade e sotaque quando importam, registro de fala, como foi gravada, a entonação, e uma restrição do tipo “sem tom de locutor”. Depois, leia a fala em voz alta antes de gerar. Direção de voz não salva um texto sem graça.
Erros comuns
- Descrever uma foto parada. Um modelo de vídeo precisa de movimento no tempo, não de uma fotografia em palavras.
- Esquecer o som. O áudio é gerado por padrão, então nomeie o efeito, a ambientação ou a fala que você quer.
- Empilhar termos de câmera. “Travelling baixo” é claro; “órbita aérea handheld com push-in baixo” não é.
- Escrever negativos. Os modelos Flux não aceitam prompts negativos, então diga o que você quer, não o que não quer.
- Sobrecarregar um clipe curto. Vários falantes, um roteiro longo e vários momentos em cinco segundos vão cortar a última palavra. Encurte a fala ou aumente a duração.
Para a lista completa de recursos e as especificações, veja a página do modelo Flux 3.
