Flux 3: guia completo, recursos, prompts e vídeo com áudio nativo

Flux 3: guia completo, recursos, prompts e vídeo com áudio nativo

O guia completo do Flux 3: vídeo com áudio nativo de até 20 segundos, os quatro formatos de prompt, o esquema CASTLE, keyframes, continuação de clipe e exemplos práticos.

Recursos e capacidades do Flux 3

O Flux 3 é o modelo multimodal de base da Black Forest Labs. Em vez de usar um modelo separado para cada tipo de saída, ele aprende imagem, vídeo e áudio ao mesmo tempo. Um único prompt já devolve um plano em movimento, com som, que se comporta como o mundo real.

A Black Forest Labs anunciou o Flux 3 em 23 de julho de 2026 e liberou a geração de vídeo para todo mundo em 4 de agosto de 2026. Os clipes duram de 5 a 20 segundos, em HD 720p ou Full HD 1080p, em qualquer uma das sete proporções disponíveis, de 21:9 até 9:16, com áudio gerado junto com os quadros por padrão. Tudo abaixo segue o guia de prompts publicado pela Black Forest Labs.

RecursoO que fazIdeal para
Vídeo com áudio nativoGera o clipe e o som sincronizado em uma única passadaCenas com som, diálogo, efeitos
Física realO movimento obedece à massa e à inércia; o som combina com o impactoFilme de produto, ação, explicativos
KeyframesInterpola um plano por até 10 imagens fixadasTransições controladas, storyboards
Continuação de vídeoEstende um clipe já existente a partir dos últimos quadrosCenas mais longas, salvar uma boa tomada
Diálogo multilíngueFala mais de 13 idiomas em cena, com sincronia labialVídeo localizado, apresentadores, anúncios
Geração de múltiplos planosMonta vários ângulos dentro de uma única geraçãoCurtas, anúncios, revelações
Modo rascunhoPré-visualização rápida, seguida de uma renderização final igual a elaTestar direções antes de decidir

Vídeo com áudio nativo

O destaque é que imagem e som chegam juntos. O Flux 3 gera cada clipe com áudio nativo sincronizado na mesma passada. Um impacto, um passo ou uma fala já vêm ligados à ação, em vez de entrar depois, numa camada separada. Nomeie o som que você quer no prompt e defina um idioma quando a cena tiver diálogo.

Física real

O Flux 3 aprende movimento, massa e som como um sistema só. Peso, inércia e colisões seguem regras reais, e os materiais mantêm o aspecto conforme a câmera se move. Descreva como o movimento evolui ao longo do plano, e a física vai parecer filmada, não simulada.

Keyframes e continuação

Duas formas de controlar o movimento. Fixe imagens como keyframes e o Flux 3 interpola um plano contínuo entre elas: uma imagem define o quadro de abertura, duas fixam um início e um fim, e até dez, marcadas em pontos no tempo, transformam o clipe num storyboard que o modelo precisa seguir em ordem. Ou entregue uma filmagem que você já tem, e a continuação retoma a partir dos últimos quadros, carregando o movimento, o comportamento de câmera e a trilha de áudio pela emenda, sem corte.

Diálogo multilíngue e tipografia

Coloque a fala entre aspas, nomeie o idioma e descreva a entonação, e o Flux 3 fala em cena com sotaque e sincronia labial correspondentes. Os idiomas com suporte incluem inglês e seus dialetos, chinês, espanhol, francês, alemão, japonês, português, russo, italiano, indonésio, turco, hindi e panjabi. Assim, um diálogo em português já sai com entonação natural, sem precisar de uma dublagem à parte. A tipografia renderiza como parte da cena e se mantém firme mesmo com a câmera em movimento, então títulos e letreiros sobrevivem ao movimento.

Casos de uso do Flux 3

Cenas com áudio nativo

O clipe já volta com o som sincronizado. Um efeito ou uma fala acontece junto com a ação, sem aquela tomada muda que você precisa consertar depois.

Filme de produto e de marca

Reflexos, peso e materiais permanecem fiéis conforme a câmera se move. Uma rotação, uma queda ou um giro de produto parece filmado de verdade, não simulado.

Sequências de múltiplos planos

Monte vários ângulos dentro de uma única geração, ou estenda um clipe com continuação, mantendo o mesmo personagem em todos os cortes.

A mesma mulher ruiva mantida consistente em três cenas

Vídeo localizado

Diálogo multilíngue e texto preciso na tela deixam uma cena sair em vários idiomas, incluindo português, sem precisar de uma passada separada de título ou de voz.

Um letreiro de rodapé de transmissão com a mesma frase em inglês e coreano

Rascunho, depois versão final

Pré-visualize uma direção rápido e barato, avalie o resultado, e depois renderize a versão aprovada em qualidade final, com os mesmos assuntos, composição e movimento.

Uma pré-visualização rápida ao lado da renderização em qualidade final do mesmo plano

Explicativos com física real

Gravidade, colisões e movimento seguem regras reais, então imagens de como algo funciona ficam precisas e continuam limpas.

Como fazer prompt no Flux 3

Dirija uma cena, não descreva uma pilha de objetos. A orientação da Black Forest Labs é nomear o que acontece, como os assuntos se movem, como a câmera se comporta e o que o plano soa, usando substantivos e verbos concretos que uma câmera realmente veja. Adjetivos vagos deixam o resultado por conta da sorte.

Escolha um formato de prompt

O Flux 3 aceita quatro formatos, e o objetivo não é escrever mais. Comece curto para explorar, e alongue só onde precisar de controle.

FormatoUse quandoExemplo
Frase curtaExplorar rápido, um assunto claro, aceitar acasos felizesUma raposa vermelha saltando pela neve fresca, teleobjetiva
Linha em linguagem naturalPadrão do dia a dia para um plano únicoUm travelling baixo de uma raposa correndo pelo mato molhado ao amanhecer
Campos rotuladosAjustar uma alavanca de cada vez sem mexer no restoPlano de câmera: aberto, ângulo baixo. Assunto: um cavaleiro atravessa um rio
TimestepA ação precisa acertar um ponto exato0,0–1,5s plano aberto fixo de um porto. 1,5–3,0s começa um push-in lento

A linha em formato de frase única tem uma estrutura confiável, vale decorar: [câmera] de [assunto] [ação] em [ambiente], seguida do detalhe visual e de movimento de apoio. Mantenha os pontos do timestep alcançáveis, dois ou três para um clipe de cinco segundos, e marque um corte seco sempre que o ângulo mudar.

Monte um CASTLE para trabalhos com vários planos

Quando o visual e a história precisam se manter firmes por vários planos, a Black Forest Labs documenta um esquema de seis partes. As seis partes formam a sigla CASTLE, em inglês (o nosso jeito de lembrar o esquema deles, não um nome oficial), e é a forma mais rápida de perceber o que está faltando num prompt longo.

ElementoO que colocar
CResumo geral (Core)Uma linha cobrindo toda a sequência: quem, onde e o arco da história
AÁudio (Audio)Por plano: a paisagem sonora, renderizada em sincronia com os quadros
SAssunto (Subject)Mantido idêntico, palavra por palavra, entre os planos, para a identidade não variar
TLinha do tempo (Timeline)Por plano, com tempo marcado: o movimento de câmera e a ação do assunto
LEstética (Look)O acabamento geral: nível de realismo, paleta de cores e granulação
EAmbiente (Environment)Por plano: cenário, qualidade da luz e profundidade de campo

Preencha cada parte na ordem que fizer sentido pra você, depois monte o prompt na sequência documentada pela Black Forest Labs: resumo geral, ambiente, assunto, linha do tempo, áudio, estética. Manter a descrição do assunto idêntica, byte a byte, entre os planos é o que evita um personagem mudar de um corte para o outro. É o truque de continuidade mais barato do guia.

Nomeie o som que você quer

O áudio é gerado junto com a imagem, então uma cena que já sugere som dá mais material para o modelo trabalhar do que uma cena abstrata. Passos, impactos, chuva, motores e multidões rendem bem. São quatro camadas, e raramente você precisa das quatro.

CamadaO que descreverExemplo
FalaQuem fala, as palavras exatas entre aspas, e comoO mecânico diz: “Já pode testar.” Tom tranquilo, direto
AmbientaçãoO som do lugarChuva batendo na janela, conversa baixa de restaurante
EfeitosSons ligados a ações visíveisUma xícara de cerâmica bate no pires
MúsicaEstilo, ritmo e onde entra na mixagemUm piano esparso sob a cena, baixo na mixagem

Dois hábitos resolvem a maior parte do trabalho. Nomeie uma fonte de som, em vez de pedir silêncio, porque “ambiente silencioso” pode virar um vazio sem áudio, enquanto “chuva na janela” dá ao modelo algo para renderizar. E, para uma fala, diga se quem fala está em cena ou é uma narração em voz off, porque, sem isso, uma frase entre aspas pode virar texto escrito na tela.

Dirija a voz, não o clima

“Profissional, calorosa e envolvente” sempre produz a mesma locução de comercial polida. Âncoras concretas funcionam melhor: idade e sotaque quando importam, registro de fala, como foi gravada, a entonação, e uma restrição do tipo “sem tom de locutor”. Depois, leia a fala em voz alta antes de gerar. Direção de voz não salva um texto sem graça.

Erros comuns

  • Descrever uma foto parada. Um modelo de vídeo precisa de movimento no tempo, não de uma fotografia em palavras.
  • Esquecer o som. O áudio é gerado por padrão, então nomeie o efeito, a ambientação ou a fala que você quer.
  • Empilhar termos de câmera. “Travelling baixo” é claro; “órbita aérea handheld com push-in baixo” não é.
  • Escrever negativos. Os modelos Flux não aceitam prompts negativos, então diga o que você quer, não o que não quer.
  • Sobrecarregar um clipe curto. Vários falantes, um roteiro longo e vários momentos em cinco segundos vão cortar a última palavra. Encurte a fala ou aumente a duração.

Para a lista completa de recursos e as especificações, veja a página do modelo Flux 3.

Perguntas frequentes

Como escrevo um bom prompt para o Flux 3?
Dirija a cena como um diretor, não descreva objetos soltos. Nomeie o assunto, o que ele faz, como a câmera se move, o cenário, a luz e uma pista de áudio, usando substantivos e verbos concretos, algo que uma câmera realmente veja. Como o Flux 3 gera som junto com a imagem, sempre diga como o plano deve soar.
Quais são os quatro formatos de prompt do Flux 3?
Uma frase curta para exploração rápida, uma linha em linguagem natural como padrão do dia a dia, campos rotulados para ajustar uma alavanca de cada vez, e o prompt por timestep quando a ação precisa acertar um ponto exato. Comece curto e alongue só onde precisar de mais controle.
O Flux 3 gera áudio junto com o vídeo?
Sim, e isso vem ativado por padrão. Todo clipe volta com áudio gerado na mesma passada, então um impacto, passos, ambientação ou uma fala já chegam sincronizados com a ação. Nomeie a fonte do som que você quer, em vez de pedir silêncio, porque um pedido de silêncio pode virar um vazio sem áudio.
Quanto tempo pode durar um vídeo do Flux 3?
O Flux 3 gera de 5 a 20 segundos em uma única passada, em segundos inteiros, ou pode escolher a duração ideal para o prompt. Para peças mais longas, use a continuação de vídeo para estender um clipe a partir dos últimos quadros, ou monte vários planos dentro de uma mesma geração com cortes secos entre eles.
Como mantenho um personagem consistente no Flux 3?
Repita a descrição do assunto palavra por palavra em cada plano do prompt. O esquema da Black Forest Labs trata essa descrição fixa como o que sustenta a identidade entre um corte e outro. Keyframes e a geração de múltiplos planos carregam esse visual pela sequência inteira. Referências combinadas de imagem e vídeo já foram anunciadas como próximo passo.
Como funcionam os keyframes do Flux 3?
Você fixa imagens estáticas e o Flux 3 interpola um plano contínuo entre elas. Uma imagem define o quadro de abertura, duas fixam um início e um fim, e até dez, marcadas em pontos no tempo, viram um storyboard que o plano precisa seguir em ordem, com o modelo preenchendo o movimento entre as marcas.
O Flux 3 funciona em português?
Sim. O Flux 3 fala mais de 13 idiomas em cena, incluindo português, com sotaque e sincronia labial ajustados à fala. Basta colocar a fala entre aspas, indicar o idioma e descrever a entonação para gerar um diálogo natural em português.