Guia completo do Seedance 2.0: recursos, comparação e tutorial passo a passo

Guia completo do Seedance 2.0 com IA para profissionais. Compare recursos com Kling, Veo e Sora. Domine vídeo multimodal com técnicas avançadas. Experimente no Morphic.

O que é o Seedance 2.0?

O Seedance 2.0 é o modelo de vídeo de IA multimodal avançado da ByteDance, que combina entradas de imagem, vídeo, áudio e texto para um controle criativo inédito. Este guia completo compara o Seedance com Kling, Veo e Sora, e mostra aos profissionais como dominar fluxos de trabalho de vídeo multimodal no Morphic.

Diferente dos modelos tradicionais de texto para vídeo, que dependem apenas de prompts escritos, o Seedance 2.0 permite mostrar à IA exatamente o que você quer por meio de referências visuais e sonoras. Envie imagens de referência para definir estilo e composição, use clipes de vídeo para demonstrar os movimentos de câmera ou as ações desejadas, acrescente áudio para estabelecer clima e ritmo, e combine tudo isso com prompts de texto detalhados para uma direção criativa precisa.

Dois guias complementares aprofundam problemas específicos: vídeos cinematográficos com o Seedance 2.0 para o lado do ofício, e o que fazer quando os prompts do Seedance 2.0 são sinalizados para gerações que voltam rejeitadas.

Por que usar o Seedance 2.0 na criação profissional de vídeo

O Seedance 2.0 ataca a limitação fundamental da geração de vídeo por IA: a distância entre a descrição e a visão. Em vez de tentar descrever em palavras movimentos de câmera complexos, detalhes de personagem ou efeitos visuais, você pode fornecer exemplos diretos. Essa abordagem multimodal entrega:

  • Controle visual preciso por meio de referências de imagem
  • Replicação fiel de movimento por meio de referências de vídeo
  • Sincronia de ritmo e clima com a integração de áudio
  • Personagem e estilo consistentes em vários planos
  • Transições de cena complexas que mantêm a continuidade

O modelo se destaca ao entender e combinar vários tipos de referência ao mesmo tempo, o que o torna especialmente valioso para produção comercial, criação de conteúdo e fluxos de trabalho profissionais de vídeo.

Seedance 2.0 vs Kling vs Veo vs Sora: comparação de recursos

Ao avaliar ferramentas de geração de vídeo por IA, entender as capacidades específicas de cada plataforma ajuda a escolher a opção certa para o seu fluxo de trabalho. Veja como o Seedance 2.0 se compara às principais alternativas:

RecursoSeedance 2.0Kling 3.0Veo 3.1Sora
Suporte a entrada multimodalImagens, vídeos, áudio, textoImagens, vídeos, áudio, textoImagens, textoImagens, texto
Duração máxima do vídeoAté 15 segundosAté 15 segundosAté 8 segundos (extensível para mais de 60 segundos)Até 60 segundos
Integração de áudioEnvio e referência direta de áudioÁudio nativo com sincronia labial e diálogo em vários idiomasÁudio nativo com efeitos sonoros e diálogoApenas texto para áudio
Capacidade de referência de vídeoReplicação completa de movimento e câmeraReplicação completa de movimento e câmera com diretor de IATransferência de estilo e imagens de referência (até 3)Limitada
Resolução máxima de saída4K (10 bits)4K4K1080p

Principais diferenças:

Flexibilidade multimodal: o Seedance 2.0 e o Kling 3.0 oferecem suporte multimodal completo, incluindo o envio direto de arquivos de vídeo e áudio. O Veo 3.1 aceita referências de imagem (até 3), mas o áudio é gerado, não referenciado. O Sora continua sendo baseado principalmente em texto e imagem.

Profundidade da referência de vídeo: o Seedance 2.0 e o Kling 3.0 se destacam na replicação de movimentos de câmera complexos, coreografias e efeitos especiais a partir de material de referência. O recurso "AI Director" do Kling 3.0 automatiza a composição de cenas com vários planos. O Veo 3.1 foca em imagem para vídeo, com forte consistência de personagem, mas dá menos ênfase à replicação de movimento de vídeo para vídeo.

Recursos de áudio: o Seedance 2.0 permite o envio direto de arquivos de áudio para controle preciso de clima e sincronia com a batida. O Kling 3.0 gera áudio nativo em vários idiomas, com sincronia labial fiel em 5 idiomas. O Veo 3.1 gera áudio de forma nativa, mas não aceita referências em arquivo de áudio. O Sora gera áudio apenas a partir de descrições em texto.

Duração e extensão: embora o Sora ofereça as gerações únicas mais longas (até 60 segundos), o recurso de extensão do Veo 3.1 permite encadear clipes além de 60 segundos. O Seedance 2.0 e o Kling 3.0 aceitam gerações de 15 segundos, com capacidade de extensão.

Resolução e qualidade: o Seedance 2.0 entrega até 4K com codificação de 10 bits, o que preserva a gradação de cor para trabalhos de HDR e de correção. Isso o coloca no mesmo patamar do Kling 3.0 e do Veo 3.1 em resolução bruta, então o fator decisivo costuma ser o controle por referência, e não a contagem de pixels.

Edição de material já existente: o Seedance 2.0 trata um vídeo enviado como algo que você pode editar, não apenas imitar. Você pode adicionar, remover ou trocar elementos dentro de um clipe, estendê-lo para frente ou para trás no tempo, e emendar clipes separados em uma peça contínua. Aqui a edição é uma tarefa de primeira classe, e não um apêndice, e é isso que torna prático manter um material que o cliente já aprovou.

Qual modelo Seedance 2.0 usar

O Seedance 2.0 é uma família de três modelos que compartilham o mesmo conjunto de recursos e diferem em qualidade e custo:

ModeloIdeal paraResolução máxima
Seedance 2.0Máxima qualidade de geração; o único que entrega 4K4K
Seedance 2.0 FastEquilibrar velocidade e custo quando a qualidade máxima não é necessária720p
Seedance 2.0 MiniMelhor custo-benefício, iteração em alto volume720p

Um padrão prático: rascunhe no Mini ou no Fast até o prompt e as referências se comportarem bem, depois faça a passagem final no Seedance 2.0 completo.

Informações válidas em julho de 2026. Recursos e disponibilidade sujeitos a mudança.

Experimente o Seedance 2.0 no Morphic →

Principais recursos e capacidades do Seedance 2.0

Sistema de entrada multimodal

O Seedance 2.0 aceita quatro tipos distintos de entrada, que funcionam em combinação:

Entradas de imagem (até 9 imagens)

  • Definem o estilo visual e a direção estética
  • Estabelecem a aparência dos personagens e mantêm a consistência
  • Definem a composição e o enquadramento da cena
  • Especificam detalhes de produto para uma reprodução fiel
  • Controlam iluminação, correção de cor e atmosfera

Entradas de vídeo (até 3 clipes, no máximo 15 segundos somados)

  • Referenciam movimentos de câmera e fotografia específicos
  • Replicam padrões de movimento e coreografias
  • Copiam transições de cena e ritmos de montagem
  • Demonstram efeitos especiais e técnicas visuais
  • Mostram ações e interações de personagens

Entradas de áudio (MP3 ou WAV, até 3 arquivos, cada um de 2-15 segundos, no máximo 15 segundos somados)

  • Definem o clima e o tom emocional por meio da música
  • Controlam o andamento com estrutura de ritmo e batida
  • Acrescentam efeitos sonoros específicos ou áudio ambiente
  • Combinam com as características de voz para o diálogo
  • Sincronizam mudanças visuais com deixas sonoras

Prompts de texto (linguagem natural)

  • Guiam a narrativa e o avanço da história
  • Especificam ações e movimentos que não aparecem nas referências
  • Descrevem transições de cena e temporização
  • Esclarecem como as referências devem ser aplicadas
  • Acrescentam detalhes além do que as referências visuais mostram

Sobre os limites: não existe um teto combinado de arquivos. Os tetos são por tipo (até 9 imagens, 3 clipes de vídeo, 3 arquivos de áudio), e a restrição real não é o teto, e sim a sua contenção: a ByteDance recomenda usar bem menos referências do que o permitido. Uma combinação, porém, realmente não tem suporte. Texto mais áudio sozinhos, e áudio sozinho, não geram nada. Todo trabalho precisa de texto, e o áudio só funciona ao lado de uma referência visual.

Arquitetura da capacidade de referência

A inovação central do Seedance 2.0 é o seu sistema de compreensão de referências. Em vez de tratar as entradas como simples guias de estilo, o modelo analisa e extrai elementos específicos de cada referência:

Das imagens: estrutura de composição, traços do personagem, detalhes de objetos, montagem de luz, relações de cor, arranjo espacial, características de estilo

Dos vídeos: trajetórias de movimento de câmera, velocidade e aceleração do movimento, mudanças de enquadramento, ações e temporização do sujeito, execução de efeitos especiais, técnicas de transição

Dos áudios: padrões de ritmo e batida, clima e atmosfera de tom, dinâmica de volume, temporização dos efeitos sonoros, características da voz

Essa compreensão granular permite especificar exatamente quais aspectos de cada referência devem influenciar a geração, criando um controle preciso sobre o resultado final.

Melhorias essenciais na qualidade da geração

Além das capacidades multimodais, o Seedance 2.0 traz avanços de base:

Dinâmica física realista: objetos e personagens se movem com física convincente. As roupas caem naturalmente, os líquidos escorrem de forma crível e as interações entre elementos seguem as regras do mundo real.

Movimento fluido: a ação contínua flui sem transições bruscas nem artefatos de deformação. Movimentos complexos, de várias etapas, mantêm a consistência ao longo de toda a execução.

Compreensão precisa do prompt: o modelo interpreta com exatidão instruções detalhadas, incluindo relações espaciais ("ao fundo, atrás de"), sequências de planos ordenadas e cenários complexos com vários sujeitos. Códigos de tempo precisos são a exceção, e são tratados abaixo.

Retenção consistente de estilo: as características visuais estabelecidas no início de uma geração permanecem estáveis até o fim. A aparência dos personagens, as condições de luz e o estilo artístico não se desviam conforme a cena avança.

Execução de ações complexas: dá conta de sequências difíceis, como coreografias de luta, movimentos detalhados de mãos, expressões faciais durante a fala e interações coordenadas entre vários personagens.

Pronto para experimentar o controle multimodal? Comece a criar com o Seedance 2.0 no Morphic →

Especificações técnicas

ParâmetroEspecificação
Duração da geração4-15 segundos
Resolução de saída480p, 720p, 1080p, 4K (Seedance 2.0). Fast e Mini chegam no máximo a 720p
Proporções21:9, 16:9, 4:3, 1:1, 3:4, 9:16, além de uma configuração adaptativa que acompanha a sua imagem de referência
Formato de saídaMP4. O 4K é codificado em H.265 (HEVC), 10 bits
Saída de áudioGeração integrada de efeitos sonoros, diálogo e música de fundo
Entradas de imagemJPEG, PNG, WEBP, BMP, TIFF, GIF, HEIC, HEIF. Até 30MB cada
Entradas de vídeoMP4, MOV (H.264 ou H.265), 24-60fps, 2-15s por clipe, até 200MB cada
Entradas de áudioMP3, WAV. 2-15s por arquivo, até 15MB cada

Duas observações sobre as configurações de saída. Não existe opção 2.35:1, então, para um visual em scope, escolha 21:9 em vez de pedir 2.35:1 no prompt. E, como o 4K usa H.265, alguns navegadores e reprodutores não fazem a pré-visualização direta, mesmo com o arquivo íntegro.

Entendendo as especificações de entrada do Seedance 2.0

Limites de quantidade de arquivos e de duração

Para otimizar a qualidade da geração e ao mesmo tempo administrar os recursos computacionais, o Seedance 2.0 aplica restrições específicas de entrada:

Limites por tipo de arquivo:

  • Imagens: no máximo 9 arquivos
  • Vídeos: no máximo 3 clipes
  • Áudio: no máximo 3 arquivos

Limites de duração somada:

  • Referências de vídeo: 15 segundos no total, somando todos os clipes
  • Referências de áudio: 15 segundos no total, somando todos os arquivos

Mínimos por clipe (fáceis de esquecer):

  • Todo clipe de vídeo de referência precisa ter pelo menos 2 segundos
  • Todo arquivo de áudio de referência precisa ter pelo menos 2 segundos
  • O vídeo de referência precisa rodar entre 24 e 60 fps

Não existe um teto combinado de arquivos. Nove imagens mais três vídeos mais três arquivos de áudio é um pedido válido. Também é um pedido ruim, pelos motivos da próxima seção.

Combinação sem suporte: texto mais áudio, e áudio sozinho, não geram nada. O áudio sempre precisa de uma referência visual ao lado.

Duração do resultado gerado: 4-15 segundos.

Não preencha todas as vagas que você tem

Os limites acima são tetos, não metas. A própria orientação da ByteDance é explícita: usar toda a cota de recursos piora os resultados. Com referências demais, o modelo tem dificuldade para julgar quais características têm prioridade, e você acaba com conflitos de estilo, identificação embaçada do sujeito e um resultado que se afasta do que você pediu.

A configuração recomendada é de 4 a 5 recursos no total. Cada um deve cumprir uma função distinta:

  • Ancoragem do personagem (1-2 imagens): fixa a aparência do personagem
  • Definição do tom da cena (1 imagem): fixa o ambiente e o estilo
  • Movimento de câmera (1 vídeo): fixa a linguagem e o ritmo dos planos
  • Ritmo e atmosfera (1 áudio): controla a emoção e o timbre

Se duas referências estão disputando a mesma função, você tem uma a mais. Enviar quatro imagens do mesmo personagem não deixa o modelo quatro vezes mais confiante sobre esse personagem. Deixa o modelo menos seguro sobre em qual imagem acreditar.

Exemplo prático: para um comercial de 15 segundos que exige uma aparência específica do produto, trabalho de câmera dinâmico e música animada, cinco recursos formam um briefing completo:

  • 2 imagens: o produto em dois ângulos
  • 1 imagem: a correção de cor e o estilo de iluminação desejados
  • 1 vídeo: referência de movimento de câmera
  • 1 áudio: faixa musical para o andamento

Todo o resto, incluindo o ambiente, o clima e o andamento, pertence ao prompt de texto.

Um teto rígido de personagens: quando mais de quatro pessoas de referência estão envolvidas, a estabilidade do resultado cai bastante. Você começa a ver o número errado de pessoas no quadro, ou duplicatas. Se precisar de um grupo de seis, gere primeiro duas imagens agrupadas de três, depois use essas imagens como referência para o vídeo.

Diretrizes de qualidade das entradas

Para referências de imagem:

  • Use fotografias nítidas e bem iluminadas quando a fidelidade importa
  • Resolução mais alta reproduz melhor os detalhes
  • Vários ângulos ajudam em produtos e objetos. E atrapalham ativamente em rostos: veja a regra da foto do rosto em close abaixo, porque uma folha de personagem com vários ângulos é lida como várias pessoas diferentes
  • Evite imagens muito comprimidas ou de baixa qualidade

Para referências de vídeo:

  • Garanta que o elemento específico que você quer referenciar esteja claramente visível
  • Clipes curtos focados em um único aspecto funcionam melhor do que clipes longos com vários elementos
  • Vídeo de qualidade mais alta melhora a compreensão do movimento
  • Corte os vídeos para mostrar apenas o trecho relevante

Para referências de áudio:

  • Use arquivos de áudio limpos, sem ruído de fundo, sempre que possível
  • Garanta que o áudio demonstre com clareza o ritmo ou o clima que você quer
  • Aproxime a duração do áudio da duração pretendida do vídeo
  • Considere usar o áudio de arquivos de vídeo quando ele servir a mais de um propósito

Como usar as referências multimodais do Seedance 2.0

O Seedance 2.0 fica disponível no Morphic, que oferece uma interface para enviar referências e escrever prompts. O sistema usa uma estrutura de menção com @ para especificar como cada arquivo enviado deve ser usado na geração.

Primeiro, saiba qual das três tarefas você está pedindo

Antes de escrever qualquer coisa, decida qual trabalho você está dando ao modelo, porque a formulação muda e errar nisso é a forma mais comum de desperdiçar uma geração.

  • Referência multimodal: extrair elementos dos seus recursos (um sujeito, um estilo, um movimento de câmera, uma voz) para fazer um vídeo totalmente novo.
  • Edição de vídeo: mudar algo dentro de um vídeo existente. Tudo o que você não mencionar continua como estava.
  • Extensão de vídeo: continuar um vídeo existente para frente ou para trás no tempo, preservando o estilo, o sujeito e a narrativa.

A armadilha: em tarefas de edição e extensão, refira-se ao clipe como @Video 1, nunca como "referência @Video 1". A palavra referência empurra o modelo a classificar o trabalho como uma tarefa de referência, então, em vez de editar o seu clipe, ele gera um vídeo novo que apenas se parece com ele. Diga "Edite estritamente @Video 1" ou "Estenda @Video 1 para trás", não "Referencie @Video 1 e edite".

Defina o seu sujeito antes de referenciá-lo

Uma imagem enviada quase sempre contém mais de uma coisa. Nomear o sujeito de forma explícita é a etapa que a maioria pula, e é justamente a que impede o modelo de se agarrar ao elemento errado.

Escolha de 2 a 3 características estáveis e estáticas (roupa, penteado, categoria) que identifiquem o sujeito de forma única, depois vincule essas características ao recurso:

Defina [características centrais] em @Image 1 como [nome do sujeito]

Por exemplo: Defina a mulher de vestido vermelho e chapéu de palha em @Image 1 como Sujeito 1. A partir daí, refira-se a ela apenas como Sujeito 1. Use o mesmo rótulo todas as vezes em que ela aparecer. Se você alternar entre "a mulher", "ela" e "Sujeito 1", o modelo pode perder o fio de quem você quer dizer.

Em trabalhos rápidos, você pode pular a definição e vincular direto na linha, repetindo o par a cada menção a ela: Sujeito 1@Image 1.

Duas regras importam aqui. Mantenha a descrição curta e sem contradições, porque duas características conflitantes no mesmo sujeito confundem o vínculo. E, quando uma relação espacial for mais fácil de mostrar do que de dizer, mostre-a em uma imagem de referência em vez de descrevê-la em texto.

O sistema de referência com @

Depois de enviar seus materiais ao Morphic, você os referencia no prompt usando o símbolo @ seguido do identificador do arquivo (Image 1, Video 1, Audio 1 etc.). O segredo é dizer explicitamente qual finalidade cada referência cumpre.

Estrutura básica de referência:

@[Tipo de material + número] como/para [finalidade específica], [contexto adicional]

Referência clara vs. referência vaga:

Vaga: "Use @Image 1 e @Video 1 para fazer um vídeo"

Clara: "@Image 1 como quadro de abertura mostrando o rosto do personagem, referencie o movimento de aproximação de câmera de @Video 1, use @Audio 1 como música de fundo para estabelecer um clima animado"

Coloque o seu recurso mais importante primeiro. Quanto mais cedo um recurso aparece no prompt, mais peso ele carrega. Se o rosto do personagem precisa sair exatamente certo, comece por ele.

A pontuação que diz ao modelo que tipo de informação ele está lendo

O Seedance 2.0 lê quatro tipos de colchetes como sinais de tipo. Usá-los é uma forma barata de evitar que um diálogo seja renderizado como legenda na tela, ou que um efeito sonoro seja falado em voz alta.

Tipo de informaçãoColcheteExemplo
Música( )(música rock acelerada toca ao fundo)
Efeito sonoro< ><um cão late ao longe>
Diálogo{ }{Precisamos ir embora. Agora.}
Legendas na tela【 】【Capítulo Um: Partida】

Se uma fala estiver em um idioma diferente do português, nomeie o idioma antes das chaves: diz em japonês {こんにちは}. Mantenha um idioma por cena. Misturar idiomas no mesmo prompt, tirando os nomes próprios, piora a pronúncia.

Como escrever prompts multimodais eficazes: o framework CRAFTS

Um bom prompt de Seedance 2.0 se parece mais com uma instrução de engenharia do que com um texto publicitário. O modelo lê o seu texto, as imagens, o vídeo e o áudio ao mesmo tempo e os divide internamente em uma camada espacial (o que está no quadro) e uma camada temporal (como isso muda ao longo do tempo). Sua tarefa é alimentar as duas camadas com clareza.

O CRAFTS cobre as seis coisas que um prompt completo especifica: Contexto, Referência, Ação, F: Enquadramento, T: Linha do tempo, S: Estilo e restrições.

C - Contexto: estabeleça a cena e o ambiente Monte o palco com local, época, atmosfera e cenário geral. Inclua aqui as referências às imagens de cena.

Exemplo: "Em um clube de jazz de luz baixa, à noite, referenciando a atmosfera interna de @Image 1"

R - Referência: defina seus sujeitos e vincule-os aos recursos Nomeie cada sujeito por 2 a 3 características estáveis, depois diga exatamente o que cada recurso contribui e o que ele não contribui.

Exemplo: "Defina o homem de terno cinza em @Image 2 como o Pianista. @Image 2 apenas para o rosto e o porte dele, não para a roupa. @Video 1 para o ritmo da caminhada. @Audio 1 para o jazz de fundo."

A - Ação: descreva os movimentos de personagens e objetos Detalhe o que acontece na cena: ações dos personagens, interações com objetos e a sequência de eventos. Duas coisas separam as descrições de ação que funcionam das que não funcionam.

Vá de pouco e devagar. O Seedance 2.0 lida com movimento suave, contínuo e de pequena escala de forma muito mais confiável do que com movimento de alta energia. Corridas, saltos grandes e rolamentos violentos são onde os membros se deformam e a física quebra. Prefira "caminha devagar", "levanta a mão com delicadeza", "senta-se acompanhando o movimento". Especifique a parte do corpo, mais a amplitude, a velocidade e a força: não "ele mexe a cabeça", e sim "ele vira a cabeça rapidamente". Quando uma ação leva à seguinte, diga como elas se conectam, para que o movimento carregue a própria inércia: "usa o impulso do giro para levantar a mão naturalmente".

Externalize a emoção em detalhe físico. O modelo não consegue renderizar "muito triste". Ele consegue renderizar o que a tristeza faz com um corpo. Troque o rótulo abstrato pelo sinal concreto.

Em vez deDescreva isto
TristezaCabeça baixa, ombros tremendo de leve, olhos avermelhados, dedos apertando a barra do casaco sem perceber, lágrimas se formando mas sem cair
AlegriaCantos da boca subindo sem controle, sobrancelhas e olhos relaxando, passos ficando leves, cantarolar sem notar, sem conseguir resistir a girar no lugar
NervosismoOlhar o relógio várias vezes, dedos tamborilando na mesa, respiração acelerada, olhos desviando, roer uma unha
RaivaOs dois punhos cerrados, mandíbula travada, peito arfando, um olhar duro, palavras saindo espremidas por entre os dentes
AlívioSoltar um longo suspiro, ombros tensos caindo de uma vez, um sorriso leve voltando ao rosto, olhar erguido rumo ao horizonte

Exemplo: "O Pianista caminha devagar pela sala, para no bar e pega um copo. Ele dá um gole e, ao olhar em direção à porta, sua mandíbula trava e seus dedos se fecham com força ao redor do copo."

F - Enquadramento: defina o trabalho de câmera e a fotografia Especifique tipos de plano, movimentos de câmera, ângulos e transições usando terminologia cinematográfica. O modelo tem um domínio forte do vocabulário padrão de câmera, então use-o de forma direta.

Exemplo: "Comece com um plano geral de apresentação, faça um dolly in até um plano médio fechado enquanto o personagem chega ao bar, depois corte para um plano por cima do ombro olhando em direção à porta"

Um movimento de câmera por plano. Pedir que um único plano faça aproximação, órbita e panorâmica ao mesmo tempo é o jeito mais rápido de desestabilizar a imagem. Se você quer três movimentos, você quer três planos.

T - Linha do tempo: sequencie seus planos, não seus segundos

Este é o elemento que a maioria dos guias erra, incluindo versões anteriores deste. O instinto é carimbar tudo com tempo: 0-4 segundos isto, 4-8 segundos aquilo. O suporte do Seedance 2.0 a temporização precisa é instável, e forçar durações exatas nos segmentos pode quebrar a geração.

Sequencie os planos e deixe o modelo encontrar o andamento. Rotule-os como Plano 1, Plano 2, Plano 3, na ordem em que os eventos acontecem, e descreva cada um assim: movimento de câmera, depois ação do sujeito, depois posição, depois som.

Fraco: "Um homem corre nervoso pela rua, e a cena parece bem cinematográfica."

Forte:

  • Plano 1: Vista lateral de um beco. O homem começa a correr, com a respiração acelerada.
  • Plano 2: Ele derruba uma banca de frutas. A câmera treme e avança até um close do rosto assustado dele.
  • Plano 3: Ele escala um muro baixo e desaparece. A câmera recua devagar e se fixa na rua vazia.

Marcações de tempo não são proibidas, e você vai vê-las nos prompts de exemplo da própria ByteDance. Trate-as como uma sugestão que o modelo talvez respeite, não como uma instrução que ele deva obedecer. Se o andamento realmente importa, a alavanca confiável é gerar menos planos por clipe, não escrever códigos de tempo mais apertados.

S - Estilo e restrições: feche a porta para os modos de falha

O último bloco do seu prompt é o que as pessoas deixam de fora, e ele trabalha mais do que elas imaginam. Ele tem três funções.

Qualidade de imagem: nomeie o acabamento que você quer. "Alta definição, muito detalhe, textura de filme, cor natural, luz suave."

Estilo: nomeie o visual, e nomeie mesmo quando você achar que a imagem de referência já o sugere. Se a sua foto de referência é realista, mas você quer animação, e você nunca diz isso, o resultado volta a puxar para live action. Diga "estilo de animação japonesa 2D" ou "CG 3D estilizado" de forma explícita.

Restrições: são as linhas que impedem o modelo de produzir artefatos que ninguém pediu.

  • Mantenha sem legendas. Evite gerar qualquer texto ou legenda.
  • Não gere logotipo.
  • Não gere marca d'água.

Vale ser franco sobre os limites aqui: as linhas de restrição reduzem a probabilidade de legendas e marcas d'água indesejadas, mas não a eliminam. Duas coisas ajudam de verdade. Se uma imagem ou clipe de referência tiver um texto de que você não precisa, remova o texto do recurso antes de enviá-lo. E, se o seu projeto permitir, gere em paisagem, porque legendas espúrias aparecem muito menos em paisagem do que em retrato. Você sempre pode recortar para o formato vertical depois.

Exemplo de prompt CRAFTS:

Exemplo de prompt CRAFTS

Contexto: Um escritório de detetive noir dos anos 1940, à noite, com sombras de persiana caindo sobre a mesa, com a iluminação e a atmosfera de @Image 1. Referência: @Image 2 para a aparência do detetive (chapéu fedora, sobretudo), @Video 1 para o passo lento e deliberado dele. Defina o homem de fedora e sobretudo em @Image 2 como o Detetive. Plano 1: Plano geral de todo o escritório. O Detetive entra pela esquerda do quadro e caminha até a mesa. <Passos em um piso de madeira.> Plano 2: A câmera o acompanha lateralmente, depois avança até um close enquanto ele levanta uma fotografia da mesa e a examina. Plano 3: Plano de detalhe da fotografia nas mãos dele. Plano 4: A câmera recua para um plano médio. Ele apoia a foto na mesa e solta um suspiro pesado. Durante todo o clipe: (uma linha melancólica de saxofone de @Audio 1). Mantenha sem legendas. Alta definição, grão de filme, luz prática quente contra sombra profunda.

Técnicas de referência de imagem

Definindo o estilo visual e a direção estética

As imagens estabelecem o visual e a sensação geral da sua geração. Use-as para definir paletas de cor, abordagens de iluminação, estilo de composição e tratamento artístico.

Direção de estilo visual

Crie uma cena noturna de rua molhada de chuva com o estilo visual de @Image 1. Reproduza os reflexos no asfalto molhado, o brilho das vitrines e a correção de cor melancólica em azul e magenta. Use a composição de arquitetura vertical de @Image 2. Alta definição, grão de filme, cor natural.

Mantendo a consistência do personagem entre planos

Ao gerar vários vídeos com o mesmo personagem, referencie a mesma imagem do personagem em cada prompt para manter a consistência de aparência.

Consistência de personagem

Apresente a mulher de @Image 1 ao longo de toda esta sequência, mantendo exatamente os traços do rosto, o penteado e a roupa dela. Ela começa no cenário externo de @Image 2, depois a cena passa para o ambiente interno mostrado em @Image 3. A aparência dela permanece consistente nos dois locais.

Vitrine de produto com detalhes fiéis

Para conteúdo comercial ou focado em produto, use vários ângulos e planos de detalhe como referência para garantir uma reprodução fiel.

Vitrine de produto

Crie uma apresentação de produto para a bolsa de @Image 1. O perfil lateral deve corresponder a @Image 2, a textura da superfície e os detalhes do material devem referenciar @Image 3, e as ferragens e o fecho devem corresponder a @Image 4. Use movimentos de câmera de rotação suave para exibir todos os ângulos. A iluminação deve ser clara e limpa para mostrar todos os detalhes.

Técnicas de referência de vídeo

Replicando movimentos de câmera e fotografia

As referências de vídeo se destacam ao demonstrar técnicas de câmera específicas que são difíceis de descrever só com texto.

Replicação de movimento de câmera

Coloque o personagem de @Image 1 no corredor de @Image 2. Siga estritamente todos os efeitos de movimento de câmera de @Video 1: plano de acompanhamento por trás enquanto o personagem caminha, a câmera contorna até a frente com perspectiva em contra-plongée, depois faz uma panorâmica de 90 graus à direita para enquadrar a porta. Execute como um único plano contínuo, sem cortes.

Copiando padrões de movimento e coreografia

Para dança, sequências de luta ou padrões de movimento específicos, as referências de vídeo dão uma orientação de movimento quadro a quadro.

Coreografia de movimento

Apresente o artista marcial de @Image 1 executando golpes no salão de treino de @Image 2. O personagem deve executar exatamente a sequência de chutes mostrada em @Video 1: chute giratório para trás, transição para chute rodado, terminando com um chute giratório aéreo. Reproduza a velocidade, a altura e a fluidez dos movimentos de referência.

Replicando efeitos especiais e técnicas visuais

As referências de vídeo podem demonstrar efeitos de partículas, transições, técnicas de composição e outros efeitos visuais para uma reprodução fiel.

Replicação de efeitos especiais

O personagem de @Image 1 realiza uma transformação mágica. Referencie os efeitos de partículas de @Video 1: partículas brilhantes sobem do chão, giram ao redor do personagem, o brilho se intensifica, depois as partículas explodem para fora revelando a aparência transformada de @Image 2.

Técnicas de referência de áudio

Integração de música de fundo e definição de clima

As referências de áudio estabelecem o tom emocional e o andamento do seu vídeo por meio da escolha musical.

Integração de música de fundo

Crie um vídeo motivacional de fitness de 15 segundos com a atleta de @Image 1 na academia de @Image 2. Use a música energética de @Audio 1 para estabelecer um clima inspirador e potente. Os movimentos de câmera devem acompanhar o ritmo pulsante da música, com aproximações dinâmicas e movimento.

Sincronia com a batida para mudanças visuais

Sincronize transições de cena, cortes ou mudanças visuais com batidas musicais específicas, para um andamento profissional e bem acabado.

Sincronia com a batida

O personagem de @Image 1 troca de roupa a cada batida musical de @Audio 1. Primeiro traje de @Image 2, corte para o segundo traje de @Image 3 na primeira batida, terceiro traje de @Image 4 na segunda batida, quarto traje de @Image 5 na terceira batida. Cada corte acontece exatamente na batida. Use cortes rápidos, sem efeitos de transição.

Timbre de voz e correspondência de diálogo

Quando características específicas de voz importam, referencie arquivos de áudio ou vídeo que contenham a qualidade de voz desejada.

Correspondência de voz e diálogo

A voz do narrador deve corresponder ao timbre grave e autoritário de @Audio 1. O texto da narração: "Em um mundo transformado pela tecnologia, uma pessoa ousa questionar tudo." Entregue com o mesmo andamento e a mesma ênfase dramática da referência.

Exemplos complexos com várias referências

Combinando todos os tipos de entrada para produção comercial

Exemplo: comercial de produto

Comercial de produto

Contexto: Um estúdio minimalista com @Image 1 como referência de ambiente: fundo branco infinito, luz lateral dramática. Referência: @Image 2 e @Image 3 mostram o produto (fones de ouvido sem fio) de frente e de lado. @Video 1 para o movimento de câmera, um dolly rotativo lento. @Audio 1 para a música de fundo. Plano 1: Plano geral apresentando os fones flutuando no centro do quadro. A câmera inicia um dolly circular lento ao redor deles, acompanhando a trajetória de @Video 1. Plano 2: Os fones se desdobram suavemente enquanto a câmera continua o contorno. <Um clique mecânico suave.> Plano 3: A câmera avança até um close enquanto os LEDs das conchas se acendem. <Um tom suave de ligar.> Durante todo o clipe: (música eletrônica animada de @Audio 1). Estilo: alta definição, acabamento limpo de comercial de produto, reflexos nítidos, cor natural. Não gere logotipo nem marca d'água. Mantenha sem legendas.

Cena com vários personagens e diálogo

Exemplo: cena narrativa

Cena de diálogo com vários personagens

Contexto: Uma sala de reuniões corporativa durante o dia, com o interior moderno de @Image 1: janelas amplas, uma mesa longa. Referência: Defina a mulher de terno azul-marinho em @Image 2 como a CEO. Defina o homem de terno cinza em @Image 3 como o Investidor. @Video 1 para o ritmo de câmera em plano e contraplano entre quem fala. @Audio 1 para a música ambiente tensa. Plano 1: Plano geral, a CEO e o Investidor em pontas opostas da mesa. A CEO se levanta, gesticula com firmeza e diz {Esta fusão é a nossa única opção.} Plano 2: Corte para um plano médio do Investidor. Ele se recosta, de braços cruzados, e responde num tom seco: {Já ouvi isso antes.} Plano 3: Corte para um plano médio da CEO. Ela se senta pesadamente, com a mandíbula travada. Plano 4: Plano geral quando o Investidor se levanta. A câmera o acompanha com suavidade enquanto ele caminha até a janela. <Passos em um piso duro.> Durante todo o clipe: (música ambiente tensa de @Audio 1, baixa na mixagem). Estilo: alta definição, tons corporativos frios, luz suave de janela. Os rostos permanecem consistentes, sem deformação. Mantenha sem legendas.

Recursos avançados do Seedance 2.0

Extensão de vídeo para narrativas contínuas

O Seedance 2.0 consegue estender um vídeo existente com conteúdo novo que dá sequência à história. Funciona nas duas direções: você pode gerar o que acontece depois de um clipe e também o que aconteceu antes dele, o que ajuda quando você tem um plano forte, mas nenhuma forma de entrar nele.

Como funciona a extensão de vídeo:

  1. Envie seu vídeo existente
  2. Diga qual direção você quer e descreva o que acontece
  3. O modelo extrai sozinho os quadros de transição e gera a continuação

Refira-se ao clipe como @Video 1, não como "referência @Video 1". Esta é uma tarefa de edição, e a palavra referência pode empurrar o modelo a gerar um vídeo parecido em vez de continuar o seu.

Exemplo: estendendo uma cena de cafeteria

Vídeo existente: clipe de 10 segundos de uma pessoa sentada à mesa de um café, olhando para um notebook

Extensão de vídeo

Gere o conteúdo depois de @Video 1. A pessoa fecha o notebook, pega a xícara de café e toma um gole enquanto olha pela janela, depois apoia a xícara e se levanta. A câmera permanece em plano médio, mantendo a composição e a iluminação do original.

A filmagem original não é regerada, então a parte de que você já gosta continua exatamente como está. Por padrão, a saída carrega apenas a ponta final do clipe de origem, não o clipe inteiro. Se quiser o original incluído no vídeo devolvido, peça: "Estenda @Video 1 para trás, [descrição], e depois termine com @Video 1."

Duas limitações a considerar no planejamento

A extensão é realmente útil, mas não é invisível, e você vai se poupar de uma tarde ruim sabendo disso desde já.

As emendas podem dar um salto. No ponto em que o novo trecho encontra o original, você pode ver um pequeno salto ou um quadro de retrocesso. Não existe hoje um prompt que resolva isso de forma confiável. O reparo prático é no seu editor: corte cerca de 6 quadros do fim do clipe que sai e 1 quadro do início do que entra, em cada emenda. Melhor ainda, planeje seus clipes para que a emenda caia num corte, e não no meio de um movimento, onde a descontinuidade fica invisível por concepção.

A qualidade decai se você encadear extensões. Reaproveitar um vídeo gerado como origem de outra extensão degrada a imagem, e o dano se acumula a cada passagem. Isso aparece primeiro como manchas de cor irregulares nos rostos. Mantenha a cadeia curta e alimente o modelo com a origem de maior qualidade que você tiver.

Se você realmente precisa estender repetidamente, a ByteDance documenta uma solução estranha, mas eficaz: converta o clipe em um vídeo em modelo branco primeiro e depois continue a partir dele. O prompt é, aproximadamente, "Converta o vídeo em um modelo 3D branco. Todos os personagens viram modelos 3D totalmente brancos, sem cor, sem textura, sem sombras, fundo totalmente branco, estrutura estável, movimento suave." Tirar a cor e a textura dá à próxima passagem uma base estrutural limpa para construir, em vez de acumular os artefatos da anterior.

Boas práticas de extensão:

  • Mantenha as extensões relativamente curtas (5-8 segundos) para a melhor continuidade
  • Descreva com clareza a ação que conecta o fim do original ao conteúdo novo
  • Mencione os elementos que devem permanecer iguais (ângulo de câmera, iluminação, posição do personagem)
  • Se o vídeo original tem áudio, aponte esse estilo de áudio como referência para a extensão

Fusão de vídeos e transições entre vários clipes

Crie transições fluidas entre vários clipes de vídeo existentes gerando o conteúdo de ligação.

Exemplo: conectando dois locais

Vídeos existentes:

  • @Video 1: personagem caminhando por uma rua urbana (termina com o personagem se aproximando da esquina)
  • @Video 2: o mesmo personagem entrando no apartamento (começa com a porta se abrindo)
Transição por fusão de vídeos

Crie um trecho de transição de 5 segundos entre @Video 1 e @Video 2. O personagem do fim de @Video 1 dobra a esquina, sobe a escada externa do prédio visível ao fundo no quadro de abertura de @Video 2, chega à porta e começa a abri-la (conectando ao início de @Video 2). Reproduza a aparência do personagem, o ritmo da caminhada e o estilo de movimento dos dois vídeos de referência. A iluminação passa da luz do dia externa, no início, à iluminação interna de @Video 2, no fim.

Isso gera um clipe-ponte que conecta suavemente duas filmagens separadas, mantendo a continuidade do personagem e da narrativa.

Substituição de personagens em vídeos existentes

Troque personagens ou sujeitos em vídeos preservando todos os outros elementos, incluindo o trabalho de câmera, o movimento e os detalhes da cena.

Exemplo: substituição em performance musical

Substituição de personagem

Em @Video 1, substitua a vocalista principal pelo artista masculino de @Image 1. As ações da performance devem replicar exatamente as do vídeo original: o manejo do microfone, os movimentos do corpo, as expressões faciais e a interação com a banda. O artista substituto deve acompanhar o tempo e a energia da performance original quadro a quadro. Todos os demais elementos permanecem inalterados: integrantes da banda, palco, iluminação, movimentos de câmera.

Casos de uso para substituição de personagem:

  • Testar diferentes talentos em conceitos publicitários
  • Criar variações da mesma cena com atores diferentes
  • Atualizar filmagens existentes com novos embaixadores de marca
  • Produzir conteúdo para mercados regionais distintos com talentos locais

Subversão do enredo e alteração narrativa

Mude completamente o rumo ou o desfecho da narrativa de um vídeo existente mantendo os elementos visuais e técnicos.

Exemplo: reviravolta em drama de relacionamento

Vídeo original (@Video 1): cena romântica em que um homem pede a mulher em casamento sobre uma ponte, ela aceita e os dois se abraçam

Subversão do enredo

Subverta o enredo de @Video 1. A cena começa de forma idêntica: o homem se ajoelha e abre a caixinha do anel. Porém, a expressão da mulher passa de alegria surpresa a percepção chocada. Ela dá um passo atrás, balançando a cabeça. O rosto do homem muda de esperançoso para frio e calculista. Ele se levanta devagar, com uma postura ameaçadora em vez de amorosa. A mulher diz "Você mentiu para mim desde o começo!" O homem responde com um sorriso gélido: "É isso que você deve à minha família." O desfecho de confronto substitui o abraço romântico original. Mantenha todos os ângulos e movimentos de câmera de @Video 1.

Essa técnica permite redirecionar a narrativa por completo preservando a fotografia e o valor de produção da filmagem existente.

Planos-sequência contínuos

Crie sequências de plano longo, sem cortes, que acompanham os sujeitos por vários ambientes.

Exemplo: perseguição urbana

Plano-sequência contínuo

@Image 1, @Image 2, @Image 3, @Image 4 e @Image 5 representam um plano-sequência que acompanha um corredor. Sequência: comece no nível da rua (@Image 1) com um plano geral em que o corredor entra em quadro pela direita, correndo a toda velocidade. A câmera o pega e o segue por trás enquanto ele chega à entrada do prédio (@Image 2). Continue acompanhando enquanto o corredor sobe a escada interna aos saltos (@Image 3), mantendo a curta distância de perseguição. Surja no nível da cobertura (@Image 4), com a câmera ainda seguindo por trás. O corredor chega à borda do telhado. A câmera contorna até a frente do corredor para o quadro final e então sobe em grua até uma perspectiva aérea que mostra o horizonte da cidade (@Image 5). Câmera: acompanhamento contínuo em estilo câmera na mão do começo ao fim. Sem cortes. Leve tremor de câmera para dar urgência e realismo. Transições de movimento suaves entre os ambientes. A ordem dos planos acima é o que determina o ritmo; não fixe os trechos em contagens exatas de segundos.

Replicação criativa de modelos

Copie a estrutura, o estilo e as técnicas de vídeos de referência substituindo por seus próprios sujeitos e marca.

Exemplo: adaptando um estilo publicitário

Referência: @Video 1 mostra um comercial de perfume de alto padrão com técnicas de câmera, transições e ritmo específicos

Replicação criativa de modelo

Crie um comercial de relógio de luxo tomando como referência o estilo publicitário e a estrutura de @Video 1. Use as mesmas técnicas de câmera: movimentos suaves de dolly, revelações de iluminação dramáticas, foco em detalhes em close e ritmo elegante. Substitua o frasco de perfume pelo relógio de @Image 1. Mantenha a colorização sofisticada, o tempo das transições e a cadência da referência. O ambiente deve ser minimalista e moderno como @Image 2. Use a música orquestral de @Audio 1 para acompanhar a sensação premium.

Casos de uso e exemplos do Seedance 2.0

Esta seção demonstra aplicações do Seedance 2.0 em diferentes setores e níveis de complexidade. Cada setor traz exemplos básicos, intermediários e avançados, mostrando uma evolução progressiva de habilidade.

Produção publicitária e comercial

Básico: vitrine estática de um único produto

Cenário: exibição simples de produto para e-commerce

Vitrine de produto único

Exiba o smartwatch de @Image 1 centralizado sobre o fundo branco de @Image 2. A câmera gira lentamente 360 graus completos ao redor do produto, mantendo a mesma distância o tempo todo. A iluminação é limpa e clara, sem sombras duras. Perto do fim do plano, o mostrador do relógio se acende, mostrando a hora. Use a música eletrônica ambiente sutil de @Audio 1. Mantenha o vídeo sem legendas. Não gere marca d'água.

Nível de complexidade: uma imagem de referência, um movimento de câmera, um evento


Intermediário: demonstração de produto em vários ângulos

Cenário: demonstração de produto de tecnologia mostrando vários recursos

Demonstração de produto em vários ângulos

Contexto: um estúdio limpo, usando @Image 1 como referência de iluminação: luz suave e uniforme contra um fundo minimalista. Referência: @Image 2 (vista frontal dos fones sem fio), @Image 3 (vista lateral), @Image 4 (estojo de carregamento, aberto). @Audio 1 para a música de fundo. Plano 1: plano aéreo olhando para o estojo aberto de cima. A tampa se fecha sozinha. <Um clique satisfatório.> Plano 2: ângulo frontal em três quartos. O estojo se abre e os fones sobem levemente para fora dele. <Um leve sopro.> Plano 3: a câmera aproxima enquanto um único fone se solta e gira devagar mostrando todos os lados. Plano 4: close do indicador de LED do estojo, pulsando para mostrar o carregamento. Ao longo de todo o vídeo: (música animada de @Audio 1). Estilo: alta definição, acabamento comercial limpo, cor natural. Mantenha o vídeo sem legendas. Não gere logotipo nem marca d'água.

Nível de complexidade: várias imagens, vários planos, ângulos de câmera variados, sincronia de áudio


Avançado: comercial completo com transições de cena

Cenário: comercial de estilo de vida de 15 segundos mostrando o produto em uso em vários ambientes

Comercial completo com transições de cena

Contexto: um comercial de estilo de vida para os fones de ouvido de @Image 1 e @Image 2 (dois ângulos). Referência: defina a jovem profissional de @Image 3 como a Passageira (foto do rosto em close). @Image 4 para a rua urbana, @Image 5 para a academia. @Video 1 para o estilo de câmera dinâmico na academia. @Audio 1 para a música que conduz a peça inteira. Plano 1: a câmera segue ao lado da Passageira, a média distância, enquanto ela caminha por uma rua movimentada usando os fones de @Image 1. <Ruído de rua, denso e próximo.> Ela toca a concha do fone, e o ruído da rua cai a zero, deixando só a música. Plano 2: corte na batida. Ela agora está a uma mesa em uma videochamada, com os fones, num home office claro. A câmera aproxima até um close da concha do fone e da sua luz indicadora. <Digitação suave de teclado por baixo da música.> Plano 3: corte na batida para a academia de @Image 5. Ela treina forte e os fones não saem do lugar. A câmera se move com a energia, seguindo o estilo de @Video 1, e depois recua para um plano geral. Ao longo de todo o vídeo: (música de @Audio 1 atravessando os três locais). Estilo: 21:9, colorização profissional acompanhando os tons frios e modernos de @Image 1, alta definição. Corte na batida. Não gere logotipo nem marca d'água.

Nível de complexidade: 5 imagens, 1 vídeo, 1 áudio. Áudio em camadas, três locais, fotografia profissional.

Este exemplo fica no topo da faixa recomendada de arquivos, e o home office é descrito em palavras em vez de receber a própria imagem de referência. Essa é uma troca deliberada. Um comercial de três locais é exatamente onde a tentação de enviar uma foto de tudo é mais forte, e exatamente onde fazer isso começa a borrar o sujeito.


Criação de conteúdo para redes sociais

Básico: vídeo de cortes rápidos em estilo de tendência

Cenário: conteúdo simples para redes sociais com efeito de transição popular

Vídeo de cortes rápidos em tendência

Defina a mulher de @Image 1 como Sujeito 1. O Sujeito 1 fica centralizado no quadro contra o fundo claro de @Image 2. Plano 1: ela levanta a mão em um gesto rápido. No gesto, corte seco para o Sujeito 1 com o look de @Image 3, na mesma posição e pose. Plano 2: outro gesto de mão e corte seco para o look de @Image 4, mesma posição. Plano 3: ela segura a pose final e sorri. Ao longo de todo o vídeo: (música animada de @Audio 1). Cada corte cai numa batida. O rosto dela permanece idêntico nos três looks. Mantenha o vídeo sem legendas.

Nível de complexidade: várias imagens de referência, sincronia com a batida, efeito de transição simples


Intermediário: sequência narrativa em vários locais

Cenário: conteúdo em estilo vlog de um dia na vida

Sequência narrativa em vários locais

Contexto: uma montagem de "um dia na vida". Referência: defina a mulher de @Image 1 como a Criadora. @Image 2 (cafeteria de manhã), @Image 3 (espaço de coworking), @Image 4 (parque ao ar livre). @Video 1 para o estilo de movimento de câmera na mão. @Audio 1 para a música de fundo. Plano 1: cafeteria de @Image 2. A Criadora entra, pede no balcão e se vira para a câmera com um café na mão, no estilo de câmera na mão de @Video 1. <Murmúrio baixo de café por baixo da música.> Plano 2: espaço de coworking de @Image 3. Ela trabalha no notebook, digitando, depois levanta os olhos para a câmera e sorri. <Digitação de teclado.> Plano 3: close da tela do notebook. Plano 4: parque de @Image 4, hora dourada. Ela senta num banco, fecha o notebook, se levanta, estica os braços acima da cabeça e caminha em direção à câmera. <Canto de pássaros e vento leve.> Ao longo de todo o vídeo: (música animada de vlog de @Audio 1). Estilo: visual de vlog com câmera na mão acompanhando o movimento de @Video 1, misturando planos médios e closes, cortando entre os locais na batida. Alta definição, cor quente e natural. Mantenha o vídeo sem legendas.

Nível de complexidade: vários locais, referência de estilo de câmera na mão, camadas de áudio, conteúdo movido por personalidade


Avançado: efeitos visuais complexos em estilo viral

Cenário: conteúdo de alta produção para redes sociais com efeitos em alta

Transformação com efeitos visuais virais

Contexto: um vídeo de transformação com o fundo urbano de @Image 4. Referência: defina a mulher de @Image 1 como a Dançarina. @Image 2 (look inicial, streetwear casual), @Image 3 (look final, figurino de performance), @Video 1 (coreografia do movimento dos braços e do giro), @Video 2 (estilo do efeito de partículas), @Audio 1 (música). Plano 1: a câmera circula a Dançarina lentamente. Ela está parada no streetwear de @Image 2. Plano 2: ela ergue os dois braços no movimento de @Video 1. No auge do movimento, a imagem falha com distorção digital. <Um som seco de glitch.> Plano 3: efeitos de partículas no estilo de @Video 2 sobem do chão e giram ao redor dela. A câmera continua sua rotação. <Um sopro ascendente.> Plano 4: um clarão de luz. Ao se dissipar, ela está com o figurino de performance de @Image 3, no meio de um giro, seguindo a coreografia de @Video 1. Plano 5: ela completa o giro e aterrissa numa pose sustentada. A câmera se acomoda de frente. O ambiente atrás dela agora é o palco de @Image 5. <Um impacto na aterrissagem.> Ao longo de todo o vídeo: (música de alta energia de @Audio 1, crescendo até um clímax). Estilo: alto contraste, cor saturada, efeitos sincronizados com a batida, alta definição. O rosto dela permanece idêntico antes e depois da transformação. Mantenha o vídeo sem legendas.

Nível de complexidade: várias referências complexas, correspondência precisa de coreografia, replicação de efeitos especiais, sincronia de áudio avançada, integração de estilo em alta


Produção de cinema e entretenimento

Básico: plano de abertura atmosférico

Cenário: plano de ambientação para conteúdo narrativo

Plano de abertura atmosférico

Plano de abertura cinematográfico da mansão abandonada de @Image 1 à noite. Plano único: a câmera começa aberta, mostrando o prédio inteiro e seu terreno tomado pelo mato, e depois aproxima lentamente em direção à entrada principal. Um movimento contínuo, sem cortes. Atmosfera escura e sombria, luar rompendo as nuvens. Todas as janelas estão escuras, exceto uma no segundo andar, onde uma luz fraca tremula. <Vento passando entre as árvores.> Ao longo de todo o vídeo: (tom ambiente sinistro de @Audio 1). Estilo: fílmico, alta definição, sombras profundas, luar frio. Mantenha o vídeo sem legendas.

Nível de complexidade: uma imagem, movimento de câmera básico, construção de atmosfera


Intermediário: cena de diálogo em campo e contracampo

Cenário: conversa entre dois personagens com cobertura profissional

Cena de diálogo em campo e contracampo

Contexto: uma sala de interrogatório com o ambiente austero de @Image 1: uma luz no teto, uma mesa de metal, duas cadeiras. Referência: defina o homem sério de meia-idade de @Image 2 como o Detetive. Defina o rapaz de @Image 3 como o Suspeito. @Video 1 para a cadência de câmera de campo e contracampo. @Audio 1 para a música ambiente tensa. Plano 1: plano geral dos dois homens à mesa. O Detetive se inclina para a frente, mãos entrelaçadas. O Suspeito não encara seus olhos, os dedos tamborilando na mesa. <Uma cadeira de metal range.> Plano 2: corte para um primeiro plano médio do Detetive, em ângulo levemente baixo. Sem piscar, ele diz {Sabemos que você estava lá naquela noite.} Plano 3: corte para um primeiro plano médio do Suspeito, em ângulo levemente alto. Os olhos dele desviam, depois ele se recompõe: {Não sei do que você está falando.} Plano 4: corte de volta para o plano geral. O Detetive desliza uma fotografia sobre a mesa. Os olhos do Suspeito se arregalam. O Detetive se recosta. Ao longo de todo o vídeo: (música tensa de @Audio 1, baixa) e som de sala. <A foto desliza sobre o metal.> Estilo: luz dura e dramática, alta definição, fílmico. Os rostos permanecem consistentes, sem deformação. Mantenha o vídeo sem legendas.

Nível de complexidade: duas imagens de personagem, referência de técnica de câmera específica, ritmo de diálogo, tensão psicológica


Avançado: sequência de ação com coreografia complexa

Cenário: cena de luta com coreografia de artes marciais específica

Sequência de ação com coreografia complexa

Contexto: uma cobertura ao pôr do sol, ambiente de @Image 1: unidades de ar-condicionado, horizonte ao longe, céu alaranjado e duro. Referência: defina o lutador de @Image 2 como o Herói (foto do rosto em close), com o figurino de @Image 3. Defina os três adversários de @Image 4 como os Adversários. @Video 1 para a coreografia da luta: a esquiva, o chute giratório, a pegada. @Video 2 para o estilo de câmera: circulando a ação, cortando no impacto. @Audio 1 para a música. Plano 1: plano geral. Os Adversários cercam o Herói. A câmera circula o grupo lentamente. O vento move as roupas deles. Plano 2: close do rosto do Herói. Mandíbula firme, respiração estável. Plano 3: o primeiro adversário avança. O Herói esquiva para a direita, reproduzindo o movimento de @Video 1. Plano 4: o Herói executa o chute giratório de @Video 1 e acerta. A câmera acompanha o chute em plano médio. <Um impacto pesado.> Plano 5: o segundo adversário se aproxima. O Herói agarra: pega, gira, arremessa, como em @Video 1. A câmera circula a ação no estilo de @Video 2. Plano 6: o terceiro adversário desfere um golpe. O Herói se abaixa por baixo dele em câmera lenta. Plano 7: o Herói se levanta, com os Adversários no chão ao seu redor. A câmera aproxima até um close, com o pôr do sol atrás dele transformando-o em silhueta. Ao longo de todo o vídeo: (música de @Audio 1, crescendo até um clímax), <vento sobre a cobertura, movimento de tecido, respiração pesada>. Estilo: tons quentes de pôr do sol, alto contraste, fílmico, alta definição. Os corpos permanecem anatomicamente estáveis, sem membros deformados. Mantenha o vídeo sem legendas.

Nível de complexidade: quatro imagens de referência, duas referências de vídeo (coreografia e estilo de câmera), referência de áudio, coreografia de ação complexa, câmera lenta.

Calibre suas expectativas com honestidade aqui. Ação rápida e de alto impacto é a coisa mais difícil de pedir a este modelo, e é onde membros deformam e a física falha. É exatamente por isso que este prompt se apoia num vídeo de referência de coreografia em vez de tentar descrever o chute em palavras: mostrar o movimento é muito mais confiável do que descrevê-lo. Ainda assim, espere gerar este várias vezes. Se um plano continua falhando, a correção normalmente é desacelerar a ação ou dividi-la em dois planos, não acrescentar mais adjetivos.


Aplicações em fluxos de trabalho profissionais

Extensão de vídeo para continuidade de projeto

Cenário: estendendo com conteúdo adicional uma filmagem já realizada

Vídeo existente: plano de 8 segundos de um CEO caminhando por um escritório moderno, terminando na porta da sala de reuniões

Extensão de vídeo para continuidade

Gere o conteúdo depois de @Video 1. O CEO do fim do vídeo abre a porta da sala de reuniões e entra. Lá dentro, a sala de reuniões corresponde ao design de @Image 1: mesa grande, janelas do piso ao teto com vista para a cidade. Três executivos de @Image 2, @Image 3 e @Image 4 já estão sentados e levantam os olhos quando o CEO entra. O CEO caminha até a cabeceira da mesa e se senta. A câmera segue o CEO pela porta com um travelling suave, depois corta para um plano geral que mostra a sala de reuniões inteira assim que o CEO se senta. Mantenha a mesma colorização profissional e o mesmo estilo de iluminação de @Video 1.

Caso de uso: acrescentar conteúdo a materiais de vídeo profissionais existentes sem refilmagens


Criação de conteúdo em massa a partir de um modelo

Cenário: criar vários vídeos para redes sociais com estilo consistente

Prompt de modelo principal (Vídeo 1):

Criação em massa baseada em modelo

Vitrine de produto para [o produto em @Image 1] contra o fundo branco de @Image 2. Plano 1: a câmera gira 360 graus completos ao redor do produto. Plano 2: um destaque gráfico aparece ao lado do produto realçando seu recurso principal. Plano 3: o logotipo de @Image 3 se define no centro do quadro. Ao longo de todo o vídeo: (música de @Audio 1). Estilo: acabamento comercial limpo, alta definição, luz suave e uniforme. Não gere marca d'água.

Prompts de variação: troque @Image 1 por produtos diferentes mantendo @Image 2, @Image 3 e @Audio 1 para a consistência da marca

Caso de uso: produção de conteúdo escalável para catálogos de produtos, mantendo a identidade de marca em vários materiais


Adaptação para vários idiomas

Cenário: criar variações regionais do mesmo comercial

Prompt base:

Adaptação para vários idiomas

Estrutura de comercial de 30 segundos de @Video 1. Substitua a narração por uma voz em [Idioma] que acompanhe o tom e o ritmo de @Audio 1. O personagem de @Image 1 permanece o mesmo. Os textos sobrepostos mudam para as versões em [Idioma], acompanhando o tempo de @Video 1.

Caso de uso: campanhas de marketing internacionais que exigem versões localizadas com identidade visual consistente

Boas práticas para o Seedance 2.0

O framework de prompts CRAFTS (detalhado)

Resultados profissionais no Seedance 2.0 exigem engenharia de prompts estruturada. O framework CRAFTS oferece uma abordagem sistemática que garante que todos os elementos críticos sejam especificados:

C - Contexto: estabeleça a cena e o ambiente

Defina onde e quando a ação acontece. Isso inclui:

  • Local físico e cenário
  • Hora do dia ou período histórico
  • Condições atmosféricas (clima, qualidade da luz)
  • Clima e tom gerais
  • Detalhes do ambiente que importam para a história

Exemplo: "Em uma boate subterrânea às 2 da manhã, com a atmosfera densa de @Image 1. Ar enevoado por máquinas de fumaça, teto baixo iluminado pelo brilho do bar, pista de dança lotada ao fundo."

R - Referência: defina os sujeitos, depois especifique as menções com @ e a finalidade exata

É aqui que vive o poder multimodal. Nomeie o sujeito primeiro e depois seja explícito sobre o que cada referência contribui:

  • Defina cada sujeito por 2 ou 3 características estáveis e reutilize esse rótulo sempre
  • Declare a menção com @ com clareza
  • Especifique exatamente qual aspecto daquela referência deve ser usado
  • Deixe claro o que NÃO usar, se a referência contém vários elementos
  • Comece pelo material que precisa ser mais preciso

Exemplo: "Defina a mulher de cabeça raspada e jaqueta de couro em @Image 1 como Ada. @Image 1 para os traços faciais e o cabelo de Ada apenas, não para as roupas. @Image 2 para o figurino da jaqueta de couro. @Video 1 para o ritmo da caminhada e o andar confiante. @Audio 1 para a música eletrônica de fundo."

A - Ação: descreva os movimentos de personagens e objetos

Detalhe o que acontece na cena: os verbos do seu vídeo:

  • Movimentos e gestos dos personagens
  • Interações com objetos (pegar, apoiar, arremessar)
  • Expressões faciais e reações emocionais
  • Interações entre vários sujeitos
  • Eventos regidos pela física (coisas caindo, líquidos sendo servidos, fumaça subindo)

Exemplo: "O personagem entra pela esquerda do quadro, caminhando com o andar confiante de @Video 1. Os olhos varrem a multidão brevemente, depois travam em alguém fora de quadro. Um leve sorriso se forma. O personagem ajusta a gola da jaqueta com a mão direita e então começa a avançar pela multidão com determinação."

F - Enquadramento: defina o trabalho de câmera e a fotografia

Use terminologia de fotografia adequada para especificar a composição dos planos:

  • Tipos de plano: plano geral, plano médio, close, primeiríssimo plano, plano sobre o ombro, plano em ponto de vista
  • Movimentos de câmera: dolly para dentro/fora, travelling, panorâmica para a esquerda/direita, tilt para cima/baixo, grua para cima/baixo, câmera na mão, steadicam
  • Ângulos: ângulo baixo, ângulo alto, altura dos olhos, ângulo holandês
  • Técnicas especiais: zoom Hitchcock, whip pan, mudança de foco, pouca profundidade de campo

Exemplo: "Abra com um plano geral que estabelece o ambiente inteiro da boate. Quando o personagem entra, a câmera o pega e começa a acompanhá-lo ao lado em plano médio. Quando o personagem para para varrer a multidão, aproxime lentamente até um primeiro plano médio. Corte para o plano em ponto de vista do personagem, olhando através da multidão. Corte de volta para o close do rosto do personagem enquanto o sorriso se forma. Retome o acompanhamento enquanto o personagem avança pela multidão, com a câmera seguindo por trás."

T - Linha do tempo: ordene seus planos e deixe o modelo encontrar o ritmo

Divida sua sequência em planos numerados, na ordem em que os eventos acontecem:

  • Rotule-os como Plano 1, Plano 2, Plano 3, o mais importante primeiro
  • Dê a cada plano um movimento de câmera, um tempo de ação, um lugar
  • Coloque o som daquele plano dentro daquele plano
  • Não atribua uma duração a cada plano

O tempo preciso é a superfície de controle mais fraca do modelo. Fixar os trechos em contagens exatas de segundos pode produzir um resultado pior do que deixá-los em paz, então descreva a ordem dos eventos e deixe o modelo respirar.

Exemplo: "Plano 1: plano geral da boate. Ada entra e começa a caminhar. Plano 2: a câmera a acompanha ao lado em plano médio enquanto ela varre a multidão. Plano 3: close enquanto um pequeno sorriso se forma. Plano 4: o ponto de vista dela, olhando através da multidão. Plano 5: a câmera retoma o acompanhamento por trás enquanto ela avança. Ao longo de todo o vídeo: (música eletrônica de @Audio 1 em volume moderado)."

S - Estilo e restrições: trave a aparência e descarte os artefatos

Encerre todo prompt com o acabamento e as travas de segurança:

  • Qualidade de imagem: "alta definição, riqueza de detalhes, textura fílmica, luz suave"
  • Estilo: nomeie-o explicitamente, mesmo que uma imagem de referência o sugira
  • Restrições: "Mantenha o vídeo sem legendas." "Não gere marca d'água." "Não gere logotipo."
  • Estabilidade: "O rosto do personagem permanece consistente, sem deformação. O movimento é suave, sem tremores nem cintilação."

Exemplo completo de CRAFTS: vídeo de treinamento corporativo

Exemplo de CRAFTS: vídeo de treinamento corporativo

Contexto: uma sala de reuniões moderna pela manhã, com luz natural de janela vindo da direita do quadro. O ambiente corresponde ao interior de @Image 1: paredes de vidro, mobiliário contemporâneo, telas na parede. Referência: defina a mulher de blazer azul-marinho em @Image 2 como a Instrutora. @Image 3 para o grupo de participantes sentados ao redor da mesa. @Video 1 para os gestos de mão e a linguagem corporal da Instrutora enquanto ela explica. Plano 1: plano geral da sala inteira a partir do canto, estabelecendo a Instrutora na cabeceira da mesa e os participantes ao redor. Plano 2: plano médio da Instrutora em ângulo frontal de três quartos. Ela gesticula em direção à tela, depois se vira para o grupo com um sorriso aberto. Plano 3: plano sobre o ombro por trás da Instrutora, mostrando os participantes ouvindo. Um deles se inclina para a frente. Plano 4: a câmera acompanha a Instrutora ao lado enquanto ela caminha ao longo da mesa, fazendo contato visual pelo caminho. Plano 5: close de um participante tomando notas. <Batidas silenciosas de teclado.> Plano 6: plano médio da Instrutora de volta à cabeceira da mesa, encerrando com um gesto confiante. Ao longo de todo o vídeo: (música de fundo corporativa de @Audio 1, baixa, cedendo espaço ao diálogo). Estilo: visual de documentário corporativo em alta definição, tons quentes e neutros, luz suave. Os rostos permanecem consistentes, sem deformação, e o movimento é suave. Mantenha o vídeo sem legendas. Não gere logotipo nem marca d'água.

Estratégia de preparação dos materiais de entrada

Otimização das imagens de referência

Entrada de qualidade gera saída de qualidade. Prepare as imagens de referência com estratégia:

Para consistência de personagem:

  • Use uma foto do rosto em close, apenas o rosto, de frente, expressão neutra, fundo mínimo
  • Acrescente uma foto de corpo inteiro para figurino e proporção. Esse é o conjunto completo
  • Não acrescente mais ângulos. Um giro de frente/perfil/três quartos piora a deriva de identidade em vez de melhorá-la, porque o modelo lê os ângulos como pessoas diferentes
  • Evite filtros ou efeitos pesados que possam confundir o modelo
  • Se o figurino importa, deixe que a foto de corpo inteiro o carregue, em vez de acrescentar recortes de detalhe

Para estilo e estética:

  • Selecione imagens que demonstrem com clareza o tratamento visual desejado
  • Garanta que a colorização esteja alinhada à visão final
  • Inclua imagens que mostrem a abordagem de iluminação que você quer
  • Considere o nível de textura e detalhe: referências muito detalhadas produzem saídas muito detalhadas

Para produtos e objetos:

  • Fotografe contra fundos simples, para manter o foco
  • Mostre vários ângulos, para garantir uma reprodução fiel
  • Inclua closes dos detalhes importantes (logotipos, texturas, recursos específicos)
  • Garanta que a iluminação mostre forma e volume com clareza

Otimização dos vídeos de referência

Para movimento de câmera:

  • Corte os vídeos para mostrar apenas o movimento de câmera específico que você quer replicar
  • Garanta que o movimento esteja claramente visível e não seja encoberto pela ação
  • Clipes mais curtos (3-5 segundos) focados em uma única técnica funcionam melhor do que clipes longos com várias técnicas
  • Use o vídeo de melhor qualidade disponível: artefatos de compressão atrapalham a compreensão

Para movimento e coreografia:

  • A ação deve estar claramente visível, sem obstrução
  • Garanta que a iluminação mostre bem a posição e o movimento do corpo
  • Vários ângulos da mesma ação podem ajudar, se houver
  • Considere desacelerar movimentos rápidos ao criar os clipes de referência

Para efeitos especiais:

  • Isole o efeito específico que você quer replicar
  • Garanta que o efeito esteja claramente visível contra o fundo
  • Se o efeito tem um tempo específico, inclua esse tempo na referência

Otimização dos áudios de referência

Para música e ritmo:

  • Use arquivos de áudio de alta qualidade (evite áudio comprimido de baixa taxa de bits)
  • Corte o áudio para o trecho com o ritmo ou o clima mais relevante
  • Garanta que o áudio demonstre com clareza o que você quer (batida, andamento, clima)
  • Considere começar o áudio numa batida forte, para facilitar a sincronia

Para voz e diálogo:

  • Use gravações limpas, com o mínimo de ruído de fundo
  • Garanta que a característica vocal específica que você quer esteja em destaque
  • Mantenha os clipes de referência curtos e concentrados na qualidade vocal relevante

Como escolher seus quatro ou cinco materiais

Não há um limite combinado de arquivos, então nada impede você de enviar nove imagens. A disciplina tem de vir de você. Use isto para decidir o que merece uma vaga.

Os quatro papéis funcionais. Um briefing completo costuma precisar de um de cada, e raramente de mais:

  1. Ancoragem de personagem (1-2 imagens): trava quem é o sujeito
  2. Definição do tom da cena (1 imagem): trava o ambiente e o estilo
  3. Movimento de câmera (1 vídeo): trava a linguagem dos planos e a cadência
  4. Ritmo e atmosfera (1 áudio): trava a emoção e o timbre

Quatro perguntas para cortar o resto:

  1. Remover esta referência muda de fato o resultado? Se não muda, corte.
  2. Isso pode ser dito em texto? Ambientes, climas e colorizações normalmente podem. Rostos, movimentos de câmera exatos e coreografias específicas normalmente não. Envie o que é difícil de descrever. Descreva todo o resto.
  3. Outro material já está cumprindo esse papel? Duas referências disputando o mesmo papel é pior do que uma.
  4. Isso é indispensável ou apenas desejável? Corte primeiro o que é apenas desejável.

Exemplo de processo de decisão

Você está fazendo um videoclipe musical e tem quinze referências candidatas:

  • 4 imagens: o artista em ângulos diferentes
  • 3 imagens: a casa de shows
  • 2 imagens: configurações de iluminação
  • 2 vídeos: coreografia da dança e movimento de câmera
  • 2 arquivos de áudio: faixa musical e som ambiente
  • 2 imagens: detalhes do figurino

Aplicando o framework:

  • Manter (ancoragem de personagem): 1 foto do rosto em close do artista, mais 1 foto de corpo inteiro. Não o conjunto de quatro ângulos. Uma folha com vários ângulos é a maneira mais confiável de fazer o modelo pensar que está olhando para várias pessoas diferentes
  • Manter (cena): 1 imagem da casa de shows, a mais representativa
  • Manter (câmera): 1 vídeo. Escolha entre a coreografia e o clipe de movimento de câmera com base em qual dos dois você não conseguiria colocar em palavras
  • Manter (ritmo): a faixa musical
  • Descrever em texto: as duas configurações de iluminação, os detalhes do figurino, o áudio ambiente e as outras duas imagens da casa de shows

Resultado: 5 materiais. As outras dez informações continuam chegando ao modelo, só que como palavras em vez de arquivos, que é exatamente onde elas devem estar.

Técnicas de consistência para projetos com vários planos

Consistência de personagem entre gerações

Manter a mesma aparência de personagem em várias gerações de vídeo exige uma gestão sistemática das referências:

Use uma foto do rosto em close mais uma foto de corpo inteiro. Nada além disso.

Esta é a regra mais contraintuitiva do modelo, e errá-la causa exatamente o problema que você estava tentando resolver.

O instinto é dar ao modelo um giro de personagem: frente, perfil, três quartos, costas. Não faça isso. O Seedance 2.0 frequentemente lê uma folha com várias vistas como várias pessoas diferentes. Isso piora a deriva de identidade em vez de melhorá-la, e é uma das principais causas do bug dos "gêmeos", em que duas cópias idênticas do seu personagem aparecem no mesmo quadro.

O que funciona são duas imagens com papéis claramente separados:

  • Uma foto do rosto em close. Só a cabeça, expressão neutra, o mínimo de ombros, pescoço ou fundo. É essa a imagem em que o modelo se apoia para a identidade, então o rosto precisa dominar o quadro. Se o rosto é uma pequena região dentro de uma foto de corpo inteiro cheia de informação, o modelo lhe dá pouco peso e a confusão ao redor vaza para o resultado.
  • Uma foto de corpo inteiro para estilo, figurino e proporção.

Depois, separe os papéis explicitamente no prompt, e coloque o rosto primeiro:

Divisão das referências de personagem

Defina a mulher de @Image 1 como Sujeito 1. Os traços faciais do Sujeito 1 têm como referência @Image 1 (a foto do rosto em close). A roupa e o estilo dela têm como referência @Image 2 (a foto de corpo inteiro).

Note que isso se aplica a rostos. Para produtos e objetos, vários ângulos são realmente úteis e você deve fornecê-los.

O erro da referência misturada: não entregue ao modelo uma imagem composta que amontoe o rosto, a pose, a roupa e um recorte de detalhe numa única figura. O rosto acaba ocupando uma fração pequena dos pixels, recebe uma parcela igualmente pequena da atenção do modelo, e a identidade deriva.

Se o seu personagem derivar mesmo assim, há uma consequência que vale conhecer: um rosto em deriva pode acabar se parecendo com uma figura pública real, e isso pode fazer com que a geração seja bloqueada na revisão mesmo que você nunca tenha pedido uma celebridade. Portanto, a deriva de identidade não é só um problema de qualidade. É uma das razões mais silenciosas para um prompt de aparência limpa voltar recusado. Nosso guia sobre prompts do Seedance 2.0 sinalizados trata do lado da recusa em detalhe.

Mantendo um rótulo consistente Use o mesmo nome para o personagem em todos os prompts e especifique "mantendo a aparência exata de @Image [X]".

Consistência de personagem

Apresente o detetive de @Image 1 (mantenha os traços faciais, o penteado e as roupas exatos desta referência). Nesta cena, o detetive entra no galpão de @Image 2. Todas as características físicas do detetive devem corresponder a @Image 1 com precisão: mesmo rosto, mesmo casaco, mesmo porte.

Consistência de estilo entre cenas

Para projetos que exigem vários planos com o mesmo tratamento visual:

Técnica 1: modelo de referência de estilo Selecione uma imagem que capture perfeitamente o estilo visual desejado:

  • Colorização
  • Abordagem de iluminação
  • Estilo de composição
  • Nível de textura e detalhe

Inclua essa mesma referência de estilo em todos os prompts de geração:

Modelo de referência de estilo

Mantenha o estilo visual de @Image 1 do começo ao fim: colorização azul sombria, iluminação de alto contraste, textura de grão de filme, pouca profundidade de campo.

Técnica 2: uma geração anterior como referência Use gerações bem-sucedidas anteriores como referência para os planos seguintes:

Geração anterior como referência

Crie a próxima cena mantendo exatamente o estilo visual de @Video 1 (minha geração anterior). A colorização, a abordagem de iluminação e a estética geral devem corresponder com precisão.

Continuidade temporal em planos sequenciais

Ao criar planos que se conectam em sequência:

Técnica 1: descrição da sobreposição Descreva como o novo plano se conecta ao anterior:

Descrição da sobreposição

Este plano retoma exatamente onde @Video 1 terminou. O personagem que estava de frente para a porta no fim de @Video 1 agora se vira para a câmera e começa a falar. A posição e a iluminação devem corresponder ao quadro final de @Video 1.

Técnica 2: especificação da transição Declare o ponto de conexão com clareza:

Especificação da transição

Comece esta geração com o mesmo ângulo e a mesma posição de câmera em que @Video 1 terminou. O personagem deve estar na mesma posição, no meio de um gesto, e este plano dá continuidade suave ao movimento.

Armadilhas comuns a evitar

Armadilha 1: uso vago das referências

Problema: "@Image 1 como referência" sem especificar qual aspecto usar

Solução: sempre declare exatamente o que a referência fornece: "@Image 1 para os traços faciais e a expressão do personagem, não para o fundo nem para a iluminação"

Armadilha 2: instruções contraditórias

Problema: "Cena de ação acelerada com movimentos de câmera lentos e contemplativos e música ambiente calma"

Solução: alinhe todos os elementos: ritmo da ação, energia da câmera, andamento da música, cadência da montagem, todos rumo a um objetivo único

Armadilha 3: prompts complicados demais

Problema: enviar uma dúzia de referências quase idênticas e escrever um prompt de 500 palavras cheio de detalhes conflitantes. A orientação da ByteDance é direta quanto a isso: não entregue ao modelo o seu roteiro inteiro e não use toda a cota de materiais

Solução: use menos referências, de maior impacto, com prompts claros e estruturados seguindo o framework CRAFTS

Armadilha 4: ignorar os limites de duração

Problema: tentar encaixar 30 segundos de ação detalhada numa geração de 15 segundos

Solução: divida sequências complexas em várias gerações ou simplifique a ação para caber no tempo disponível

Armadilha 5: especificar pouco o trabalho de câmera

Problema: "A câmera se move ao redor" sem direção específica

Solução: use termos precisos de fotografia: "A câmera faz um dolly do plano geral até um primeiro plano médio ao longo de 5 segundos, mantendo a perspectiva na altura dos olhos"

Armadilha 6: negligenciar a integração do áudio

Problema: tratar o áudio como algo secundário ou apenas dizer "adicionar música"

Solução: diga para que serve o áudio e coloque o som dentro do plano a que ele pertence: "(ritmo pulsante de @Audio 1 do começo ao fim). Cada corte cai numa batida."

Armadilha 7: qualidade inconsistente das referências

Problema: misturar fotos profissionais em alta resolução com imagens comprimidas de baixa qualidade

Solução: mantenha uma qualidade uniforme em todas as referências: não deixe uma única referência ruim comprometer a geração

Armadilha 8: presumir que o modelo vai deduzir

Problema: "Faça ficar bonito" ou "você sabe o que eu quero dizer"

Solução: seja explícito sobre cada detalhe importante: o modelo executa suas instruções, ele não interpreta intenções vagas

Guia rápido de solução de problemas

Problema: a aparência do personagem muda entre gerações Solução: use a mesma imagem de referência do personagem em cada prompt e declare explicitamente "mantenha a aparência exata de @Image X"

Problema: o movimento de câmera não corresponde à referência Solução: acrescente uma descrição mais específica do movimento de câmera em texto e divida movimentos complexos em etapas

Problema: o estilo não corresponde à referência Solução: descreva os elementos específicos do estilo em texto, ao lado da referência: "Reproduza a colorização de @Image 1: azuis dessaturados, alto contraste, pretos fechados"

Problema: o tempo parece errado Solução: resista à vontade de acrescentar marcações de tempo, que tendem a piorar as coisas. Reduza o número de planos que você pede num mesmo clipe e dê ao momento importante um plano só dele.

Problema: o áudio não combina com o clima Solução: descreva o papel do áudio explicitamente em vez de apenas apontar para o arquivo: não "@Audio 1", mas "(tenso, criando suspense, de @Audio 1)".

Problema: a voz não soa como o meu áudio de referência Solução: referências de áudio sozinhas entregam pouco em termos de timbre. Descreva a voz em palavras além de referenciá-la: "Use a voz masculina de meia-idade, grave, quente e levemente rascante de @Audio 1 para dizer...". Manter o diálogo escrito próximo em tom da gravação de referência também ajuda.

Problema: duas cópias idênticas do meu personagem aparecem no mesmo quadro Solução: é o bug dos "gêmeos". Pare de usar folhas de personagem com várias vistas, use fotos de referência com uma só pessoa, nomeie cada personagem e associe-o à sua imagem ("Ada (@Image 1) entrega o arquivo a Ben (@Image 2)") e acrescente uma restrição final: "Ao longo de todo o vídeo, não gere personagens duplicados nem efeito de gêmeos. Mantenha apenas um de cada personagem em quadro."

Problema: aparecem legendas ou uma marca d'água que eu nunca pedi Solução: acrescente as linhas de restrição ("Mantenha o vídeo sem legendas", "Não gere marca d'água"), retire todo texto dos seus materiais de referência antes de enviá-los e gere em formato horizontal, se puder, já que legendas indevidas são bem menos comuns nele do que no vertical.

Problema: meu estilo de animação voltou a virar imagem real Solução: uma imagem de referência realista vai puxar a saída para o realismo, a menos que você diga o contrário. Nomeie o estilo explicitamente no prompt ("estilo de animação japonesa 2D") ou converta a imagem de referência para o estilo desejado antes de gerar a partir dela.

Problema: um efeito descrito sai embaralhado, como uma contagem regressiva que embaralha os dígitos Solução: pare de descrever o efeito e mostre-o. Alimente o modelo com um vídeo de referência do efeito e aponte para ele: "a forma como o número aparece deve seguir @Video 1." A lógica do movimento é uma das coisas que o modelo lê muito melhor a partir de imagens em movimento do que de texto.

Problema: o vídeo termina com um clique ou um ruído de corte abrupto Solução: é um artefato conhecido em clipes com narração. Gere de novo ou corrija no seu editor aplicando um fade curto de volume ao fim da faixa de áudio. É uma correção de 20 segundos e não vale queimar uma geração com isso.

Problema: a imagem salta ou estica, e minha foto de referência aparece distorcida Solução: normalmente é uma incompatibilidade de proporção. Se a proporção da sua imagem de referência não bate com a proporção de saída que você selecionou, o modelo precisa forçar um encaixe. Recorte a imagem para a proporção desejada antes de enviá-la, ou defina a saída como proporção adaptativa, para que ela siga a referência. As imagens de referência também precisam ficar dentro de uma proporção de 0,4 a 2,5 e de 300 a 6000px por lado.

Conclusão

O Seedance 2.0 representa um avanço fundamental na geração de vídeo com IA graças à sua abordagem multimodal completa. Ao aceitar imagens, vídeos, áudio e texto como entradas, ele oferece aos profissionais um controle inédito sobre o processo criativo: vai além dos prompts apenas de texto e chega à direção de mostrar e contar.

A posição do Seedance 2.0 no cenário de vídeo com IA

A capacidade multimodal distingue o Seedance 2.0 das plataformas concorrentes. Kling, Veo e Sora oferecem recursos impressionantes de texto para vídeo, mas a integração de referências diretas de vídeo e áudio no Seedance permite reproduzir com precisão o trabalho de câmera, os padrões de movimento e a sincronia rítmica, algo difícil ou impossível de obter apenas com descrição em texto. Isso posiciona o Seedance como a ferramenta preferida de profissionais que precisam de controle rigoroso sobre estilo visual, consistência de personagem e execução cinematográfica.

A plataforma continua evoluindo com melhorias regulares de capacidade e suporte a novos recursos. Dominar o sistema de referências multimodais e o framework de prompts CRAFTS cria uma base para criações de vídeo cada vez mais sofisticadas conforme a plataforma avança.

Principais conclusões

Controle multimodal: a combinação de entradas de imagem, vídeo, áudio e texto do Seedance 2.0 permite mostrar à IA exatamente o que você quer, em vez de tentar descrever tudo em palavras. Essa mudança de abordagem torna simples especificações antes difíceis: movimentos exatos de câmera, coreografias específicas, edição sincronizada com as batidas.

Vantagens estratégicas na comparação: em relação a Kling, Veo e Sora, o Seedance 2.0 oferece capacidades únicas de integração de áudio e profundidade nas referências de vídeo. O upload direto de arquivos de áudio e o sistema de referência permitem controle preciso de clima e sincronia com as batidas. A referência de vídeo vai além da transferência de estilo e chega à replicação completa de movimento e câmera.

Framework profissional CRAFTS: a metodologia CRAFTS em seis partes (Contexto, Referência, Ação, Enquadramento, Linha do tempo, Estilo e restrições) cobre tudo o que um prompt completo precisa especificar. As duas partes que as pessoas mais pulam são justamente as que decidem se a geração funciona: definir o sujeito antes de referenciá-lo e fechar o prompt com as restrições que descartam artefatos.

Sequencie seus planos, não os cronometre: o instinto de escrever códigos de tempo segundo a segundo é a forma mais comum de piorar o resultado do Seedance. Ordene seus planos e deixe o modelo encontrar o ritmo.

Contenção vence volume: quatro ou cinco ativos bem escolhidos superam uma dúzia. Cada referência a mais dificulta que o modelo descubra quais características importam, e giros de personagem em 360 graus, em particular, provocam desvio de identidade.

Disponível no Morphic: criadores profissionais podem acessar toda a família Seedance 2.0 pelo Morphic, incluindo Fast e Mini para iteração barata e o Seedance 2.0 completo para finalizações em 4K.

Pronto para criar? Acesse o Seedance 2.0 no Morphic →

Perguntas frequentes

Como manter a consistência de personagem em vários vídeos do Seedance 2.0?

Use a mesma imagem de referência do personagem em toda geração em que ele aparecer. No seu prompt, declare explicitamente "manter a aparência exata de @Image X" e descreva quaisquer variações (roupa diferente, expressão), enfatizando que os traços faciais, o porte físico e outras características de identificação permanecem idênticos. Para melhores resultados, use uma foto frontal nítida e bem iluminada como referência mestre do personagem.

Como replicar movimentos de câmera específicos que vejo em um vídeo de referência?

Envie o vídeo que mostra o trabalho de câmera desejado e faça a referência de forma específica: "@Video 1 apenas para o movimento de câmera." No prompt de texto, descreva o movimento com terminologia de cinematografia (dolly in, travelling, grua para cima). Para movimentos complexos, divida-os em planos separados em vez de códigos de tempo separados: "Plano 1: dolly in do plano geral ao plano médio. Plano 2: pan à direita, mantendo a distância." Mantenha um único movimento de câmera por plano, já que empilhar um avanço, uma órbita e um pan no mesmo plano é o caminho mais rápido para desestabilizar a imagem.

Como sincronizar meu vídeo do Seedance 2.0 com batidas musicais específicas?

Envie sua faixa musical e descreva a sincronia em termos de batidas, e não de segundos, já que o tratamento de códigos de tempo precisos pelo modelo é instável. Algo assim: "(música animada de @Audio 1). Cada corte cai em uma batida", com cada corte escrito como seu próprio plano. Instruções relativas às batidas funcionam muito mais confiavelmente do que "aos 6 segundos".

Como criar transições suaves entre diferentes clipes de vídeo do Seedance 2.0?

Use o recurso de extensão de vídeo ou a técnica de fusão. Para a extensão: envie o vídeo existente e escreva "Gerar o conteúdo depois de @Video 1", descrevendo a ação de ligação e definindo a duração nas configurações de geração, e não no prompt. Para a fusão: crie um segmento de ponte que referencie o fim de um clipe e o começo de outro, descrevendo explicitamente a ação de transição que os conecta.

Como controlar a duração de ações específicas no meu vídeo do Seedance 2.0?

De forma menos direta do que você gostaria, e essa é a superfície de controle mais fraca do modelo. Códigos de tempo precisos ("0-3 segundos: [ação]") são instáveis, e forçar durações exatas nos segmentos pode piorar o resultado em vez de deixá-lo mais justo. Em vez disso, sequencie seus planos ("Plano 1: ... Plano 2: ...") e deixe o modelo encontrar o ritmo. Se uma ação parecer apressada, as correções confiáveis são pedir menos planos no clipe, dar a essa ação um plano só dela ou aumentar a duração geral da geração, em vez de escrever um código de tempo mais apertado.

Quantos arquivos de referência devo realmente enviar?

Menos do que o permitido. A ByteDance recomenda de 4 a 5 ativos: 1 a 2 imagens de personagem, 1 imagem de cenário, 1 vídeo de movimento de câmera, 1 clipe de áudio. Além disso, o modelo tem dificuldade para descobrir quais características têm prioridade, e você acaba com conflitos de estilo, identificação embaçada do sujeito e resultados que se afastam do briefing. A regra prática: envie o que é genuinamente difícil de descrever (um rosto específico, um movimento exato de câmera, uma coreografia particular) e coloque todo o resto no prompt de texto. Vale notar também que a estabilidade cai bastante quando mais de quatro pessoas de referência estão envolvidas.

Como recriar efeitos especiais que vejo em um vídeo de referência?

Envie o vídeo com o efeito desejado e especifique: "@Video 1 apenas para a técnica do efeito de partículas." No prompt de texto, descreva o efeito em detalhe: quando acontece, como se move, quais são suas características visuais. Para melhores resultados, use clipes de referência em que o efeito esteja claramente visível e isolado: "Referenciar o redemoinho de partículas brilhantes de @Video 1 que sobe do nível do chão e se dispersa ao alcançar a altura da cabeça."

Como fazer meu personagem do Seedance 2.0 falar com uma qualidade vocal específica?

Envie uma referência de áudio ou vídeo contendo a voz desejada e especifique: "@Audio 1 para o timbre da voz e o estilo de entrega." No prompt, descreva as características vocais: "O personagem fala com o tom grave e autoritário de @Audio 1, dizendo a fala: [seu texto de diálogo]."

Como corrigir resultados inconsistentes ao gerar vários vídeos relacionados?

Mantenha materiais de referência consistentes em todas as gerações da sua sequência. Use a mesma imagem de referência de estilo, as mesmas referências de personagem e prompts semelhantes, com apenas as variações necessárias. Inclua referências a resultados bem-sucedidos anteriores: "Manter o estilo visual de @Video 1 (geração anterior)" para garantir a continuidade.

Como criar vídeos do Seedance 2.0 com mais de 15 segundos?

Use a extensão de vídeo. Gere o primeiro segmento, depois envie-o e escreva "Gerar o conteúdo depois de @Video 1", descrevendo o que acontece em seguida. Você pode encadear extensões, mas mantenha a cadeia curta: cada passagem degrada a qualidade da imagem, e o dano se acumula, aparecendo primeiro como manchas de cor nos rostos. Espere também um salto visível nas emendas, que você corrige no editor cortando cerca de seis quadros do fim do clipe que sai e um do começo do clipe que entra. Para peças mais longas ou de ritmo acelerado, gerar clipes separados e montá-los costuma superar uma longa cadeia de extensões.

Qual é a principal diferença entre Seedance 2.0 e Kling para trabalho profissional de vídeo?

O principal diferencial do Seedance 2.0 é a entrada multimodal completa, incluindo o upload direto de arquivos de áudio e a profundidade do seu sistema de referência e edição de vídeo. Os dois modelos aceitam entrada multimodal, então a diferença está menos no que você pode anexar e mais no que o modelo faz com um clipe enviado: o Seedance edita dentro dele, estende-o em qualquer direção e junta clipes, em vez de apenas imitar o estilo. Isso pesa mais em projetos em que já existe material filmado e aprovado.

Como a integração de áudio do Seedance 2.0 se compara à de outras ferramentas de vídeo com IA?

O Seedance 2.0 aceita o upload direto de arquivos de áudio e extrai deles três coisas distintas: timbre, melodia e conteúdo do diálogo. Isso significa que você pode entregar a faixa musical real, ou uma gravação da voz que deseja, em vez de descrever qualquer uma delas em palavras. Veo e Sora geram áudio a partir de descrições em texto, em vez de aceitar áudio de referência. Uma ressalva honesta: sozinha, a referência de áudio tende a entregar menos do que o esperado na voz. Descreva o timbre também em texto, por exemplo "usar a voz masculina de meia-idade grave, cálida e ligeiramente granulada de @Audio 1".

O Seedance 2.0 gera vídeos mais longos que Kling ou Veo?

Seedance 2.0 e Kling 3.0 geram até 15 segundos em uma única passagem. O Sora vai mais longe, até 60 segundos. Na prática, esse teto importa menos do que parece, porque a maior parte do trabalho comercial e social é montada a partir de vários clipes curtos e de alta qualidade, e não filmada em uma única tomada longa. Onde o Seedance se destaca é no que acontece depois que o clipe existe: você pode estendê-lo para frente ou para trás, editar dentro dele e juntar clipes, o que é um tipo de duração diferente de uma geração única mais longa.

O Seedance 2.0 é mais preciso que o Runway para replicar estilos específicos?

A abordagem multimodal do Seedance 2.0 oferece controle mais direto para a replicação de estilo, porque você pode enviar várias imagens de referência, clipes de vídeo que mostram o estilo em movimento e áudio que estabelece o clima. Em vez de descrever um estilo em texto, você mostra exemplos sob vários ângulos. Isso normalmente resulta em uma reprodução mais fiel de estilos complexos em comparação com abordagens apenas de texto.

Como a consistência de personagem do Seedance 2.0 se compara à de outros modelos de vídeo com IA?

O sistema de referência de imagem do Seedance 2.0, quando usado corretamente com imagens de personagem consistentes entre os prompts, oferece forte consistência de personagem. Essa capacidade é comparável aos recursos de consistência de personagem do Kling, mas mais controlável do que as descrições de personagem baseadas em texto de Veo ou Sora. A chave é usar imagens de referência de personagem de alta qualidade e declarar explicitamente "manter a aparência exata de @Image X" em cada geração.

Qual é melhor para produção comercial: Seedance 2.0 ou Veo?

No trabalho comercial, o fator decisivo costuma ser o controle, e não a qualidade bruta de geração, e é aí que o sistema de referências do Seedance 2.0 se justifica: você pode enviar as fotos exatas do produto, a faixa musical exata e um clipe com o movimento de câmera exato, o que importa quando o cliente já aprovou os três. O Seedance também permite editar e estender material existente, de modo que o conteúdo aprovado pode ser reaproveitado em vez de regerado. O Veo é forte em aderência ao prompt e extensão de formato longo, e continua sendo uma escolha razoável quando o briefing é mais solto e a duração pesa mais do que o alinhamento exato com a marca.

O Seedance 2.0 consegue fazer tudo o que o Sora faz?

Eles são feitos para trabalhos diferentes. O Sora gera tomadas únicas mais longas, de até 60 segundos, e é forte em inferir física e cenas complexas apenas a partir do texto. O Seedance 2.0 chega no máximo a 15 segundos por geração, mas dá um controle que o Sora não dá: upload direto de áudio, referências de vídeo para replicação de movimento e câmera, várias referências visuais ao mesmo tempo e a capacidade de editar e estender material que você já tem. Se o seu prompt é um parágrafo de descrição, o Sora é convincente. Se você tem ativos e um resultado específico em mente, o sistema de referências do Seedance é a ferramenta mais controlável.

Como a referência de vídeo do Seedance 2.0 se compara ao controle de movimento do Kling?

As duas plataformas oferecem recursos de referência de movimento, mas o sistema de referência de vídeo do Seedance 2.0 vai mais fundo. O Kling oferece pincel de movimento e transferência básica de movimento, enquanto o Seedance permite enviar clipes de vídeo completos e replicar não apenas as trajetórias de movimento, mas também o trabalho de câmera, o ritmo de edição e coreografias complexas quadro a quadro. Você pode mostrar ao Seedance uma sequência inteira de luta ou uma coreografia de dança e fazer com que ele replique o movimento com precisão, em vez de descrevê-lo ou desenhar trajetórias de movimento.

Qual é a diferença entre Seedance 2.0, Fast e Mini?

Eles compartilham o mesmo conjunto de recursos e diferem em qualidade e custo. O Seedance 2.0 entrega a maior qualidade e é o único dos três que gera saída em 4K. O Seedance 2.0 Fast troca parte da qualidade por velocidade e custo. O Seedance 2.0 Mini é o mais barato e o mais adequado para iteração em alto volume. Fast e Mini chegam no máximo a 720p. Um fluxo de trabalho prático é iterar no Mini ou no Fast até que o prompt e as referências se comportem, e então rodar a versão final no Seedance 2.0 completo.

Quais formatos de arquivo o Seedance 2.0 aceita nos uploads?

Imagens em JPG ou PNG, vídeo em MP4 ou MOV e áudio em MP3. A saída é MP4, com o 4K codificado em H.265 de 10 bits, que alguns navegadores e players não conseguem pré-visualizar diretamente, mesmo com o arquivo íntegro. Use as fontes de maior qualidade que você tiver: artefatos de compressão em um clipe de referência degradam de forma mensurável a leitura que o modelo faz do movimento nele.

Quais são os limites de entrada para uma única geração do Seedance 2.0?

Até 9 imagens, 3 clipes de vídeo e 3 arquivos de áudio. Os clipes de vídeo devem ter de 2 a 15 segundos cada e 15 segundos somados; os arquivos de áudio, o mesmo. Não há um teto combinado entre os tipos, então a requisição máxima permitida é de 15 arquivos, mas você deve ficar bem longe disso: de 4 a 5 ativos é a faixa de trabalho recomendada. Uma combinação simplesmente não funciona: texto mais áudio sem nenhum visual, e áudio sozinho, não geram nada.

Qual é o vídeo mais longo que o Seedance 2.0 pode gerar em uma única geração?

O Seedance 2.0 gera vídeos entre 4 e 15 segundos em uma única geração. Você pode selecionar a duração específica em incrementos de 1 segundo. Para conteúdos mais longos, use o recurso de extensão de vídeo para encadear várias gerações ou gere segmentos separados que possam ser montados juntos na pós-produção.

Posso usar o Seedance 2.0 em projetos comerciais e trabalhos para clientes?

Sim, o Seedance 2.0 pelo Morphic pode ser usado em produção comercial. O licenciamento específico e os direitos de uso são regidos pelos termos de serviço do Morphic. Consulte esses termos para detalhes sobre uso comercial, trabalho para clientes e eventuais exigências de atribuição.

O Seedance 2.0 mantém a qualidade de resolução ao longo de toda a duração do vídeo?

Dentro de uma única geração, sim. A qualidade se mantém ao longo do clipe. Onde ela não se mantém é ao longo de extensões de vídeo encadeadas: cada vez que você realimenta um vídeo gerado para estendê-lo, a imagem se degrada um pouco, e isso se acumula. Aparece primeiro como manchas de cor irregulares nos rostos. Mantenha as cadeias de extensão curtas.

Posso gerar vídeos em diferentes proporções com o Seedance 2.0?

Sim. O Seedance 2.0 aceita 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16, definidos nas configurações de geração. Não há opção 2.35:1, então, se você quer um visual de cinema panorâmico, escolha 21:9. Uma observação prática: legendas indesejadas aparecem visivelmente menos em formato paisagem do que em retrato, então, se a peça é destinada ao vertical, pode valer a pena gerar em paisagem e recortar depois.

Como acesso o Seedance 2.0?

O Seedance 2.0 é acessível pelo Morphic. Acesse o Morphic, crie uma conta ou faça login e use o Seedance 2.0 na interface de geração de vídeo. O sistema de entrada multimodal e a funcionalidade de referência com @ estão integrados ao fluxo de trabalho da Morphic.

Posso editar ou modificar os vídeos depois que o Seedance 2.0 os gera?

Sim, você pode usar os vídeos gerados de várias formas: como referências para novas gerações (para modificar elementos específicos), como entradas para a extensão de vídeo (para adicionar continuação), em fluxos de trabalho de fusão de vídeo (para conectar com outros clipes) ou exportá-los para edição tradicional em softwares de edição padrão. Os vídeos gerados são seus para editar, combinar e refinar em qualquer fluxo de trabalho que sirva ao seu projeto.