Como funciona o sistema de entrada do Seedance 2.0
Antes de mais nada, ajuda entender exatamente o que o Seedance 2.0 aceita e onde a maioria das pessoas erra antes mesmo de escrever um prompt.
- Imagens: até 9. Usadas como frame inicial, referência de personagem, ambiente de cena ou âncora de estilo.
- Clipes de vídeo: até 3 clipes, com duração combinada de no máximo 15 segundos. Usados para referenciar movimentos de câmera, replicar movimento ou como material de origem para estender ou editar.
- Arquivos de áudio: até 3 arquivos, com duração combinada de no máximo 15 segundos. Usados para música de fundo, design de som ou referência de tom de narração.
- Texto: seu prompt, em linguagem natural.
Não existe limite combinado de arquivos entre os tipos de entrada, então nada impede você de anexar nove imagens. A disciplina está na contenção: a ByteDance recomenda de 4 a 5 assets no total e alerta que usar toda a cota deixa mais difícil para o modelo descobrir quais características importam, o que gera conflitos de estilo e identificação imprecisa do sujeito. Tire prioridade primeiro do áudio e das referências visuais secundárias, já que esses são os elementos mais fáceis de descrever em palavras. Reserve os uploads para o que realmente não dá para escrever: um rosto específico, um movimento de câmera exato, uma coreografia particular.
Dois limites que pegam as pessoas de surpresa: todo clipe de referência (vídeo ou áudio) precisa ter pelo menos 2 segundos, e texto mais áudio, sozinhos, não geram nada. O áudio sempre precisa de uma referência visual junto.
[Referência] Escolhendo o ponto de entrada certo
- Primeiro e último frame: use para gerações com uma única imagem mais texto. Direto e rápido para cenas simples.
- All-in-One Reference: obrigatório para qualquer combinação de imagens, vídeo e áudio. É o único modo em que a referência com @ funciona. Se você está misturando tipos de entrada, é nesse modo que precisa estar.
Observação: Smart Multi-Frame e Subject Reference não estão disponíveis no Seedance 2.0 no momento.
O verdadeiro motivo pelo qual seu prompt foi sinalizado
A maioria das pessoas presume que um prompt sinalizado contém uma palavra ou frase específica que ativou um filtro. Essa suposição leva a um ciclo sem fim de trocar palavras, adicionar avisos ou reduzir o prompt ao mínimo. Nada disso resolve o problema de verdade.
O filtro de conteúdo do Seedance 2.0 não funciona assim. Ele usa um modelo de linguagem para ler o prompt inteiro como uma única cena e julgar o que essa cena representa. Ele avalia intenção e contexto, não faz uma varredura por termos isolados.
Pense num segurança de estúdio de cinema comparado a um segurança de banco. A mesma arma cenográfica passa pelo portão do estúdio sem levantar suspeita, porque o contexto deixa o propósito óbvio. No banco, a história é completamente diferente. O objeto não mudou. O contexto sim.
Na prática, isso significa que uma palavra que parece sensível isolada pode aparecer dentro de um prompt cinematográfico bem construído sem nenhum problema. O filtro lê o quadro completo. Um prompt sem quadro nenhum para ler, sem cenário, sem propósito visual, sem lógica narrativa, não dá material nenhum para ele trabalhar. Quando o filtro não consegue interpretar com segurança o que está sendo feito, ele erra pelo lado da cautela.
É esse o cerne de quase todo prompt sinalizado que não deveria ter sido. Não é conteúdo ruim. Não é uma ideia ruim. É só um prompt que não deu ao filtro o suficiente para entender.
A mudança prática é esta: um prompt que se lê como um cineasta descrevendo um plano tende a passar. Um prompt que se lê como um recado para um amigo tende a ser sinalizado.
Uma categoria é bloqueio duro, não uma sinalização corrigível. Dois tipos de conteúdo são rejeitados na etapa de varredura da imagem, antes mesmo de o prompt ser lido, e nenhum enquadramento cinematográfico vai fazê-los passar:
- Rostos reais de pessoas identificáveis: celebridades, políticos e figuras públicas
- Personagens protegidos por direitos autorais: super-heróis de marcas, personagens da Disney, propriedade intelectual ficcional reconhecível
Se sua geração está falhando por causa da foto enviada de uma pessoa real, isso é uma restrição da plataforma, não um problema de prompt.
Como escrever prompts que o filtro leia como claramente criativos
[Filtro] Enquadre a cena inteira, não só a ação
A estrutura mais comum nos prompts sinalizados é uma ação isolada, sem contexto ao redor. Algo acontece, mas não há local, nem atmosfera visual, nem motivo para a câmera estar ali. O filtro não consegue distinguir se aquilo é um set de filmagem ou outra coisa.
A solução não é remover a ação. É construir a cena em volta dela até a intenção ficar evidente por si só.
| Evite isto | Use isto no lugar |
|---|---|
| um soldado atira em alguém na rua | plano aberto, rua do Leste Europeu destruída pela guerra nos anos 1940, um soldado de uniforme cinza dispara em direção a uma posição fora de quadro durante um tiroteio ativo, fumaça subindo de prédios desabados ao fundo, luz difusa de céu encoberto, granulação 35mm, enquadramento em câmera na mão estilo documentário, escombros espalhados pelo primeiro plano |
A ação é idêntica. O primeiro dá ao filtro uma única coisa para avaliar. O segundo dá a ele um contexto de guerra, um período histórico, uma posição de câmera e uma atmosfera visual completa. Um se lê como um relatório. O outro se lê como um briefing de filmagem.
Construa a partir da ação e responda estas quatro perguntas no seu prompt:
- Onde isso está acontecendo?
- Como é a aparência visual?
- O que a câmera está fazendo?
- Qual é a atmosfera geral?
Responda às quatro e a maior parte dos problemas de sinalização se resolve sozinha.
[Prompt] Trate seu prompt como uma série de fatos visuais, não como uma história
Uma das causas menos óbvias de sinalização é um texto de prompt que se lê de forma emocional ou narrativa, em vez de visual. Estes elementos acrescentam ruído interpretativo que o modelo precisa contornar:
- Motivações do personagem
- História de fundo dramática
- Contexto de relacionamentos
- Explicações emocionais
O filtro se importa com o que a câmera veria se essa cena existisse. Ele não precisa saber por quê.
Um roteiro tem duas partes: a descrição da cena e o subtexto. O Seedance 2.0 só precisa da descrição da cena. A corrente emocional, a história prévia, o motivo pelo qual o personagem está correndo. Isso é subtexto. Pertence à cabeça do roteirista, não ao prompt.
Antes de incluir qualquer frase no seu prompt, faça uma pergunta: se isto fosse uma filmagem real, essa frase apareceria na lista de planos? Se não, ela quase certamente não pertence ao prompt.
Essa disciplina também melhora bastante a qualidade da geração. O modelo executa o que consegue ver, não o que consegue inferir. Prompts densos, específicos e visuais superam prompts longos e narrativos quase sempre.
Para sequências de vários planos, dê estrutura ao prompt. A forma recomendada pela ByteDance é um storyboard plano a plano em prosa simples: estabeleça o registro visual uma vez, depois trate cada plano em sequência como movimento de câmera, ação do sujeito, posição, som.
Registro visual (vale para tudo): luz suave de céu encoberto, sombras difusas, sem bordas duras.
Naturais dessaturados, brancos frios, tons apagados. Granulação 35mm, lente anamórfica, halação
suave nas altas luzes. Silencioso, isolado, amplo.
Plano 1: Plano aberto com câmera fixa, ângulo baixo. Um cavaleiro solitário chega ao topo de uma
crista nevada.
Plano 2: Plano de acompanhamento por trás, com sensação de câmera na mão. Cavalo e cavaleiro
galopam pela neve funda, a capa do cavaleiro chicoteando ao vento.
Plano 3: Plano aberto estático, totalmente fixo. Um campo de neve vazio. Um lobo imóvel sobre uma
crista distante.
Mantenha sem legendas. Não gere marca d'água.
Estabelecer o registro visual uma única vez, logo no início, define o tom cinematográfico da sequência inteira. Cada plano então só precisa descrever o que a câmera vê naquele momento.
Não atribua uma duração a cada plano. É tentador escrever "duração": "3 segundos" em cada batida, e é a forma mais comum de as pessoas piorarem o próprio resultado. O tratamento que o Seedance dá a marcações precisas de tempo é instável, e fixar segmentos em contagens exatas de segundos pode quebrar a geração em vez de apertá-la. Ordene os planos e deixe o modelo encontrar o ritmo.
[Prompt] Use linguagem de produção para deixar claro que tipo de conteúdo é este
Existe um padrão confiável que vale conhecer: prompts que incluem o vocabulário de produção audiovisual tendem a ser avaliados com bem mais margem do que prompts escritos em linguagem comum.
O motivo é simples. Quando um prompt traz tipos de plano, especificações de lente, esquemas de iluminação e proporções de tela, o modelo o interpreta como um briefing de produção. Produções cinematográficas podem retratar material dramático, intenso e moralmente complexo. Esse contexto muda o peso que o filtro dá ao conteúdo.
Funciona um pouco como usar capacete numa obra. O capacete não muda o que você está fazendo, mas sinaliza na hora, para todo mundo em volta, que tipo de ambiente é aquele e quais são as regras. Dois ou três termos de produção num prompt fazem a mesma coisa: estabelecem o registro antes de o filtro avaliar qualquer outra coisa.
Isso não quer dizer encher todo prompt de jargão técnico. Quer dizer incluir linguagem de produção suficiente para que o enquadramento seja inequívoco. Aqui vai uma lista de referência organizada por categoria:
Tipos de plano
- Plano aberto, plano médio, close, close extremo
- Plano por sobre o ombro, POV, vista aérea, plano de dois
- Ângulo baixo, ângulo alto, ângulo holandês
Movimentos de câmera
- Dolly in / dolly out
- Plano de acompanhamento, panorâmica, tilt, plano de grua
- Câmera fixa, avanço em ângulo baixo, plano circular, câmera na mão
Lente e formato
- Granulação 35mm, lente anamórfica, proporção 2.39:1, 1.85:1
- Óptica vintage, halação suave, pouca profundidade de campo
- Flare de lente, mudança de foco
Estes são termos descritivos para a aparência, não configurações de saída. Escrever "2.39:1" no prompt diz ao modelo que tipo de imagem você quer; a proporção que você de fato seleciona nas configurações é 21:9, o formato panorâmico mais próximo que o Seedance entrega.
Iluminação
- Luz difusa de céu encoberto, raios volumétricos atravessando a névoa
- Iluminação prática, contraluz lateral, sombra motivada
- Hora dourada, luz direcional dura, luz de contorno
Cor e tonalidade
- Paleta apagada e dessaturada, alto contraste, bleach bypass
- Tons azuis frios, âmbar quente, pretos esmagados
- Altas luzes estouradas, gradação plana de baixo contraste
Acrescentar dois ou três termos de qualquer uma dessas categorias a um prompt estabelece o contexto de produção com clareza. Muitas vezes é tudo o que basta.
Por que seu prompt é sinalizado mesmo sem nenhum conteúdo sensível
Às vezes uma geração é sinalizada e não há nada nem remotamente sensível no prompt. Nenhuma ação, nenhum drama, nenhum assunto delicado. Só uma cena que deveria passar sem problema.
Isso acontece quando o prompt é escasso demais. Uma descrição curta e simples, sem enquadramento cinematográfico, contexto de cena ou especificidade visual, dá ao filtro um quadro incompleto. É como mandar para alguém uma única frase do meio de um roteiro, sem capa, sem cabeçalho de cena e sem rubrica. A pessoa não consegue dizer se é um suspense, uma comédia ou outra coisa. Quadros incompletos não são aprovados, ficam retidos.
| Evite isto | Use isto no lugar |
|---|---|
| uma pessoa segura uma faca | close, as mãos de um chef seguram um cutelo sobre uma tábua de madeira, borrão de movimento enquanto a lâmina desce sobre um peixe inteiro, ambiente de cozinha com vapor subindo ao fundo, luz quente de tungstênio, pouca profundidade de campo, estilo de documentário gastronômico cinematográfico |
Mesmo objeto, leitura completamente diferente. O primeiro dá ao filtro um objeto e uma ação. O segundo dá a ele um ambiente, um propósito, um contexto de produção e uma descrição de câmera.
A correção é simples. Até uma cena simples se beneficia destas adições:
- Um cenário e um período de tempo específicos
- Um descritor de atmosfera ou clima
- Uma posição de câmera ou tipo de plano
- Um ou dois termos de linguagem de produção para estabelecer o contexto
O sistema de referência @: por que os uploads falham em silêncio
Boa parte dos problemas com o Seedance 2.0 não tem nada a ver com filtro. São problemas de referência. As pessoas enviam imagens e clipes de vídeo esperando que o modelo entenda para que serve cada arquivo, e o modelo não presume nada.
Enviar um vídeo não o transforma em referência de câmera. Enviar uma imagem não a transforma no frame inicial. Pense em entregar uma pilha de fotos sem etiqueta a um diretor no set. Ele vê o que há em cada foto, mas não faz ideia de qual você quer como frame inicial, qual é referência de figurino e qual é só inspiração de fundo. Sem etiquetas, ele chuta. O Seedance 2.0 não é diferente. Todo arquivo enviado precisa de um papel explícito declarado no prompt com tags @, ou será processado de forma ambígua.
Ative as tags @ digitando @ no campo do prompt (um seletor de referências vai aparecer) ou clicando no ícone @ na barra de ferramentas. Depois diga exatamente para que serve cada arquivo, antes de descrever a ação.
| O que você quer | Como escrever |
|---|---|
| Definir o frame inicial | @Image 1 as the first frame |
| Referenciar o movimento de câmera | reference all camera movements from @Video 1 |
| Manter a aparência do personagem | character appearance based on @Image 2 |
| Definir a música de fundo | use @Audio 1 as the background score |
| Replicar a coreografia do movimento | replicate the movement style from @Video 1 |
| Definir o ambiente | the setting is based on @Image 3 |
| Referenciar o estilo da narração | match the voiceover tone of @Video 2 |
Ao usar várias referências, liste toda a atribuição de papéis no topo do prompt, antes de qualquer descrição de cena. Uma tag @ sem papel explícito é uma das causas mais confiáveis de resultado inconsistente ou inesperado.
Como o Seedance 2.0 lê as imagens enviadas (e onde isso desanda)
[Imagem] Quando você envia a imagem de um personagem, deixe a imagem fazer o trabalho
Existe uma tentação natural, ao enviar uma imagem de referência de personagem, de descrever esse personagem também no prompt. Resista. A imagem já fez esse trabalho. Repetir em texto não reforça o resultado. Introduz uma segunda camada de informação, concorrente, que o modelo precisa conciliar.
O que o prompt precisa fazer é descrever a cena com clareza:
- O que está acontecendo no plano
- Como a câmera está posicionada
- Como é o ambiente
- Como o plano se move
A imagem cuida da aparência. O prompt cuida de tudo o que a câmera vê.
É aqui também que a sinalização vira um problema de imagem. O Seedance 2.0 aplica avaliação mais rígida a qualquer prompt em que um personagem possa ser lido como menor de idade. Palavras que sinalizam juventude ("criança", "garoto", "jovem", "menino", "menina") disparam escrutínio elevado sobre o prompt inteiro, não só sobre a frase em que aparecem, e independentemente do que a imagem enviada mostre.
A abordagem mais limpa é descrever os personagens pelo papel deles na cena. A imagem cuida de tudo sobre quem eles são. O prompt cuida do que acontece e do que a câmera vê.
| Evite isto | Use isto no lugar |
|---|---|
| um menino jovem assiste a um prédio pegar fogo | uma figura pequena de casaco escuro está na borda de uma multidão observando um prédio consumido pelo fogo, plano médio por trás, brilho alaranjado e quente das chamas, fumaça densa subindo para um céu escuro, cinematográfico, anamórfico 2.39:1, estilo documentário |
A palavra "jovem" na primeira versão eleva o limiar de sensibilidade do prompt inteiro. A segunda versão deixa a imagem enviada carregar a identidade do personagem. O prompt descreve só o que a câmera vê.
[Imagem] Sinalizado antes mesmo de enviar? A imagem é o problema
Existe uma camada de avaliação de imagem no Seedance 2.0 que roda independentemente do filtro de prompt. Se uma imagem enviada contém um rosto claramente visível, ela pode disparar uma rejeição antes de o modelo processar qualquer texto. Isso explica o padrão em que reescrever o prompt várias vezes não faz diferença nenhuma. O prompt não está sendo lido.
Como contornar:
- Rosto virado para longe da câmera. Enquadre o sujeito por trás ou num ângulo em que os traços faciais não fiquem visíveis. Roupa, postura, cabelo e ambiente carregam informação suficiente para a maioria das finalidades de referência.
- Abra o plano. Abra o plano o bastante para que a figura leia como silhueta ou elemento pequeno no quadro, em vez de sujeito dominante.
- Prefira ilustração a fotografia. Troque referências fotográficas por ilustradas ou estilizadas. A avaliação se aplica de outra forma e as imagens ilustradas passam com mais consistência.
- Mude a finalidade da referência. Use a imagem para roupa, cenário, paleta de cores ou composição espacial, em vez de rosto ou identidade.
Se uma geração continua falhando sem explicação clara do lado do prompt, ajuste a imagem antes de reescrever qualquer texto.
Técnicas avançadas que vale conhecer
[Avançado] Estender material existente
Diga em qual direção você quer, depois descreva o que o novo trecho contém. A extensão funciona nos dois sentidos: você pode gerar o que acontece depois de um clipe e o que aconteceu antes dele.
Generate the content after @Video 1. [Descrição do novo trecho.]
Extend @Video 1 backward. [Descrição do que leva até ele.]
Não escreva "reference @Video 1" aqui. Esta é uma tarefa de edição, não de referência, e a palavra reference empurra o modelo a classificá-la como tal, então, em vez de continuar seu clipe, ele gera um vídeo novo que apenas se parece com ele. Refira-se ao clipe simplesmente como @Video 1.
O material original não é gerado de novo, então a parte de que você já gostou sobrevive intacta. Duas coisas para planejar: a emenda pode mostrar um pequeno salto (resolva no seu editor, cortando cerca de seis frames do fim do clipe que sai e um do início do que entra), e a qualidade se degrada se você encadear extensões repetidamente, aparecendo primeiro como cor manchada nos rostos. Mantenha as cadeias curtas.
[Avançado] Ligar dois clipes com um meio gerado
Generate a connecting scene between @Video 1 and @Video 2. The transition shows [descreva a ação, o ambiente ou o movimento que liga os dois clipes].
O trecho gerado será inserido entre os dois clipes enviados, então descreva-o como se fosse uma cena curta própria.
[Avançado] Copiar o estilo de câmera de um clipe de referência
Envie qualquer clipe com o estilo de movimento que você quer e nomeie-o diretamente:
Reference all camera movements from @Video 1, including the low-angle circling shot and the push into close-up.
A palavra "reference" está correta aqui, porque isto de fato é uma tarefa de referência: você está fazendo um vídeo novo que toma emprestado um estilo de câmera. Só abandone a palavra quando estiver editando ou estendendo o próprio clipe enviado.
O modelo extrai ritmo de movimento, lógica de enquadramento e cadência de transição do clipe de referência. Nomes técnicos precisos ajudam, mas não são obrigatórios. Ainda assim, mantenha um movimento de câmera por plano: empilhar um avanço, uma órbita e uma panorâmica num único plano é uma forma confiável de desestabilizar a imagem.
[Avançado] Sincronizar cortes com a música
(Rhythm and tempo from @Audio 1.) Scene transitions land on the beat. Apply the visual style change at each cut.
O Seedance 2.0 consegue sincronizar cortes, mudanças de luz e transições de cena com o ritmo de uma faixa de áudio enviada. Descreva a sincronia em batidas, não em segundos. O tratamento que o modelo dá a marcações precisas de tempo ("corte aos 6 segundos") é instável, e fixar eventos em contagens exatas de segundos pode degradar o resultado em vez de apertá-lo. Escreva cada corte como um plano próprio e deixe a batida carregar o tempo.
[Avançado] Usar o áudio de um clipe de vídeo existente
Não é preciso enviar áudio separado se o clipe que você já está referenciando tem o áudio que você quer:
Use the audio embedded in @Video 1 as the background score.
[Avançado] Palavras de restrição: descartar artefatos que ninguém pediu
Separado do filtro de conteúdo, existe uma classe de falha em que a geração dá certo, mas o resultado traz algo que você nunca pediu: legendas gravadas no quadro, um logo perdido, a marca d'água de outra plataforma. A orientação da própria ByteDance é fechar o prompt com frases explícitas de restrição:
Keep it subtitle-free. Avoid generating any text or subtitles.
Do not generate a logo. Do not generate a watermark.
The character's face stays consistent with no deformation. Motion is smooth, with no stutter or flicker.
Seja realista sobre o que isso compra. As linhas de restrição reduzem a probabilidade de legendas e marcas d'água indesejadas. Elas não a eliminam. Duas coisas ajudam mais do que as palavras:
- Tire o texto dos seus assets de referência antes de enviar. Se uma imagem ou clipe de referência tem texto de que você não precisa, remova antes. Texto na entrada é a forma mais confiável de obter texto na saída.
- Gere em paisagem, se puder. Legendas espúrias aparecem bem menos em paisagem do que em retrato. Se a peça final for vertical, muitas vezes compensa gerar em 16:9 e cortar depois.
Mantenha as restrições curtas e ligadas à falha que você está vendo de verdade. Uma lista longa e genérica de tudo o que poderia dar errado tende a ser diluída ou ignorada.
[Comunidade] Uma coisa com que as pessoas vêm experimentando
Alguns usuários relatam taxas de aprovação melhores ao escrever a descrição da cena em chinês, mantendo qualquer diálogo ou texto em tela em inglês. O raciocínio é que o Seedance 2.0 foi desenvolvido originalmente com forte treinamento em língua chinesa, então prompts escritos em chinês podem ser interpretados com limiares de filtro ligeiramente diferentes.
Não é uma solução garantida e os resultados variam, mas, se um prompt bem construído continua sendo sinalizado apesar de um enquadramento cinematográfico sólido, é algo barato de testar. Passe a descrição da cena por qualquer tradutor, mantenha as falas em inglês e veja se o resultado muda.
Um custo documentado a pesar contra isso. A orientação da ByteDance é explícita: misturar chinês e inglês num prompt deve ser evitado, salvo nomes próprios, e a língua do diálogo em particular precisa se manter consistente. Ou seja, uma descrição de cena em chinês com diálogo em inglês é exatamente a mistura contra a qual o dono do modelo alerta, e o preço costuma aparecer como pronúncia degradada nas falas. Se o seu vídeo não tem diálogo, o risco é baixo. Se tem, teste antes de depender disso.
Limites de entrada num relance
| Tipo de entrada | Limite |
|---|---|
| Imagens | Até 9. JPEG, PNG, WEBP, BMP, TIFF, GIF, HEIC, HEIF. Máx. 30MB cada |
| Clipes de vídeo | Até 3. Cada um de 2-15s, 15s no total. MP4/MOV, 24-60fps, máx. 200MB cada |
| Arquivos de áudio | Até 3. Cada um de 2-15s, 15s no total. MP3/WAV, máx. 15MB cada |
| Todos os arquivos somados | Sem limite combinado. Mas 4-5 assets no total é a faixa recomendada |
| Não suportado | Texto + áudio sem nada visual, ou áudio sozinho |
| Duração da geração | 4 a 15 segundos |
Antes de gerar: um checklist rápido
- Estou no modo All-in-One Reference? (Obrigatório sempre que você mistura tipos de entrada)
- Toda tag @ tem um papel declarado explicitamente no prompt?
- O prompt descreve uma cena visual, e não uma narrativa ou história de fundo?
- Incluí ao menos um elemento de linguagem de produção: um tipo de plano, um movimento de câmera ou uma descrição de luz?
- Cada frase descreve o que a câmera vê ou estabelece um contexto cinematográfico?
- O prompt se refere aos personagens pelo papel, e não pela idade?
- Minha imagem de referência está livre de rostos em destaque, ou foi cortada/ilustrada?
- Minha imagem de referência está livre de pessoas reais identificáveis ou de personagens protegidos por direitos autorais?
- Estou usando o mínimo de referências que o plano realmente exige? (4 a 5 é a faixa recomendada; não existe limite combinado, mas usar toda a cota degrada os resultados)
- Meus planos estão ordenados (Plano 1, Plano 2) em vez de marcados por tempo?
- Fechei o prompt com restrições? ("Keep it subtitle-free. Do not generate a watermark.")
Perguntas frequentes
O filtro precisa de contexto visual suficiente para interpretar com segurança o que está sendo feito. Prompts curtos e simples, sem enquadramento cinematográfico nem detalhe de cena, dão a ele um quadro incompleto, então ele opta pela cautela. Acrescentar cenário, atmosfera, posição de câmera e alguma noção do contexto de produção costuma resolver.
Se as edições no prompt não fazem diferença, o problema provavelmente é a imagem. O Seedance 2.0 roda detecção de rosto nos uploads antes de o filtro de prompt entrar em ação. Se um rosto é detectado numa imagem de referência, a geração é rejeitada nessa etapa. Edite a imagem, corte-a, abra o plano ou use uma ilustração, antes de continuar revisando o prompt.
Isso é um bloqueio duro da plataforma, não um problema de prompt. O Seedance 2.0 varre as imagens enviadas em busca de rostos reais identificáveis antes de o prompt ser processado. Fotos de celebridades, figuras públicas ou de qualquer pessoa com semelhança reconhecível são rejeitadas nessa etapa. Trocar por uma referência ilustrada ou uma imagem não identificável é a única saída.
Sim. A linguagem de produção sinaliza ao modelo que este é um contexto de criação cinematográfica, avaliado com mais margem do que descrições em linguagem comum. Incluir tipos de plano, especificações de lente e descrições de luz muda a forma como o filtro interpreta a intenção do prompt inteiro.
First and Last Frames serve para gerações com uma única imagem mais texto. All-in-One Reference é obrigatório sempre que você combina vários tipos de entrada: imagens, clipes de vídeo e áudio. É também o único modo em que as tags @ funcionam.
Sim. Marque-a várias vezes com papéis diferentes. Por exemplo: @Image 1 as the first frame, environment and lighting also based on @Image 1. Cada papel precisa ser declarado explicitamente.
Envie o clipe e escreva "Generate the content after @Video 1", depois descreva o novo trecho. A extensão também funciona para trás, gerando o que leva até o clipe. O material original não é gerado de novo, então o que você já tem sobrevive intacto. Não escreva "reference @Video 1" para isso: a palavra empurra o modelo a tratar a tarefa como referência e produzir um vídeo parecido em vez de continuar o seu.
Não é necessário, e não há suporte oficial para isso. O ideal documentado pela ByteDance é um
storyboard em prosa simples: um registro visual no início, depois Plano 1, Plano 2, Plano 3, cada
um descrevendo um movimento de câmera, uma ação, uma posição e o som. Estrutura ajuda muito; a
sintaxe JSON em si, não. E, se você recorrer a JSON, evite dar a cada plano um campo duration,
porque fixar planos em contagens exatas de segundos é instável e tende a piorar o resultado.
Feche seu prompt com frases explícitas de restrição: "Keep it subtitle-free. Avoid generating any text or subtitles." e "Do not generate a logo or watermark." Elas reduzem a probabilidade sem eliminá-la. Duas coisas ajudam mais: tire todo texto desnecessário dos seus assets de referência antes de enviar, e gere em paisagem sempre que puder, já que legendas indesejadas são bem menos comuns em paisagem do que em retrato. Corte para vertical depois, se precisar.
Menos do que o permitido. A ByteDance recomenda de 4 a 5 assets no total: 1 a 2 imagens de personagem, 1 imagem de cena, 1 vídeo de movimento de câmera, 1 clipe de áudio. Além disso, o modelo tem dificuldade para descobrir quais características têm prioridade, e você acaba com conflitos de estilo, identificação imprecisa do sujeito e um resultado que se afasta do briefing. Referências secundárias de estilo e descritores de clima quase sempre funcionam melhor como texto no prompt do que como arquivos enviados. Um limite duro a conhecer: passando de quatro pessoas de referência, a estabilidade cai bastante e você começa a ver a contagem errada de gente ou personagens duplicados.
Comece a gerar no Morphic
A melhor forma de testar o que está descrito aqui é abrir uma geração e experimentar. O Seedance 2.0 no Morphic dá acesso multimodal completo: imagens, vídeo, áudio e texto, sem nada para instalar.