ByteDance Seed Audio 1.0: guia completo de voz, música e efeitos com IA

ByteDance Seed Audio 1.0: guia completo de voz, música e efeitos com IA

Aprenda a usar o Seed Audio 1.0: gere voz, música e efeitos sonoros em uma única passagem, escreva prompts T2A e TA2A, escale vozes a partir de áudio de referência e controle o tempo no segundo.

Ouça o Seed Audio 1.0

Narração documental

Fala, calorosa e cadenciada

Locução de suspense

Fala, sussurrada e tensa

Ambiente de mercado de especiarias

Efeitos sonoros, base ao ar livre

Tempestade

Efeitos sonoros, tempestade até o trovão

Trilha orquestral

Música, cordas e metais em crescendo

Batida lo-fi

Música, teclas suaves e vinil

Casos de uso do Seed Audio 1.0

Áudio de vídeo em uma geração

Dê a um clipe sua narração, seu design sonoro e sua música em uma geração. Descreva a cena, quem fala, o que acontece e o clima, e o modelo cuida da trilha de áudio inteira.

Still cinematográfico: uma figura solitária com guarda-chuva em uma rua molhada pela chuva ao entardecer

Vídeos explicativos e tutoriais

Uma voz bem colocada com ruído de sala e uma base musical leve em uma saída só. A narração leva o conteúdo, e o modelo preenche o espaço acústico para soar situado e pronto.

Plano por trás do ombro de mãos ajustando a roda de uma bicicleta em uma bancada sob luz suave de janela

Anúncios e promos curtos

Fala, efeitos sonoros e música como uma faixa pronta para usar. Escreva o tempo no prompt, e o modelo marca a batida na palavra certa e baixa a música na hora certa.

Um único tênis de corrida suspenso no ar sobre uma pista iluminada pelo sol dourado

Diálogo roteirizado e radionovela

Cenas com vários personagens, vozes distintas, interpretação precisa e ambiência combinando, tudo em um prompt. Escreva o roteiro, descreva cada voz, e o modelo escala e dirige.

Duas pessoas conversando em uma pequena mesa de café perto de uma janela com gotas de chuva

Audiolivros e narração longa

Narração, vozes de personagens e design sonoro sem sessão de estúdio, a um custo que a ByteDance estima perto de um décimo de uma gravação humana. Escale o narrador a partir de um clipe ou de uma descrição e avance cena a cena.

Um cantinho aconchegante de gravação caseira com um microfone de estúdio iluminado por luz quente

Dublagem no quadro certo

Coloque um timecode em cada fala e o modelo encaixa a interpretação naquela janela exata, para o diálogo cair no corte e não por perto. Funciona nos vinte idiomas suportados.

Uma área de trabalho de edição de áudio com uma linha do tempo de forma de onda brilhante em um monitor escuro

Como escrever um prompt do Seed Audio 1.0

Um bom prompt se lê como um briefing de cena curto, e não como uma linha de síntese de voz. É assim que o modelo encaixa voz, música e efeitos em uma mesma cena. Passe pelo SCENE antes de enviar.

SCENEO que incluirExemplo
SituaçãoTempo, lugar, contexto, acústicaCorredor depois da aula, passos ao longe, reverberação
CastingO que cada personagem faz ou vesteMochila no ombro, aceno da porta
EfeitosClima e gênero da música, efeitos sonorosTambores de guerra, metais graves, um “clac” de armário
Notas de vozGênero, idade, sotaque, emoção, tom, velocidadeAdolescente, sotaque americano, voz clara e cheia de si
EnunciadosO que cada personagem diz, entre aspas“Ei, Emma, você está livre no sábado?”

Três hábitos separam prompts fortes de prompts genéricos.

Escreva longo. O limite é de 3.000 caracteres, e os exemplos oficiais usam quase tudo. Aqui a descrição não é enchimento: o ambiente, a música e a interpretação de cada personagem são coisas que o modelo renderiza, então cada frase cortada é uma decisão devolvida para ele.

Escreva os sons. Onomatopeia funciona. O zíper de uma mochila “zzzip”, o sinal da escola “trim-trim” sumindo ao longe, o “vum, vum” de uma lâmina cortando o ar. Soletrar o som é mais confiável do que nomeá-lo.

Use o mesmo idioma. Escreva o prompt no mesmo idioma das falas. Um roteiro em português com briefing em inglês é a causa mais comum de sotaque estranho.

Sinal da escola “trim-trim” sumindo de perto para longe, corredor depois da aula com passos ao longe, conversa de alunos, um “clac” de armário de vez em quando e reverberação de corredor. Jake (adolescente, sotaque americano, voz jovem e clara, solar e cheio de si) diz brincando e provocando: “Ei, Emma, você está livre no sábado? Eu pago, naquele parque de diversões novo!” O zíper de uma mochila faz “zzzip”. Emma (adolescente, sotaque americano, voz doce, suave e aérea, tímida) baixa a voz, sem jeito: “Ahn… ainda não terminei a lição.” Jake insiste, arrastando as palavras: “Você faz no domingo, é só meio dia!” Emma murmura, cedendo: “Mas… é para segunda.” Jake diz com calma: “Eu faço junto com você e depois a gente sai, fechado?” Emma não segura o riso e cede sem jeito: “Tá bom, só meio dia, combinado?” Jake, animado: “Fechado!” Termina com os passos dos dois sumindo.

Controlar o tempo no segundo

O Seed Audio 1.0 tem controle preciso de tempo. Coloque um timecode no início de uma fala, na forma [início:fim], e o modelo encaixa a interpretação daquela fala exatamente na janela. Ele acelera, desacelera e coloca as pausas para a fala caber.

Ryan (homem jovem, voz calorosa) chama, aflito e um pouco ofegante: “[5.5s:8.0s] Maya! Espera, você vai embora hoje mesmo?” Maya (mulher jovem, voz suave) responde baixinho, se forçando a manter a compostura: “[8.5s:11.5s] Eu preciso ir. Passei anos atrás disso, não dá para desistir agora.”

É isso que torna o modelo utilizável em dublagem. Tire os pontos de entrada e saída de cada fala da sua linha do tempo, escreva no prompt, e a faixa gerada assenta na imagem sem esticar nem cortar. Sem timecodes, o modelo dá à cena um ritmo natural.

Escalar vozes a partir de áudio de referência (TA2A)

Há duas formas de colocar uma voz em uma cena. No T2A, você descreve e o modelo escala. No TA2A, você envia áudio de referência e a voz gerada segue a gravação.

Existe ainda um modo mais simples de clonagem de voz, fora do trabalho de cena: envie um único clipe e a voz clonada fica disponível para síntese de voz comum. Use quando você só precisa que uma voz leia um roteiro. Vá para o TA2A assim que essa voz precisar conviver em uma cena com música, efeitos e outros personagens.

O TA2A aceita até três clipes de referência de no máximo 30 segundos. Ligue cada clipe a um personagem dentro do texto, para o modelo saber qual voz pertence a qual falante, e depois escreva a cena exatamente como faria no T2A.

[Som ambiente de rua: carros passando, conversa ao longe, uma brisa leve.] Marcus (voz masculina, macia e confiante, tom de apresentador caloroso e brincalhão, articulação clara, o ator é <<TGT_SPK1>>), animado e acolhedor, diz: “Oi! Pergunta rápida, qual foi a coisa mais vergonhosa que já aconteceu com você?” Tyler (voz masculina mais jovem, meio nervosa, expressiva com um riso leve, o ator é <<TGT_SPK2>>), soltando um gemido longo e uma risada sofrida, diz: “Ah, você NÃO quer saber. Tá bom, mas isso fica entre a gente.” Marcus (o ator é <<TGT_SPK1>>), se inclinando, curioso, diz: “Agora eu PRECISO ouvir. Manda.” [Os dois caem na risada; a ambiência de rua sobe e some.]

Três coisas para acertar em um prompt TA2A: qual conteúdo gerar, qual áudio de referência usar e para que serve cada áudio de referência. Os clipes são selecionados com @Audio1, @Audio2 e @Audio3, enviados para o trabalho atual ou escolhidos na sua biblioteca de assets e reaproveitados em uma série inteira.

Marcações entre colchetes como [Som ambiente de rua: carros passando, conversa ao longe] são um jeito limpo de abrir e fechar uma cena sem prender o som a um falante.

Prepare os clipes de referência pela checklist CLEAR:

  • Gravação limpa, com pouco ruído de fundo
  • Duração abaixo de 30 segundos por clipe
  • Emoção alinhada com a interpretação que você quer
  • Sotaque constante dentro de cada clipe
  • Ruído de sala estável entre os clipes

Sem nenhum clipe, descreva a voz em texto, dando idade, sotaque e velocidade em vez de “agradável” ou “profissional”. Uma imagem de personagem também funciona: o modelo deduz uma voz coerente com a idade e o caráter aparentes, o que ajuda em falantes de ficção ou animados.

Como usar o Seed Audio 1.0

Chegar a uma faixa pronta leva quatro passos.

  1. Escreva o briefing de cena. Descreva o cenário, o elenco, a música e os efeitos, cada voz e as falas, seguindo a checklist SCENE acima. Até 3.000 caracteres.
  2. Defina as vozes. Descreva no prompt para T2A, ou envie até três clipes de referência e ligue cada um para TA2A. Uma imagem de personagem também vale.
  3. Acrescente o tempo se precisar. Coloque timecodes [início:fim] nas falas que têm de cair em uma janela exata.
  4. Gere. Uma passagem devolve voz, música e efeitos sonoros juntos, já mixados, com até dois minutos.

Para qualquer coisa acima de dois minutos, um capítulo de audiolivro ou um episódio inteiro, trabalhe cena a cena e mantenha a mesma referência de voz entre as gerações para o elenco não mudar.

Perguntas frequentes

Qual a diferença entre T2A e TA2A no Seed Audio 1.0?

O T2A, texto para áudio, monta tudo a partir da sua descrição: o ambiente, a música, os efeitos sonoros e a voz de cada personagem. O TA2A, texto mais áudio para áudio, acrescenta até três gravações de referência que você liga a personagens específicos, para essas vozes seguirem as gravações em vez de uma descrição escrita. Todo o resto do prompt é igual.

O Seed Audio 1.0 clona vozes?

Sim. Além do T2A e do TA2A existe um modo de clonagem de voz: você envia um clipe de áudio e a voz clonada fica disponível para síntese de voz comum. A ByteDance documenta isso como uma clonagem a partir de um único clipe. Se a voz precisar aparecer em uma cena completa, com música, efeitos e outros falantes, use o TA2A, que aceita até três clipes de referência e liga cada um a um personagem.

Como funciona o controle de tempo no Seed Audio 1.0?

Coloque um timecode na forma [5.5s:8.0s] no início de uma fala e o modelo encaixa a interpretação exatamente nessa janela, ajustando ritmo e pausas para caber. É o recurso que torna o modelo prático em dublagem, em que o áudio precisa bater com a imagem. Falas sem timecode ficam com ritmo natural.

Quais idiomas o Seed Audio 1.0 suporta?

Vinte: inglês, chinês, japonês, coreano, espanhol do México, espanhol da Espanha, indonésio, alemão, português do Brasil, francês, tailandês, vietnamita, malaio, filipino, italiano, russo, holandês, polonês, turco e sueco. Escreva o prompt no mesmo idioma do roteiro para o resultado mais constante.

O Seed Audio 1.0 gera vários falantes de uma vez?

Sim. Descreva a voz de cada personagem conforme escreve a cena, e o modelo dá a cada falante uma voz, uma emoção e um ritmo distintos em uma única geração, junto com a ambiência e os efeitos em volta. No modo TA2A, você pode ligar até três desses personagens a gravações de referência.

Qual é a duração máxima de uma geração do Seed Audio 1.0?

Até dois minutos de áudio por passagem, a partir de um prompt de no máximo 3.000 caracteres. A geração é sem streaming: o modelo renderiza a faixa mixada completa em vez de devolver áudio em tempo real. Produções mais longas são montadas cena a cena.

O Seed Audio 1.0 narra um audiolivro?

É um dos usos em que o modelo mais se destaca. Um único prompt cobre a voz do narrador, as vozes dos personagens e o design sonoro em volta, então a cena chega pronta em vez de virem faixas separadas para mixar. Mantenha a mesma referência de voz entre os capítulos e o narrador segue constante no livro inteiro.

O Seed Audio 1.0 é diferente da síntese de voz comum?

Bastante. A síntese de voz comum escolhe uma voz e lê um texto. O Seed Audio 1.0 vai da síntese de voz para o áudio por referência: um único prompt descreve o ambiente, a música, os efeitos e a voz de cada personagem, e o modelo devolve a cena inteira já mixada. A diferença de escopo é uma produção de áudio completa contra apenas a voz.