Ouça o Seed Audio 1.0
Narração documental
Fala, calorosa e cadenciada
Locução de suspense
Fala, sussurrada e tensa
Ambiente de mercado de especiarias
Efeitos sonoros, base ao ar livre
Tempestade
Efeitos sonoros, tempestade até o trovão
Trilha orquestral
Música, cordas e metais em crescendo
Batida lo-fi
Música, teclas suaves e vinil
Casos de uso do Seed Audio 1.0
Áudio de vídeo em uma geração
Dê a um clipe sua narração, seu design sonoro e sua música em uma geração. Descreva a cena, quem fala, o que acontece e o clima, e o modelo cuida da trilha de áudio inteira.

Vídeos explicativos e tutoriais
Uma voz bem colocada com ruído de sala e uma base musical leve em uma saída só. A narração leva o conteúdo, e o modelo preenche o espaço acústico para soar situado e pronto.

Anúncios e promos curtos
Fala, efeitos sonoros e música como uma faixa pronta para usar. Escreva o tempo no prompt, e o modelo marca a batida na palavra certa e baixa a música na hora certa.

Diálogo roteirizado e radionovela
Cenas com vários personagens, vozes distintas, interpretação precisa e ambiência combinando, tudo em um prompt. Escreva o roteiro, descreva cada voz, e o modelo escala e dirige.

Audiolivros e narração longa
Narração, vozes de personagens e design sonoro sem sessão de estúdio, a um custo que a ByteDance estima perto de um décimo de uma gravação humana. Escale o narrador a partir de um clipe ou de uma descrição e avance cena a cena.

Dublagem no quadro certo
Coloque um timecode em cada fala e o modelo encaixa a interpretação naquela janela exata, para o diálogo cair no corte e não por perto. Funciona nos vinte idiomas suportados.

Como escrever um prompt do Seed Audio 1.0
Um bom prompt se lê como um briefing de cena curto, e não como uma linha de síntese de voz. É assim que o modelo encaixa voz, música e efeitos em uma mesma cena. Passe pelo SCENE antes de enviar.
| SCENE | O que incluir | Exemplo |
|---|---|---|
| Situação | Tempo, lugar, contexto, acústica | Corredor depois da aula, passos ao longe, reverberação |
| Casting | O que cada personagem faz ou veste | Mochila no ombro, aceno da porta |
| Efeitos | Clima e gênero da música, efeitos sonoros | Tambores de guerra, metais graves, um “clac” de armário |
| Notas de voz | Gênero, idade, sotaque, emoção, tom, velocidade | Adolescente, sotaque americano, voz clara e cheia de si |
| Enunciados | O que cada personagem diz, entre aspas | “Ei, Emma, você está livre no sábado?” |
Três hábitos separam prompts fortes de prompts genéricos.
Escreva longo. O limite é de 3.000 caracteres, e os exemplos oficiais usam quase tudo. Aqui a descrição não é enchimento: o ambiente, a música e a interpretação de cada personagem são coisas que o modelo renderiza, então cada frase cortada é uma decisão devolvida para ele.
Escreva os sons. Onomatopeia funciona. O zíper de uma mochila “zzzip”, o sinal da escola “trim-trim” sumindo ao longe, o “vum, vum” de uma lâmina cortando o ar. Soletrar o som é mais confiável do que nomeá-lo.
Use o mesmo idioma. Escreva o prompt no mesmo idioma das falas. Um roteiro em português com briefing em inglês é a causa mais comum de sotaque estranho.
Sinal da escola “trim-trim” sumindo de perto para longe, corredor depois da aula com passos ao longe, conversa de alunos, um “clac” de armário de vez em quando e reverberação de corredor. Jake (adolescente, sotaque americano, voz jovem e clara, solar e cheio de si) diz brincando e provocando: “Ei, Emma, você está livre no sábado? Eu pago, naquele parque de diversões novo!” O zíper de uma mochila faz “zzzip”. Emma (adolescente, sotaque americano, voz doce, suave e aérea, tímida) baixa a voz, sem jeito: “Ahn… ainda não terminei a lição.” Jake insiste, arrastando as palavras: “Você faz no domingo, é só meio dia!” Emma murmura, cedendo: “Mas… é para segunda.” Jake diz com calma: “Eu faço junto com você e depois a gente sai, fechado?” Emma não segura o riso e cede sem jeito: “Tá bom, só meio dia, combinado?” Jake, animado: “Fechado!” Termina com os passos dos dois sumindo.
Controlar o tempo no segundo
O Seed Audio 1.0 tem controle preciso de tempo. Coloque um timecode no início de uma fala, na forma [início:fim], e o modelo encaixa a interpretação daquela fala exatamente na janela. Ele acelera, desacelera e coloca as pausas para a fala caber.
Ryan (homem jovem, voz calorosa) chama, aflito e um pouco ofegante: “[5.5s:8.0s] Maya! Espera, você vai embora hoje mesmo?” Maya (mulher jovem, voz suave) responde baixinho, se forçando a manter a compostura: “[8.5s:11.5s] Eu preciso ir. Passei anos atrás disso, não dá para desistir agora.”
É isso que torna o modelo utilizável em dublagem. Tire os pontos de entrada e saída de cada fala da sua linha do tempo, escreva no prompt, e a faixa gerada assenta na imagem sem esticar nem cortar. Sem timecodes, o modelo dá à cena um ritmo natural.
Escalar vozes a partir de áudio de referência (TA2A)
Há duas formas de colocar uma voz em uma cena. No T2A, você descreve e o modelo escala. No TA2A, você envia áudio de referência e a voz gerada segue a gravação.
Existe ainda um modo mais simples de clonagem de voz, fora do trabalho de cena: envie um único clipe e a voz clonada fica disponível para síntese de voz comum. Use quando você só precisa que uma voz leia um roteiro. Vá para o TA2A assim que essa voz precisar conviver em uma cena com música, efeitos e outros personagens.
O TA2A aceita até três clipes de referência de no máximo 30 segundos. Ligue cada clipe a um personagem dentro do texto, para o modelo saber qual voz pertence a qual falante, e depois escreva a cena exatamente como faria no T2A.
[Som ambiente de rua: carros passando, conversa ao longe, uma brisa leve.] Marcus (voz masculina, macia e confiante, tom de apresentador caloroso e brincalhão, articulação clara, o ator é <<TGT_SPK1>>), animado e acolhedor, diz: “Oi! Pergunta rápida, qual foi a coisa mais vergonhosa que já aconteceu com você?” Tyler (voz masculina mais jovem, meio nervosa, expressiva com um riso leve, o ator é <<TGT_SPK2>>), soltando um gemido longo e uma risada sofrida, diz: “Ah, você NÃO quer saber. Tá bom, mas isso fica entre a gente.” Marcus (o ator é <<TGT_SPK1>>), se inclinando, curioso, diz: “Agora eu PRECISO ouvir. Manda.” [Os dois caem na risada; a ambiência de rua sobe e some.]
Três coisas para acertar em um prompt TA2A: qual conteúdo gerar, qual áudio de referência usar e para que serve cada áudio de referência. Os clipes são selecionados com @Audio1, @Audio2 e @Audio3, enviados para o trabalho atual ou escolhidos na sua biblioteca de assets e reaproveitados em uma série inteira.
Marcações entre colchetes como [Som ambiente de rua: carros passando, conversa ao longe] são um jeito limpo de abrir e fechar uma cena sem prender o som a um falante.
Prepare os clipes de referência pela checklist CLEAR:
- Gravação limpa, com pouco ruído de fundo
- Duração abaixo de 30 segundos por clipe
- Emoção alinhada com a interpretação que você quer
- Sotaque constante dentro de cada clipe
- Ruído de sala estável entre os clipes
Sem nenhum clipe, descreva a voz em texto, dando idade, sotaque e velocidade em vez de “agradável” ou “profissional”. Uma imagem de personagem também funciona: o modelo deduz uma voz coerente com a idade e o caráter aparentes, o que ajuda em falantes de ficção ou animados.
Como usar o Seed Audio 1.0
Chegar a uma faixa pronta leva quatro passos.
- Escreva o briefing de cena. Descreva o cenário, o elenco, a música e os efeitos, cada voz e as falas, seguindo a checklist SCENE acima. Até 3.000 caracteres.
- Defina as vozes. Descreva no prompt para T2A, ou envie até três clipes de referência e ligue cada um para TA2A. Uma imagem de personagem também vale.
- Acrescente o tempo se precisar. Coloque timecodes
[início:fim]nas falas que têm de cair em uma janela exata. - Gere. Uma passagem devolve voz, música e efeitos sonoros juntos, já mixados, com até dois minutos.
Para qualquer coisa acima de dois minutos, um capítulo de audiolivro ou um episódio inteiro, trabalhe cena a cena e mantenha a mesma referência de voz entre as gerações para o elenco não mudar.
Perguntas frequentes
O T2A, texto para áudio, monta tudo a partir da sua descrição: o ambiente, a música, os efeitos sonoros e a voz de cada personagem. O TA2A, texto mais áudio para áudio, acrescenta até três gravações de referência que você liga a personagens específicos, para essas vozes seguirem as gravações em vez de uma descrição escrita. Todo o resto do prompt é igual.
Sim. Além do T2A e do TA2A existe um modo de clonagem de voz: você envia um clipe de áudio e a voz clonada fica disponível para síntese de voz comum. A ByteDance documenta isso como uma clonagem a partir de um único clipe. Se a voz precisar aparecer em uma cena completa, com música, efeitos e outros falantes, use o TA2A, que aceita até três clipes de referência e liga cada um a um personagem.
Coloque um timecode na forma [5.5s:8.0s] no início de uma fala e o modelo encaixa a interpretação exatamente nessa janela, ajustando ritmo e pausas para caber. É o recurso que torna o modelo prático em dublagem, em que o áudio precisa bater com a imagem. Falas sem timecode ficam com ritmo natural.
Vinte: inglês, chinês, japonês, coreano, espanhol do México, espanhol da Espanha, indonésio, alemão, português do Brasil, francês, tailandês, vietnamita, malaio, filipino, italiano, russo, holandês, polonês, turco e sueco. Escreva o prompt no mesmo idioma do roteiro para o resultado mais constante.
Sim. Descreva a voz de cada personagem conforme escreve a cena, e o modelo dá a cada falante uma voz, uma emoção e um ritmo distintos em uma única geração, junto com a ambiência e os efeitos em volta. No modo TA2A, você pode ligar até três desses personagens a gravações de referência.
Até dois minutos de áudio por passagem, a partir de um prompt de no máximo 3.000 caracteres. A geração é sem streaming: o modelo renderiza a faixa mixada completa em vez de devolver áudio em tempo real. Produções mais longas são montadas cena a cena.
É um dos usos em que o modelo mais se destaca. Um único prompt cobre a voz do narrador, as vozes dos personagens e o design sonoro em volta, então a cena chega pronta em vez de virem faixas separadas para mixar. Mantenha a mesma referência de voz entre os capítulos e o narrador segue constante no livro inteiro.
Bastante. A síntese de voz comum escolhe uma voz e lê um texto. O Seed Audio 1.0 vai da síntese de voz para o áudio por referência: um único prompt descreve o ambiente, a música, os efeitos e a voz de cada personagem, e o modelo devolve a cena inteira já mixada. A diferença de escopo é uma produção de áudio completa contra apenas a voz.
