Geração de áudio

Seed Audio 1.0

por ByteDance

O modelo TTS all‑in‑one da ByteDance.\nVoz, música e efeitos sonoros em uma geração.

Seed Audio 1.0

Principais recursos

Ouça a variedade

Locução de documentárioSpeech

Uma voz de documentário calorosa e ponderada.

0:00
0:12
Locução de suspenseSpeech

Uma fala sussurrada e tensa, próxima e íntima.

0:00
0:12
Ambiência de mercado de especiariasSound effects

Uma base sonora de mercado a céu aberto, em camadas.

0:00
0:12
TempestadeSound effects

Uma tempestade crescente até um trovão distante.

0:00
0:12
Trilha orquestralMusic

Uma trilha curta e crescente para cordas e metais.

0:00
0:12
Batida lo-fiMusic

Uma batida relaxada com teclas suaves e chiado de vinil.

0:00
0:12

Especificações técnicas

ByteDance

Desenvolvido pela equipe de pesquisa Seed da ByteDance.

20

Inglês, chinês, japonês, coreano, espanhol, francês, alemão e mais.

Até 2 min

No máximo dois minutos de áudio gerado por geração.

3.000 car.

Espaço para um briefing de cena completo, com diálogo.

Até 3

Até três clipes de referência, de 30 segundos cada.

Sem streaming

Renderiza a faixa completa, não um fluxo em tempo real.

Casos de uso

Audiolivros

Narração, vozes e design sonoro para um livro inteiro. A ByteDance estima o custo perto de um décimo do estúdio.

Dublagem de vídeo

Descreva a voz ou envie uma imagem de personagem, e use timecodes para colocar cada fala onde a imagem pede.

Áudio de games

Falas de personagem, cenas interpretadas e efeitos de ambiente para momentos imersivos, gerados a partir do roteiro.

Áudio de vídeo em um passe

Dê a um clipe sua narração, seu design sonoro e sua música em uma geração, sem etapa de mixagem depois.

Anúncios e promos

Uma fala, efeitos sonoros e música como uma faixa pronta para usar, feita para formatos curtos.

Diálogo e radionovela

Vários personagens, cada um com sua voz e sua interpretação, em uma cena com a ambiência e o ritmo certos.

Exemplos de prompts

Explicação narrada

Narrador calmo, ambiência suave de cozinha: “Misture a farinha e a manteiga.”

Edit prompt

Controle de tempo

Ryan (caloroso, ofegante): “[5.5s:8.0s] Maya! Você vai embora hoje mesmo?”

Edit prompt

Cena de audiolivro

Chuva na janela. Narradora, grave e sem pressa: “Ela leu duas vezes.”

Edit prompt

Narração esportiva

Estádio lotado, torcida rugindo. Narrador, eufórico: “GOOOOL!”

Edit prompt

Radionovela

Detetive, tenso: “Não se mexa.” Os passos param, uma porta range.

Edit prompt

Momento de game

Voz grave e heroica: “O selo antigo se rompeu.” Pedra rangendo.

Edit prompt

Preços simples

Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.

Basic

$9/ mês
cobrado como $0 por ano

900 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Standard

$24/ mês
cobrado como $0 por ano

3200 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Pro

$45/ mês
cobrado como $0 por ano

6200 compartilhado mensal créditos

1 usuário

+ até 4 mais com custo adicional

Todos os modelos

Workflows

Pro Max

$170/ mês
cobrado como $0 por ano

24000 compartilhado mensal créditos

1 usuário

+ até 9 mais com custo adicional

Todos os modelos

Workflows

Enterprise

Para limites maiores

Personalizado

termos de preços e cobrança

Créditos de alto volume
Limites de vagas personalizados
Todos os modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

grátis para sempre

Até 20 créditos
apenas 1 usuário
Modelos limitados
Workflows

Perguntas frequentes

O que é o Seed Audio 1.0?
O Seed Audio 1.0 é o modelo de síntese de voz all-in-one da ByteDance. A partir de um único prompt de texto, ele produz voz, música instrumental e efeitos sonoros juntos, como uma faixa pronta e mixada. Ele funciona em dois modos principais: texto para áudio (T2A), em que tudo vem da sua descrição, e texto mais áudio para áudio (TA2A), em que você acrescenta clipes de referência para escalar vozes específicas.
Quais idiomas o Seed Audio 1.0 suporta?
O Seed Audio 1.0 suporta 20 idiomas: inglês, chinês, japonês, coreano, espanhol do México, espanhol da Espanha, indonésio, alemão, português do Brasil, francês, tailandês, vietnamita, malaio, filipino, italiano, russo, holandês, polonês, turco e sueco. Para o melhor resultado, escreva o prompt no mesmo idioma das falas.
Como funciona o áudio de referência no Seed Audio 1.0?
No modo TA2A você fornece até três clipes de referência de no máximo 30 segundos e liga cada um deles no prompt, para que cada personagem corresponda a uma gravação. O modelo pega o caráter vocal e a emoção da referência e mantém isso pela geração inteira. Você também pode definir uma voz por descrição em texto ou por imagem de personagem.
O Seed Audio 1.0 clona vozes?
Sim. Ao lado do T2A e do TA2A existe um modo de clonagem de voz: você envia um único clipe de áudio e a voz clonada fica disponível para síntese de voz comum. A ByteDance documenta isso como uma clonagem a partir de um clipe só. Quando a voz precisa se encaixar em uma cena completa, com música, efeitos e outros personagens, use o TA2A e seus três clipes de referência.
O Seed Audio 1.0 controla o tempo de cada fala?
Sim. O Seed Audio 1.0 tem controle preciso de tempo: coloque um timecode como [5.5s:8.0s] no início de uma fala e o modelo encaixa a fala exatamente nessa janela. É isso que o torna utilizável em dublagem, em que o diálogo precisa bater com a imagem.
O Seed Audio 1.0 gera vários falantes de uma vez?
Sim. Escreva uma cena com vários personagens e descreva cada voz ao longo do texto. O Seed Audio 1.0 dá a cada falante uma voz, uma emoção e um ritmo distintos em uma única geração, junto com a ambiência e os efeitos em volta.
Qual é a duração máxima de uma geração do Seed Audio 1.0?
O Seed Audio 1.0 gera até dois minutos de áudio em uma única passagem, a partir de um prompt de no máximo 3.000 caracteres. Produções mais longas são montadas cena a cena.
Qual a diferença entre o Seed Audio 1.0 e a síntese de voz comum?
A síntese de voz comum escolhe uma voz e lê um texto. O Seed Audio 1.0 vai da síntese de voz para o áudio por referência: um único prompt descreve o ambiente, a música, os efeitos e a voz de cada personagem, e o modelo devolve a cena inteira já mixada. A diferença é de escopo: uma produção de áudio pronta em vez de apenas a voz.