Seed Audio 1.0
por ByteDance
O modelo TTS all‑in‑one da ByteDance.\nVoz, música e efeitos sonoros em uma geração.

Principais recursos
Ouça a variedade
Uma voz de documentário calorosa e ponderada.
Uma fala sussurrada e tensa, próxima e íntima.
Uma base sonora de mercado a céu aberto, em camadas.
Uma tempestade crescente até um trovão distante.
Uma trilha curta e crescente para cordas e metais.
Uma batida relaxada com teclas suaves e chiado de vinil.
Especificações técnicas
ByteDance
Desenvolvido pela equipe de pesquisa Seed da ByteDance.
20
Inglês, chinês, japonês, coreano, espanhol, francês, alemão e mais.
Até 2 min
No máximo dois minutos de áudio gerado por geração.
3.000 car.
Espaço para um briefing de cena completo, com diálogo.
Até 3
Até três clipes de referência, de 30 segundos cada.
Sem streaming
Renderiza a faixa completa, não um fluxo em tempo real.
Casos de uso
Audiolivros
Narração, vozes e design sonoro para um livro inteiro. A ByteDance estima o custo perto de um décimo do estúdio.
Dublagem de vídeo
Descreva a voz ou envie uma imagem de personagem, e use timecodes para colocar cada fala onde a imagem pede.
Áudio de games
Falas de personagem, cenas interpretadas e efeitos de ambiente para momentos imersivos, gerados a partir do roteiro.
Áudio de vídeo em um passe
Dê a um clipe sua narração, seu design sonoro e sua música em uma geração, sem etapa de mixagem depois.
Anúncios e promos
Uma fala, efeitos sonoros e música como uma faixa pronta para usar, feita para formatos curtos.
Diálogo e radionovela
Vários personagens, cada um com sua voz e sua interpretação, em uma cena com a ambiência e o ritmo certos.
Exemplos de prompts
Explicação narrada
Narrador calmo, ambiência suave de cozinha: “Misture a farinha e a manteiga.”
Edit promptControle de tempo
Ryan (caloroso, ofegante): “[5.5s:8.0s] Maya! Você vai embora hoje mesmo?”
Edit promptVisão geral
O Seed Audio 1.0 é o modelo de áudio all-in-one da ByteDance, pensado como o próximo passo da síntese de voz e não como uma ruptura com ela. Fluxos de áudio tradicionais usam ferramentas separadas para voz, música e efeitos sonoros, cada uma gerada de um lado e depois mixada. O Seed Audio 1.0 produz as três juntas a partir de um único prompt de texto, e a saída é uma faixa de áudio completa, pronta para usar.
Da síntese de voz para o áudio por referência
A TTS de sempre pega uma voz e um bloco de texto. O Seed Audio 1.0 pega uma cena: o tempo lá fora e a sala, a música por baixo, os efeitos em volta da ação, a aparência e o som de cada personagem, e as falas que eles dizem. Tudo que você conseguir descrever entra na mesma geração, e é por isso que um prompt pode chegar a 3.000 caracteres sem virar enchimento.
O modelo entende o contexto da cena. Um prompt de conversa em cafeteria recebe burburinho e o espaço acústico certo, não um ruído de sala genérico. Uma cena de ação recebe efeitos secos e uma trilha dinâmica, não música de fundo colada sobre o silêncio. As três camadas saem proporcionadas e mixadas para a cena, e não montadas a partir de exportações separadas.
Quatro modos
O mais simples é a síntese de voz: escolha uma voz, digite o texto e o modelo lê. A clonagem de voz acrescenta um passo: você envia um único clipe de áudio e a voz clonada fica disponível para essa mesma síntese de voz. Os outros dois modos são o que separa este modelo da TTS de sempre.
Em texto para áudio (T2A), cada voz vem da sua descrição. Diga a idade, o sotaque, a emoção, o tom e a velocidade de um personagem, e o modelo escala a voz.
Em texto mais áudio para áudio (TA2A), você envia até três clipes de referência de no máximo 30 segundos e liga cada um a um personagem no prompt. A voz gerada então segue a gravação, e não uma descrição. Os clipes de referência podem ser enviados para um único trabalho ou guardados em uma biblioteca de assets e reaproveitados em uma série inteira.
Vinte idiomas
O Seed Audio 1.0 gera em inglês, chinês, japonês, coreano, espanhol do México, espanhol da Espanha, indonésio, alemão, português do Brasil, francês, tailandês, vietnamita, malaio, filipino, italiano, russo, holandês, polonês, turco e sueco. O idioma do prompt e o do roteiro devem ser o mesmo: escreva o briefing no idioma que os personagens falam.
Tempo que você define no segundo
O Seed Audio 1.0 aceita um timecode em qualquer fala, escrito na linha como [5.5s:8.0s], e encaixa a interpretação exatamente nessa janela. Em dublagem, essa é a diferença entre um áudio que quase serve e um áudio que cai no corte. A geração é sem streaming: o modelo renderiza a faixa pronta em uma única passagem, de até dois minutos.
Preços simples
Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.
Basic
1100 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Standard
3625 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Pro
6350 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Pro Max
24650 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Enterprise
Para limites maiores
Personalizado
termos de preços e cobrança

Free
Para experimentar
$0
grátis para sempre
Perguntas frequentes
ChatGPT Images 2.5
OpenAI
Detalhe mais nítido e edição que não bagunça o resto do quadro. O modelo de imagem da OpenAI, de setembro de 2026.
Lyria 3.5
Google DeepMind
O melhor modelo de música do Google. Músicas inteiras, com voz e letra.
MiniMax H3 Max Turbo
fal.ai
O nível rápido do H3 da fal. O dobro da velocidade, quase igual.
Inworld TTS 2
Inworld
Noventa e cinco vozes, 100+ idiomas. A fala começa em menos de um segundo.