Génération audio

Seed Audio 1.0

par ByteDance

Le modèle TTS tout‑en‑un de ByteDance.
Voix, musique et effets sonores, en une passe.

Seed Audio 1.0

Fonctionnalités clés

Écoutez l'éventail

Narration documentaireVoix

Une voix off documentaire chaleureuse et posée.

0:00
0:12
Voix off thrillerVoix

Une réplique lue tout bas, tendue, proche et intime.

0:00
0:12
Ambiance de marché aux épicesEffets sonores

Un lit sonore de marché en plein air, en couches.

0:00
0:12
OrageEffets sonores

Un orage roulant vers un coup de tonnerre lointain.

0:00
0:12
Envolée orchestraleMusique

Une courte montée pour cordes et cuivres.

0:00
0:12
Beat lo-fiMusique

Un beat détendu avec claviers doux et grésillement de vinyle.

0:00
0:12

Spécifications techniques

ByteDance

Développé par l'équipe de recherche Seed de ByteDance.

20

Anglais, chinois, japonais, coréen, espagnol, français, allemand et plus.

Jusqu'à 2 min

Deux minutes d'audio généré au maximum par passe.

3 000 car.

De quoi écrire un brief de scène complet, dialogues compris.

Jusqu'à 3

Jusqu'à trois extraits de référence, de 30 secondes chacun.

Non-streaming

Rend la piste complète, pas un flux en temps réel.

Cas d'utilisation

Livres audio

Narration, voix et design sonore pour un livre entier. ByteDance situe le coût autour du dixième d'un studio.

Doublage vidéo

Décrivez la voix ou envoyez une image de personnage, puis calez chaque réplique à l'endroit exact voulu par l'image.

Audio de jeu vidéo

Répliques de personnages, scènes jouées et effets d'environnement immersifs, générés directement depuis le script.

Audio vidéo en une passe

Donnez à un clip sa narration, son design sonore et sa musique en une génération, sans étape de mixage séparée ensuite.

Pubs et promos

Une réplique, des effets sonores et de la musique en une piste prête à l'emploi, pensée pour les formats courts.

Dialogues et fiction audio

Plusieurs personnages, chacun avec sa voix et son jeu, dans une scène avec l'ambiance et le rythme qui vont avec.

Exemples de prompts

Explication narrée

Narrateur calme, ambiance de cuisine : « Mélangez la farine et le beurre. »

Edit prompt

Contrôle du minutage

Ryan (chaleureux, essoufflé) : « [5.5s:8.0s] Maya ! Tu pars vraiment ce soir ? »

Edit prompt

Scène de livre audio

Pluie sur la vitre. Narratrice, posée : « Elle relut la lettre. »

Edit prompt

Commentaire sportif

Stade comble, foule en fusion. Commentateur exalté : « OH, IL MARQUE ! »

Edit prompt

Fiction audio

Détective, tendu : « Ne bougez pas. » Les pas cessent, une porte grince.

Edit prompt

Moment de jeu

Voix grave et héroïque : « Le sceau ancien a cédé. » Pierre qui broie.

Edit prompt

Tarifs simples

Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.

Basic

$9/ mois
facturé comme $0 par an

900 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Standard

$24/ mois
facturé comme $0 par an

3200 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Pro

$45/ mois
facturé comme $0 par an

6200 partagé mensuel crédits

1 utilisateur

+ jusqu'à 4 plus à un coût supplémentaire

Tous les modèles

Workflows

Pro Max

$170/ mois
facturé comme $0 par an

24000 partagé mensuel crédits

1 utilisateur

+ jusqu'à 9 plus à un coût supplémentaire

Tous les modèles

Workflows

Enterprise

Pour des limites plus élevées

Personnalisé

conditions de tarification et de facturation

Crédits à haut volume
Limites de sièges personnalisées
Tous les modèles
Workflows
Pricing Gradient

Free

Pour expérimenter

$0

gratuit pour toujours

Jusqu'à 20 crédits
1 utilisateur uniquement
Modèles limités
Workflows

Questions fréquentes

Qu'est-ce que Seed Audio 1.0 ?
Seed Audio 1.0 est le modèle de synthèse vocale tout-en-un de ByteDance. À partir d'un seul prompt texte, il produit voix, musique instrumentale et effets sonores ensemble, en une piste finie et mixée. Il fonctionne selon deux modes principaux : prompt texte vers audio (T2A), où tout vient de votre description, et prompt texte plus audio vers audio (TA2A), où vous ajoutez des extraits de référence pour distribuer des voix précises.
Quelles langues Seed Audio 1.0 prend-il en charge ?
Seed Audio 1.0 gère 20 langues : anglais, chinois, japonais, coréen, espagnol du Mexique, espagnol d'Espagne, indonésien, allemand, portugais du Brésil, français, thaï, vietnamien, malais, philippin, italien, russe, néerlandais, polonais, turc et suédois. Pour un meilleur résultat, écrivez le prompt dans la même langue que les répliques à faire dire.
Comment fonctionne l'audio de référence dans Seed Audio 1.0 ?
En mode TA2A, vous fournissez jusqu'à trois extraits de référence de 30 secondes maximum, puis vous les associez dans le prompt pour que chaque personnage corresponde à un enregistrement. Le modèle reprend le caractère vocal et l'émotion de la référence et les tient sur toute la génération. Vous pouvez aussi définir une voix par une description texte ou une image de personnage.
Seed Audio 1.0 peut-il cloner une voix ?
Oui. À côté du T2A et du TA2A, il existe un mode de clonage vocal : envoyez un seul extrait audio, et la voix clonée devient disponible pour de la synthèse vocale simple. ByteDance le documente comme un clonage à partir d'un seul extrait. Quand la voix doit s'intégrer à une scène complète avec musique, effets et autres personnages, passez plutôt par le TA2A et ses trois extraits de référence.
Seed Audio 1.0 peut-il contrôler le minutage de chaque réplique ?
Oui. Seed Audio 1.0 gère le contrôle précis du minutage : placez un timecode comme [5.5s:8.0s] au début d'une réplique et le modèle l'ajuste exactement à cette fenêtre. C'est ce qui le rend utilisable en doublage, où le dialogue doit coller à l'image.
Seed Audio 1.0 peut-il générer plusieurs locuteurs à la fois ?
Oui. Écrivez une scène à plusieurs personnages et décrivez chaque voix au fil du texte. Seed Audio 1.0 donne à chaque locuteur une voix, une émotion et un rythme distincts en une seule génération, avec l'ambiance et les effets autour d'eux.
Quelle peut être la durée d'une génération Seed Audio 1.0 ?
Seed Audio 1.0 génère jusqu'à deux minutes d'audio en une passe, à partir d'un prompt de 3 000 caractères maximum. Les productions plus longues se construisent scène par scène.
En quoi Seed Audio 1.0 diffère-t-il d'une synthèse vocale classique ?
Une synthèse vocale classique choisit une voix et lit un texte. Seed Audio 1.0 passe du texte-vers-parole au référence-vers-audio : un seul prompt décrit l'environnement, la musique, les effets et la voix de chaque personnage, et le modèle rend la scène entière déjà mixée. La différence est d'échelle : une production audio finie plutôt que la seule voix.