Génération audio

Seed Audio 1.0

par ByteDance

Le modèle TTS tout‑en‑un de ByteDance.
Voix, musique et effets sonores, en une passe.

Seed Audio 1.0

Fonctionnalités clés

Écoutez l'éventail

Narration documentaireVoix

Une voix off documentaire chaleureuse et posée.

0:00
0:12
Voix off thrillerVoix

Une réplique lue tout bas, tendue, proche et intime.

0:00
0:12
Ambiance de marché aux épicesEffets sonores

Un lit sonore de marché en plein air, en couches.

0:00
0:12
OrageEffets sonores

Un orage roulant vers un coup de tonnerre lointain.

0:00
0:12
Envolée orchestraleMusique

Une courte montée pour cordes et cuivres.

0:00
0:12
Beat lo-fiMusique

Un beat détendu avec claviers doux et grésillement de vinyle.

0:00
0:12

Spécifications techniques

ByteDance

Développé par l'équipe de recherche Seed de ByteDance.

20

Anglais, chinois, japonais, coréen, espagnol, français, allemand et plus.

Jusqu'à 2 min

Deux minutes d'audio généré au maximum par passe.

3 000 car.

De quoi écrire un brief de scène complet, dialogues compris.

Jusqu'à 3

Jusqu'à trois extraits de référence, de 30 secondes chacun.

Non-streaming

Rend la piste complète, pas un flux en temps réel.

Cas d'utilisation

Livres audio

Narration, voix et design sonore pour un livre entier. ByteDance situe le coût autour du dixième d'un studio.

Doublage vidéo

Décrivez la voix ou envoyez une image de personnage, puis calez chaque réplique à l'endroit exact voulu par l'image.

Audio de jeu vidéo

Répliques de personnages, scènes jouées et effets d'environnement immersifs, générés directement depuis le script.

Audio vidéo en une passe

Donnez à un clip sa narration, son design sonore et sa musique en une génération, sans étape de mixage séparée ensuite.

Pubs et promos

Une réplique, des effets sonores et de la musique en une piste prête à l'emploi, pensée pour les formats courts.

Dialogues et fiction audio

Plusieurs personnages, chacun avec sa voix et son jeu, dans une scène avec l'ambiance et le rythme qui vont avec.

Exemples de prompts

Explication narrée

Narrateur calme, ambiance de cuisine : « Mélangez la farine et le beurre. »

Edit prompt

Contrôle du minutage

Ryan (chaleureux, essoufflé) : « [5.5s:8.0s] Maya ! Tu pars vraiment ce soir ? »

Edit prompt

Scène de livre audio

Pluie sur la vitre. Narratrice, posée : « Elle relut la lettre. »

Edit prompt

Commentaire sportif

Stade comble, foule en fusion. Commentateur exalté : « OH, IL MARQUE ! »

Edit prompt

Fiction audio

Détective, tendu : « Ne bougez pas. » Les pas cessent, une porte grince.

Edit prompt

Moment de jeu

Voix grave et héroïque : « Le sceau ancien a cédé. » Pierre qui broie.

Edit prompt

Vue d'ensemble

Seed Audio 1.0 est le modèle audio tout-en-un de ByteDance, conçu comme l'étape suivante de la synthèse vocale plutôt que comme une rupture avec elle. Les flux audio traditionnels utilisent des outils séparés pour la voix, la musique et les effets sonores, chacun généré de son côté puis mixé. Seed Audio 1.0 produit les trois ensemble à partir d'un seul prompt texte, et la sortie est une piste audio complète, prête à l'emploi.

Du texte-vers-parole au référence-vers-audio

Une TTS classique prend une voix et un bloc de texte. Seed Audio 1.0 prend une scène : la météo et la pièce, la musique en dessous, les effets autour de l'action, l'allure et la voix de chaque personnage, et les répliques qu'ils prononcent. Tout ce que vous décrivez entre dans la même génération, et c'est pourquoi un prompt peut atteindre 3 000 caractères sans être du remplissage.

Le modèle comprend le contexte de la scène. Un prompt de conversation au café obtient un brouhaha ambiant et le bon espace acoustique, pas un fond de pièce générique. Une scène d'action obtient des effets nets et une partition dynamique, pas une musique posée sur du silence. Les trois couches sortent proportionnées et mixées pour la scène, et non assemblées depuis des exports séparés.

Quatre modes

Le plus simple est la synthèse vocale : choisissez une voix, saisissez un texte, et le modèle le lit. Le clonage vocal ajoute une étape : envoyez un seul extrait audio et la voix clonée devient disponible pour cette même synthèse vocale. Les deux autres modes sont ceux qui démarquent le modèle.

En prompt texte vers audio (T2A), chaque voix vient de votre description. Précisez l'âge, l'accent, l'émotion, le ton et le débit d'un personnage, et le modèle le distribue.

En prompt texte plus audio vers audio (TA2A), vous envoyez jusqu'à trois extraits de référence de 30 secondes maximum et vous associez chacun à un personnage dans le prompt. La voix générée suit alors l'enregistrement plutôt qu'une description. Les extraits de référence peuvent être envoyés pour une seule tâche ou conservés dans une bibliothèque d'assets et réutilisés sur toute une série.

Vingt langues

Seed Audio 1.0 génère en anglais, chinois, japonais, coréen, espagnol du Mexique, espagnol d'Espagne, indonésien, allemand, portugais du Brésil, français, thaï, vietnamien, malais, philippin, italien, russe, néerlandais, polonais, turc et suédois. La langue du prompt et celle du script doivent correspondre : rédigez le brief dans la langue que parlent les personnages.

Un minutage réglable à la seconde

Seed Audio 1.0 accepte un timecode sur n'importe quelle réplique, écrit en ligne sous la forme [5.5s:8.0s], et ajuste le jeu à cette fenêtre exacte. En doublage, c'est la différence entre un audio qui tombe à peu près juste et un audio qui tombe sur la coupe. La génération est non-streaming : le modèle rend la piste finie en une seule passe, jusqu'à deux minutes.

Tarifs simples

Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.

Basic

$9/ mois
facturé comme $0 par an

1100 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Standard

$24/ mois
facturé comme $0 par an

3625 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Pro

$45/ mois
facturé comme $0 par an

6350 partagé mensuel crédits

1 utilisateur

+ jusqu'à 4 plus à un coût supplémentaire

Tous les modèles

Workflows

Pro Max

$170/ mois
facturé comme $0 par an

24650 partagé mensuel crédits

1 utilisateur

+ jusqu'à 9 plus à un coût supplémentaire

Tous les modèles

Workflows

Enterprise

Pour des limites plus élevées

Personnalisé

conditions de tarification et de facturation

Crédits à haut volume
Limites de sièges personnalisées
Tous les modèles
Workflows
Pricing Gradient

Free

Pour expérimenter

$0

gratuit pour toujours

Jusqu'à 20 crédits
1 utilisateur uniquement
Modèles limités
Workflows

Questions fréquentes

Qu'est-ce que Seed Audio 1.0 ?
Seed Audio 1.0 est le modèle de synthèse vocale tout-en-un de ByteDance. À partir d'un seul prompt texte, il produit voix, musique instrumentale et effets sonores ensemble, en une piste finie et mixée. Il fonctionne selon deux modes principaux : prompt texte vers audio (T2A), où tout vient de votre description, et prompt texte plus audio vers audio (TA2A), où vous ajoutez des extraits de référence pour distribuer des voix précises.
Quelles langues Seed Audio 1.0 prend-il en charge ?
Seed Audio 1.0 gère 20 langues : anglais, chinois, japonais, coréen, espagnol du Mexique, espagnol d'Espagne, indonésien, allemand, portugais du Brésil, français, thaï, vietnamien, malais, philippin, italien, russe, néerlandais, polonais, turc et suédois. Pour un meilleur résultat, écrivez le prompt dans la même langue que les répliques à faire dire.
Comment fonctionne l'audio de référence dans Seed Audio 1.0 ?
En mode TA2A, vous fournissez jusqu'à trois extraits de référence de 30 secondes maximum, puis vous les associez dans le prompt pour que chaque personnage corresponde à un enregistrement. Le modèle reprend le caractère vocal et l'émotion de la référence et les tient sur toute la génération. Vous pouvez aussi définir une voix par une description texte ou une image de personnage.
Seed Audio 1.0 peut-il cloner une voix ?
Oui. À côté du T2A et du TA2A, il existe un mode de clonage vocal : envoyez un seul extrait audio, et la voix clonée devient disponible pour de la synthèse vocale simple. ByteDance le documente comme un clonage à partir d'un seul extrait. Quand la voix doit s'intégrer à une scène complète avec musique, effets et autres personnages, passez plutôt par le TA2A et ses trois extraits de référence.
Seed Audio 1.0 peut-il contrôler le minutage de chaque réplique ?
Oui. Seed Audio 1.0 gère le contrôle précis du minutage : placez un timecode comme [5.5s:8.0s] au début d'une réplique et le modèle l'ajuste exactement à cette fenêtre. C'est ce qui le rend utilisable en doublage, où le dialogue doit coller à l'image.
Seed Audio 1.0 peut-il générer plusieurs locuteurs à la fois ?
Oui. Écrivez une scène à plusieurs personnages et décrivez chaque voix au fil du texte. Seed Audio 1.0 donne à chaque locuteur une voix, une émotion et un rythme distincts en une seule génération, avec l'ambiance et les effets autour d'eux.
Quelle peut être la durée d'une génération Seed Audio 1.0 ?
Seed Audio 1.0 génère jusqu'à deux minutes d'audio en une passe, à partir d'un prompt de 3 000 caractères maximum. Les productions plus longues se construisent scène par scène.
En quoi Seed Audio 1.0 diffère-t-il d'une synthèse vocale classique ?
Une synthèse vocale classique choisit une voix et lit un texte. Seed Audio 1.0 passe du texte-vers-parole au référence-vers-audio : un seul prompt décrit l'environnement, la musique, les effets et la voix de chaque personnage, et le modèle rend la scène entière déjà mixée. La différence est d'échelle : une production audio finie plutôt que la seule voix.