Seed Audio 1.0
par ByteDance
Le modèle TTS tout‑en‑un de ByteDance.
Voix, musique et effets sonores, en une passe.

Fonctionnalités clés
Écoutez l'éventail
Une voix off documentaire chaleureuse et posée.
Une réplique lue tout bas, tendue, proche et intime.
Un lit sonore de marché en plein air, en couches.
Un orage roulant vers un coup de tonnerre lointain.
Une courte montée pour cordes et cuivres.
Un beat détendu avec claviers doux et grésillement de vinyle.
Spécifications techniques
ByteDance
Développé par l'équipe de recherche Seed de ByteDance.
20
Anglais, chinois, japonais, coréen, espagnol, français, allemand et plus.
Jusqu'à 2 min
Deux minutes d'audio généré au maximum par passe.
3 000 car.
De quoi écrire un brief de scène complet, dialogues compris.
Jusqu'à 3
Jusqu'à trois extraits de référence, de 30 secondes chacun.
Non-streaming
Rend la piste complète, pas un flux en temps réel.
Cas d'utilisation
Livres audio
Narration, voix et design sonore pour un livre entier. ByteDance situe le coût autour du dixième d'un studio.
Doublage vidéo
Décrivez la voix ou envoyez une image de personnage, puis calez chaque réplique à l'endroit exact voulu par l'image.
Audio de jeu vidéo
Répliques de personnages, scènes jouées et effets d'environnement immersifs, générés directement depuis le script.
Audio vidéo en une passe
Donnez à un clip sa narration, son design sonore et sa musique en une génération, sans étape de mixage séparée ensuite.
Pubs et promos
Une réplique, des effets sonores et de la musique en une piste prête à l'emploi, pensée pour les formats courts.
Dialogues et fiction audio
Plusieurs personnages, chacun avec sa voix et son jeu, dans une scène avec l'ambiance et le rythme qui vont avec.
Exemples de prompts
Explication narrée
Narrateur calme, ambiance de cuisine : « Mélangez la farine et le beurre. »
Edit promptContrôle du minutage
Ryan (chaleureux, essoufflé) : « [5.5s:8.0s] Maya ! Tu pars vraiment ce soir ? »
Edit promptCommentaire sportif
Stade comble, foule en fusion. Commentateur exalté : « OH, IL MARQUE ! »
Edit promptVue d'ensemble
Seed Audio 1.0 est le modèle audio tout-en-un de ByteDance, conçu comme l'étape suivante de la synthèse vocale plutôt que comme une rupture avec elle. Les flux audio traditionnels utilisent des outils séparés pour la voix, la musique et les effets sonores, chacun généré de son côté puis mixé. Seed Audio 1.0 produit les trois ensemble à partir d'un seul prompt texte, et la sortie est une piste audio complète, prête à l'emploi.
Du texte-vers-parole au référence-vers-audio
Une TTS classique prend une voix et un bloc de texte. Seed Audio 1.0 prend une scène : la météo et la pièce, la musique en dessous, les effets autour de l'action, l'allure et la voix de chaque personnage, et les répliques qu'ils prononcent. Tout ce que vous décrivez entre dans la même génération, et c'est pourquoi un prompt peut atteindre 3 000 caractères sans être du remplissage.
Le modèle comprend le contexte de la scène. Un prompt de conversation au café obtient un brouhaha ambiant et le bon espace acoustique, pas un fond de pièce générique. Une scène d'action obtient des effets nets et une partition dynamique, pas une musique posée sur du silence. Les trois couches sortent proportionnées et mixées pour la scène, et non assemblées depuis des exports séparés.
Quatre modes
Le plus simple est la synthèse vocale : choisissez une voix, saisissez un texte, et le modèle le lit. Le clonage vocal ajoute une étape : envoyez un seul extrait audio et la voix clonée devient disponible pour cette même synthèse vocale. Les deux autres modes sont ceux qui démarquent le modèle.
En prompt texte vers audio (T2A), chaque voix vient de votre description. Précisez l'âge, l'accent, l'émotion, le ton et le débit d'un personnage, et le modèle le distribue.
En prompt texte plus audio vers audio (TA2A), vous envoyez jusqu'à trois extraits de référence de 30 secondes maximum et vous associez chacun à un personnage dans le prompt. La voix générée suit alors l'enregistrement plutôt qu'une description. Les extraits de référence peuvent être envoyés pour une seule tâche ou conservés dans une bibliothèque d'assets et réutilisés sur toute une série.
Vingt langues
Seed Audio 1.0 génère en anglais, chinois, japonais, coréen, espagnol du Mexique, espagnol d'Espagne, indonésien, allemand, portugais du Brésil, français, thaï, vietnamien, malais, philippin, italien, russe, néerlandais, polonais, turc et suédois. La langue du prompt et celle du script doivent correspondre : rédigez le brief dans la langue que parlent les personnages.
Un minutage réglable à la seconde
Seed Audio 1.0 accepte un timecode sur n'importe quelle réplique, écrit en ligne sous la forme [5.5s:8.0s], et ajuste le jeu à cette fenêtre exacte. En doublage, c'est la différence entre un audio qui tombe à peu près juste et un audio qui tombe sur la coupe. La génération est non-streaming : le modèle rend la piste finie en une seule passe, jusqu'à deux minutes.
Tarifs simples
Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.
Basic
1100 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Standard
3625 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Pro
6350 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Pro Max
24650 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Enterprise
Pour des limites plus élevées
Personnalisé
conditions de tarification et de facturation

Free
Pour expérimenter
$0
gratuit pour toujours
Questions fréquentes
ChatGPT Images 2.5
OpenAI
Le modèle d'image d'OpenAI, sorti en septembre 2026. Plus de détail, des retouches ciblées, plus de vitesse.
Lyria 3.5
Google DeepMind
Le meilleur modèle musical de Google. Des chansons entières, voix et paroles.
MiniMax H3 Max Turbo
fal.ai
Le palier rapide du H3 signé fal. Deux fois plus vite, rendu quasi égal.
Inworld TTS 2
Inworld
95 voix, plus de 100 langues. La voix part en moins d’une seconde.