Écoutez Seed Audio 1.0
Narration de documentaire
Voix, chaleureuse et posée
Voix off de thriller
Voix, feutrée et tendue
Ambiance de marché aux épices
Effets sonores, nappe en plein air
Orage
Effets sonores, tempête jusqu'au coup de tonnerre
Cue orchestral
Musique, cordes et cuivres en montée
Beat lo-fi
Musique, claviers doux et vinyle
Cas d'usage de Seed Audio 1.0
Audio vidéo en une passe
Donnez à un clip sa narration, son design sonore et sa musique en une génération. Décrivez la scène, qui parle, ce qui se passe et l'ambiance, et le modèle prend en charge toute la piste audio.

Explications et tutoriels narrés
Une voix posée avec un fond de pièce et un lit musical léger en une seule sortie. La narration porte le contenu, et le modèle remplit l'espace acoustique pour que ce soit situé et fini.

Pubs et promos courtes
Réplique, effets sonores et musique en une piste prête à l'emploi. Écrivez le minutage dans le prompt, et le modèle place l'accent sur le bon mot et baisse la musique au bon moment.

Dialogues écrits et fiction audio
Des scènes à plusieurs personnages avec des voix distinctes, un jeu juste et l'ambiance qui va avec, en un seul prompt. Écrivez le script, décrivez chaque voix, et le modèle distribue et dirige.

Livres audio et narration longue
Narration, voix de personnages et design sonore sans séance de studio, pour un coût que ByteDance situe autour du dixième d'un enregistrement humain. Distribuez le narrateur depuis un extrait ou une description, puis avancez scène par scène.

Doublage vidéo à l'image près
Posez un timecode sur chaque réplique et le modèle ajuste le jeu à cette fenêtre exacte : le dialogue tombe sur la coupe, pas à côté. Fonctionne dans les vingt langues prises en charge.

Comment écrire un prompt Seed Audio 1.0
Un bon prompt se lit comme un bref de scène, pas comme une ligne de synthèse vocale : c'est ce qui permet au modèle de faire tenir voix, musique et effets dans une même scène. Passez par SCENE avant d'envoyer.
| SCENE | À inclure | Exemple |
|---|---|---|
| Scène | Météo, lieu, contexte, acoustique | Couloir après les cours, pas lointains, réverbération |
| Casting | Ce que fait ou porte chaque personnage | Sac sur l'épaule, salut depuis la porte |
| Effets | Ambiance et genre musical, effets sonores | Tambours de guerre, cuivres graves, un casier qui claque |
| Notes de voix | Genre, âge, accent, émotion, ton, débit | Adolescent, accent américain, voix claire et sûre |
| Énoncés | Ce que dit chaque personnage, entre guillemets | « Hé, Emma, tu es libre samedi ? » |
Trois habitudes séparent les bons prompts des prompts génériques.
Écrivez long. La limite est de 3 000 caractères, et les exemples officiels en utilisent l'essentiel. Ici, la description n'est pas du remplissage : l'environnement, la musique et le jeu de chaque personnage sont autant de choses que le modèle rend, donc chaque phrase coupée est une décision que vous lui rendez.
Écrivez les sons. Les onomatopées fonctionnent. La fermeture éclair d'un sac « zzzip », une sonnerie d'école « dring » qui s'éloigne, le « whoum, whoum » d'une lame dans l'air. Épeler le son est plus fiable que le nommer.
Faites correspondre les langues. Écrivez le prompt dans la langue des répliques à dire. Un script français briefé en anglais est la première cause d'accent bancal.
Sonnerie d'école « dring » qui s'éloigne du proche au lointain, couloir d'après les cours avec des pas au loin, des bavardages d'élèves, un « clac » de casier de temps en temps, et une réverbération de couloir. Jake (adolescent, accent américain, voix jeune et claire, solaire et sûr de lui) dit sur un ton joueur et taquin : « Hé, Emma, tu es libre samedi ? Je t'invite, au nouveau parc d'attractions ! » La fermeture éclair d'un sac fait « zzzip ». Emma (adolescente, accent américain, voix douce et aérienne, timide) baisse la voix, troublée : « Euh, je n'ai pas fini mes devoirs. » Jake insiste en traînant sur les mots : « Tu les feras dimanche, c'est juste une demi-journée ! » Emma murmure, adoucie : « Mais c'est pour lundi. » Jake dit avec douceur : « Je les fais avec toi, et après on y va, ça marche ? » Emma ne peut pas s'empêcher de rire et cède timidement : « Bon, juste une demi-journée, d'accord ? » Jake, tout excité : « Ça marche ! » Finit sur les pas des deux qui s'éloignent.
Contrôler le minutage à la seconde
Seed Audio 1.0 gère le contrôle précis du minutage. Placez un timecode en tête de réplique, sous la forme [début:fin], et le modèle fait tenir le jeu de cette réplique dans la fenêtre exacte. Il accélère, ralentit et place les pauses pour que ça tombe juste.
Ryan (jeune homme, voix chaleureuse) appelle avec inquiétude, un peu essoufflé : « [5.5s:8.0s] Maya ! Attends, tu pars vraiment ce soir ? » Maya (jeune femme, voix douce) répond doucement, s'efforçant de rester posée : « [8.5s:11.5s] Je dois y aller. J'ai passé des années à courir après ça, je ne peux pas renoncer maintenant. »
C'est ce qui rend le modèle utilisable en doublage. Reprenez les points d'entrée et de sortie de chaque réplique depuis votre timeline, écrivez-les dans le prompt, et la piste rendue se pose sur l'image sans étirement ni rognage. Sans timecodes, le modèle donne à la scène un rythme naturel.
Distribuer des voix depuis un audio de référence (TA2A)
Il y a deux façons d'amener une voix dans une scène. En T2A, vous la décrivez et le modèle la distribue. En TA2A, vous envoyez un audio de référence et la voix générée suit l'enregistrement.
Il existe aussi un mode de clonage vocal plus simple, en dehors du travail de scène : envoyez un seul extrait, et la voix clonée devient disponible pour de la synthèse vocale simple. À utiliser quand il s'agit seulement de faire lire un texte. Passez au TA2A dès que cette voix doit tenir dans une scène, avec la musique, les effets et les autres personnages.
TA2A accepte jusqu'à trois extraits de référence de 30 secondes maximum. Associez chaque extrait à un personnage directement dans le texte, pour que le modèle sache quelle voix va à quel locuteur, puis écrivez la scène exactement comme pour du T2A.
[Ambiance de rue : voitures qui passent, brouhaha lointain, une brise légère.] Marcus (voix masculine, posée et assurée, ton de présentateur chaleureux et joueur, articulation nette, l'acteur est <<TGT_SPK1>>), enjoué et engageant, dit : « Salut ! Petite question, c'est quoi le truc le plus gênant qui vous soit arrivé ? » Tyler (voix masculine plus jeune, un peu nerveuse, expressive avec un petit rire, l'acteur est <<TGT_SPK2>>), lâchant un long soupir et un rire gêné, dit : « Oh, vous ne voulez VRAIMENT pas savoir. Bon, d'accord, mais ça reste entre nous. » Marcus (l'acteur est <<TGT_SPK1>>), se penchant, intrigué, dit : « Là il FAUT que je sache. Allez-y. » [Les deux éclatent de rire ; l'ambiance de rue monte puis s'efface.]
Trois choses à cadrer dans un prompt TA2A : quel contenu générer, quel audio de référence utiliser, et à quoi sert chaque audio de référence. Les extraits se sélectionnent avec @Audio1, @Audio2 et @Audio3, envoyés pour la tâche en cours ou pris dans votre bibliothèque d'assets et réutilisés sur toute une série.
Les indications entre crochets comme [Ambiance de rue : voitures qui passent, brouhaha lointain] sont un moyen propre d'ouvrir et de fermer une scène sans rattacher le son à un locuteur.
Préparez vos extraits de référence avec la checklist CLEAR :
- Enregistrement propre, avec peu de bruit de fond
- Durée sous les 30 secondes par extrait
- Émotion alignée sur le jeu que vous voulez
- Accent constant à l'intérieur de chaque extrait
- Fond de pièce stable d'un extrait à l'autre
Sans extrait, décrivez la voix en texte, en donnant l'âge, l'accent et le débit plutôt que « agréable » ou « professionnelle ». Une image de personnage marche aussi : le modèle en déduit une voix cohérente avec l'âge et le caractère apparents, ce qui est utile pour des locuteurs fictifs ou animés.
Comment utiliser Seed Audio 1.0
Obtenir une piste finie prend quatre étapes.
- Écrivez le bref de scène. Décrivez le décor, la distribution, la musique et les effets, chaque voix et les répliques, en suivant la checklist SCENE ci-dessus. Jusqu'à 3 000 caractères.
- Réglez les voix. Décrivez-les dans le prompt pour du T2A, ou envoyez jusqu'à trois extraits de référence et associez-les pour du TA2A. Une image de personnage marche aussi.
- Ajoutez le minutage si nécessaire. Posez des timecodes
[début:fin]sur les répliques qui doivent tenir dans une fenêtre précise. - Générez. Une passe rend voix, musique et effets sonores ensemble, déjà mixés, jusqu'à deux minutes.
Au-delà de deux minutes, pour un chapitre de livre audio ou un épisode entier, avancez scène par scène en gardant la même référence vocale d'une génération à l'autre pour que la distribution reste stable.
Questions fréquentes
T2A, prompt texte vers audio, construit tout à partir de votre description : l'environnement, la musique, les effets sonores et la voix de chaque personnage. TA2A, prompt texte plus audio vers audio, y ajoute jusqu'à trois enregistrements de référence que vous associez à des personnages précis, pour que ces voix suivent les enregistrements plutôt qu'une description écrite. Tout le reste du prompt est identique.
Oui. Au-delà du T2A et du TA2A, il existe un mode de clonage vocal : envoyez un seul extrait audio, et la voix clonée devient disponible pour de la synthèse vocale simple. ByteDance le documente comme un clonage à partir d'un unique extrait. Si la voix doit apparaître dans une scène complète avec musique, effets et autres locuteurs, utilisez plutôt le TA2A, qui accepte jusqu'à trois extraits de référence et associe chacun à un personnage.
Placez un timecode de la forme [5.5s:8.0s] au début d'une réplique et le modèle fait tenir le jeu exactement dans cette fenêtre, en ajustant le débit et les pauses pour que ça tombe juste. C'est la fonction qui rend le modèle pratique en doublage, où l'audio doit coller à l'image. Les répliques sans timecode gardent un rythme naturel.
Vingt : anglais, chinois, japonais, coréen, espagnol du Mexique, espagnol d'Espagne, indonésien, allemand, portugais du Brésil, français, thaï, vietnamien, malais, philippin, italien, russe, néerlandais, polonais, turc et suédois. Écrivez le prompt dans la même langue que le script pour le résultat le plus régulier.
Oui. Décrivez la voix de chaque personnage au fil de la scène, et le modèle donne à chaque locuteur une voix, une émotion et un rythme distincts en une seule génération, avec l'ambiance et les effets autour d'eux. En mode TA2A, vous pouvez associer jusqu'à trois de ces personnages à des enregistrements de référence.
Jusqu'à deux minutes d'audio par passe, à partir d'un prompt de 3 000 caractères maximum. La génération est non-streaming : le modèle rend la piste mixée complète plutôt que de renvoyer de l'audio en temps réel. Les productions plus longues se construisent scène par scène.
C'est l'un des usages où le modèle est le plus à sa place. Un seul prompt couvre la voix du narrateur, celles des personnages et le design sonore autour, si bien qu'une scène arrive finie plutôt qu'en pistes séparées à mixer. Gardez la même référence vocale d'un chapitre à l'autre et le narrateur reste constant sur tout le livre.
Nettement. Une synthèse vocale classique choisit une voix et lit un texte. Seed Audio 1.0 passe du texte-vers-parole au référence-vers-audio : un seul prompt décrit l'environnement, la musique, les effets et la voix de chaque personnage, et le modèle rend la scène entière déjà mixée. La différence d'échelle est celle d'une production audio complète face à la seule voix.
