So klingt Seed Audio 1.0
Dokumentarfilm-Erzählung
Sprache, warm und bedächtig
Thriller-Voice-over
Sprache, gedämpft und angespannt
Gewürzmarkt-Atmosphäre
Soundeffekte, offene Geräuschkulisse
Gewitter
Soundeffekte, Sturm bis zum Donnerschlag
Orchestrales Motiv
Musik, aufsteigende Streicher und Blechbläser
Lo-Fi-Beat
Musik, sanfte Keys und Vinyl-Sound
Seed Audio 1.0 Anwendungsfälle
Videoton in einem Durchgang
Ein Clip bekommt Erzählung, Sounddesign und Musik in einer Generierung. Beschreiben Sie die Szene, wer spricht, was passiert und die Stimmung, und das Modell übernimmt die komplette Tonspur.

Erklärvideos und Tutorials
Eine gefasste Stimme mit Raumton und leichtem Musikbett in einer Ausgabe. Die Erzählung trägt den Inhalt, und das Modell füllt den akustischen Raum, damit es verortet und fertig klingt.

Kurze Werbung und Promos
Gesprochene Zeile, Soundeffekte und Musik als fertige Spur. Schreiben Sie das Timing in den Prompt, und das Modell setzt den Akzent auf das richtige Wort und blendet die Musik im richtigen Moment ab.

Dialogszenen und Hörspiel
Szenen mit mehreren Figuren, eigenen Stimmen, treffendem Spiel und passender Atmosphäre, alles in einem Prompt. Schreiben Sie das Skript, beschreiben Sie jede Stimme, und das Modell besetzt und inszeniert.

Hörbücher und lange Erzähltexte
Erzählung, Figurenstimmen und Sounddesign ohne Studiotermin, zu Kosten, die ByteDance bei etwa einem Zehntel einer menschlichen Aufnahme ansetzt. Besetzen Sie den Erzähler über einen Clip oder eine Beschreibung und arbeiten Sie Szene für Szene.

Bildgenaue Synchronisation
Setzen Sie einen Timecode auf jede Zeile, und das Modell passt den Vortrag exakt in dieses Fenster ein, damit der Dialog auf dem Schnitt sitzt statt daneben. Funktioniert in allen zwanzig Sprachen.

So schreiben Sie einen Seed-Audio-1.0-Prompt
Ein starker Prompt liest sich wie ein kurzes Szenen-Briefing, nicht wie eine Text-to-Speech-Zeile. Nur so bringt das Modell Stimme, Musik und Effekte in einer Szene zusammen. Gehen Sie vor dem Absenden SCENE durch.
| SCENE | Enthält | Beispiel |
|---|---|---|
| Szene | Wetter, Ort, Kontext, Akustik | Schulflur nach dem Unterricht, ferne Schritte, Hall |
| Cast | Was jede Figur tut oder trägt | Rucksack geschultert, Winken von der Tür |
| Effekte | Musikstimmung und Genre, Soundeffekte | Tiefe Kriegstrommeln, Blech, ein Spind-Klacken |
| Notizen zur Stimme | Geschlecht, Alter, Akzent, Emotion, Ton, Tempo | Teenager, US-Akzent, helle, forsche Stimme |
| Exakte Zeilen | Was jede Figur sagt, in Anführungszeichen | „Hey Emma, hast du Samstag Zeit?“ |
Drei Gewohnheiten unterscheiden starke Prompts von generischen.
Schreiben Sie lang. Das Limit liegt bei 3.000 Zeichen, und die offiziellen Beispiele nutzen den Großteil davon. Beschreibung ist hier kein Füllmaterial: Umgebung, Musik und das Spiel jeder Figur werden alle vom Modell gerendert, also ist jeder gestrichene Satz eine Entscheidung, die Sie ihm zurückgeben.
Schreiben Sie die Geräusche aus. Lautmalerei funktioniert. Ein Rucksack-Reißverschluss „zzzip“, eine Schulklingel „kling-a-ling“, die sich entfernt, das „wumm, wumm“ einer Klinge durch die Luft. Das Geräusch zu buchstabieren ist zuverlässiger, als es zu benennen.
Halten Sie die Sprachen gleich. Schreiben Sie den Prompt in derselben Sprache wie die zu sprechenden Zeilen. Ein deutsches Skript mit englischem Briefing ist die häufigste Ursache für einen schiefen Akzent.
Schulklingel „kling-a-ling“, die von nah nach fern verklingt, Flur nach dem Unterricht mit fernen Schritten, Schülergemurmel, gelegentlichem Spind-„Klack“ und Flurhall. Jake (männlicher Teenager, US-Akzent, helle jugendliche Stimme, sonnig und forsch) sagt verspielt und neckend: „Hey Emma, hast du Samstag Zeit? Ich lade dich ein, in den neuen Freizeitpark!“ Ein Rucksack-Reißverschluss macht „zzzip“. Emma (weiblicher Teenager, US-Akzent, weiche, luftige Stimme, schüchtern) senkt die Stimme, verlegen: „Äh, ich bin noch nicht mit den Hausaufgaben fertig.“ Jake überredet sie, die Worte dehnend: „Die machst du Sonntag, es ist doch nur ein halber Tag!“ Emma murmelt, weicher werdend: „Aber sie sind Montag fällig.“ Jake sagt sanft: „Ich mach sie mit dir, und dann fahren wir, abgemacht?“ Emma muss lachen und gibt schüchtern nach: „Na gut, nur ein halber Tag, okay?“ Jake, aufgeregt: „Abgemacht!“ Endet damit, dass beide Schritte sich entfernen.
Das Timing auf die Sekunde steuern
Seed Audio 1.0 beherrscht präzise Zeitsteuerung. Setzen Sie einen Timecode an den Anfang einer Zeile, in der Form [Start:Ende], und das Modell passt den Vortrag dieser Zeile exakt in das Fenster ein. Es beschleunigt, verlangsamt und setzt Pausen, damit die Zeile passt.
Ryan (junger Mann, warme Stimme) ruft besorgt, leicht außer Atem: „[5.5s:8.0s] Maya! Warte, du gehst wirklich heute Abend?“ Maya (junge Frau, weiche Stimme) antwortet leise und zwingt sich zur Fassung: „[8.5s:11.5s] Ich muss. Ich habe Jahre darauf hingearbeitet, ich kann jetzt nicht aufgeben.“
Genau das macht das Modell für die Synchronisation brauchbar. Übernehmen Sie In- und Out-Punkte jeder Zeile aus Ihrer Timeline, schreiben Sie sie in den Prompt, und die gerenderte Spur legt sich ohne Dehnen oder Beschneiden auf das Bild. Ohne Timecodes gibt das Modell der Szene ein natürliches Tempo.
Stimmen über Referenzaudio besetzen (TA2A)
Es gibt zwei Wege, eine Stimme in eine Szene zu bekommen. Bei T2A beschreiben Sie sie, und das Modell besetzt sie. Bei TA2A laden Sie Referenzaudio hoch, und die erzeugte Stimme folgt der Aufnahme.
Daneben gibt es einen einfacheren Modus zum Stimmenklonen, außerhalb der Szenenarbeit: einen einzigen Clip hochladen, und die geklonte Stimme steht für reines Text-to-Speech bereit. Nehmen Sie ihn, wenn eine Stimme nur ein Skript lesen soll. Nehmen Sie TA2A, sobald diese Stimme in einer Szene neben Musik, Effekten und anderen Figuren bestehen muss.
TA2A nimmt bis zu drei Referenzclips von je maximal 30 Sekunden. Weisen Sie jeden Clip im Text einer Figur zu, damit das Modell weiß, welche Stimme zu welchem Sprecher gehört, und schreiben Sie die Szene dann genau wie bei T2A.
[Straßenatmosphäre: vorbeifahrende Autos, fernes Stimmengewirr, eine leichte Brise.] Marcus (männliche Stimme, geschmeidig und selbstsicher, warmer, verspielter Moderatorenton, klare Artikulation, der Sprecher ist <<TGT_SPK1>>), aufgeräumt und einladend, sagt: „Hallo! Kurze Frage, was ist das Peinlichste, das Ihnen je passiert ist?“ Tyler (jüngere männliche Stimme, leicht nervös, ausdrucksstark mit einem leichten Lachen, der Sprecher ist <<TGT_SPK2>>), stößt ein langes Stöhnen und ein gequältes Lachen aus und sagt: „Oh, das wollen Sie WIRKLICH nicht wissen. Also gut, aber das bleibt unter uns.“ Marcus (der Sprecher ist <<TGT_SPK1>>), lehnt sich neugierig vor und sagt: „Jetzt MUSS ich es hören. Los.“ [Beide brechen in Lachen aus; die Straßenatmosphäre schwillt an und blendet ab.]
Drei Dinge müssen in einem TA2A-Prompt stimmen: welcher Inhalt erzeugt werden soll, welches Referenzaudio verwendet wird und wozu jedes Referenzaudio dient. Die Clips werden über @Audio1, @Audio2 und @Audio3 ausgewählt, entweder für den aktuellen Auftrag hochgeladen oder aus Ihrer Asset-Bibliothek gewählt und über eine ganze Serie wiederverwendet.
Hinweise in eckigen Klammern wie [Straßenatmosphäre: vorbeifahrende Autos, fernes Stimmengewirr] sind ein sauberer Weg, eine Szene zu öffnen und zu schließen, ohne den Klang an einen Sprecher zu binden.
Bereiten Sie Referenzclips nach der CLEAR-Checkliste vor:
- Saubere Aufnahme, mit wenig Hintergrundgeräusch
- Länge unter 30 Sekunden pro Clip
- Emotion passend zum gewünschten Vortrag
- Akzent innerhalb jedes Clips konsistent
- Raumton über alle Clips hinweg gleichbleibend
Ohne Clip beschreiben Sie die Stimme im Text und nennen Alter, Akzent und Tempo statt „angenehm“ oder „professionell“. Ein Figurenbild funktioniert ebenfalls: Das Modell leitet aus scheinbarem Alter und Charakter eine passende Stimme ab, was für fiktive oder animierte Sprecher nützlich ist.
So nutzen Sie Seed Audio 1.0
Bis zur fertigen Spur sind es vier Schritte.
- Schreiben Sie das Szenen-Briefing. Beschreiben Sie Schauplatz, Besetzung, Musik und Effekte, jede Stimme und die Zeilen, nach der SCENE-Checkliste oben. Bis zu 3.000 Zeichen.
- Legen Sie die Stimmen fest. Beschreiben Sie sie im Prompt für T2A, oder laden Sie bis zu drei Referenzclips hoch und weisen Sie sie für TA2A zu. Ein Figurenbild geht auch.
- Ergänzen Sie bei Bedarf das Timing. Setzen Sie
[Start:Ende]-Timecodes auf Zeilen, die ein exaktes Fenster treffen müssen. - Generieren Sie. Ein Durchgang liefert Stimme, Musik und Soundeffekte gemeinsam, bereits gemischt, bis zu zwei Minuten lang.
Für alles über zwei Minuten, ein Hörbuchkapitel oder eine ganze Folge, arbeiten Sie Szene für Szene und behalten dieselbe Stimmreferenz über die Generierungen hinweg, damit die Besetzung konsistent bleibt.
Häufig gestellte Fragen
T2A, Text-Prompt zu Audio, baut alles aus Ihrer Beschreibung: Umgebung, Musik, Soundeffekte und die Stimme jeder Figur. TA2A, Text-Prompt plus Audio zu Audio, ergänzt bis zu drei Referenzaufnahmen, die Sie bestimmten Figuren zuweisen, sodass diese Stimmen den Aufnahmen folgen statt einer schriftlichen Beschreibung. Alles Übrige am Prompt bleibt gleich.
Ja. Über T2A und TA2A hinaus gibt es einen Modus zum Stimmenklonen: Sie laden einen Audioclip hoch, und die geklonte Stimme steht danach für reines Text-to-Speech bereit. ByteDance dokumentiert das als Klon aus einem einzigen Clip. Soll die Stimme in einer kompletten Szene mit Musik, Effekten und weiteren Sprechern auftreten, nehmen Sie stattdessen TA2A, das bis zu drei Referenzclips aufnimmt und jeden einer Figur zuweist.
Setzen Sie einen Timecode der Form [5.5s:8.0s] an den Anfang einer Zeile, und das Modell passt den Vortrag exakt in dieses Fenster ein, indem es Tempo und Pausen anpasst. Das ist die Funktion, die das Modell für die Synchronisation praktikabel macht, wo der Ton zum Bild passen muss. Zeilen ohne Timecode bekommen ein natürliches Tempo.
Zwanzig: Englisch, Chinesisch, Japanisch, Koreanisch, mexikanisches Spanisch, kastilisches Spanisch, Indonesisch, Deutsch, brasilianisches Portugiesisch, Französisch, Thai, Vietnamesisch, Malaiisch, Filipino, Italienisch, Russisch, Niederländisch, Polnisch, Türkisch und Schwedisch. Schreiben Sie den Prompt in derselben Sprache wie das Skript, dann wird das Ergebnis am gleichmäßigsten.
Ja. Beschreiben Sie die Stimme jeder Figur im Verlauf der Szene, und das Modell gibt jedem Sprecher eine eigene Stimme, Emotion und Sprechweise in einer einzigen Generierung, samt Atmosphäre und Effekten drumherum. Im TA2A-Modus können Sie bis zu drei dieser Figuren mit Referenzaufnahmen verknüpfen.
Bis zu zwei Minuten Audio pro Durchgang, aus einem Prompt von maximal 3.000 Zeichen. Die Generierung ist Non-Streaming: Das Modell rendert die komplette gemischte Spur, statt Audio in Echtzeit zurückzugeben. Längere Produktionen entstehen Szene für Szene.
Das ist einer der stärksten Anwendungsfälle für das Modell. Ein einziger Prompt deckt die Stimme des Erzählers, die Figurenstimmen und das Sounddesign drumherum ab, sodass eine Szene fertig ankommt statt als getrennte Spuren zum Mischen. Behalten Sie dieselbe Stimmreferenz über die Kapitel hinweg, und der Erzähler bleibt durch das ganze Buch konsistent.
Deutlich. Gewöhnliches Text-to-Speech wählt eine Stimme und liest Text vor. Seed Audio 1.0 geht von Text-to-Speech zu Referenz-zu-Audio: Ein Prompt beschreibt Umgebung, Musik, Effekte und die Stimme jeder Figur, und das Modell liefert die ganze Szene fertig gemischt. Der Unterschied im Umfang ist eine komplette Audioproduktion gegenüber nur der Stimme.
