Seed Audio 1.0: Der komplette Guide

Seed Audio 1.0: Der komplette Guide

Erfahren Sie, wie Sie mit Seed Audio 1.0 Stimme, Musik und Soundeffekte in einem Durchgang erzeugen, T2A- und TA2A-Prompts schreiben, Stimmen über Referenzaudio besetzen und das Timing auf die Sekunde steuern.

So klingt Seed Audio 1.0

Dokumentarfilm-Erzählung

Sprache, warm und bedächtig

Thriller-Voice-over

Sprache, gedämpft und angespannt

Gewürzmarkt-Atmosphäre

Soundeffekte, offene Geräuschkulisse

Gewitter

Soundeffekte, Sturm bis zum Donnerschlag

Orchestrales Motiv

Musik, aufsteigende Streicher und Blechbläser

Lo-Fi-Beat

Musik, sanfte Keys und Vinyl-Sound

Seed Audio 1.0 Anwendungsfälle

Videoton in einem Durchgang

Ein Clip bekommt Erzählung, Sounddesign und Musik in einer Generierung. Beschreiben Sie die Szene, wer spricht, was passiert und die Stimmung, und das Modell übernimmt die komplette Tonspur.

Ein filmisches Standbild: eine einsame Gestalt mit Regenschirm auf einer regennassen Straße in der Abenddämmerung

Erklärvideos und Tutorials

Eine gefasste Stimme mit Raumton und leichtem Musikbett in einer Ausgabe. Die Erzählung trägt den Inhalt, und das Modell füllt den akustischen Raum, damit es verortet und fertig klingt.

Blick über die Schulter: Hände zentrieren ein Fahrradlaufrad auf einer Werkbank im sanften Fensterlicht

Kurze Werbung und Promos

Gesprochene Zeile, Soundeffekte und Musik als fertige Spur. Schreiben Sie das Timing in den Prompt, und das Modell setzt den Akzent auf das richtige Wort und blendet die Musik im richtigen Moment ab.

Ein einzelner Laufschuh mitten in der Luft über einer sonnenbeschienenen Laufbahn zur goldenen Stunde

Dialogszenen und Hörspiel

Szenen mit mehreren Figuren, eigenen Stimmen, treffendem Spiel und passender Atmosphäre, alles in einem Prompt. Schreiben Sie das Skript, beschreiben Sie jede Stimme, und das Modell besetzt und inszeniert.

Zwei Personen mitten im Gespräch an einem kleinen Café-Tisch vor einem regenverhangenen Fenster

Hörbücher und lange Erzähltexte

Erzählung, Figurenstimmen und Sounddesign ohne Studiotermin, zu Kosten, die ByteDance bei etwa einem Zehntel einer menschlichen Aufnahme ansetzt. Besetzen Sie den Erzähler über einen Clip oder eine Beschreibung und arbeiten Sie Szene für Szene.

Eine gemütliche Aufnahme-Ecke zu Hause mit einem Studiomikrofon im warmen Licht

Bildgenaue Synchronisation

Setzen Sie einen Timecode auf jede Zeile, und das Modell passt den Vortrag exakt in dieses Fenster ein, damit der Dialog auf dem Schnitt sitzt statt daneben. Funktioniert in allen zwanzig Sprachen.

Ein Audio-Bearbeitungs-Arbeitsplatz mit einer leuchtenden Wellenform-Zeitleiste auf einem dunklen Monitor

So schreiben Sie einen Seed-Audio-1.0-Prompt

Ein starker Prompt liest sich wie ein kurzes Szenen-Briefing, nicht wie eine Text-to-Speech-Zeile. Nur so bringt das Modell Stimme, Musik und Effekte in einer Szene zusammen. Gehen Sie vor dem Absenden SCENE durch.

SCENEEnthältBeispiel
SzeneWetter, Ort, Kontext, AkustikSchulflur nach dem Unterricht, ferne Schritte, Hall
CastWas jede Figur tut oder trägtRucksack geschultert, Winken von der Tür
EffekteMusikstimmung und Genre, SoundeffekteTiefe Kriegstrommeln, Blech, ein Spind-Klacken
Notizen zur StimmeGeschlecht, Alter, Akzent, Emotion, Ton, TempoTeenager, US-Akzent, helle, forsche Stimme
Exakte ZeilenWas jede Figur sagt, in Anführungszeichen„Hey Emma, hast du Samstag Zeit?“

Drei Gewohnheiten unterscheiden starke Prompts von generischen.

Schreiben Sie lang. Das Limit liegt bei 3.000 Zeichen, und die offiziellen Beispiele nutzen den Großteil davon. Beschreibung ist hier kein Füllmaterial: Umgebung, Musik und das Spiel jeder Figur werden alle vom Modell gerendert, also ist jeder gestrichene Satz eine Entscheidung, die Sie ihm zurückgeben.

Schreiben Sie die Geräusche aus. Lautmalerei funktioniert. Ein Rucksack-Reißverschluss „zzzip“, eine Schulklingel „kling-a-ling“, die sich entfernt, das „wumm, wumm“ einer Klinge durch die Luft. Das Geräusch zu buchstabieren ist zuverlässiger, als es zu benennen.

Halten Sie die Sprachen gleich. Schreiben Sie den Prompt in derselben Sprache wie die zu sprechenden Zeilen. Ein deutsches Skript mit englischem Briefing ist die häufigste Ursache für einen schiefen Akzent.

Schulklingel „kling-a-ling“, die von nah nach fern verklingt, Flur nach dem Unterricht mit fernen Schritten, Schülergemurmel, gelegentlichem Spind-„Klack“ und Flurhall. Jake (männlicher Teenager, US-Akzent, helle jugendliche Stimme, sonnig und forsch) sagt verspielt und neckend: „Hey Emma, hast du Samstag Zeit? Ich lade dich ein, in den neuen Freizeitpark!“ Ein Rucksack-Reißverschluss macht „zzzip“. Emma (weiblicher Teenager, US-Akzent, weiche, luftige Stimme, schüchtern) senkt die Stimme, verlegen: „Äh, ich bin noch nicht mit den Hausaufgaben fertig.“ Jake überredet sie, die Worte dehnend: „Die machst du Sonntag, es ist doch nur ein halber Tag!“ Emma murmelt, weicher werdend: „Aber sie sind Montag fällig.“ Jake sagt sanft: „Ich mach sie mit dir, und dann fahren wir, abgemacht?“ Emma muss lachen und gibt schüchtern nach: „Na gut, nur ein halber Tag, okay?“ Jake, aufgeregt: „Abgemacht!“ Endet damit, dass beide Schritte sich entfernen.

Das Timing auf die Sekunde steuern

Seed Audio 1.0 beherrscht präzise Zeitsteuerung. Setzen Sie einen Timecode an den Anfang einer Zeile, in der Form [Start:Ende], und das Modell passt den Vortrag dieser Zeile exakt in das Fenster ein. Es beschleunigt, verlangsamt und setzt Pausen, damit die Zeile passt.

Ryan (junger Mann, warme Stimme) ruft besorgt, leicht außer Atem: „[5.5s:8.0s] Maya! Warte, du gehst wirklich heute Abend?“ Maya (junge Frau, weiche Stimme) antwortet leise und zwingt sich zur Fassung: „[8.5s:11.5s] Ich muss. Ich habe Jahre darauf hingearbeitet, ich kann jetzt nicht aufgeben.“

Genau das macht das Modell für die Synchronisation brauchbar. Übernehmen Sie In- und Out-Punkte jeder Zeile aus Ihrer Timeline, schreiben Sie sie in den Prompt, und die gerenderte Spur legt sich ohne Dehnen oder Beschneiden auf das Bild. Ohne Timecodes gibt das Modell der Szene ein natürliches Tempo.

Stimmen über Referenzaudio besetzen (TA2A)

Es gibt zwei Wege, eine Stimme in eine Szene zu bekommen. Bei T2A beschreiben Sie sie, und das Modell besetzt sie. Bei TA2A laden Sie Referenzaudio hoch, und die erzeugte Stimme folgt der Aufnahme.

Daneben gibt es einen einfacheren Modus zum Stimmenklonen, außerhalb der Szenenarbeit: einen einzigen Clip hochladen, und die geklonte Stimme steht für reines Text-to-Speech bereit. Nehmen Sie ihn, wenn eine Stimme nur ein Skript lesen soll. Nehmen Sie TA2A, sobald diese Stimme in einer Szene neben Musik, Effekten und anderen Figuren bestehen muss.

TA2A nimmt bis zu drei Referenzclips von je maximal 30 Sekunden. Weisen Sie jeden Clip im Text einer Figur zu, damit das Modell weiß, welche Stimme zu welchem Sprecher gehört, und schreiben Sie die Szene dann genau wie bei T2A.

[Straßenatmosphäre: vorbeifahrende Autos, fernes Stimmengewirr, eine leichte Brise.] Marcus (männliche Stimme, geschmeidig und selbstsicher, warmer, verspielter Moderatorenton, klare Artikulation, der Sprecher ist <<TGT_SPK1>>), aufgeräumt und einladend, sagt: „Hallo! Kurze Frage, was ist das Peinlichste, das Ihnen je passiert ist?“ Tyler (jüngere männliche Stimme, leicht nervös, ausdrucksstark mit einem leichten Lachen, der Sprecher ist <<TGT_SPK2>>), stößt ein langes Stöhnen und ein gequältes Lachen aus und sagt: „Oh, das wollen Sie WIRKLICH nicht wissen. Also gut, aber das bleibt unter uns.“ Marcus (der Sprecher ist <<TGT_SPK1>>), lehnt sich neugierig vor und sagt: „Jetzt MUSS ich es hören. Los.“ [Beide brechen in Lachen aus; die Straßenatmosphäre schwillt an und blendet ab.]

Drei Dinge müssen in einem TA2A-Prompt stimmen: welcher Inhalt erzeugt werden soll, welches Referenzaudio verwendet wird und wozu jedes Referenzaudio dient. Die Clips werden über @Audio1, @Audio2 und @Audio3 ausgewählt, entweder für den aktuellen Auftrag hochgeladen oder aus Ihrer Asset-Bibliothek gewählt und über eine ganze Serie wiederverwendet.

Hinweise in eckigen Klammern wie [Straßenatmosphäre: vorbeifahrende Autos, fernes Stimmengewirr] sind ein sauberer Weg, eine Szene zu öffnen und zu schließen, ohne den Klang an einen Sprecher zu binden.

Bereiten Sie Referenzclips nach der CLEAR-Checkliste vor:

  • Saubere Aufnahme, mit wenig Hintergrundgeräusch
  • Länge unter 30 Sekunden pro Clip
  • Emotion passend zum gewünschten Vortrag
  • Akzent innerhalb jedes Clips konsistent
  • Raumton über alle Clips hinweg gleichbleibend

Ohne Clip beschreiben Sie die Stimme im Text und nennen Alter, Akzent und Tempo statt „angenehm“ oder „professionell“. Ein Figurenbild funktioniert ebenfalls: Das Modell leitet aus scheinbarem Alter und Charakter eine passende Stimme ab, was für fiktive oder animierte Sprecher nützlich ist.

So nutzen Sie Seed Audio 1.0

Bis zur fertigen Spur sind es vier Schritte.

  1. Schreiben Sie das Szenen-Briefing. Beschreiben Sie Schauplatz, Besetzung, Musik und Effekte, jede Stimme und die Zeilen, nach der SCENE-Checkliste oben. Bis zu 3.000 Zeichen.
  2. Legen Sie die Stimmen fest. Beschreiben Sie sie im Prompt für T2A, oder laden Sie bis zu drei Referenzclips hoch und weisen Sie sie für TA2A zu. Ein Figurenbild geht auch.
  3. Ergänzen Sie bei Bedarf das Timing. Setzen Sie [Start:Ende]-Timecodes auf Zeilen, die ein exaktes Fenster treffen müssen.
  4. Generieren Sie. Ein Durchgang liefert Stimme, Musik und Soundeffekte gemeinsam, bereits gemischt, bis zu zwei Minuten lang.

Für alles über zwei Minuten, ein Hörbuchkapitel oder eine ganze Folge, arbeiten Sie Szene für Szene und behalten dieselbe Stimmreferenz über die Generierungen hinweg, damit die Besetzung konsistent bleibt.

Häufig gestellte Fragen

Was ist der Unterschied zwischen T2A und TA2A in Seed Audio 1.0?

T2A, Text-Prompt zu Audio, baut alles aus Ihrer Beschreibung: Umgebung, Musik, Soundeffekte und die Stimme jeder Figur. TA2A, Text-Prompt plus Audio zu Audio, ergänzt bis zu drei Referenzaufnahmen, die Sie bestimmten Figuren zuweisen, sodass diese Stimmen den Aufnahmen folgen statt einer schriftlichen Beschreibung. Alles Übrige am Prompt bleibt gleich.

Kann Seed Audio 1.0 eine Stimme klonen?

Ja. Über T2A und TA2A hinaus gibt es einen Modus zum Stimmenklonen: Sie laden einen Audioclip hoch, und die geklonte Stimme steht danach für reines Text-to-Speech bereit. ByteDance dokumentiert das als Klon aus einem einzigen Clip. Soll die Stimme in einer kompletten Szene mit Musik, Effekten und weiteren Sprechern auftreten, nehmen Sie stattdessen TA2A, das bis zu drei Referenzclips aufnimmt und jeden einer Figur zuweist.

Wie funktioniert die Zeitsteuerung in Seed Audio 1.0?

Setzen Sie einen Timecode der Form [5.5s:8.0s] an den Anfang einer Zeile, und das Modell passt den Vortrag exakt in dieses Fenster ein, indem es Tempo und Pausen anpasst. Das ist die Funktion, die das Modell für die Synchronisation praktikabel macht, wo der Ton zum Bild passen muss. Zeilen ohne Timecode bekommen ein natürliches Tempo.

Welche Sprachen unterstützt Seed Audio 1.0?

Zwanzig: Englisch, Chinesisch, Japanisch, Koreanisch, mexikanisches Spanisch, kastilisches Spanisch, Indonesisch, Deutsch, brasilianisches Portugiesisch, Französisch, Thai, Vietnamesisch, Malaiisch, Filipino, Italienisch, Russisch, Niederländisch, Polnisch, Türkisch und Schwedisch. Schreiben Sie den Prompt in derselben Sprache wie das Skript, dann wird das Ergebnis am gleichmäßigsten.

Kann Seed Audio 1.0 mehrere Sprecher gleichzeitig erzeugen?

Ja. Beschreiben Sie die Stimme jeder Figur im Verlauf der Szene, und das Modell gibt jedem Sprecher eine eigene Stimme, Emotion und Sprechweise in einer einzigen Generierung, samt Atmosphäre und Effekten drumherum. Im TA2A-Modus können Sie bis zu drei dieser Figuren mit Referenzaufnahmen verknüpfen.

Wie lang darf eine Generierung mit Seed Audio 1.0 sein?

Bis zu zwei Minuten Audio pro Durchgang, aus einem Prompt von maximal 3.000 Zeichen. Die Generierung ist Non-Streaming: Das Modell rendert die komplette gemischte Spur, statt Audio in Echtzeit zurückzugeben. Längere Produktionen entstehen Szene für Szene.

Kann Seed Audio 1.0 ein Hörbuch erzählen?

Das ist einer der stärksten Anwendungsfälle für das Modell. Ein einziger Prompt deckt die Stimme des Erzählers, die Figurenstimmen und das Sounddesign drumherum ab, sodass eine Szene fertig ankommt statt als getrennte Spuren zum Mischen. Behalten Sie dieselbe Stimmreferenz über die Kapitel hinweg, und der Erzähler bleibt durch das ganze Buch konsistent.

Unterscheidet sich Seed Audio 1.0 von gewöhnlichem Text-to-Speech?

Deutlich. Gewöhnliches Text-to-Speech wählt eine Stimme und liest Text vor. Seed Audio 1.0 geht von Text-to-Speech zu Referenz-zu-Audio: Ein Prompt beschreibt Umgebung, Musik, Effekte und die Stimme jeder Figur, und das Modell liefert die ganze Szene fertig gemischt. Der Unterschied im Umfang ist eine komplette Audioproduktion gegenüber nur der Stimme.