Audio-Generierung

Seed Audio 1.0

von ByteDance

ByteDances All‑in‑One‑TTS‑Modell.
Stimme, Musik und Soundeffekte in einem Durchgang.

Seed Audio 1.0

Hauptfunktionen

Hören Sie die Bandbreite

Dokumentarfilm-ErzählungSprache

Eine warme, ruhige Dokumentar-Erzählstimme.

0:00
0:12
Thriller-VoiceoverSprache

Eine gedämpfte, angespannte Zeilenlesung, nah und intim.

0:00
0:12
Gewürzmarkt-AtmosphäreSoundeffekte

Ein vielschichtiges Klangbett eines Freiluftmarkts.

0:00
0:12
GewitterSoundeffekte

Ein anschwellendes Gewitter, das zu einem fernen Donnerschlag führt.

0:00
0:12
Orchestrales MotivMusik

Ein kurzes, aufsteigendes Motiv für Streicher und Blechbläser.

0:00
0:12
Lo-Fi-BeatMusik

Ein entspannter Beat mit sanften Keys und Vinyl-Knistern.

0:00
0:12

Technische Spezifikationen

ByteDance

Entwickelt vom Seed-Forschungsteam von ByteDance.

20

Englisch, Chinesisch, Japanisch, Koreanisch, Spanisch, Französisch, Deutsch und mehr.

Bis zu 2 Min.

Maximal zwei Minuten erzeugtes Audio pro Durchgang.

3.000 Zeichen

Platz für ein vollständiges Szenen-Briefing, Dialog inklusive.

Bis zu 3

Bis zu drei Referenzclips von je maximal 30 Sekunden.

Non-Streaming

Rendert die komplette Spur, keinen Echtzeit-Stream.

Anwendungsfälle

Hörbücher

Erzählung, Stimmen und Sounddesign für ein ganzes Buch. ByteDance nennt etwa ein Zehntel der Studiokosten.

Video-Synchronisation

Stimme beschreiben oder Figurenbild hochladen, dann per Timecode jede Zeile genau dort platzieren, wo das Bild sie braucht.

Game-Audio

Figurenzeilen, gespielte Szenen und Umgebungseffekte für immersive Momente, direkt aus dem Skript erzeugt.

Videoton in einem Zug

Ein Clip bekommt Erzählung, Sounddesign und Musik in einer Generierung, ohne separaten Mischschritt danach.

Werbung und Promos

Eine gesprochene Zeile, Soundeffekte und Musik als fertige Spur, gemacht für kurze Formate.

Dialog und Hörspiel

Mehrere Figuren, jede mit eigener Stimme und eigenem Spiel, in einer Szene mit passender Atmosphäre und Timing.

Prompt-Beispiele

Erklärvideo-Erzählung

Ruhiger Erzähler, sanfte Küchenatmosphäre: „Mehl und Butter vermengen.“

Edit prompt

Zeitsteuerung

Ryan (warm, außer Atem): „[5.5s:8.0s] Maya! Du gehst wirklich heute Abend?“

Edit prompt

Hörbuchszene

Regen am Fenster. Erzählerin, tief und ruhig: „Sie las es zweimal.“

Edit prompt

Sportkommentar

Volles Stadion, tosende Menge. Kommentator, außer sich: „TOOOR!“

Edit prompt

Hörspiel

Detektiv, angespannt: „Keine Bewegung.“ Schritte stoppen, eine Tür knarrt.

Edit prompt

Spielmoment

Tiefer Erzähler: „Das alte Siegel ist gebrochen.“ Stein mahlt, dunkles Summen.

Edit prompt

Überblick

Seed Audio 1.0 ist ByteDances All-in-One-Audiomodell, gebaut als nächster Schritt für Text-to-Speech und nicht als Abkehr davon. Klassische Audio-Workflows nutzen getrennte Werkzeuge für Stimme, Musik und Soundeffekte, jeweils einzeln erzeugt und dann gemischt. Seed Audio 1.0 produziert alle drei gemeinsam aus einem einzigen Text-Prompt, und das Ergebnis ist eine vollständige, direkt verwendbare Audiospur.

Von Text-to-Speech zu Referenz-zu-Audio

Gewöhnliches TTS nimmt eine Stimme und einen Textblock. Seed Audio 1.0 nimmt eine Szene: Wetter und Raum, die Musik darunter, die Effekte rund um die Handlung, wie jede Figur aussieht und klingt, und die Zeilen, die sie sprechen. Alles, was Sie beschreiben können, wird Teil derselben Generierung. Genau deshalb darf ein Prompt bis zu 3.000 Zeichen lang sein, ohne Füllmaterial zu sein.

Das Modell versteht den Szenenkontext. Ein Prompt für ein Café-Gespräch bekommt Stimmengewirr und den passenden akustischen Raum, keinen generischen Raumton. Eine Actionszene bekommt scharfe Effekte und eine dynamische Musik, keine über Stille gelegte Hintergrundmusik. Die drei Ebenen kommen für die Szene ausbalanciert und gemischt heraus, nicht aus getrennten Exporten zusammengesetzt.

Vier Modi

Am einfachsten ist Text-to-Speech: Stimme wählen, Text eingeben, das Modell liest vor. Stimmenklonen ergänzt einen Schritt: Sie laden einen einzigen Audioclip hoch, und die geklonte Stimme steht für dasselbe Text-to-Speech bereit. Die anderen beiden Modi sind das, was dieses Modell von gewöhnlicher TTS abhebt.

Bei Text-Prompt zu Audio (T2A) entsteht jede Stimme aus Ihrer Beschreibung. Nennen Sie Alter, Akzent, Emotion, Tonfall und Tempo einer Figur, und das Modell besetzt sie.

Bei Text-Prompt plus Audio zu Audio (TA2A) laden Sie bis zu drei Referenzclips von je maximal 30 Sekunden hoch und weisen jeden im Prompt einer Figur zu. Die erzeugte Stimme folgt dann der Aufnahme statt einer Beschreibung. Referenzclips lassen sich für einen einzelnen Auftrag hochladen oder in einer Asset-Bibliothek halten und über eine ganze Serie wiederverwenden.

Zwanzig Sprachen

Seed Audio 1.0 generiert in Englisch, Chinesisch, Japanisch, Koreanisch, mexikanischem Spanisch, kastilischem Spanisch, Indonesisch, Deutsch, brasilianischem Portugiesisch, Französisch, Thai, Vietnamesisch, Malaiisch, Filipino, Italienisch, Russisch, Niederländisch, Polnisch, Türkisch und Schwedisch. Prompt-Sprache und Skriptsprache sollten übereinstimmen: Schreiben Sie das Briefing in der Sprache, die die Figuren sprechen.

Timing auf die Sekunde genau

Seed Audio 1.0 akzeptiert einen Timecode auf jeder Zeile, inline geschrieben als [5.5s:8.0s], und passt den Vortrag exakt in dieses Fenster ein. Bei der Synchronisation ist das der Unterschied zwischen Ton, der ungefähr passt, und Ton, der auf dem Schnitt sitzt. Die Generierung ist Non-Streaming: Das Modell rendert die fertige Spur in einem Durchgang, bis zu zwei Minuten lang.

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$19/ Monat
abgerechnet als $0 pro Jahr

2400 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3625 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6350 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Max

$170/ Monat
abgerechnet als $0 pro Jahr

24650 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Was ist Seed Audio 1.0?
Seed Audio 1.0 ist ByteDances All-in-One-Text-to-Speech-Modell. Aus einem einzigen Text-Prompt erzeugt es Stimme, Instrumentalmusik und Soundeffekte gemeinsam als fertig gemischte Spur. Es arbeitet in zwei Hauptmodi: Text-Prompt zu Audio (T2A), wo alles aus Ihrer Beschreibung entsteht, und Text-Prompt plus Audio zu Audio (TA2A), wo Sie Referenzclips ergänzen, um bestimmte Stimmen zu besetzen.
Welche Sprachen unterstützt Seed Audio 1.0?
Seed Audio 1.0 unterstützt 20 Sprachen: Englisch, Chinesisch, Japanisch, Koreanisch, mexikanisches Spanisch, kastilisches Spanisch, Indonesisch, Deutsch, brasilianisches Portugiesisch, Französisch, Thai, Vietnamesisch, Malaiisch, Filipino, Italienisch, Russisch, Niederländisch, Polnisch, Türkisch und Schwedisch. Schreiben Sie den Prompt am besten in derselben Sprache wie die gesprochenen Zeilen.
Wie funktioniert Referenzaudio in Seed Audio 1.0?
Im TA2A-Modus liefern Sie bis zu drei Referenzclips von je maximal 30 Sekunden und weisen sie im Prompt zu, sodass jede Figur einer Aufnahme entspricht. Das Modell übernimmt Stimmcharakter und Emotion der Referenz und hält sie über die gesamte Generierung. Alternativ definieren Sie eine Stimme über eine Textbeschreibung oder ein Figurenbild.
Kann Seed Audio 1.0 eine Stimme klonen?
Ja. Neben T2A und TA2A gibt es einen Modus zum Stimmenklonen: Sie laden einen einzigen Audioclip hoch, und die geklonte Stimme steht danach für reines Text-to-Speech bereit. ByteDance dokumentiert das als Klon aus einem Clip. Wenn die Stimme in einer kompletten Szene mit Musik, Effekten und weiteren Figuren sitzen soll, nehmen Sie stattdessen TA2A mit seinen drei Referenzclips.
Kann Seed Audio 1.0 das Timing jeder Zeile steuern?
Ja. Seed Audio 1.0 beherrscht präzise Zeitsteuerung: Setzen Sie einen Timecode wie [5.5s:8.0s] an den Anfang einer Zeile, und das Modell passt sie exakt in dieses Fenster ein. Genau das macht es für die Synchronisation brauchbar, wo der Dialog zum Bild passen muss.
Kann Seed Audio 1.0 mehrere Sprecher gleichzeitig erzeugen?
Ja. Schreiben Sie eine Szene mit mehreren Figuren und beschreiben Sie jede Stimme im Text. Seed Audio 1.0 gibt jedem Sprecher eine eigene Stimme, Emotion und Sprechweise in einer einzigen Generierung, samt Atmosphäre und Effekten drumherum.
Wie lang darf eine Generierung mit Seed Audio 1.0 sein?
Seed Audio 1.0 erzeugt bis zu zwei Minuten Audio in einem Durchgang, aus einem Prompt von maximal 3.000 Zeichen. Längere Produktionen entstehen Szene für Szene.
Worin unterscheidet sich Seed Audio 1.0 von gewöhnlichem Text-to-Speech?
Gewöhnliches Text-to-Speech wählt eine Stimme und liest Text vor. Seed Audio 1.0 geht von Text-to-Speech zu Referenz-zu-Audio: Ein Prompt beschreibt Umgebung, Musik, Effekte und die Stimme jeder Figur, und das Modell liefert die ganze Szene fertig gemischt. Der Unterschied ist der Umfang, eine fertige Audioproduktion statt nur der Stimme.