Audio-Generierung

Seed Audio 1.0

von ByteDance

ByteDances All‑in‑One‑TTS‑Modell.
Stimme, Musik und Soundeffekte in einem Durchgang.

Seed Audio 1.0

Hauptfunktionen

Hören Sie die Bandbreite

Dokumentarfilm-ErzählungSprache

Eine warme, ruhige Dokumentar-Erzählstimme.

0:00
0:12
Thriller-VoiceoverSprache

Eine gedämpfte, angespannte Zeilenlesung, nah und intim.

0:00
0:12
Gewürzmarkt-AtmosphäreSoundeffekte

Ein vielschichtiges Klangbett eines Freiluftmarkts.

0:00
0:12
GewitterSoundeffekte

Ein anschwellendes Gewitter, das zu einem fernen Donnerschlag führt.

0:00
0:12
Orchestrales MotivMusik

Ein kurzes, aufsteigendes Motiv für Streicher und Blechbläser.

0:00
0:12
Lo-Fi-BeatMusik

Ein entspannter Beat mit sanften Keys und Vinyl-Knistern.

0:00
0:12

Technische Spezifikationen

ByteDance

Entwickelt vom Seed-Forschungsteam von ByteDance.

20

Englisch, Chinesisch, Japanisch, Koreanisch, Spanisch, Französisch, Deutsch und mehr.

Bis zu 2 Min.

Maximal zwei Minuten erzeugtes Audio pro Durchgang.

3.000 Zeichen

Platz für ein vollständiges Szenen-Briefing, Dialog inklusive.

Bis zu 3

Bis zu drei Referenzclips von je maximal 30 Sekunden.

Non-Streaming

Rendert die komplette Spur, keinen Echtzeit-Stream.

Anwendungsfälle

Hörbücher

Erzählung, Stimmen und Sounddesign für ein ganzes Buch. ByteDance nennt etwa ein Zehntel der Studiokosten.

Video-Synchronisation

Stimme beschreiben oder Figurenbild hochladen, dann per Timecode jede Zeile genau dort platzieren, wo das Bild sie braucht.

Game-Audio

Figurenzeilen, gespielte Szenen und Umgebungseffekte für immersive Momente, direkt aus dem Skript erzeugt.

Videoton in einem Zug

Ein Clip bekommt Erzählung, Sounddesign und Musik in einer Generierung, ohne separaten Mischschritt danach.

Werbung und Promos

Eine gesprochene Zeile, Soundeffekte und Musik als fertige Spur, gemacht für kurze Formate.

Dialog und Hörspiel

Mehrere Figuren, jede mit eigener Stimme und eigenem Spiel, in einer Szene mit passender Atmosphäre und Timing.

Prompt-Beispiele

Erklärvideo-Erzählung

Ruhiger Erzähler, sanfte Küchenatmosphäre: „Mehl und Butter vermengen.“

Edit prompt

Zeitsteuerung

Ryan (warm, außer Atem): „[5.5s:8.0s] Maya! Du gehst wirklich heute Abend?“

Edit prompt

Hörbuchszene

Regen am Fenster. Erzählerin, tief und ruhig: „Sie las es zweimal.“

Edit prompt

Sportkommentar

Volles Stadion, tosende Menge. Kommentator, außer sich: „TOOOR!“

Edit prompt

Hörspiel

Detektiv, angespannt: „Keine Bewegung.“ Schritte stoppen, eine Tür knarrt.

Edit prompt

Spielmoment

Tiefer Erzähler: „Das alte Siegel ist gebrochen.“ Stein mahlt, dunkles Summen.

Edit prompt

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$9/ Monat
abgerechnet als $0 pro Jahr

900 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3200 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6200 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Pro Max

$170/ Monat
abgerechnet als $0 pro Jahr

24000 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Was ist Seed Audio 1.0?
Seed Audio 1.0 ist ByteDances All-in-One-Text-to-Speech-Modell. Aus einem einzigen Text-Prompt erzeugt es Stimme, Instrumentalmusik und Soundeffekte gemeinsam als fertig gemischte Spur. Es arbeitet in zwei Hauptmodi: Text-Prompt zu Audio (T2A), wo alles aus Ihrer Beschreibung entsteht, und Text-Prompt plus Audio zu Audio (TA2A), wo Sie Referenzclips ergänzen, um bestimmte Stimmen zu besetzen.
Welche Sprachen unterstützt Seed Audio 1.0?
Seed Audio 1.0 unterstützt 20 Sprachen: Englisch, Chinesisch, Japanisch, Koreanisch, mexikanisches Spanisch, kastilisches Spanisch, Indonesisch, Deutsch, brasilianisches Portugiesisch, Französisch, Thai, Vietnamesisch, Malaiisch, Filipino, Italienisch, Russisch, Niederländisch, Polnisch, Türkisch und Schwedisch. Schreiben Sie den Prompt am besten in derselben Sprache wie die gesprochenen Zeilen.
Wie funktioniert Referenzaudio in Seed Audio 1.0?
Im TA2A-Modus liefern Sie bis zu drei Referenzclips von je maximal 30 Sekunden und weisen sie im Prompt zu, sodass jede Figur einer Aufnahme entspricht. Das Modell übernimmt Stimmcharakter und Emotion der Referenz und hält sie über die gesamte Generierung. Alternativ definieren Sie eine Stimme über eine Textbeschreibung oder ein Figurenbild.
Kann Seed Audio 1.0 eine Stimme klonen?
Ja. Neben T2A und TA2A gibt es einen Modus zum Stimmenklonen: Sie laden einen einzigen Audioclip hoch, und die geklonte Stimme steht danach für reines Text-to-Speech bereit. ByteDance dokumentiert das als Klon aus einem Clip. Wenn die Stimme in einer kompletten Szene mit Musik, Effekten und weiteren Figuren sitzen soll, nehmen Sie stattdessen TA2A mit seinen drei Referenzclips.
Kann Seed Audio 1.0 das Timing jeder Zeile steuern?
Ja. Seed Audio 1.0 beherrscht präzise Zeitsteuerung: Setzen Sie einen Timecode wie [5.5s:8.0s] an den Anfang einer Zeile, und das Modell passt sie exakt in dieses Fenster ein. Genau das macht es für die Synchronisation brauchbar, wo der Dialog zum Bild passen muss.
Kann Seed Audio 1.0 mehrere Sprecher gleichzeitig erzeugen?
Ja. Schreiben Sie eine Szene mit mehreren Figuren und beschreiben Sie jede Stimme im Text. Seed Audio 1.0 gibt jedem Sprecher eine eigene Stimme, Emotion und Sprechweise in einer einzigen Generierung, samt Atmosphäre und Effekten drumherum.
Wie lang darf eine Generierung mit Seed Audio 1.0 sein?
Seed Audio 1.0 erzeugt bis zu zwei Minuten Audio in einem Durchgang, aus einem Prompt von maximal 3.000 Zeichen. Längere Produktionen entstehen Szene für Szene.
Worin unterscheidet sich Seed Audio 1.0 von gewöhnlichem Text-to-Speech?
Gewöhnliches Text-to-Speech wählt eine Stimme und liest Text vor. Seed Audio 1.0 geht von Text-to-Speech zu Referenz-zu-Audio: Ein Prompt beschreibt Umgebung, Musik, Effekte und die Stimme jeder Figur, und das Modell liefert die ganze Szene fertig gemischt. Der Unterschied ist der Umfang, eine fertige Audioproduktion statt nur der Stimme.