Seed Audio 1.0
von ByteDance
ByteDances All‑in‑One‑TTS‑Modell.
Stimme, Musik und Soundeffekte in einem Durchgang.

Hauptfunktionen
Hören Sie die Bandbreite
Eine warme, ruhige Dokumentar-Erzählstimme.
Eine gedämpfte, angespannte Zeilenlesung, nah und intim.
Ein vielschichtiges Klangbett eines Freiluftmarkts.
Ein anschwellendes Gewitter, das zu einem fernen Donnerschlag führt.
Ein kurzes, aufsteigendes Motiv für Streicher und Blechbläser.
Ein entspannter Beat mit sanften Keys und Vinyl-Knistern.
Technische Spezifikationen
ByteDance
Entwickelt vom Seed-Forschungsteam von ByteDance.
20
Englisch, Chinesisch, Japanisch, Koreanisch, Spanisch, Französisch, Deutsch und mehr.
Bis zu 2 Min.
Maximal zwei Minuten erzeugtes Audio pro Durchgang.
3.000 Zeichen
Platz für ein vollständiges Szenen-Briefing, Dialog inklusive.
Bis zu 3
Bis zu drei Referenzclips von je maximal 30 Sekunden.
Non-Streaming
Rendert die komplette Spur, keinen Echtzeit-Stream.
Anwendungsfälle
Hörbücher
Erzählung, Stimmen und Sounddesign für ein ganzes Buch. ByteDance nennt etwa ein Zehntel der Studiokosten.
Video-Synchronisation
Stimme beschreiben oder Figurenbild hochladen, dann per Timecode jede Zeile genau dort platzieren, wo das Bild sie braucht.
Game-Audio
Figurenzeilen, gespielte Szenen und Umgebungseffekte für immersive Momente, direkt aus dem Skript erzeugt.
Videoton in einem Zug
Ein Clip bekommt Erzählung, Sounddesign und Musik in einer Generierung, ohne separaten Mischschritt danach.
Werbung und Promos
Eine gesprochene Zeile, Soundeffekte und Musik als fertige Spur, gemacht für kurze Formate.
Dialog und Hörspiel
Mehrere Figuren, jede mit eigener Stimme und eigenem Spiel, in einer Szene mit passender Atmosphäre und Timing.
Prompt-Beispiele
Erklärvideo-Erzählung
Ruhiger Erzähler, sanfte Küchenatmosphäre: „Mehl und Butter vermengen.“
Edit promptSpielmoment
Tiefer Erzähler: „Das alte Siegel ist gebrochen.“ Stein mahlt, dunkles Summen.
Edit promptÜberblick
Seed Audio 1.0 ist ByteDances All-in-One-Audiomodell, gebaut als nächster Schritt für Text-to-Speech und nicht als Abkehr davon. Klassische Audio-Workflows nutzen getrennte Werkzeuge für Stimme, Musik und Soundeffekte, jeweils einzeln erzeugt und dann gemischt. Seed Audio 1.0 produziert alle drei gemeinsam aus einem einzigen Text-Prompt, und das Ergebnis ist eine vollständige, direkt verwendbare Audiospur.
Von Text-to-Speech zu Referenz-zu-Audio
Gewöhnliches TTS nimmt eine Stimme und einen Textblock. Seed Audio 1.0 nimmt eine Szene: Wetter und Raum, die Musik darunter, die Effekte rund um die Handlung, wie jede Figur aussieht und klingt, und die Zeilen, die sie sprechen. Alles, was Sie beschreiben können, wird Teil derselben Generierung. Genau deshalb darf ein Prompt bis zu 3.000 Zeichen lang sein, ohne Füllmaterial zu sein.
Das Modell versteht den Szenenkontext. Ein Prompt für ein Café-Gespräch bekommt Stimmengewirr und den passenden akustischen Raum, keinen generischen Raumton. Eine Actionszene bekommt scharfe Effekte und eine dynamische Musik, keine über Stille gelegte Hintergrundmusik. Die drei Ebenen kommen für die Szene ausbalanciert und gemischt heraus, nicht aus getrennten Exporten zusammengesetzt.
Vier Modi
Am einfachsten ist Text-to-Speech: Stimme wählen, Text eingeben, das Modell liest vor. Stimmenklonen ergänzt einen Schritt: Sie laden einen einzigen Audioclip hoch, und die geklonte Stimme steht für dasselbe Text-to-Speech bereit. Die anderen beiden Modi sind das, was dieses Modell von gewöhnlicher TTS abhebt.
Bei Text-Prompt zu Audio (T2A) entsteht jede Stimme aus Ihrer Beschreibung. Nennen Sie Alter, Akzent, Emotion, Tonfall und Tempo einer Figur, und das Modell besetzt sie.
Bei Text-Prompt plus Audio zu Audio (TA2A) laden Sie bis zu drei Referenzclips von je maximal 30 Sekunden hoch und weisen jeden im Prompt einer Figur zu. Die erzeugte Stimme folgt dann der Aufnahme statt einer Beschreibung. Referenzclips lassen sich für einen einzelnen Auftrag hochladen oder in einer Asset-Bibliothek halten und über eine ganze Serie wiederverwenden.
Zwanzig Sprachen
Seed Audio 1.0 generiert in Englisch, Chinesisch, Japanisch, Koreanisch, mexikanischem Spanisch, kastilischem Spanisch, Indonesisch, Deutsch, brasilianischem Portugiesisch, Französisch, Thai, Vietnamesisch, Malaiisch, Filipino, Italienisch, Russisch, Niederländisch, Polnisch, Türkisch und Schwedisch. Prompt-Sprache und Skriptsprache sollten übereinstimmen: Schreiben Sie das Briefing in der Sprache, die die Figuren sprechen.
Timing auf die Sekunde genau
Seed Audio 1.0 akzeptiert einen Timecode auf jeder Zeile, inline geschrieben als [5.5s:8.0s], und passt den Vortrag exakt in dieses Fenster ein. Bei der Synchronisation ist das der Unterschied zwischen Ton, der ungefähr passt, und Ton, der auf dem Schnitt sitzt. Die Generierung ist Non-Streaming: Das Modell rendert die fertige Spur in einem Durchgang, bis zu zwei Minuten lang.
Einfache Preise
Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.
Basic
2400 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Standard
3625 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Pro
6350 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Max
24650 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Enterprise
Für höhere Limits
Individuell
Preis- und Abrechnungsbedingungen

Free
Zum Ausprobieren
$0
dauerhaft kostenlos
Häufig gestellte Fragen
ChatGPT Images 2.5
OpenAI
OpenAIs Bildmodell, erschienen im September 2026. Schärfere Details, präzise Edits, kürzere Wartezeit.
Lyria 3.5
Google DeepMind
Googles bestklingendes Musikmodell. Ganze Songs mit Aufbau und Gesang.
MiniMax H3 Max Turbo
fal.ai
Das Tempo-Modell von fal, aus H3 Max. Doppelt so schnell, fast gleiche Optik.
Inworld TTS 2
Inworld
Eine Stimme, über 100 Sprachen. 95 Stimmen, erster Ton in Echtzeit.