ElevenLabs
von ElevenLabs
Sechs Audiomodi an einem Ort.
Stimme, Musik, Sounddesign, Dialog und Voice Changer.

Hauptfunktionen
Hören Sie die Bandbreite
Eine warme, unaufgeregte Lesung im Doku-Tempo.
Geschriebener Text, zurückgesungen als Indie-Folk-Titel.
Grillen, ein Hund in der Ferne, ein Auto fährt vorbei.
Zwei Rollen, klar getrennte Stimmen, eine Generierung.
Technische Spezifikationen
6
Sprache, Musik, SFX, Dialog, Voice Changer, Transkripte
3.000 Zeichen
Pro Text-to-Speech-Generierung
5 s – 5 Min.
Instrumental oder gesungen nach Ihrem Text
0,5 – 22 s
Pro erzeugtem Effekt
5.000 Zeichen
Alle Rollen in einem Durchgang
Bis zu 5 Min.
Quellmaterial pro Umwandlung
Anwendungsfälle

Narration und Voice-over
Vertonen Sie KI-Material oder Realfilm und wählen die Stimme nach Geschlecht, Alter, Akzent und Einsatz statt aus einer Liste.

Eigene Songs und Score
Legen Sie ein Instrumentalbett unter den Schnitt, oder schreiben den Text und bekommen den Song im gewünschten Stil gesungen.

Sounddesign und Ambiente
Foley, Raumklang und Wetterbetten für einen Schnitt bauen, ohne Lizenzen, und für jeden Moment exakt die Länge festlegen.

Podcasts und Hörspiel
Intros, Erzählstrecken und ganze Szenen mit mehreren Rollen produzieren, jede Figur mit eigener Stimme und eigenem Vortrag.

Hörbuch-Narration
Langform mit gleichbleibendem Tempo und Ton über alle Kapitel, erzeugt in Durchgängen, die Sie Kapitel für Kapitel steuern.

Dubbing und Transkripte
Einen aufgenommenen Take neu vertonen, ohne neu einzusprechen, und jeden Clip in ein Transkript mit Sprechermarkierung wandeln.
Prompt-Beispiele
Song mit Gesang
Ruhiger Indie-Folk, Besen-Drums, eine nahe Frauenstimme singt meinen Text.
Dialog zu zweit
Ana (tonlos): „Du sagtest neun.“ Theo (hastig): „Brücke zu, ich lief.“
Überblick
ElevenLabs deckt die Tonseite von Morphic vollständig ab. Sechs Modi laufen darauf: Sprache, Musik, Soundeffekte, Dialog, der Voice Changer und die Scribe-Transkription. Genau diese Bandbreite ist der Punkt. Ein Schnitt braucht meistens eine Erzählstimme, ein Musikbett, ein paar Effekte und manchmal eine zweite Figur. All das kommt aus einer Quelle, im selben Projekt wie das Bildmaterial.
Die Regler unterscheiden es von gewöhnlicher Sprachsynthese. Stabilität, Stil, Ähnlichkeit und Tempo machen aus einer Generierung eine Regieanweisung statt eines Glücksspiels. Die Musik nimmt Ihren Text und singt ihn. Soundeffekte bekommen eine Länge, damit ein Schlag genau auf dem Frame sitzt, für den er geschrieben wurde. Und Speech-to-Speech heißt: Ein bereits aufgenommener Take kann eine andere Stimme tragen, ohne die eingefangene Darbietung zu verlieren.
Einfache Preise
Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.
Basic
2400 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Standard
3625 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Pro
6350 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Max
24650 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Enterprise
Für höhere Limits
Individuell
Preis- und Abrechnungsbedingungen

Free
Zum Ausprobieren
$0
dauerhaft kostenlos
Häufig gestellte Fragen
Weitere Modelle
Entdecken Sie den Rest des Morphic-Modellkatalogs.
ChatGPT Images 2.5
OpenAI
OpenAIs Bildmodell, erschienen im September 2026. Schärfere Details, präzise Edits, kürzere Wartezeit.
Lyria 3.5
Google DeepMind
Googles bestklingendes Musikmodell. Ganze Songs mit Aufbau und Gesang.
MiniMax H3 Max Turbo
fal.ai
Das Tempo-Modell von fal, aus H3 Max. Doppelt so schnell, fast gleiche Optik.
Inworld TTS 2
Inworld
Eine Stimme, über 100 Sprachen. 95 Stimmen, erster Ton in Echtzeit.