Audio-Generierung
Jetzt verfügbar

ElevenLabs

von ElevenLabs

Sechs Audiomodi an einem Ort.
Stimme, Musik, Sounddesign, Dialog und Voice Changer.

ElevenLabs

Hauptfunktionen

Hören Sie die Bandbreite

Doku-ErzählungSprache

Eine warme, unaufgeregte Lesung im Doku-Tempo.

0:00
0:12
Song mit GesangMusik

Geschriebener Text, zurückgesungen als Indie-Folk-Titel.

0:00
0:12
AbendambienteSoundeffekte

Grillen, ein Hund in der Ferne, ein Auto fährt vorbei.

0:00
0:12
Szene zu zweitDialog

Zwei Rollen, klar getrennte Stimmen, eine Generierung.

0:00
0:12

Technische Spezifikationen

6

Sprache, Musik, SFX, Dialog, Voice Changer, Transkripte

3.000 Zeichen

Pro Text-to-Speech-Generierung

5 s – 5 Min.

Instrumental oder gesungen nach Ihrem Text

0,5 – 22 s

Pro erzeugtem Effekt

5.000 Zeichen

Alle Rollen in einem Durchgang

Bis zu 5 Min.

Quellmaterial pro Umwandlung

Anwendungsfälle

Ein Lichtband, das anschwillt und schmaler wird wie eine gesprochene Wellenform

Narration und Voice-over

Vertonen Sie KI-Material oder Realfilm und wählen die Stimme nach Geschlecht, Alter, Akzent und Einsatz statt aus einer Liste.

Konzentrische Bögen aus goldenem Licht, die sich wie ein angeschlagener Akkord ausdehnen

Eigene Songs und Score

Legen Sie ein Instrumentalbett unter den Schnitt, oder schreiben den Text und bekommen den Song im gewünschten Stil gesungen.

Leuchtende Fäden, die von einem einzigen hellen Aufschlag ausgehen

Sounddesign und Ambiente

Foley, Raumklang und Wetterbetten für einen Schnitt bauen, ohne Lizenzen, und für jeden Moment exakt die Länge festlegen.

Zwei Lichtbänder, eines bernsteinfarben, eines schiefergrau, die sich verflechten

Podcasts und Hörspiel

Intros, Erzählstrecken und ganze Szenen mit mehreren Rollen produzieren, jede Figur mit eigener Stimme und eigenem Vortrag.

Ein einzelner Faden warmen Lichts, der weit ins Dunkel zurückweicht

Hörbuch-Narration

Langform mit gleichbleibendem Tempo und Ton über alle Kapitel, erzeugt in Durchgängen, die Sie Kapitel für Kapitel steuern.

Ein Lichtband, das von warmem Bernstein in kühles Silber übergeht

Dubbing und Transkripte

Einen aufgenommenen Take neu vertonen, ohne neu einzusprechen, und jeden Clip in ein Transkript mit Sprechermarkierung wandeln.

Prompt-Beispiele

Voice-over

Warmer Doku-Sprecher: „Die Flut kam noch nie zu spät.“

0:00
0:12
Edit prompt

Song mit Gesang

Ruhiger Indie-Folk, Besen-Drums, eine nahe Frauenstimme singt meinen Text.

0:00
0:12
Edit prompt

Sounddesign

Schwere Eichentür schleift über Stein, Scharniere ächzen. 8 Sekunden.

0:00
0:12
Edit prompt

Ambiente

Später Abend: Grillen, ein ferner Hund, ein Auto weit weg. 20 Sek.

0:00
0:12
Edit prompt

Dialog zu zweit

Ana (tonlos): „Du sagtest neun.“ Theo (hastig): „Brücke zu, ich lief.“

0:00
0:12
Edit prompt

Charakterstimme

Leuchtturmwärter, rau und warm: „Vierzig Winter, dieses Licht.“

0:00
0:12
Edit prompt

Überblick

ElevenLabs deckt die Tonseite von Morphic vollständig ab. Sechs Modi laufen darauf: Sprache, Musik, Soundeffekte, Dialog, der Voice Changer und die Scribe-Transkription. Genau diese Bandbreite ist der Punkt. Ein Schnitt braucht meistens eine Erzählstimme, ein Musikbett, ein paar Effekte und manchmal eine zweite Figur. All das kommt aus einer Quelle, im selben Projekt wie das Bildmaterial.

Die Regler unterscheiden es von gewöhnlicher Sprachsynthese. Stabilität, Stil, Ähnlichkeit und Tempo machen aus einer Generierung eine Regieanweisung statt eines Glücksspiels. Die Musik nimmt Ihren Text und singt ihn. Soundeffekte bekommen eine Länge, damit ein Schlag genau auf dem Frame sitzt, für den er geschrieben wurde. Und Speech-to-Speech heißt: Ein bereits aufgenommener Take kann eine andere Stimme tragen, ohne die eingefangene Darbietung zu verlieren.

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$19/ Monat
abgerechnet als $0 pro Jahr

2400 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3625 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6350 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Max

$170/ Monat
abgerechnet als $0 pro Jahr

24650 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Was ist ElevenLabs auf Morphic?
ElevenLabs ist die Audio-Engine hinter sechs Audiomodi von Morphic: Text-to-Speech, Text-to-Music, Text-to-Sound-Effects, Text-to-Dialogue, Speech-to-Speech (der Voice Changer) und die Scribe-Transkription. Sie erzeugen Ton im selben Arbeitsbereich wie Ihre Bilder und Videos, es muss also nichts exportiert und wieder importiert werden.
Welche Arten von Audio erzeugt ElevenLabs?
Gesprochene Erzählung und Voice-over, eigene Musik instrumental oder gesungen, Soundeffekte und Ambiente, Dialogszenen mit mehreren Rollen sowie eine umgewandelte Fassung einer vorhandenen Aufnahme. Scribe läuft in die andere Richtung und macht aus Audio oder Video ein Transkript mit Sprechermarkierung.
Lässt sich steuern, wie eine ElevenLabs-Stimme eine Zeile spricht?
Ja. Jede Text-to-Speech-Generierung bietet Stabilität, Stil, Ähnlichkeit und Tempo. Stabilität wägt Gleichmäßigkeit gegen Ausdruck ab, Stil führt den Vortrag weiter weg vom Neutralen, Ähnlichkeit bestimmt, wie eng das Ergebnis der gewählten Stimme folgt, und Tempo regelt das Sprechtempo. Dialoggenerierungen haben eine eigene Stabilitätssteuerung.
Kann ElevenLabs-Musik Text und Gesang enthalten?
Ja. Das Musikwerkzeug hat einen Gesangsschalter und ein Textfeld. Fügen Sie Ihren eigenen Text ein und das Modell singt ihn, oder lassen Sie das Feld leer und es schreibt ihn selbst. Titel laufen von fünf Sekunden bis fünf Minuten, dasselbe Werkzeug deckt also den kurzen Sting und den ganzen Song ab.
Was macht der ElevenLabs Voice Changer?
Speech-to-Speech nimmt eine Aufnahme und spricht sie in einer anderen Stimme neu, während Vortrag, Tempo und Emotion des Originals erhalten bleiben. Pro Umwandlung sind bis zu fünf Minuten Quellmaterial möglich, auf Englisch und mehrsprachig. Es ist eine Stimmumwandlung: Es entsteht keine wiederverwendbare Kopie der Stimme einer bestimmten Person.
Wie lang kann ElevenLabs-Audio sein?
Musik läuft von fünf Sekunden bis fünf Minuten. Soundeffekte laufen von einer halben bis zu 22 Sekunden. Sprache begrenzt nicht die Uhr, sondern die Promptlänge von bis zu 3.000 Zeichen pro Generierung, ein Dialogskript darf 5.000 Zeichen umfassen. Längere Stücke entstehen in mehreren Durchgängen und werden zusammengesetzt.
Wie arbeitet ElevenLabs-Audio mit KI-Video auf Morphic zusammen?
Erzeugen Sie Erzählung, Score und Sounddesign mit ElevenLabs und holen Sie beides in Canvas zu Clips aus jedem Videomodell auf Morphic. Ton und Bild liegen im selben Projekt, ein Schnitt lässt sich also vertonen und erzählen, ohne den Arbeitsbereich zu verlassen.