For the complete documentation index, see llms.txt. This page is also available as Markdown.

Sprachsteuerung für Emotionen

Mit der Stimmungssteuerung bei Morphic kannst du gestalten, wie die erzeugte Sprache klingt – vom emotionalen Ton bis hin zu Reaktionen, Sprechtempo und Vortragsstil. Schreibe deinen Prompt mit den richtigen Hinweisen, und die Stimme liefert die gewünschte Performance.

So verwendest du die Stimmungssteuerung der Stimme

Hier ist ein kurzes Tutorial zur Verwendung der Stimmungssteuerung der Stimme in Morphic:

  1. Öffne Morphic und gehe zu deinem Projekt.

  2. Erstelle eine neue Datei oder öffne eine vorhandene.

  3. Wechsle unten in der Promptleiste den Modus zu „Audio“ und wähle „Sprache“ aus.

  4. Wähle dein Audiomodell: „ElevenLabs“ oder „MiniMax“.

  5. Wähle im Voice-Picker eine Stimme und eine Sprache aus.

  6. Schreibe deinen Prompt im Format zur Emotionssteuerung für dein ausgewähltes Modell (siehe unten).

  7. Klicke auf „Generieren“.

Morphic unterstützt zwei Sprachmodelle. Jedes verwendet eine andere Syntax für die Emotionssteuerung. Wähle dein Modell und folge dann der Anleitung unten.

ElevenLabs

ElevenLabs verwendet eckige Tags, die direkt in deinen Prompt geschrieben werden. Setze jede Emotion, Reaktion oder Anweisung in eckige Klammern, und das Modell interpretiert sie als Hinweis für die Darbietung, nicht als gesprochenen Text.

So funktioniert es

[Tag] Dein Dialogtext hier.

Tags beeinflussen alles danach, bis ein neuer Tag erscheint. Du kannst Tags überall in deinem Text platzieren und mehrere Tags hintereinander kombinieren.

Ohne Tags
Mit Tags

Ich habe die Rolle bekommen. Ich habe sie wirklich bekommen.

[aufgeregt] Ich habe die Rolle bekommen. Ich habe sie wirklich bekommen.

Wir müssen los. Jetzt.

[flüstert][angespannt] Wir müssen los. Jetzt.

Ich glaube nicht, dass das gut ausgehen wird.

[traurig][zögernd] Ich glaube nicht, dass das gut ausgehen wird.

Der Schatz ist unter der alten Kapelle vergraben.

[Piratenstimme] Der Schatz ist unter der alten Kapelle vergraben.

ElevenLabs ist offen gehalten. Es gibt keine feste Liste. Schreibe jede beliebige Emotion oder Anweisung in Klammern, und das Modell versucht, sie zu interpretieren. Tags wie [eifersüchtig], [romantisch], [unbeholfen], [misstrauischer Ton] oder [macht nach einem Moment weiter] funktionieren alle.

Die unten stehenden Tags werden häufig verwendet und zuverlässig erkannt, du bist aber nicht auf sie beschränkt.

Tags

Emotionen

Tag
Was es bewirkt

[aufgeregt]

Energiegeladene, enthusiastische Darbietung

[fröhlich]

Warmer, heiterer Ton

[heiter]

Leichte, lebhafte Darbietung

[traurig]

Niedergeschlagener, gedämpfter Ton

[trauernd]

Tiefe Traurigkeit, Kummer

[wütend]

Scharfe, energische Darbietung

[nervös]

Unsicher, leicht zittrig

[frustriert]

Angespannter, ungeduldiger Ton

[ruhig]

Ausgeglichene, entspannte Darbietung

[müde]

Wenig Energie, erschöpft

[neugierig]

Fragender, nachdenklicher Ton

[sarkastisch]

Trockenes, ironisches Sprechen

[verspielt]

Leichte, neckische Energie

[monoton]

Flache, emotionslose Darbietung

Probier es aus:

Emotionale Nuance

Für subtilere Tonverschiebungen. Diese verleihen einer Zeile mehr Tiefe, ohne die gesamte Darbietung zu überlagern.

Tag
Was es bewirkt

[zögernd]

Unsicher, zurückhaltend

[erleichtert]

Last fällt ab, Anspannung löst sich

[angespannt]

Nervös, auf etwas gefasst

[warm]

Sanfter, fürsorglicher Ton

[resignierter Ton]

Sich fügen, die Niederlage akzeptieren

[stottert]

Stolpert über die Worte, verlegen

[bedauernd]

Wünschen, dass etwas anders wäre

[mitfühlend]

Mitfühlend, verständnisvoll

[beruhigend]

Tröstend, ruhig

[ehrfürchtig]

Von Staunen oder Bewunderung ergriffen

Probier es aus:

Reaktionen

Nichtsprachliche Laute, die zwischen oder innerhalb von Zeilen für mehr Realismus sorgen.

Tag
Was es bewirkt

[lacht]

Lacht laut

[kichert]

Leises, sanftes Lachen

[leichtes Kichern]

Kurzes, gedämpftes Lachen

[seufzt]

Ausatmen vor Müdigkeit, Erleichterung oder Frustration

[schnappt nach Luft]

Schroffer Luftzug, Überraschung oder Schock

[schluckt]

Nervöses Schlucken

[weint]

Tränenreiche, brechende Stimme

[räuspert sich]

Kurzer stimmlicher Neustart

Probier es aus:

Vortrag

Steuere, wie die Stimme die Zeile körperlich vorträgt, unabhängig von der Emotion.

Tag
Was es bewirkt

[flüstert]

Leise, hauchig, nah

[ruft]

Laut, tragende Stimme

[leise]

Geringe Lautstärke, zurückhaltend

[laut]

Erhöhte Lautstärke, kraftvoll

[eilend]

Schnelles, dringliches Tempo

[gedehnt]

Langsame, gedehnte Darbietung

[dramatischer Ton]

Theatralisch, gesteigerte Intensität

Probier es aus:

Akzente und Charaktere

Wechsle den Akzent, ohne die Stimme zu verändern, oder gib der Stimme eine Charakterrolle.

Tag
Was es bewirkt

[amerikanischer Akzent]

Standardamerikanisches Englisch

[britischer Akzent]

Standardbritisches Englisch

[französischer Akzent]

Englisch mit französischem Akzent

[Südstaaten-US-Akzent]

Südstaaten-amerikanischer Akzent

[australischer Akzent]

Australisches Englisch

[starker russischer Akzent]

Starker russischer Akzent

[starker X-Akzent]

Ersetze X durch jede beliebige Nationalität

[Piratenstimme]

Raue, seemännische Figur

[Stimme eines alten Mannes]

Gealterte, abgenutzte Darbietung

[Roboterstimme]

Mechanischer, synthetischer Ton

[Fantasy-Erzähler]

Epenhafte, märchenhafte Erzählung

[Film-noir-Erzähler]

Düstere, stimmungsvolle, zynische Erzählung

[sarkastisch]

Trockenes, ironisches Vorlesen in Charakterrolle

Probier es aus:

Dialog mit mehreren Charakteren

Wenn du Szenen mit zwei oder mehr Charakteren in einem Prompt schreibst, nutze diese, um zu gestalten, wie die Zeilen miteinander interagieren.

Tag
Was es bewirkt

[unterbricht]

Fällt ein, bevor die andere Zeile beendet ist

[überlappend]

Beginnt zu sprechen, während die andere Stimme ausklingt

Probier es aus:

Pausen und Sprechtempo

ElevenLabs unterstützt keine expliziten Pausendauern. Die Länge der Pause wird aus Kontext, Tags und Satzzeichen abgeleitet.

Schreibe dies
Was es bewirkt

[Pause]

Dramatische Stille (das Modell entscheidet die Länge)

...

Zögernde, ausklingende Pause

ALLES GROSS

Betonung auf dem Wort

Neuer Absatz

Deutliche Pause und Neustart der Intonation

Probier es aus:

Tipps für bessere Ergebnisse

Tipp
Warum es funktioniert

Tags an den Text anpassen

[weint] Lass mich nicht allein. klingt natürlich. Das Hinzufügen [weint] zu einem lockeren Satz tut das nicht. Das Modell liest die gesamte Zeile im Kontext.

Tags kombinieren

[flüstert][angespannt] oder [zögernd][nervös] gibt dem Modell zwei Hinweise, die es zu einem nuancierteren Ergebnis verbinden kann.

Die richtige Stimme wählen

Eine ruhige Stimme wird nicht überzeugend schreien. Eine energiegeladene Stimme wird nicht gut flüstern. Stimme und Rolle sollten zusammenpassen.

Creative- oder Natural-Stabilität verwenden

Diese Einstellungen geben dem Modell mehr Spielraum, Tags auszudrücken. Robust ist konsistenter, aber weniger ausdrucksstark.

Satzzeichen als Rhythmushinweise verwenden

Kommas verlangsamen das Tempo. Punkte erzeugen harte Stopps. Auslassungspunkte lassen etwas ausklingen. Das Modell liest Satzzeichen und reagiert darauf.

Google Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS bietet dir ausdrucksstarke, mehrsprachige Sprachsynthese mit feiner Kontrolle über Ton, Tempo und Akzent über eine breite Palette von Sprachen hinweg. Du steuerst es auf zwei Arten: mit Anweisungen in natürlicher Sprache und mit eingebetteten Hinweisen in deinem Skript.

So funktioniert es

Gemini liest die Anweisung, die du in natürlicher Sprache schreibst, und formt die Darbietung entsprechend. Setze die Anweisung an den Anfang, dann deine Zeile.

Ohne Anweisung
Mit Anweisung

Der Sturm ist vorüber. Du bist jetzt in Sicherheit.

Sag das warm und langsam, als würdest du ein Kind trösten: Der Sturm ist vorüber. Du bist jetzt in Sicherheit.

Du kannst auch Inline-Hinweise in eckigen Klammern einfügen, um Reaktionen hinzuzufügen und den Vortrag mitten in der Zeile zu verändern. Gemini spielt den Hinweis aus, statt ihn laut vorzulesen.

Probier es aus: Ich kann nicht glauben, dass du das getan hast [lacht]. Die beste Überraschung des ganzen Jahres.

Tags

Platziere einen Hinweis in eckigen Klammern direkt dort, wo du ihn in der Zeile haben möchtest. Gemini führt den Hinweis aus, statt ihn laut vorzulesen, und du kannst mehr als einen in einem einzigen Skript verwenden.

Reaktionen und Laute:

Tag
Was es bewirkt

[lacht]

Fügt ein natürliches Lachen hinzu

[lacht nervös]

Fügt ein nervöses Lachen hinzu

[seufzt]

Fügt einen Seufzer hinzu

[schnappt nach Luft]

Fügt ein scharfes Lufteinziehen hinzu

[atmet aus]

Fügt ein hörbares Ausatmen hinzu

[schnaubt]

Fügt ein abfälliges Schnauben hinzu

[räuspert sich]

Fügt vor der Zeile ein Räuspern hinzu

[weint]

Liefert die Zeile unter Tränen

Vortrag und Ton:

Tag
Was es bewirkt

[flüsternd]

Senkt die Stimme zu einem Flüstern

[normale Stimme]

Kehrt zu einer normalen Sprechstimme zurück

[sanft]

Macht den Vortrag weicher

[schreiend]

Erhöht die Stimme zu einem Schrei

[langsam]

Verlangsamt das Tempo

[aufgeregt]

Fügt Energie und Begeisterung hinzu

[nervös]

Fügt einen nervösen, zögernden Ton hinzu

Probier es aus: [flüsternd] Mach keinen Laut. [normale Stimme] Okay, wir sind durch.

Beschreibe für Ton, Energie oder Akzent in einfacher Sprache vor der Zeile, was du möchtest. Gemini unterstützt Akzentsteuerung über seine Sprachen hinweg.

Probier es aus: Lies das mit britischem Akzent: Schönes Wetter, das wir heute haben, nicht wahr?

Dialog mit mehreren Sprechern

Gemini kann in einer einzigen Generierung ein Hin und Her zwischen zwei Sprechern sprechen lassen und jedem Sprecher eine eigene Stimme geben. Beschrifte jede Zeile mit dem Namen des Sprechers und weise dann vor der Generierung jedem Sprecher eine Stimme zu. Gemini unterstützt bis zu zwei Sprecher pro Dialog.

Probier es aus:

Element
Was zu tun ist

Sprecherkennzeichnung

Beginne jede Zeile mit dem Namen des Sprechers, gefolgt von einem Doppelpunkt

Stimme pro Sprecher

Weise jedem benannten Sprecher vor der Generierung eine eigene Stimme zu

Sprecherlimit

Bis zu zwei unterschiedliche Sprecher in einem Dialog

Pausen und Sprechtempo

Verwende Auslassungspunkte, um einen Moment Stille einzufügen, und bitte in deiner Anweisung um das gewünschte Tempo.

Methode
Beispiel

Auslassungspunkte für eine Pause

Warte... ... ... hast du das gehört?

Tempo in der Anweisung

Lies das langsam und bewusst: Jedes. Wort. Zählt.

Tipps für bessere Ergebnisse

Tipp
Warum es hilft

Setze die Anweisung vor die Zeile

Gemini wendet die Anweisung auf den nachfolgenden Text an

Die Szene setzen

Kontext wie Eine Naturdokumentation erzählen, ruhig und gedämpft: prägt Ton und Vortrag

Methoden kombinieren

Kombiniere eine Anweisung in einfacher Sprache mit Inline-Hinweisen in Klammern im selben Skript

Sprache an die Stimme anpassen

Wähle vor der Generierung eine Stimme und Sprache, die zu deinem Skript passen

MiniMax

MiniMax verwendet Klammer-Tags für Laute in deinem Prompt und einen separaten Emotionsauswähler in der Benutzeroberfläche von Morphic.

Emotion

Wähle beim Generieren die Emotion aus dem Dropdown-Menü aus. Dadurch wird der allgemeine Ton der gesamten Ausgabe festgelegt.

Emotion
Effekt

Auto

Das Modell liest den Text und wählt die beste Emotion aus (Standard)

Fröhlich

Lebhaft, positiv

Traurig

Niedergeschlagen, melancholisch

Wütend

Nachdrücklich, aggressiv

Ängstlich

Besorgt, verängstigt

Angewidert

Abgestoßen, ablehnend

Überrascht

Erschrocken, verblüfft

Ruhig

Entspannt, gelassen

Flüssig

Sauber, im Broadcast-Stil — ideal für Nachrichten oder technische Erzählungen

Neutral

Keine emotionale Färbung

Laute

Füge nichtsprachliche Laute direkt in deinen Prompt mit Klammern ein. Diese sind nur als Voreinstellung verfügbar — unterstützt werden nur die unten aufgeführten Tags.

Tag
Tag
Tag

(lacht)

(kichert)

(hustet)

(räuspert sich)

(stöhnt)

(atmet)

(keucht)

(einatmen)

(ausatmen)

(schnappt nach Luft)

(schnüffelt)

(seufzt)

(schnaubt)

(rülpst)

(schmatzt)

(summt)

(zischt)

(ähm)

(pfeift)

(niest)

(weint)

(Applaus)

(gähnt)

Im Gegensatz zu ElevenLabs können Sie nicht benutzerdefinierte Tags erfinden. Das Schreiben (nervös) oder (eifersüchtig) funktioniert nicht — das Modell spricht sie als Text aus. Verwenden Sie den Emotionswähler für den emotionalen Ton.

Pausen

Fügen Sie zeitgesteuerte Pausen mit <#x#> wobei x Sekunden sind (0,01–99,99).

Tipps

  • Verwenden Sie Sound-Tags sparsam — zu viele können unnatürlich klingen.

  • Stellen Sie die Emotion auf Auto für die meisten Fälle ein. Überschreiben Sie sie manuell, wenn Sie über längeren Text hinweg einen einheitlichen Ton benötigen.

  • Interpunktion ist wichtig — Kommas und Punkte steuern das Tempo und die Intonation des Modells.

Zuletzt aktualisiert