Sprachsteuerung für Emotionen
Mit der Stimmungssteuerung bei Morphic kannst du gestalten, wie die erzeugte Sprache klingt – vom emotionalen Ton bis hin zu Reaktionen, Sprechtempo und Vortragsstil. Schreibe deinen Prompt mit den richtigen Hinweisen, und die Stimme liefert die gewünschte Performance.
So verwendest du die Stimmungssteuerung der Stimme
Hier ist ein kurzes Tutorial zur Verwendung der Stimmungssteuerung der Stimme in Morphic:
Öffne Morphic und gehe zu deinem Projekt.
Erstelle eine neue Datei oder öffne eine vorhandene.
Wechsle unten in der Promptleiste den Modus zu „Audio“ und wähle „Sprache“ aus.
Wähle dein Audiomodell: „ElevenLabs“ oder „MiniMax“.
Wähle im Voice-Picker eine Stimme und eine Sprache aus.
Schreibe deinen Prompt im Format zur Emotionssteuerung für dein ausgewähltes Modell (siehe unten).
Klicke auf „Generieren“.
Morphic unterstützt zwei Sprachmodelle. Jedes verwendet eine andere Syntax für die Emotionssteuerung. Wähle dein Modell und folge dann der Anleitung unten.
ElevenLabs
ElevenLabs verwendet eckige Tags, die direkt in deinen Prompt geschrieben werden. Setze jede Emotion, Reaktion oder Anweisung in eckige Klammern, und das Modell interpretiert sie als Hinweis für die Darbietung, nicht als gesprochenen Text.
So funktioniert es
[Tag] Dein Dialogtext hier.Tags beeinflussen alles danach, bis ein neuer Tag erscheint. Du kannst Tags überall in deinem Text platzieren und mehrere Tags hintereinander kombinieren.
Ich habe die Rolle bekommen. Ich habe sie wirklich bekommen.
[aufgeregt] Ich habe die Rolle bekommen. Ich habe sie wirklich bekommen.
Wir müssen los. Jetzt.
[flüstert][angespannt] Wir müssen los. Jetzt.
Ich glaube nicht, dass das gut ausgehen wird.
[traurig][zögernd] Ich glaube nicht, dass das gut ausgehen wird.
Der Schatz ist unter der alten Kapelle vergraben.
[Piratenstimme] Der Schatz ist unter der alten Kapelle vergraben.
ElevenLabs ist offen gehalten. Es gibt keine feste Liste. Schreibe jede beliebige Emotion oder Anweisung in Klammern, und das Modell versucht, sie zu interpretieren. Tags wie [eifersüchtig], [romantisch], [unbeholfen], [misstrauischer Ton] oder [macht nach einem Moment weiter] funktionieren alle.
Die unten stehenden Tags werden häufig verwendet und zuverlässig erkannt, du bist aber nicht auf sie beschränkt.
Tags
Emotionen
[aufgeregt]
Energiegeladene, enthusiastische Darbietung
[fröhlich]
Warmer, heiterer Ton
[heiter]
Leichte, lebhafte Darbietung
[traurig]
Niedergeschlagener, gedämpfter Ton
[trauernd]
Tiefe Traurigkeit, Kummer
[wütend]
Scharfe, energische Darbietung
[nervös]
Unsicher, leicht zittrig
[frustriert]
Angespannter, ungeduldiger Ton
[ruhig]
Ausgeglichene, entspannte Darbietung
[müde]
Wenig Energie, erschöpft
[neugierig]
Fragender, nachdenklicher Ton
[sarkastisch]
Trockenes, ironisches Sprechen
[verspielt]
Leichte, neckische Energie
[monoton]
Flache, emotionslose Darbietung
Probier es aus:
Emotionale Nuance
Für subtilere Tonverschiebungen. Diese verleihen einer Zeile mehr Tiefe, ohne die gesamte Darbietung zu überlagern.
[zögernd]
Unsicher, zurückhaltend
[erleichtert]
Last fällt ab, Anspannung löst sich
[angespannt]
Nervös, auf etwas gefasst
[warm]
Sanfter, fürsorglicher Ton
[resignierter Ton]
Sich fügen, die Niederlage akzeptieren
[stottert]
Stolpert über die Worte, verlegen
[bedauernd]
Wünschen, dass etwas anders wäre
[mitfühlend]
Mitfühlend, verständnisvoll
[beruhigend]
Tröstend, ruhig
[ehrfürchtig]
Von Staunen oder Bewunderung ergriffen
Probier es aus:
Reaktionen
Nichtsprachliche Laute, die zwischen oder innerhalb von Zeilen für mehr Realismus sorgen.
[lacht]
Lacht laut
[kichert]
Leises, sanftes Lachen
[leichtes Kichern]
Kurzes, gedämpftes Lachen
[seufzt]
Ausatmen vor Müdigkeit, Erleichterung oder Frustration
[schnappt nach Luft]
Schroffer Luftzug, Überraschung oder Schock
[schluckt]
Nervöses Schlucken
[weint]
Tränenreiche, brechende Stimme
[räuspert sich]
Kurzer stimmlicher Neustart
Probier es aus:
Vortrag
Steuere, wie die Stimme die Zeile körperlich vorträgt, unabhängig von der Emotion.
[flüstert]
Leise, hauchig, nah
[ruft]
Laut, tragende Stimme
[leise]
Geringe Lautstärke, zurückhaltend
[laut]
Erhöhte Lautstärke, kraftvoll
[eilend]
Schnelles, dringliches Tempo
[gedehnt]
Langsame, gedehnte Darbietung
[dramatischer Ton]
Theatralisch, gesteigerte Intensität
Probier es aus:
Akzente und Charaktere
Wechsle den Akzent, ohne die Stimme zu verändern, oder gib der Stimme eine Charakterrolle.
[amerikanischer Akzent]
Standardamerikanisches Englisch
[britischer Akzent]
Standardbritisches Englisch
[französischer Akzent]
Englisch mit französischem Akzent
[Südstaaten-US-Akzent]
Südstaaten-amerikanischer Akzent
[australischer Akzent]
Australisches Englisch
[starker russischer Akzent]
Starker russischer Akzent
[starker X-Akzent]
Ersetze X durch jede beliebige Nationalität
[Piratenstimme]
Raue, seemännische Figur
[Stimme eines alten Mannes]
Gealterte, abgenutzte Darbietung
[Roboterstimme]
Mechanischer, synthetischer Ton
[Fantasy-Erzähler]
Epenhafte, märchenhafte Erzählung
[Film-noir-Erzähler]
Düstere, stimmungsvolle, zynische Erzählung
[sarkastisch]
Trockenes, ironisches Vorlesen in Charakterrolle
Probier es aus:
Dialog mit mehreren Charakteren
Wenn du Szenen mit zwei oder mehr Charakteren in einem Prompt schreibst, nutze diese, um zu gestalten, wie die Zeilen miteinander interagieren.
[unterbricht]
Fällt ein, bevor die andere Zeile beendet ist
[überlappend]
Beginnt zu sprechen, während die andere Stimme ausklingt
Probier es aus:
Pausen und Sprechtempo
ElevenLabs unterstützt keine expliziten Pausendauern. Die Länge der Pause wird aus Kontext, Tags und Satzzeichen abgeleitet.
[Pause]
Dramatische Stille (das Modell entscheidet die Länge)
...
Zögernde, ausklingende Pause
ALLES GROSS
Betonung auf dem Wort
Neuer Absatz
Deutliche Pause und Neustart der Intonation
Probier es aus:
Tipps für bessere Ergebnisse
Tags an den Text anpassen
[weint] Lass mich nicht allein. klingt natürlich. Das Hinzufügen [weint] zu einem lockeren Satz tut das nicht. Das Modell liest die gesamte Zeile im Kontext.
Tags kombinieren
[flüstert][angespannt] oder [zögernd][nervös] gibt dem Modell zwei Hinweise, die es zu einem nuancierteren Ergebnis verbinden kann.
Die richtige Stimme wählen
Eine ruhige Stimme wird nicht überzeugend schreien. Eine energiegeladene Stimme wird nicht gut flüstern. Stimme und Rolle sollten zusammenpassen.
Creative- oder Natural-Stabilität verwenden
Diese Einstellungen geben dem Modell mehr Spielraum, Tags auszudrücken. Robust ist konsistenter, aber weniger ausdrucksstark.
Satzzeichen als Rhythmushinweise verwenden
Kommas verlangsamen das Tempo. Punkte erzeugen harte Stopps. Auslassungspunkte lassen etwas ausklingen. Das Modell liest Satzzeichen und reagiert darauf.
Google Gemini 3.1 Flash TTS
Gemini 3.1 Flash TTS bietet dir ausdrucksstarke, mehrsprachige Sprachsynthese mit feiner Kontrolle über Ton, Tempo und Akzent über eine breite Palette von Sprachen hinweg. Du steuerst es auf zwei Arten: mit Anweisungen in natürlicher Sprache und mit eingebetteten Hinweisen in deinem Skript.
So funktioniert es
Gemini liest die Anweisung, die du in natürlicher Sprache schreibst, und formt die Darbietung entsprechend. Setze die Anweisung an den Anfang, dann deine Zeile.
Der Sturm ist vorüber. Du bist jetzt in Sicherheit.
Sag das warm und langsam, als würdest du ein Kind trösten: Der Sturm ist vorüber. Du bist jetzt in Sicherheit.
Du kannst auch Inline-Hinweise in eckigen Klammern einfügen, um Reaktionen hinzuzufügen und den Vortrag mitten in der Zeile zu verändern. Gemini spielt den Hinweis aus, statt ihn laut vorzulesen.
Probier es aus: Ich kann nicht glauben, dass du das getan hast [lacht]. Die beste Überraschung des ganzen Jahres.
Tags
Platziere einen Hinweis in eckigen Klammern direkt dort, wo du ihn in der Zeile haben möchtest. Gemini führt den Hinweis aus, statt ihn laut vorzulesen, und du kannst mehr als einen in einem einzigen Skript verwenden.
Reaktionen und Laute:
[lacht]
Fügt ein natürliches Lachen hinzu
[lacht nervös]
Fügt ein nervöses Lachen hinzu
[seufzt]
Fügt einen Seufzer hinzu
[schnappt nach Luft]
Fügt ein scharfes Lufteinziehen hinzu
[atmet aus]
Fügt ein hörbares Ausatmen hinzu
[schnaubt]
Fügt ein abfälliges Schnauben hinzu
[räuspert sich]
Fügt vor der Zeile ein Räuspern hinzu
[weint]
Liefert die Zeile unter Tränen
Vortrag und Ton:
[flüsternd]
Senkt die Stimme zu einem Flüstern
[normale Stimme]
Kehrt zu einer normalen Sprechstimme zurück
[sanft]
Macht den Vortrag weicher
[schreiend]
Erhöht die Stimme zu einem Schrei
[langsam]
Verlangsamt das Tempo
[aufgeregt]
Fügt Energie und Begeisterung hinzu
[nervös]
Fügt einen nervösen, zögernden Ton hinzu
Probier es aus: [flüsternd] Mach keinen Laut. [normale Stimme] Okay, wir sind durch.
Beschreibe für Ton, Energie oder Akzent in einfacher Sprache vor der Zeile, was du möchtest. Gemini unterstützt Akzentsteuerung über seine Sprachen hinweg.
Probier es aus: Lies das mit britischem Akzent: Schönes Wetter, das wir heute haben, nicht wahr?
Dialog mit mehreren Sprechern
Gemini kann in einer einzigen Generierung ein Hin und Her zwischen zwei Sprechern sprechen lassen und jedem Sprecher eine eigene Stimme geben. Beschrifte jede Zeile mit dem Namen des Sprechers und weise dann vor der Generierung jedem Sprecher eine Stimme zu. Gemini unterstützt bis zu zwei Sprecher pro Dialog.
Probier es aus:
Sprecherkennzeichnung
Beginne jede Zeile mit dem Namen des Sprechers, gefolgt von einem Doppelpunkt
Stimme pro Sprecher
Weise jedem benannten Sprecher vor der Generierung eine eigene Stimme zu
Sprecherlimit
Bis zu zwei unterschiedliche Sprecher in einem Dialog
Pausen und Sprechtempo
Verwende Auslassungspunkte, um einen Moment Stille einzufügen, und bitte in deiner Anweisung um das gewünschte Tempo.
Auslassungspunkte für eine Pause
Warte... ... ... hast du das gehört?
Tempo in der Anweisung
Lies das langsam und bewusst: Jedes. Wort. Zählt.
Tipps für bessere Ergebnisse
Setze die Anweisung vor die Zeile
Gemini wendet die Anweisung auf den nachfolgenden Text an
Die Szene setzen
Kontext wie Eine Naturdokumentation erzählen, ruhig und gedämpft: prägt Ton und Vortrag
Methoden kombinieren
Kombiniere eine Anweisung in einfacher Sprache mit Inline-Hinweisen in Klammern im selben Skript
Sprache an die Stimme anpassen
Wähle vor der Generierung eine Stimme und Sprache, die zu deinem Skript passen
MiniMax
MiniMax verwendet Klammer-Tags für Laute in deinem Prompt und einen separaten Emotionsauswähler in der Benutzeroberfläche von Morphic.
Emotion
Wähle beim Generieren die Emotion aus dem Dropdown-Menü aus. Dadurch wird der allgemeine Ton der gesamten Ausgabe festgelegt.
Auto
Das Modell liest den Text und wählt die beste Emotion aus (Standard)
Fröhlich
Lebhaft, positiv
Traurig
Niedergeschlagen, melancholisch
Wütend
Nachdrücklich, aggressiv
Ängstlich
Besorgt, verängstigt
Angewidert
Abgestoßen, ablehnend
Überrascht
Erschrocken, verblüfft
Ruhig
Entspannt, gelassen
Flüssig
Sauber, im Broadcast-Stil — ideal für Nachrichten oder technische Erzählungen
Neutral
Keine emotionale Färbung
Laute
Füge nichtsprachliche Laute direkt in deinen Prompt mit Klammern ein. Diese sind nur als Voreinstellung verfügbar — unterstützt werden nur die unten aufgeführten Tags.
(lacht)
(kichert)
(hustet)
(räuspert sich)
(stöhnt)
(atmet)
(keucht)
(einatmen)
(ausatmen)
(schnappt nach Luft)
(schnüffelt)
(seufzt)
(schnaubt)
(rülpst)
(schmatzt)
(summt)
(zischt)
(ähm)
(pfeift)
(niest)
(weint)
(Applaus)
(gähnt)
Im Gegensatz zu ElevenLabs können Sie nicht benutzerdefinierte Tags erfinden. Das Schreiben
(nervös)oder(eifersüchtig)funktioniert nicht — das Modell spricht sie als Text aus. Verwenden Sie den Emotionswähler für den emotionalen Ton.
Pausen
Fügen Sie zeitgesteuerte Pausen mit <#x#> wobei x Sekunden sind (0,01–99,99).
Tipps
Verwenden Sie Sound-Tags sparsam — zu viele können unnatürlich klingen.
Stellen Sie die Emotion auf Auto für die meisten Fälle ein. Überschreiben Sie sie manuell, wenn Sie über längeren Text hinweg einen einheitlichen Ton benötigen.
Interpunktion ist wichtig — Kommas und Punkte steuern das Tempo und die Intonation des Modells.
Zuletzt aktualisiert