Audio-Generierung
Jetzt verfügbar

Gemini 3.1 Flash TTS

von Google DeepMind

Googles ausdrucksstärkstes Text‑to‑Speech‑Modell, mit Audio‑Tags und Mehrsprecher‑Dialogen.

Gemini 3.1 Flash TTS

Hauptfunktionen

Technische Spezifikationen

Mehrsprachig

Steuerung von Stil, Tempo und Akzent in vielen Sprachen

Bis zu 2

Zwei unverwechselbare Stimmen in einer Mehrsprecher-Generierung

Audio-Tags

Anweisungen in normaler Sprache plus Hinweise in eckigen Klammern

SynthID

Unhörbares Wasserzeichen zur Kennzeichnung von KI-Inhalten

Anwendungsfälle

Videoerzählung und Voice-over

Verleihen Sie KI- oder Realvideos eine natürliche Erzählstimme, mit Ton und Tempo in normaler Sprache festgelegt.

Charakterdialoge

Vertonen Sie Zweier-Szenen für Kurzfilme, Games und Erklärvideos, jede Figur mit eigener Stimme.

Lokalisierte Vertonung

Erzählen Sie dasselbe Skript in vielen Sprachen mit nativer Betonung und Akzentsteuerung, inklusive deutscher Stimmen.

Hörbücher und Langform-Inhalte

Halten Sie die Wiedergabe über lange Erzählpassagen hinweg natürlich und konsistent.

Erklärvideos und Tutorials

Klare, steuerbare Erzählung für Produkt-Walkthroughs, Schulungen und Anleitungen.

Werbespots und Promotions

Ausdrucksstarke, markengerechte Sprachaufnahmen mit der Energie und Betonung, die Sie vorgeben.

Prompt-Beispiele

Warme Erzählung

Diese Zeile warm und langsam sprechen, wie beim Trösten eines Kindes: Der Sturm ist vorüber. Du bist jetzt in Sicherheit.

Edit prompt

Spontane Reaktion

Ich kann nicht glauben, dass du das getan hast [laughs]. Beste Überraschung des Jahres.

Edit prompt

Vom Flüstern zur normalen Stimme

[whispering] Keinen Laut. [normal voice] Okay, die Luft ist rein.

Edit prompt

Akzentsteuerung

Das mit britischem Akzent lesen: Schönes Wetter heute, nicht wahr?

Edit prompt

Dramatisches Tempo

Das langsam und bedächtig lesen: Jedes. Wort. Zählt.

Edit prompt

Zweier-Szene

Maya: Hast du schon vom Job gehört? Tom: Ja. Ich fange Montag an.

Edit prompt

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$9/ Monat
abgerechnet als $0 pro Jahr

900 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3200 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6200 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Pro Max

$170/ Monat
abgerechnet als $0 pro Jahr

24000 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Was ist Gemini 3.1 Flash TTS?
Gemini 3.1 Flash TTS ist Googles Text-to-Speech-Modell, vorgestellt am 15. April 2026. Es erzeugt ausdrucksstarke, natürliche Erzählstimmen, die Sie mit Anweisungen in normaler Sprache und Audio-Tags im Text steuern, unterstützt Mehrsprecher-Dialoge und versieht jeden Clip mit einem SynthID-Wasserzeichen.
Was kann ich damit auf Morphic erstellen?
Nutzen Sie Gemini 3.1 Flash TTS für Voice-over, Erzählung, Charakterdialoge, lokalisierte Vertonung und ausdrucksstarke Werbespots. Erzeugen Sie das Audio auf Morphic und legen Sie es im selben Workflow direkt neben Ihre Videoclips in Canvas.
Kennzeichnet Gemini 3.1 Flash TTS die Audiodateien als KI-Inhalt?
Ja. Jeder von Gemini 3.1 Flash TTS erzeugte Clip trägt Googles unhörbares SynthID-Wasserzeichen zur Kennzeichnung von KI-Inhalten. Es ist für Hörer nicht wahrnehmbar und übersteht gängige Bearbeitungen wie erneutes Kodieren.
Wie steuere ich die Stimme?
Auf zwei Arten, die sich kombinieren lassen. Schreiben Sie vor Ihrer Zeile eine Anweisung in normaler Sprache, etwa „Sprich das warm und langsam“, und setzen Sie zusätzlich Hinweise in eckigen Klammern wie [laughs] oder [whispering] genau dort, wo Sie sie brauchen. Gemini spielt den Hinweis, statt ihn vorzulesen.
Unterstützt es mehrere Sprecher?
Ja. Gemini 3.1 Flash TTS kann einen Wechseldialog zwischen zwei Sprechern in einer einzigen Generierung vertonen und jedem Sprecher eine eigene, unverwechselbare Stimme geben. Markieren Sie jede Zeile mit dem Namen des Sprechers und weisen Sie vor der Generierung jeweils eine Stimme zu.
Wie viele Sprachen unterstützt es?
Gemini 3.1 Flash TTS erzählt in vielen Sprachen, mit Kontrolle über Akzent, Tempo und Stil in jeder einzelnen. Wählen Sie vor der Generierung die passende Stimme und Sprache für Ihr Skript.
Wie unterscheidet es sich von ElevenLabs auf Morphic?
Beide liefern menschenähnliche Stimmen auf Morphic. ElevenLabs ist eine vollständige Audio-Suite für Sprache, Musik und Soundeffekte mit feinen Stimmeinstellungen. Gemini 3.1 Flash TTS konzentriert sich auf ausdrucksstarke, steuerbare Sprache, mit Anweisungen in normaler Sprache, Audio-Tags im Text und Mehrsprecher-Dialogen. Viele Creator nutzen beide, eines für die Stimme, das andere für Musik und Effekte.
Wie nutze ich Gemini 3.1 Flash TTS auf Morphic?
Öffnen Sie Morphic, wechseln Sie die Prompt-Leiste auf Audio und wählen Sie Speech. Wählen Sie Gemini 3.1 Flash TTS als Audiomodell, schreiben Sie Ihr Skript mit den gewünschten Anweisungen oder Tags, wählen Sie Stimme und Sprache, und generieren Sie.