Gemini 3.1 Flash TTS
von Google DeepMind
Googles ausdrucksstärkstes Text‑to‑Speech‑Modell, mit Audio‑Tags und Mehrsprecher‑Dialogen.

Hauptfunktionen
Technische Spezifikationen
Mehrsprachig
Steuerung von Stil, Tempo und Akzent in vielen Sprachen
Bis zu 2
Zwei unverwechselbare Stimmen in einer Mehrsprecher-Generierung
Audio-Tags
Anweisungen in normaler Sprache plus Hinweise in eckigen Klammern
SynthID
Unhörbares Wasserzeichen zur Kennzeichnung von KI-Inhalten
Anwendungsfälle
Videoerzählung und Voice-over
Verleihen Sie KI- oder Realvideos eine natürliche Erzählstimme, mit Ton und Tempo in normaler Sprache festgelegt.
Charakterdialoge
Vertonen Sie Zweier-Szenen für Kurzfilme, Games und Erklärvideos, jede Figur mit eigener Stimme.
Lokalisierte Vertonung
Erzählen Sie dasselbe Skript in vielen Sprachen mit nativer Betonung und Akzentsteuerung, inklusive deutscher Stimmen.
Hörbücher und Langform-Inhalte
Halten Sie die Wiedergabe über lange Erzählpassagen hinweg natürlich und konsistent.
Erklärvideos und Tutorials
Klare, steuerbare Erzählung für Produkt-Walkthroughs, Schulungen und Anleitungen.
Werbespots und Promotions
Ausdrucksstarke, markengerechte Sprachaufnahmen mit der Energie und Betonung, die Sie vorgeben.
Prompt-Beispiele
Warme Erzählung
Diese Zeile warm und langsam sprechen, wie beim Trösten eines Kindes: Der Sturm ist vorüber. Du bist jetzt in Sicherheit.
Edit promptSpontane Reaktion
Ich kann nicht glauben, dass du das getan hast [laughs]. Beste Überraschung des Jahres.
Edit promptVom Flüstern zur normalen Stimme
[whispering] Keinen Laut. [normal voice] Okay, die Luft ist rein.
Edit promptÜberblick
Gemini 3.1 Flash TTS ist Googles Text-to-Speech-Modell, vorgestellt am 15. April 2026 und in Morphic als Audiomodell für Sprache integriert. Es verwandelt Text in ausdrucksstarke, natürliche Erzählung, die Sie mit Anweisungen in normaler Sprache und Audio-Tags im Text steuern, vertont Mehrsprecher-Dialoge und versieht jeden Clip mit einem SynthID-Wasserzeichen.
Was Gemini 3.1 Flash TTS anders macht
Die meisten Text-to-Speech-Systeme lesen Ihre Worte nur in fester Betonung vor. Gemini 3.1 Flash TTS nimmt Regieanweisungen an. Schreiben Sie eine Anweisung in normaler Sprache vor eine Zeile, um Ton, Tempo oder Akzent festzulegen, und setzen Sie Hinweise in eckigen Klammern, wie [laughs] oder [whispering], genau dort, wo Sie sie brauchen. Das Modell setzt die Anweisung um, statt sie vorzulesen, sodass ein einziges Skript von einem gedämpften Nebensatz zu einer energiegeladenen Vorlesung wechseln kann.
Gemini 3.1 Flash TTS auf Morphic
Auf Morphic finden Sie Gemini 3.1 Flash TTS in der Audiomodell-Auswahl für Speech, neben ElevenLabs. Wechseln Sie die Prompt-Leiste auf Audio, wählen Sie Speech, dann Gemini 3.1 Flash TTS, schreiben Sie Ihr Skript mit den gewünschten Anweisungen oder Tags, wählen Sie Stimme und Sprache, und generieren Sie. Das Audio landet direkt in Canvas neben Ihren Videoclips.
Einfache Preise
Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.
Basic
2400 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Standard
3625 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Pro
6350 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Max
24650 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Enterprise
Für höhere Limits
Individuell
Preis- und Abrechnungsbedingungen

Free
Zum Ausprobieren
$0
dauerhaft kostenlos
Häufig gestellte Fragen
ChatGPT Images 2.5
OpenAI
OpenAIs Bildmodell, erschienen im September 2026. Schärfere Details, präzise Edits, kürzere Wartezeit.
Lyria 3.5
Google DeepMind
Googles bestklingendes Musikmodell. Ganze Songs mit Aufbau und Gesang.
MiniMax H3 Max Turbo
fal.ai
Das Tempo-Modell von fal, aus H3 Max. Doppelt so schnell, fast gleiche Optik.
Inworld TTS 2
Inworld
Eine Stimme, über 100 Sprachen. 95 Stimmen, erster Ton in Echtzeit.