Inworld TTS 2
von Inworld
Eine Stimme, über 100 Sprachen.
95 Stimmen, erster Ton in Echtzeit.

Hauptfunktionen
Technische Spezifikationen
95
Fertige Stimmen aus vierzehn Herkunftssprachen
100+
Crosslingual, mit einer Stimmidentität über alle hinweg
2.000 Zeichen
Maximale Skriptlänge pro Generierung
Unter 200 ms
Median bis zum ersten Ton
MP3, 48 kHz
Volle Abtastrate, direkt für die Timeline
2
Inworld TTS 2 und Inworld TTS 2 Flash
Anwendungsfälle

Interaktive Figuren
Die Antwort kommt schnell genug für ein echtes Gespräch. Hier ist die Latenz die eigentliche Funktion und keine Fußnote.

Erzählstimme und Voice-over
Sie besetzen die Erzählstimme einmal. In jedem Schnitt, jeder Nachaufnahme und jeder Korrekturrunde klingt sie danach gleich.

Vertonung für Auslandsmärkte
Das Schulungsvideo geht an die Werke in Polen, Frankreich und Mexiko. Jede Fassung spricht dieselbe Stimme.

Hörbücher und lange Texte
Ein Buch entsteht Abschnitt für Abschnitt. Die Erzählstimme hält ihren Ton über alle Kapitel hinweg.

Dialoge für Spiele und NPCs
Sie besetzen ein ganzes Ensemble. 95 Stimmen füllen ein Dorf, ohne dass eine davon zweimal auftaucht.

Erklärvideo und Unterweisung
Eine Vorschrift ändert sich, Sie tauschen genau diesen einen Satz. Ein zweiter Sprechertermin entfällt, auch in der englischen Fassung.
Prompt-Beispiele





Sicherheitsunterweisung
Willkommen zurück. Wir beginnen heute mit der jährlichen Unterweisung.
Edit prompt
Überblick
Inworld TTS 2 ist das Text-to-Speech-Modell Realtime TTS-2 von Inworld. Es erschien am 31.08.2026 und stand noch am selben Tag auf Morphic bereit. Es liest Ihr Skript in einer von 95 fertigen Stimmen, und diese Stimme trägt über mehr als 100 Sprachen.
Für den deutschsprachigen Markt entscheidet genau dieser zweite Satz. Kaum ein Video bleibt hier bei einer Sprache. Ein Imagefilm läuft auf Deutsch und Englisch. Die Unterweisung kommt auf Polnisch, Rumänisch und Spanisch dazu. So sind die Standorte verteilt, so ist die Belegschaft. Bisher hieß das: drei Sprecher, drei Termine, drei Rechnungen, und am Ende drei verschiedene Marken im Ohr.
Was Inworld TTS 2 auszeichnet
Eine Stimme ist hier nicht an eine Sprache gebunden. Jede Stimme aus dem Katalog spricht jede unterstützte Sprache. Die Identität hält sogar dann, wenn die Sprache innerhalb einer Generierung wechselt. Ein zweisprachiges Skript klingt danach nach einer Person. Es klingt nicht nach zwei Aufnahmen, die jemand aneinandergesetzt hat.
Praktisch heißt das: Sie besetzen Ihre Markenstimme einmal und behalten sie über alle Sprachfassungen. Die Wiedererkennung überlebt die Lokalisierung, und der Abstimmungsaufwand fällt auf eine Runde zusammen.
Der zweite Punkt ist die Latenz. Bis zum ersten Ton vergehen im Median weniger als 200 Millisekunden. Text-to-Speech wird damit vom Renderjob zur Interaktion. Eine Figur antwortet, während die Spielerin noch zuhört, und ein Agent im Kundendialog spricht, bevor die Pause auffällt.
Inworld TTS 2 auf Morphic
Auf Morphic steht Inworld TTS 2 in der Modellauswahl für Speech, neben ElevenLabs und Gemini 3.1 Flash TTS. Stellen Sie die Prompt-Leiste auf Audio, wählen Sie Speech, dann Inworld TTS 2 und eine Stimme. Skript einfügen, generieren. Pro Durchgang sind 2.000 Zeichen möglich, zurück kommt MP3 mit 48 kHz, direkt auf Ihrem Canvas.
Ein Hinweis für Skripte aus dem Arbeitsalltag: Prüfen Sie vor dem Einfügen, welche personenbezogenen Stellen wirklich in die Sprachfassung müssen. Namen und Nummern lassen sich vorher durch Platzhalter ersetzen, ohne dass der Text an Klarheit verliert.
Zwei Stufen stehen bereit. Inworld TTS 2 ist die Voreinstellung. Inworld TTS 2 Flash arbeitet aus demselben Katalog mit 95 Stimmen, nur schneller und günstiger. Das passt für große Mengen und für Entwürfe. Ein Wechsel zwischen den Stufen bedeutet keine neue Besetzung.
Einfache Preise
Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.
Basic
1100 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Standard
3625 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Pro
6350 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Pro Max
24650 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Enterprise
Für höhere Limits
Individuell
Preis- und Abrechnungsbedingungen

Free
Zum Ausprobieren
$0
dauerhaft kostenlos
Häufig gestellte Fragen
ChatGPT Images 2.5
OpenAI
OpenAIs Bildmodell, erschienen im September 2026. Schärfere Details, präzise Edits, kürzere Wartezeit.
Lyria 3.5
Google DeepMind
Googles bestklingendes Musikmodell. Ganze Songs mit Aufbau und Gesang.
MiniMax H3 Max Turbo
fal.ai
Das Tempo-Modell von fal, aus H3 Max. Doppelt so schnell, fast gleiche Optik.
Gemini Omni Flash 1.1
Google DeepMind
Googles Videomodell: Die Änderung ist ein Satz. Jetzt mit 4K und Szenen bis 40 Sekunden.