Audio-Generierung
Jetzt verfügbar

Inworld TTS 2

von Inworld

Eine Stimme, über 100 Sprachen.
95 Stimmen, erster Ton in Echtzeit.

Inworld TTS 2

Hauptfunktionen

Technische Spezifikationen

95

Fertige Stimmen aus vierzehn Herkunftssprachen

100+

Crosslingual, mit einer Stimmidentität über alle hinweg

2.000 Zeichen

Maximale Skriptlänge pro Generierung

Unter 200 ms

Median bis zum ersten Ton

MP3, 48 kHz

Volle Abtastrate, direkt für die Timeline

2

Inworld TTS 2 und Inworld TTS 2 Flash

Anwendungsfälle

Zwei leuchtende Knoten, verbunden durch einen straff gespannten Lichtfaden, einer antwortet dem anderen

Interaktive Figuren

Die Antwort kommt schnell genug für ein echtes Gespräch. Hier ist die Latenz die eigentliche Funktion und keine Fußnote.

Ein langes, ruhiges Lichtband mit gleichmäßiger Körnung über seine ganze Länge

Erzählstimme und Voice-over

Sie besetzen die Erzählstimme einmal. In jedem Schnitt, jeder Nachaufnahme und jeder Korrekturrunde klingt sie danach gleich.

Ein Lichtband, das sich in parallele Bänder teilt, die im Gleichtakt bleiben

Vertonung für Auslandsmärkte

Das Schulungsvideo geht an die Werke in Polen, Frankreich und Mexiko. Jede Fassung spricht dieselbe Stimme.

Eine lange, langsame Spirale aus bernsteinfarbenem Licht, die in gleichmäßigen Windungen in die Tiefe führt

Hörbücher und lange Texte

Ein Buch entsteht Abschnitt für Abschnitt. Die Erzählstimme hält ihren Ton über alle Kapitel hinweg.

Viele kleine Lichtpunkte, in der Tiefe verstreut und durch feine Fäden verbunden

Dialoge für Spiele und NPCs

Sie besetzen ein ganzes Ensemble. 95 Stimmen füllen ein Dorf, ohne dass eine davon zweimal auftaucht.

Eine klare, aufsteigende Folge leuchtender Stufen, die in die Tiefe führt

Erklärvideo und Unterweisung

Eine Vorschrift ändert sich, Sie tauschen genau diesen einen Satz. Ein zweiter Sprechertermin entfällt, auch in der englischen Fassung.

Prompt-Beispiele

Eine weiche Blüte aus blassgoldenem Licht, die sich am Bildrand öffnet

Herzlicher Empfang

Der Tee zieht schon. Setzen Sie sich, erzählen Sie mir alles.

Edit prompt
Eine sanfte Falte aus knochenweißem Licht, das sich entlang der Kante fängt

Kapitelanfang

Kapitel eins. An jenem Morgen lief das Wasser ab und kam nie ganz zurück.

Edit prompt
Ein einzelner weicher Faden aus warmem elfenbeinfarbenem Licht, einmal eingerollt

Rezeptschritt

Mehl und Butter verkneten, bis der Teig gerade zusammenhält.

Edit prompt
Zwei dünne Linien aus kühlem weißem Licht, die in einem Punkt zusammenlaufen

Eilmeldung

Sie werden nicht glauben, wer eben angerufen hat.

Edit prompt
Ein feines Netz aus silbergrauem Licht, aus großer Nähe gesehen

Sicherheitsunterweisung

Willkommen zurück. Wir beginnen heute mit der jährlichen Unterweisung.

Edit prompt
Ein langsam auslaufender Streifen aus weichem Bernsteinlicht, der sich zu einem Punkt verjüngt

Ansage zur Führung

Die Führung beginnt um neun, direkt vor dem Nordtor.

Edit prompt

Überblick

Inworld TTS 2 ist das Text-to-Speech-Modell Realtime TTS-2 von Inworld. Es erschien am 31.08.2026 und stand noch am selben Tag auf Morphic bereit. Es liest Ihr Skript in einer von 95 fertigen Stimmen, und diese Stimme trägt über mehr als 100 Sprachen.

Für den deutschsprachigen Markt entscheidet genau dieser zweite Satz. Kaum ein Video bleibt hier bei einer Sprache. Ein Imagefilm läuft auf Deutsch und Englisch. Die Unterweisung kommt auf Polnisch, Rumänisch und Spanisch dazu. So sind die Standorte verteilt, so ist die Belegschaft. Bisher hieß das: drei Sprecher, drei Termine, drei Rechnungen, und am Ende drei verschiedene Marken im Ohr.

Was Inworld TTS 2 auszeichnet

Eine Stimme ist hier nicht an eine Sprache gebunden. Jede Stimme aus dem Katalog spricht jede unterstützte Sprache. Die Identität hält sogar dann, wenn die Sprache innerhalb einer Generierung wechselt. Ein zweisprachiges Skript klingt danach nach einer Person. Es klingt nicht nach zwei Aufnahmen, die jemand aneinandergesetzt hat.

Praktisch heißt das: Sie besetzen Ihre Markenstimme einmal und behalten sie über alle Sprachfassungen. Die Wiedererkennung überlebt die Lokalisierung, und der Abstimmungsaufwand fällt auf eine Runde zusammen.

Der zweite Punkt ist die Latenz. Bis zum ersten Ton vergehen im Median weniger als 200 Millisekunden. Text-to-Speech wird damit vom Renderjob zur Interaktion. Eine Figur antwortet, während die Spielerin noch zuhört, und ein Agent im Kundendialog spricht, bevor die Pause auffällt.

Inworld TTS 2 auf Morphic

Auf Morphic steht Inworld TTS 2 in der Modellauswahl für Speech, neben ElevenLabs und Gemini 3.1 Flash TTS. Stellen Sie die Prompt-Leiste auf Audio, wählen Sie Speech, dann Inworld TTS 2 und eine Stimme. Skript einfügen, generieren. Pro Durchgang sind 2.000 Zeichen möglich, zurück kommt MP3 mit 48 kHz, direkt auf Ihrem Canvas.

Ein Hinweis für Skripte aus dem Arbeitsalltag: Prüfen Sie vor dem Einfügen, welche personenbezogenen Stellen wirklich in die Sprachfassung müssen. Namen und Nummern lassen sich vorher durch Platzhalter ersetzen, ohne dass der Text an Klarheit verliert.

Zwei Stufen stehen bereit. Inworld TTS 2 ist die Voreinstellung. Inworld TTS 2 Flash arbeitet aus demselben Katalog mit 95 Stimmen, nur schneller und günstiger. Das passt für große Mengen und für Entwürfe. Ein Wechsel zwischen den Stufen bedeutet keine neue Besetzung.

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$9/ Monat
abgerechnet als $0 pro Jahr

1100 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3625 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6350 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Pro Max

$170/ Monat
abgerechnet als $0 pro Jahr

24650 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Was ist Inworld TTS 2?
Inworld TTS 2 ist das Text-to-Speech-Modell Realtime TTS-2 von Inworld, erschienen am 31.08.2026. Es liest Ihr Skript in einer von 95 fertigen Stimmen. Diese Stimmidentität trägt über mehr als 100 Sprachen. Das Audio kommt in Echtzeit zurück.
Spricht Inworld TTS 2 Deutsch?
Ja. Das Modell arbeitet crosslingual, und jede Stimme aus dem Katalog spricht jede unterstützte Sprache. Es sind mehr als 100. Die Herkunftssprache einer Stimme sagt deshalb nur, wie sie besetzt wurde, und nicht, worauf sie festgelegt ist. Wichtiger für die Praxis ist der zweite Teil: Beim Sprachwechsel bleibt die Identität erhalten. Ein Skript, das von Deutsch auf Englisch springt, klingt danach nach einer Person und nicht nach zwei zusammengeschnittenen Aufnahmen.
Was passiert mit dem Skript, das ich einfüge, und wie steht es um die DSGVO?
Ihr Text geht als Eingabe an das Modell und kommt als Audiodatei zurück. Die Datei liegt danach auf Ihrem Canvas, also in Ihrem eigenen Arbeitsbereich auf Morphic. Von dort laden Sie sie herunter oder löschen sie wieder. Für die DSGVO gilt die übliche Regel bei jedem Cloud-Dienst: Personenbezogene Stellen gehören nur ins Skript, wenn die Ausgabe sie wirklich braucht. Kundennamen, Vertragsnummern und Adressen ersetzen Sie besser vorher durch Platzhalter. Welche Grundlage für Ihren Einsatz gilt, klären Sie über die Datenschutzhinweise von Morphic und Ihr eigenes Verarbeitungsverzeichnis.
Wie viele Stimmen und Sprachen gibt es?
95 fertige Stimmen aus vierzehn Herkunftssprachen, dazu crosslinguale Ausgabe in mehr als 100 Sprachen. Jede Stimme kann jede unterstützte Sprache sprechen. Sie besetzen also nach Klang und Charakter, nicht nach Sprachliste.
Warum ist das Modell so schnell?
Bis zum ersten Ton vergehen im Median weniger als 200 Millisekunden. Damit fällt Text-to-Speech aus der Kategorie heraus, in der man auf einen Render wartet. Genau das öffnet die interaktiven Fälle: eine Figur im Spiel, ein Agent im Kundendialog, eine Demo vor Publikum. Für reines Voice-over, das einmal entsteht, wäre die Zahl nebensächlich.
Was unterscheidet Inworld TTS 2 von Inworld TTS 2 Flash?
Beide greifen auf denselben Katalog mit 95 Stimmen zu. Inworld TTS 2 liefert die vollste Lesung. Inworld TTS 2 Flash ist die schnellere und günstigere Stufe, gedacht für große Mengen und für Entwürfe. Der Wechsel kostet Sie keine Neubesetzung.
Wie unterscheidet es sich von ElevenLabs auf Morphic?
Beide liefern auf Morphic Sprache in menschlicher Qualität. ElevenLabs ist die vollständige Audio-Suite: Sprache, Musik, Soundeffekte, dazu eine feine Justage der Stimme. Inworld TTS 2 macht ausschließlich Sprache. Seine Stärken liegen bei der Latenz und bei der einen Stimme über viele Sprachen. Viele Teams nutzen beides, das eine für die Stimme, das andere für Musik und Effekte.
Wie nutze ich Inworld TTS 2 auf Morphic?
Öffnen Sie Morphic, stellen Sie die Prompt-Leiste auf Audio und wählen Sie Speech. Dann setzen Sie Inworld TTS 2 als Modell, wählen eine Stimme, fügen Ihr Skript ein und generieren. Das Audio landet auf Ihrem Canvas, direkt neben Ihren Videoclips.