Inworld TTS 2
由 Inworld 提供
95 个音色,100 多种语言。
开口不到一秒,换语言不换人。

核心功能
技术规格
95
覆盖 14 种母语的现成音色
100+
跨语言输出,音色身份始终不变
2,000 字符
单次生成的脚本上限
低于 200 毫秒
首个音频的中位延迟
MP3,48 kHz
满码率音频,可直接放上时间线
2 档
Inworld TTS 2 与 Inworld TTS 2 Flash
应用场景

互动角色
话得接得上,声音就得马上出来。这里的延迟不是脚注,它本身就是功能。

旁白与配音
旁白定下来之后,后面每一次剪辑、补录和改稿,用的都是同一把嗓子。

多语言配音
一条稿子做中文版、英文版,再加东南亚几种语言。做内容出海时,品牌的声音不会在翻译这一关走样。

有声书与长稿
一本书一段一段做下来。叙述者的状态在各章之间都稳得住。

游戏与 NPC 对白
一次凑齐一整组角色。95 个音色,填满一个村子也不用重复用同一个。

讲解与教程
产品改了版本,重做那一句就行。不必为一句话再约一次录音棚。
提示词示例






Inworld TTS 2 概览
第一声出来,不到 200 毫秒。文字转语音因此换了一种用法:声音可以直接放进一场还在进行的对话,而不是交上去、等一轮渲染再拿回来。
Inworld TTS 2 是 Inworld 的 Realtime TTS-2 文字转语音模型,2026 年 8 月 31 日发布,同一天上线 Morphic。目录里有 95 个现成音色,挑一个来读您的稿子。这个音色跨 100 多种语言都不变。
Inworld TTS 2 与其他语音模型的差别
一是延迟。首个音频的中位延迟低于 200 毫秒。互动角色要在玩家还在听的时候把话接上,只有在这条线以内才做得到。
二是音色不绑定语言。目录里任何一个音色都能说任何一种受支持的语言。一次生成中途换语言,人也不换。中英夹杂的稿子读完,听起来是一个人在讲,而不是两条录音拼在一起。
做内容出海的团队最看重这一点。一条口播稿要发中文版、英文版,再加东南亚几种语言,过去每种语言都得单独找一位配音。现在音色定一次,后面都用它。品牌的声音不会跟着翻译走样,观众换个语区听到的还是同一个人。
在 Morphic 上使用 Inworld TTS 2
在 Morphic 上,Inworld TTS 2 就排在 Speech 的音频模型里,旁边是 ElevenLabs 和 Gemini 3.1 Flash TTS。把提示框切到 Audio,选 Speech,模型选 Inworld TTS 2,挑音色,贴稿子,生成。单次脚本上限 2,000 字符,出来的是 48 kHz MP3,直接落在 Canvas 上。
两档可选。默认是 Inworld TTS 2,读得最完整。走量和打草稿用 Inworld TTS 2 Flash,速度更快,成本更低,音色目录还是那 95 个。两档之间来回切换,不用重新挑音色。
简单定价
今天就免费开始,随时可以升级或取消。
Basic
1100 每月 信用
1 个用户
所有模型
工作流
Standard
3625 每月 信用
1 个用户
所有模型
工作流
Pro
6350 共享 每月 信用
1 用户
所有模型
工作流
Pro Max
24650 共享 每月 信用
1 用户
所有模型
工作流
Enterprise
更高的限制
自定义
定价和账单条款

Free
供随意体验
$0
永久免费