音频生成
已上线

Inworld TTS 2

由 Inworld 提供

95 个音色,100 多种语言。
开口不到一秒,换语言不换人。

Inworld TTS 2

核心功能

技术规格

95

覆盖 14 种母语的现成音色

100+

跨语言输出,音色身份始终不变

2,000 字符

单次生成的脚本上限

低于 200 毫秒

首个音频的中位延迟

MP3,48 kHz

满码率音频,可直接放上时间线

2 档

Inworld TTS 2 与 Inworld TTS 2 Flash

应用场景

两个发光的节点被一束绷紧的光线连着,一个正在回应另一个

互动角色

话得接得上,声音就得马上出来。这里的延迟不是脚注,它本身就是功能。

一条长而稳定的光带,颗粒感从头到尾均匀

旁白与配音

旁白定下来之后,后面每一次剪辑、补录和改稿,用的都是同一把嗓子。

一条光带分成几条平行的光带,节奏始终一致

多语言配音

一条稿子做中文版、英文版,再加东南亚几种语言。做内容出海时,品牌的声音不会在翻译这一关走样。

一道琥珀色的光缓缓螺旋着向深处退去,圈距均匀

有声书与长稿

一本书一段一段做下来。叙述者的状态在各章之间都稳得住。

许多细小的光点散布在纵深里,被淡淡的丝线连在一起

游戏与 NPC 对白

一次凑齐一整组角色。95 个音色,填满一个村子也不用重复用同一个。

一列干净的发光台阶层层升高,向深处退去

讲解与教程

产品改了版本,重做那一句就行。不必为一句话再约一次录音棚。

提示词示例

一团柔和的淡金色光晕在画面边缘散开

短视频口播开场

先说结论。这三点看完,你今天就能上手。

Edit prompt
一道骨白色的光轻轻折起,沿着折痕透出亮边

有声书开篇

第一章。那天早上潮水退了出去,之后再没真正回来过。

Edit prompt
一缕温润的象牙色光丝,轻轻卷了一圈

直播间欢迎语

刚进来的朋友别急着走,我们从第一件事讲起。

Edit prompt
两道细细的冷白光线交汇于一点

突发消息

你绝对猜不到,刚才是谁打来的。

Edit prompt
一层银灰色的细密光网,近距离看去

课程开场

欢迎回来。我们接着上次停下的地方往下讲。

Edit prompt
一束柔和的琥珀色光缓缓收窄,收成一个点

景区导览

行程九点出发,集合点在北门外面。

Edit prompt

Inworld TTS 2 概览

第一声出来,不到 200 毫秒。文字转语音因此换了一种用法:声音可以直接放进一场还在进行的对话,而不是交上去、等一轮渲染再拿回来。

Inworld TTS 2 是 Inworld 的 Realtime TTS-2 文字转语音模型,2026 年 8 月 31 日发布,同一天上线 Morphic。目录里有 95 个现成音色,挑一个来读您的稿子。这个音色跨 100 多种语言都不变。

Inworld TTS 2 与其他语音模型的差别

一是延迟。首个音频的中位延迟低于 200 毫秒。互动角色要在玩家还在听的时候把话接上,只有在这条线以内才做得到。

二是音色不绑定语言。目录里任何一个音色都能说任何一种受支持的语言。一次生成中途换语言,人也不换。中英夹杂的稿子读完,听起来是一个人在讲,而不是两条录音拼在一起。

做内容出海的团队最看重这一点。一条口播稿要发中文版、英文版,再加东南亚几种语言,过去每种语言都得单独找一位配音。现在音色定一次,后面都用它。品牌的声音不会跟着翻译走样,观众换个语区听到的还是同一个人。

在 Morphic 上使用 Inworld TTS 2

在 Morphic 上,Inworld TTS 2 就排在 Speech 的音频模型里,旁边是 ElevenLabs 和 Gemini 3.1 Flash TTS。把提示框切到 Audio,选 Speech,模型选 Inworld TTS 2,挑音色,贴稿子,生成。单次脚本上限 2,000 字符,出来的是 48 kHz MP3,直接落在 Canvas 上。

两档可选。默认是 Inworld TTS 2,读得最完整。走量和打草稿用 Inworld TTS 2 Flash,速度更快,成本更低,音色目录还是那 95 个。两档之间来回切换,不用重新挑音色。

简单定价

今天就免费开始,随时可以升级或取消。

Basic

$9/
账单金额为 $0 每年

1100 每月 信用

1 个用户

所有模型

工作流

Standard

$24/
账单金额为 $0 每年

3625 每月 信用

1 个用户

所有模型

工作流

Pro

$45/
账单金额为 $0 每年

6350 共享 每月 信用

1 用户

+ 最多 4 人额外付费可增加

所有模型

工作流

Pro Max

$170/
账单金额为 $0 每年

24650 共享 每月 信用

1 用户

+ 最多 9 人额外付费可增加

所有模型

工作流

Enterprise

更高的限制

自定义

定价和账单条款

大容量信用
自定义席位限制
所有模型
工作流
Pricing Gradient

Free

供随意体验

$0

永久免费

最多 20 积分
仅1个用户
部分模型
工作流

常见问题

Inworld TTS 2 是什么?
Inworld TTS 2 是 Inworld 的 Realtime TTS-2 文字转语音模型,2026 年 8 月 31 日发布。它用 95 个现成音色中的一个把稿子读出来。这个音色跨 100 多种语言保持不变,出声速度接近实时。
Inworld TTS 2 能生成中文语音吗?
可以。目录里任何一个音色都能说它支持的语言,覆盖范围超过 100 种,中文也在其中。换语言的时候音色本身不变,所以一段中英夹杂的稿子读下来仍然是同一个人在说。有一点要说清楚:Inworld 公布的是 14 种母语音色加上 100 多种跨语言输出,并没有列出那 14 种具体是哪几种,本页也不做这个断言。听感请以您自己的试听为准。
Inworld TTS 2 为什么能这么快?
首个音频的中位延迟低于 200 毫秒。这个数字把文字转语音从“提交完等结果”里挪了出来。互动角色和实时对话因此才成立,而不只是那种一次生成、慢慢等的配音。
Inworld TTS 2 和 Inworld TTS 2 Flash 怎么选?
两档共用同一套 95 个音色的目录,音色不用重挑。成片用 Inworld TTS 2,读得最完整。走量和打草稿用 Inworld TTS 2 Flash,速度更快,成本更低。一条稿子先在 Flash 上定语气,再切回 Inworld TTS 2 出最终版,是省时间的做法。
一共有多少个音色和语言?
95 个现成音色,分布在 14 种母语上,跨语言输出覆盖 100 多种语言。任何一个音色都能说任何一种受支持的语言。所以一个音色的母语说明的是它当初怎么被塑造出来,而不是它只能说这一种。
一次能读多长的稿子?
单次生成最多 2,000 字符。更长的内容拆成几段,按顺序生成。挑好的音色在各段之间不变,整篇听下来仍然连贯。
它和 Morphic 上的 ElevenLabs 有什么区别?
两者在 Morphic 上都能做出接近真人的语音。ElevenLabs 是一整套音频工具,语音、音乐、音效都覆盖,音色调节也更细。Inworld TTS 2 只做语音,强项集中在两处:延迟低,音色跨语言不变。如果您平时用的是讯飞智作、魔音工坊这类中文配音工具,可以按这两点判断它补的是哪一段。不少创作者两个都留着,一个负责人声,另一个做音乐和音效。
在 Morphic 上怎么用 Inworld TTS 2?
打开 Morphic,把提示框切到 Audio,选择 Speech。模型选 Inworld TTS 2,挑一个音色,把稿子贴进去,然后生成。音频会直接落在 Canvas 上,就在您的视频片段旁边。