오디오 생성
사용 가능

Inworld TTS 2

Inworld 제공

음성 95종, 언어 100개 이상.
첫 소리까지 1초가 걸리지 않습니다.

Inworld TTS 2

주요 기능

기술 사양

95종

14개 언어를 바탕으로 만든 기성 음성

100개 이상

목소리 하나가 모든 지원 언어에서 유지됩니다

2,000자

한 번 생성에 넣을 수 있는 최대 대본 길이

200ms 미만

첫 소리가 나오기까지 걸린 시간의 중앙값

MP3, 48 kHz

타임라인에 바로 올리는 원본 음질

2단계

Inworld TTS 2와 Inworld TTS 2 Flash

활용 사례

팽팽한 빛의 실로 이어진 두 개의 빛나는 노드, 한쪽이 다른 쪽에 답하는 모습

AI 캐릭터 챗

말이 빨리 시작되어야 대화가 성립합니다. 사용자가 보내고 나서 답이 오기까지의 그 짧은 틈, 여기서는 그게 각주가 아니라 기능입니다.

전체 길이에 걸쳐 입자가 고른, 길고 안정적인 빛의 띠

숏폼 내레이션

채널 목소리를 한 번 정해 두면 그대로 갑니다. 영상 스무 개를 몰아 찍어도, 몇 달 뒤 이어 올려도 같은 사람이 읽습니다.

여러 갈래로 갈라지면서도 보조를 맞춰 나아가는 빛의 리본

해외 채널 더빙

한국어로 만든 콘텐츠를 영어나 일본어로 다시 내보낼 때 쓰는 자리입니다. 대본만 바꾸고 목소리는 그대로 둡니다. 언어마다 성우를 새로 구할 일이 없습니다.

고르게 감기며 깊이 속으로 물러나는 길고 느린 호박색 빛의 나선

오디오북과 웹소설 낭독

긴 원고를 한 단락씩 나눠 진행합니다. 회차가 쌓여도 낭독자의 목소리는 첫 회와 같습니다.

깊이 속에 흩어진 작은 빛점 여럿, 희미한 실로 서로 이어진 모습

게임 NPC 더빙

배역을 통째로 캐스팅합니다. 음성 95종이면 같은 목소리를 두 번 쓰지 않고 마을 하나를 채웁니다. 글로벌 빌드에서는 같은 배역이 다른 언어로 말합니다.

깊이 속으로 물러나며 정연하게 올라가는 빛의 계단

제품 설명과 강의

화면이 바뀌면 그 한 줄만 다시 만듭니다. 성우 일정을 다시 잡고 스튜디오를 예약하는 과정이 통째로 빠집니다.

프롬프트 예시

화면 가장자리에서 부드럽게 피어나는 옅은 금빛

브이로그 오프닝

오늘은 성수동에서 시작합니다. 커피 한 잔 하고 갈게요.

Edit prompt
접힌 자리를 따라 빛을 머금은, 뼈처럼 흰 빛의 주름

오디오북 도입

1장. 그해 여름은 장마가 길었고, 골목은 좀처럼 마르지 않았습니다.

Edit prompt
따뜻한 아이보리빛 실 한 가닥이 한 번 감기는 모습

레시피 한 컷

고추장은 한 큰술만 넣고, 불은 중불로 줄여 주세요.

Edit prompt
한 점으로 모여드는 차갑고 흰 두 줄기 가는 빛

드라마 예고

다음 주, 그 사람이 돌아옵니다. 아무도 모르는 얼굴로.

Edit prompt
아주 가까이서 본 은회색 빛의 고운 그물

온라인 강의 인사

자, 다시 만났습니다. 지난 시간 끝난 데서 이어 가겠습니다.

Edit prompt
한 점으로 좁아지며 잦아드는 부드러운 호박색 빛

한옥마을 안내

관람은 아홉 시부터입니다. 정문 왼쪽에서 모이겠습니다.

Edit prompt

개요

Inworld TTS 2는 Inworld가 만든 Realtime TTS-2 음성 합성 모델입니다. 2026년 8월 31일에 공개되었고, 같은 날부터 Morphic에서 쓸 수 있습니다. 준비된 음성 95종 가운데 하나로 대본을 읽습니다. 그 목소리는 100개가 넘는 언어에서 그대로 이어집니다. 속도는 대화 한가운데 넣어도 어색하지 않을 만큼 빠릅니다.

Inworld TTS 2가 다른 점

다른 음성 모델과 갈리는 지점은 두 가지입니다.

첫째는 지연 시간입니다. 첫 소리가 나오기까지 중앙값 200밀리초가 걸리지 않습니다. 걸어 두고 기다리는 작업에서 벗어난다는 뜻입니다. 사용자가 아직 화면을 보고 있는 사이에 캐릭터가 대답해야 하는 자리, 그런 쓰임이 여기서 열립니다.

둘째는 목소리가 언어에 묶여 있지 않다는 점입니다. 카탈로그의 어떤 음성이든 지원 언어라면 읽습니다. 한 번 생성하는 도중에 언어가 바뀌어도 인물은 그대로 남습니다.

이 성질이 가장 크게 쓰이는 쪽은 한 편을 만들어 여러 나라에 내보내는 작업입니다. 한국어 채널을 영어로도 여는 유튜버, 게임을 글로벌 빌드까지 내보내는 팀, 국내에서 만든 영상을 해외 배급까지 이어 가는 스튜디오가 여기에 해당합니다. 지금까지는 언어를 하나 늘릴 때마다 성우를 새로 구하고 톤을 맞추는 일이 따라붙었습니다. 목소리를 한 번만 정해 두면 그 과정이 대본 교체로 줄어듭니다.

Morphic에서 쓰는 Inworld TTS 2

Morphic에서는 Speech용 오디오 모델 목록에 Inworld TTS 2가 놓입니다. 옆에는 ElevenLabs와 Gemini 3.1 Flash TTS가 있습니다. 프롬프트 바를 Audio로 바꾸고 Speech를 고르세요. 모델로 Inworld TTS 2를 선택한 뒤 음성을 정하고, 대본을 붙여 넣고 생성하면 됩니다. 한 번에 2,000자까지 들어갑니다. 결과는 48 kHz MP3로 Canvas에 바로 올라갑니다.

등급은 두 가지입니다. 기본은 Inworld TTS 2입니다. Inworld TTS 2 Flash는 같은 음성 95종을 더 빠르고 저렴하게 돌립니다. 숏폼을 한 번에 여러 편 올리거나 초안을 여러 벌 들어 볼 때 맞습니다. 등급을 바꾼다고 목소리를 다시 캐스팅해야 하는 것은 아닙니다.

간단한 가격

오늘 무료로 시작하고 언제든지 업그레이드하거나 취소할 수 있습니다.

Basic

$9/
청구 금액 $0

1100 월간 크레딧

1 명 전용

모든 모델

워크플로

Standard

$24/
청구 금액 $0

3625 월간 크레딧

1 명 전용

모든 모델

워크플로

Pro

$45/
청구 금액 $0

6350 공유 월간 크레딧

1 사용자

+ 최대 4 명 추가 비용으로 추가 가능

모든 모델

워크플로

Pro Max

$170/
청구 금액 $0

24650 공유 월간 크레딧

1 사용자

+ 최대 9 명 추가 비용으로 추가 가능

모든 모델

워크플로

Enterprise

더 높은 제한

사용자 정의

가격 및 청구 조건

대용량 크레딧
맞춤형 시트 제한
모든 모델
워크플로
Pricing Gradient

Free

가볍게 사용해보기

$0

영구 무료

최대 20 크레딧
1명 전용
일부 모델
워크플로

자주 묻는 질문

Inworld TTS 2는 어떤 모델인가요?
Inworld가 만든 Realtime TTS-2 음성 합성 모델입니다. 2026년 8월 31일에 공개되었습니다. 준비된 음성 95종 가운데 하나로 대본을 읽습니다. 그 목소리는 100개가 넘는 언어에서 그대로 유지됩니다. 결과가 돌아오는 속도는 실시간에 가깝습니다.
한국어 대본도 읽어 주나요?
카탈로그의 어떤 음성이든 지원 언어라면 읽습니다. 지원 언어는 100개가 넘습니다. 음성에 붙은 원어 표시는 그 목소리가 어떻게 캐스팅되었는지를 알려 줄 뿐, 말할 수 있는 범위를 정하지 않습니다. 한국어 대본이 중요한 작업이라면 짧은 문장부터 먼저 만들어 소리를 확인해 보세요.
한국어 채널과 영어 채널을 같은 목소리로 운영할 수 있나요?
그렇게 쓰라고 만든 기능입니다. 목소리 하나를 정해 두고 대본만 언어별로 바꾸면 됩니다. 한 번 생성하는 도중에 언어가 바뀌어도 인물은 유지됩니다. 그래서 한국어와 영어가 섞인 대본도 따로 녹음해 이어 붙인 소리가 아니라 한 사람의 목소리로 돌아옵니다. 채널을 늘릴 때마다 성우를 새로 구하고 톤을 맞추던 과정이 빠집니다.
음성과 언어는 몇 개나 되나요?
기성 음성은 95종이고, 14개 언어를 바탕으로 만들어졌습니다. 전달은 크로스링구얼로 이뤄져 100개가 넘는 언어를 지원합니다. 음성에 적힌 원어는 한계가 아니라 캐스팅 기준으로 읽으면 됩니다.
얼마나 빠른가요?
첫 소리가 나오기까지 중앙값 200밀리초 미만입니다. 걸어 두고 기다리는 작업이 아니라는 뜻입니다. 한 번 만들어 두고 쓰는 내레이션은 물론이고, 사용자가 앞에서 기다리는 캐릭터 챗이나 실시간 에이전트에도 쓸 수 있는 이유가 여기에 있습니다.
Inworld TTS 2와 Inworld TTS 2 Flash는 어떻게 다른가요?
음성 95종 카탈로그는 두 등급이 똑같이 씁니다. 가장 충실한 낭독은 Inworld TTS 2입니다. Flash는 더 빠르고 저렴한 등급이라 물량이 많은 작업이나 초안에 맞습니다. 등급을 바꿔도 목소리를 다시 캐스팅할 필요는 없습니다.
Morphic의 ElevenLabs와는 무엇이 다른가요?
둘 다 사람 수준의 음성을 만듭니다. ElevenLabs는 음성과 음악, 효과음까지 다루는 오디오 제품군이고 목소리를 세밀하게 조정할 수 있습니다. Inworld TTS 2는 음성만 다룹니다. 강점은 두 가지, 지연 시간과 언어를 넘나드는 목소리 유지입니다. 목소리는 이쪽에서, 음악과 효과음은 저쪽에서 가져다 쓰는 창작자가 많습니다.
Morphic에서 Inworld TTS 2를 어떻게 쓰나요?
Morphic을 열고 프롬프트 바를 Audio로 바꾼 다음 Speech를 고릅니다. 모델에서 Inworld TTS 2를 선택하고 음성을 정하세요. 대본을 붙여 넣고 생성하면 됩니다. 한 번에 2,000자까지 들어갑니다. 만들어진 음원은 영상 클립 옆 Canvas에 바로 올라갑니다.