오디오 생성

Seed Audio 1.0

ByteDance 제공

ByteDance의 올인원 TTS 모델.
음성, 음악, 효과음을 한 번의 생성으로.

Seed Audio 1.0

주요 기능

사운드의 범위 듣기

다큐멘터리 내레이션음성

따뜻하고 차분한 다큐멘터리 내레이션.

0:00
0:12
스릴러 내레이션음성

낮고 긴장된, 가깝고 은밀한 대사 낭독.

0:00
0:12
향신료 시장 앰비언스효과음

겹겹이 쌓인 야외 시장 사운드 베드.

0:00
0:12
천둥번개효과음

몰아치다 먼 천둥소리로 커지는 폭풍.

0:00
0:12
오케스트라 큐음악

현악과 금관의 짧게 고조되는 큐.

0:00
0:12
로파이 비트음악

부드러운 건반과 바이닐 잡음이 있는 편안한 비트.

0:00
0:12

기술 사양

ByteDance

ByteDance의 Seed 연구팀이 개발했습니다.

20

영어, 중국어, 일본어, 한국어, 스페인어, 프랑스어, 독일어 등.

최대 2분

한 번의 생성당 최대 2분 분량의 오디오.

3,000자

대사까지 담은 장면 브리프를 쓸 수 있는 분량.

최대 3개

각 30초 이내의 참조 클립을 최대 3개까지.

논스트리밍

실시간 스트림이 아니라 완성 트랙을 렌더링합니다.

활용 사례

오디오북

책 한 권 분량을 녹음실 없이. ByteDance는 비용을 스튜디오의 10분의 1 수준으로 봅니다.

영상 더빙

목소리를 설명하거나 인물 이미지를 올리고, 타임스탬프로 대사를 화면에 맞춥니다.

게임 오디오

인물 대사, 연기된 장면, 환경 효과음을 대본에서 바로 만들어 냅니다.

영상 오디오 한 번에

내레이션, 사운드 디자인, 음악을 한 번의 생성으로. 이후 믹싱 단계가 없습니다.

광고와 프로모

대사, 효과음, 음악이 바로 쓸 수 있는 트랙 하나로. 숏폼 콘텐츠에 맞춥니다.

대화와 오디오 드라마

여러 인물이 각자 목소리와 연기로, 어울리는 앰비언스와 호흡의 장면을 만듭니다.

프롬프트 예시

내레이션 설명

차분한 내레이터, 은은한 주방 소리: “밀가루와 버터를 섞으세요.”

Edit prompt

시간 제어

라이언(숨찬): “[5.5s:8.0s] 마야! 정말 오늘 밤 떠나?”

Edit prompt

오디오북 장면

창에 빗소리. 내레이터, 낮고 느긋하게: “그녀는 두 번 읽었다.”

Edit prompt

스포츠 중계

가득 찬 경기장, 함성. 캐스터, 격앙되어: “고오오올!”

Edit prompt

오디오 드라마

형사, 긴장한 채: “움직이지 마.” 발소리가 멎고 문이 삐걱인다.

Edit prompt

게임 한 장면

깊고 영웅적인 목소리: “고대의 봉인이 깨졌다.” 돌이 갈리는 소리.

Edit prompt

간단한 가격

오늘 무료로 시작하고 언제든지 업그레이드하거나 취소할 수 있습니다.

Basic

$9/
청구 금액 $0

900 월간 크레딧

1 명 전용

모든 모델

워크플로

Standard

$24/
청구 금액 $0

3200 월간 크레딧

1 명 전용

모든 모델

워크플로

Pro

$45/
청구 금액 $0

6200 공유 월간 크레딧

1 사용자

+ 최대 4 명 추가 비용으로 추가 가능

모든 모델

워크플로

Pro Max

$170/
청구 금액 $0

24000 공유 월간 크레딧

1 사용자

+ 최대 9 명 추가 비용으로 추가 가능

모든 모델

워크플로

Enterprise

더 높은 제한

사용자 정의

가격 및 청구 조건

대용량 크레딧
맞춤형 시트 제한
모든 모델
워크플로
Pricing Gradient

Free

가볍게 사용해보기

$0

영구 무료

최대 20 크레딧
1명 전용
일부 모델
워크플로

자주 묻는 질문

Seed Audio 1.0은 무엇인가요?
Seed Audio 1.0은 ByteDance의 올인원 음성 합성 모델입니다. 텍스트 프롬프트 하나로 음성, 반주 음악, 효과음을 함께 만들어 믹싱이 끝난 완성 트랙으로 내놓습니다. 두 가지 주요 모드로 동작합니다. 모든 것이 설명에서 나오는 텍스트→오디오(T2A), 그리고 참조 클립을 더해 특정 목소리를 배역으로 정하는 텍스트+오디오→오디오(TA2A)입니다.
Seed Audio 1.0은 어떤 언어를 지원하나요?
Seed Audio 1.0은 20개 언어를 지원합니다. 영어, 중국어, 일본어, 한국어, 멕시코 스페인어, 카스티야 스페인어, 인도네시아어, 독일어, 브라질 포르투갈어, 프랑스어, 태국어, 베트남어, 말레이어, 필리핀어, 이탈리아어, 러시아어, 네덜란드어, 폴란드어, 튀르키예어, 스웨덴어입니다. 가장 좋은 결과를 얻으려면 말하게 할 대사와 같은 언어로 프롬프트를 쓰세요.
Seed Audio 1.0에서 참조 음성은 어떻게 동작하나요?
TA2A 모드에서는 각 30초 이내의 참조 클립을 최대 3개까지 넣고 프롬프트 안에서 연결해 인물마다 녹음이 대응되게 합니다. 모델은 참조에서 음성의 결과 감정을 가져와 생성 내내 유지합니다. 녹음 대신 텍스트 설명이나 캐릭터 이미지로 목소리를 정할 수도 있습니다.
Seed Audio 1.0은 목소리를 복제할 수 있나요?
네. T2A와 TA2A 외에 음성 클로닝 모드가 있습니다. 오디오 클립 하나를 올리면 복제된 목소리를 일반 음성 합성에 쓸 수 있습니다. ByteDance는 이를 클립 한 개로 하는 복제로 설명합니다. 그 목소리가 음악과 효과음, 다른 인물과 함께 한 장면 안에 들어가야 한다면 참조 클립을 세 개까지 쓰는 TA2A를 쓰세요.
Seed Audio 1.0은 대사별 길이를 제어할 수 있나요?
네. Seed Audio 1.0은 정밀한 시간 제어를 지원합니다. 대사 앞에 [5.5s:8.0s] 같은 타임스탬프를 넣으면 모델이 그 구간에 정확히 맞춰 줍니다. 대사가 화면과 맞아야 하는 더빙에서 이 모델을 쓸 수 있게 해 주는 기능입니다.
Seed Audio 1.0은 여러 화자를 한 번에 만들 수 있나요?
네. 여러 인물이 나오는 장면을 쓰고 각 목소리를 본문에서 설명하세요. Seed Audio 1.0은 한 번의 생성으로 화자마다 다른 목소리와 감정, 호흡을 주고 주변의 앰비언스와 효과음까지 함께 만듭니다.
Seed Audio 1.0의 생성 길이는 얼마나 되나요?
Seed Audio 1.0은 한 번에 최대 2분 분량의 오디오를 만들며, 프롬프트는 최대 3,000자입니다. 더 긴 작업은 장면 단위로 나눠서 만듭니다.
Seed Audio 1.0은 일반 음성 합성과 어떻게 다른가요?
일반 음성 합성은 목소리를 고르고 텍스트를 읽습니다. Seed Audio 1.0은 텍스트에서 음성으로, 다시 참조에서 오디오로 나아갑니다. 프롬프트 하나로 환경, 음악, 효과음, 인물마다의 목소리를 설명하면 모델이 장면 전체를 믹싱된 상태로 돌려줍니다. 차이는 범위입니다. 목소리만이 아니라 완성된 오디오 결과물입니다.