Seed Audio 1.0
ByteDance 제공
ByteDance의 올인원 TTS 모델.
음성, 음악, 효과음을 한 번의 생성으로.

주요 기능
사운드의 범위 듣기
따뜻하고 차분한 다큐멘터리 내레이션.
낮고 긴장된, 가깝고 은밀한 대사 낭독.
겹겹이 쌓인 야외 시장 사운드 베드.
몰아치다 먼 천둥소리로 커지는 폭풍.
현악과 금관의 짧게 고조되는 큐.
부드러운 건반과 바이닐 잡음이 있는 편안한 비트.
기술 사양
ByteDance
ByteDance의 Seed 연구팀이 개발했습니다.
20
영어, 중국어, 일본어, 한국어, 스페인어, 프랑스어, 독일어 등.
최대 2분
한 번의 생성당 최대 2분 분량의 오디오.
3,000자
대사까지 담은 장면 브리프를 쓸 수 있는 분량.
최대 3개
각 30초 이내의 참조 클립을 최대 3개까지.
논스트리밍
실시간 스트림이 아니라 완성 트랙을 렌더링합니다.
활용 사례
오디오북
책 한 권 분량을 녹음실 없이. ByteDance는 비용을 스튜디오의 10분의 1 수준으로 봅니다.
영상 더빙
목소리를 설명하거나 인물 이미지를 올리고, 타임스탬프로 대사를 화면에 맞춥니다.
게임 오디오
인물 대사, 연기된 장면, 환경 효과음을 대본에서 바로 만들어 냅니다.
영상 오디오 한 번에
내레이션, 사운드 디자인, 음악을 한 번의 생성으로. 이후 믹싱 단계가 없습니다.
광고와 프로모
대사, 효과음, 음악이 바로 쓸 수 있는 트랙 하나로. 숏폼 콘텐츠에 맞춥니다.
대화와 오디오 드라마
여러 인물이 각자 목소리와 연기로, 어울리는 앰비언스와 호흡의 장면을 만듭니다.
프롬프트 예시
개요
Seed Audio 1.0은 ByteDance의 올인원 오디오 모델로, 음성 합성과 결별하는 대신 그다음 단계로 만들어졌습니다. 전통적인 오디오 작업은 음성, 음악, 효과음을 각각 다른 도구로 따로 만든 뒤 믹싱합니다. Seed Audio 1.0은 텍스트 프롬프트 하나로 셋을 함께 만들고, 결과물은 바로 쓸 수 있는 완성 오디오 트랙입니다.
텍스트에서 음성으로, 다시 참조에서 오디오로
기존 TTS는 목소리 하나와 텍스트 덩어리를 받습니다. Seed Audio 1.0은 장면을 받습니다. 날씨와 공간, 그 아래 깔리는 음악, 동작 주변의 효과음, 인물마다의 생김새와 목소리, 그리고 그들이 하는 대사까지. 설명할 수 있는 모든 것이 같은 생성의 일부가 되며, 프롬프트가 군더더기 없이 3,000자까지 늘어날 수 있는 이유가 여기 있습니다.
모델은 장면의 맥락을 이해합니다. 카페 대화 프롬프트에는 밋밋한 룸톤이 아니라 주변의 웅성거림과 알맞은 음향 공간이 따라옵니다. 액션 장면에는 정적 위에 얹은 배경음악이 아니라 날카로운 효과음과 역동적인 음악이 붙습니다. 세 겹은 따로 내보낸 파일을 이어 붙인 것이 아니라, 장면에 맞게 비율이 잡히고 믹싱된 채로 나옵니다.
네 가지 모드
가장 단순한 것은 음성 합성입니다. 목소리를 고르고 텍스트를 넣으면 모델이 읽습니다. 음성 클로닝은 여기에 한 단계를 더합니다. 오디오 클립 하나를 올리면 복제된 목소리를 같은 음성 합성에 쓸 수 있습니다. 나머지 두 모드가 이 모델을 일반 TTS와 갈라놓는 지점입니다.
텍스트→오디오(T2A) 에서는 모든 목소리가 설명에서 나옵니다. 인물의 나이, 억양, 감정, 톤, 속도를 적으면 모델이 배역을 정합니다.
텍스트+오디오→오디오(TA2A) 에서는 각 30초 이내의 참조 클립을 최대 3개까지 올리고 프롬프트 안에서 각각을 인물에 연결합니다. 그러면 생성되는 목소리가 설명이 아니라 녹음을 따라갑니다. 참조 클립은 한 작업에만 올려 쓸 수도 있고, 에셋 라이브러리에 두고 시리즈 전체에서 재사용할 수도 있습니다.
스무 개 언어
Seed Audio 1.0은 영어, 중국어, 일본어, 한국어, 멕시코 스페인어, 카스티야 스페인어, 인도네시아어, 독일어, 브라질 포르투갈어, 프랑스어, 태국어, 베트남어, 말레이어, 필리핀어, 이탈리아어, 러시아어, 네덜란드어, 폴란드어, 튀르키예어, 스웨덴어로 생성합니다. 프롬프트 언어와 대본 언어는 같아야 합니다. 인물이 말하는 언어로 브리프를 쓰세요.
초 단위로 정할 수 있는 타이밍
Seed Audio 1.0은 어느 대사에나 타임스탬프를 받습니다. 줄 안에 [5.5s:8.0s]처럼 적으면 그 구간에 정확히 맞춰 연기를 넣습니다. 더빙에서는 대충 맞는 오디오와 컷에 정확히 떨어지는 오디오의 차이가 됩니다. 생성은 논스트리밍이라, 모델이 최대 2분 길이의 완성 트랙을 한 번에 렌더링합니다.
간단한 가격
오늘 무료로 시작하고 언제든지 업그레이드하거나 취소할 수 있습니다.
Basic
1100 월간 크레딧
1 명 전용
모든 모델
워크플로
Standard
3625 월간 크레딧
1 명 전용
모든 모델
워크플로
Pro
6350 공유 월간 크레딧
1 사용자
모든 모델
워크플로
Pro Max
24650 공유 월간 크레딧
1 사용자
모든 모델
워크플로
Enterprise
더 높은 제한
사용자 정의
가격 및 청구 조건

Free
가볍게 사용해보기
$0
영구 무료