비디오 생성

Wan 3.0

Alibaba 제공

Alibaba의 최신 영상 모델, 퍼블릭 베타.
문서와 웹페이지에서 30초 클립.

Wan 3.0

주요 기능

위 기능은 2026년 8월 Alibaba의 Wan 3.0 퍼블릭 베타 공개 내용을 기준으로 정리했습니다.

기술 사양

최대 30초

한 번의 실행에서 30초까지 나오며, 길이는 자동으로 조절됩니다.

480p~1080p

480p, 720p, 1080p 세 등급입니다. 4K 출력은 없습니다.

퍼블릭 베타

Alibaba Cloud Model Studio와 Qwen Cloud에 wan3.0-video로 올라와 있습니다.

API 전용

공개 가중치는 없습니다. Alibaba의 오픈 Wan 계열은 Wan 2.2에서 멈춰 있습니다.

활용 사례

보고서를 영상으로

발표 자료와 스프레드시트, pdf를 넘기면 Wan 3.0이 그 안의 수치와 문구로 영상 시퀀스를 짭니다.

광고 한 편을 한 번에

30초 클립 하나면 광고 한 편이 생성 한 번으로 끝납니다. 나중에 컷을 잇고 톤을 맞출 일이 없습니다.

레퍼런스를 고정한 시리즈

Omni-Reference가 캐릭터와 제품, 세트를 모든 컷에서 같은 모습으로 붙잡습니다. 시리즈가 한 편의 작업처럼 읽힙니다.

프롬프트 예시

긴 원테이크

비 온 뒤 골목을 끊지 않고 한 번에 밀고 들어가는 컷, 젖은 노면에 가로등 빛이 번집니다

Edit prompt

레퍼런스 유지

같은 배달 라이더가 도심 세 블록을 지나갑니다, 아침 안개에서 한낮의 강한 빛까지

Edit prompt

제품 리빌

상세페이지용 앰플 한 병이 어두운 석재 위에서 천천히 도는 스튜디오 조명 컷

Edit prompt

연기 장면

해금 연주자가 한 소절을 끝내고 활을 내린 뒤 숨을 고릅니다, 낮은 조도

Edit prompt

풍경 리빌

해 뜰 무렵 안개가 걷히는 강 하구에서 천천히 뒤로 빠지는 항공 샷

Edit prompt

화면 속 자막

골든아워의 해안 절벽, 화면 아래에 자막 카드가 깔끔하게 들어갑니다

Edit prompt

개요

Wan 3.0은 Alibaba Tongyi Lab의 Wan 영상 모델 계열에서 가장 최신 버전입니다. 2026년 8월 6일 퍼블릭 베타로 공개되었습니다.

Alibaba는 이 모델을 두고 “한 프레임을 만드는 일에서 이야기 한 편을 들려주는 일로” 넘어갔다고 설명합니다. 한 번에 30초 클립이 나옵니다. 오디오는 화면과 함께 생성됩니다. 입력은 프롬프트에서 끝나지 않고 문서와 발표 자료, 웹페이지까지 갑니다.

실행 환경은 Alibaba Cloud Model Studio와 Qwen Cloud이고, 모델 이름은 wan3.0-video입니다. 해상도는 세 등급이며 API 요금은 초 단위로 매겨집니다.

문서를 영상으로 바꾸는 기능이 핵심입니다

Wan 3.0을 다른 모델과 갈라놓는 것은 Omni-Reference입니다. 텍스트와 이미지, 오디오, 영상은 기본입니다. 여기에 doc, xls, ppt, pdf, txt, key, pages, numbers, md 파일과 웹페이지 URL을 읽습니다. 그리고 그 안에 있는 내용으로 영상 시퀀스를 짭니다.

Alibaba는 이를 정적이고 텍스트가 많은 데이터를 현실 수준의 영상 콘텐츠로 바꾸는 일이라고 표현합니다. 분기 실적 자료나 제품 사양서를 넘기면 스토리보드가 아니라 완성된 클립이 돌아옵니다. 지금 주류 영상 모델 가운데 문서를 이런 방식으로 읽는 모델은 없습니다.

30초를 한 번에

한 번에 30초는 Wan 2.7 대비 약 두 배입니다. 숫자만 늘어난 것이 아니라 작업 단위가 바뀝니다. 광고 한 편이나 짧은 장면, 느린 리빌이 생성 한 번 안에 들어갑니다. 여러 클립을 이어 붙이고 빛과 속도, 연결을 다시 맞출 일이 사라집니다. 길이는 브리프에 맞춰 자동으로 정해지므로 짧은 장면을 빈 초로 늘리지 않습니다.

긴 컷은 프롬프트 쓰는 법도 다릅니다. 30초에는 흐름이 필요합니다. 시작이 있고 전환이 있고 마무리가 있어야 합니다. 그래서 브리프에는 화면에 무엇이 있는지보다 화면이 어떻게 변해 가는지를 적어야 합니다. 전환 없는 길이는 그저 느린 클립일 뿐입니다. 롱폼 생성이 낭비되는 가장 흔한 이유가 여기에 있습니다.

레퍼런스 고정과 구간 편집

Omni-Reference는 레퍼런스를 최대 20개까지 받습니다. 캐릭터와 제품, 세트를 클립 안에서도 컷 사이에서도 같은 모습으로 유지합니다. 시리즈가 한 편의 작업처럼 읽히는 이유입니다. 레퍼런스는 넣는 것만큼 프롬프트에서 이름을 붙여 주는 일이 중요합니다.

편집도 별도 툴이 아니라 같은 모델 안에서 이뤄집니다. Wan 3.0은 지시 기반 편집과 레퍼런스 기반 편집을 지원합니다. 시간 구간을 골라 그 부분만 다시 생성하고 나머지는 그대로 둡니다. 비주얼과 동작은 물론 인물의 대사까지 손볼 수 있습니다. 중국 매체는 이 변화를 뽑기에서 제작으로 넘어간 것이라고 표현했습니다. 끝없는 재시도 대신 통제할 수 있는 한 번의 작업이라는 뜻입니다.

화질과 오디오, 화면 속 텍스트

Alibaba가 내건 목표는 현실 수준의 렌더링이고, 초점은 사람에게 맞춰져 있습니다. 얼굴과 피부의 디테일, 절제된 자연스러운 감정, 손동작에 맞물리는 미세 표정이 여기에 들어갑니다. 인물 커스터마이징은 골격과 눈 디테일까지 내려갑니다.

오디오는 화면과 같은 패스에서 생성됩니다. 그래서 박자를 프롬프트에 적어야 합니다. 사운드의 결을 지정하고 비트가 들어갈 지점을 표시하면 화면과 소리가 함께 떨어집니다.

화면 속 텍스트도 좋아졌습니다. 12개 언어 장문 텍스트 렌더링을 지원하고 도표와 수식, 인포그래픽이 한결 정돈됐습니다. 다만 리뷰어들은 오디오 품질과 화면 속 텍스트에 아직 나아질 여지가 있다고 지적합니다.

해상도, 그리고 4K 소문

Wan 3.0의 출력은 480p, 720p, 1080p입니다. 4K 등급은 없습니다. 검색 결과에 도는 Wan 3.0의 4K 지원 이야기는 Alibaba에서 나온 것이 아닙니다. 자체 모델 목록에는 정확히 세 등급의 요금만 있고 4K는 어디에도 없습니다. 60B 파라미터나 Apache 2.0 오픈 가중치를 적어 둔 사양표도 돕니다. 4K와 마찬가지입니다. Alibaba가 모델 카드를 내놓기 전까지는 지어낸 정보로 보시면 됩니다.

오픈 가중치에 대해

Wan 3.0은 API로만 쓰는 비공개 모델입니다. Wan-AI Hugging Face 조직에도, Wan-Video GitHub 조직에도 가중치가 올라온 적이 없습니다. ModelScope도 마찬가지입니다. Alibaba가 공개한 오픈 가중치는 Apache 2.0의 Wan 2.2에서 멈춰 있습니다. 2.5와 2.6, 2.7 세대는 모두 상용 API 모델이었습니다. 자체 서버에 올려야 하는 조건이라면 지금도 내려받을 수 있는 최신 Wan은 2.2입니다. 이 계열이 자체 호스팅 파이프라인에 맞는지는 결국 이 지점에서 갈립니다.

Wan 3.0과 Morphic

Wan 3.0은 Morphic 카탈로그에 없습니다. 대신 Morphic에는 Seedance와 Kling, Veo를 포함한 영상 모델이 넓게 올라와 있습니다. 지금 바로 영상을 만들고 컷에 맞는 모델을 고르시면 됩니다.

위에서 정리한 프롬프트 습관은 어느 모델에서나 그대로 통합니다. 긴 컷을 흐름으로 쓰는 일, 레퍼런스마다 이름을 붙이는 일, 박자를 프롬프트에 넣는 일입니다. 지금 손에 익혀 두어도 손해 볼 것이 없습니다. 무료 플랜으로 시작해 보세요.

간단한 가격

오늘 무료로 시작하고 언제든지 업그레이드하거나 취소할 수 있습니다.

Basic

$9/
청구 금액 $0

1100 월간 크레딧

1 명 전용

모든 모델

워크플로

Standard

$24/
청구 금액 $0

3625 월간 크레딧

1 명 전용

모든 모델

워크플로

Pro

$45/
청구 금액 $0

6350 공유 월간 크레딧

1 사용자

+ 최대 4 명 추가 비용으로 추가 가능

모든 모델

워크플로

Pro Max

$170/
청구 금액 $0

24650 공유 월간 크레딧

1 사용자

+ 최대 9 명 추가 비용으로 추가 가능

모든 모델

워크플로

Enterprise

더 높은 제한

사용자 정의

가격 및 청구 조건

대용량 크레딧
맞춤형 시트 제한
모든 모델
워크플로
Pricing Gradient

Free

가볍게 사용해보기

$0

영구 무료

최대 20 크레딧
1명 전용
일부 모델
워크플로

자주 묻는 질문

Wan 3.0은 무엇인가요?
Wan 3.0은 Alibaba Tongyi Lab의 최신 영상 모델입니다. 2026년 8월 6일부터 퍼블릭 베타로 열려 있습니다. 한 번에 30초, 최대 1080p 클립을 만들고 오디오도 같은 패스에서 생성합니다. 대표 기능은 Omni-Reference입니다. 텍스트와 이미지, 오디오, 영상은 기본입니다. 여기에 문서와 스프레드시트, 슬라이드, pdf, 웹페이지까지 받아 그 내용으로 영상을 만듭니다. Alibaba Cloud Model Studio와 Qwen Cloud에서 wan3.0-video라는 이름으로 쓸 수 있습니다.
Wan 3.0 클립은 몇 초까지 나오나요?
한 번의 실행에서 30초까지 나옵니다. 길이는 프롬프트에 맞춰 자동으로 정해지므로 짧은 장면을 빈 초로 늘리지 않습니다. Wan 2.7의 15초 상한과 비교하면 두 배입니다. 짧은 조각을 이어 붙이는 방식이 아니라 끊기지 않는 한 컷을 염두에 두고 만들어졌습니다.
화면 속 한글 텍스트도 제대로 나오나요?
Alibaba는 12개 언어 장문 텍스트 렌더링과 함께 도표, 수식, 인포그래픽이 정돈됐다고 밝혔습니다. 다만 언어별 렌더링 성능은 따로 공개하지 않았습니다. 리뷰어들도 오디오 품질과 화면 속 텍스트에는 아직 나아질 여지가 있다고 지적합니다. 자막이나 상세페이지 문구처럼 한글이 정확해야 하는 작업이라면 소량으로 먼저 확인해 보세요.
Wan 3.0은 오픈소스인가요?
아닙니다. Wan 3.0은 API로만 쓰는 비공개 모델입니다. Hugging Face와 GitHub, ModelScope 어디에도 가중치가 올라온 적이 없습니다. Alibaba가 공개한 마지막 오픈 가중치 영상 플래그십은 2025년에 Apache 2.0으로 나온 Wan 2.2입니다. 자체 서버에 올려야 한다면 지금도 내려받을 수 있는 최신 Wan은 2.2입니다. Wan 3.0 가중치나 무료 다운로드를 내건 사이트는 진짜 모델을 주는 곳이 아닙니다.
Wan 3.0은 문서로 무엇을 만들 수 있나요?
받는 형식은 doc, xls, ppt, pdf, txt, key, pages, numbers, md 파일과 웹페이지 URL입니다. 내용을 읽고 거기서 영상 시퀀스를 만들어 냅니다. Alibaba는 이를 정적이고 텍스트가 많은 데이터를 완성된 영상으로 바꾸는 일이라고 설명합니다. 문서와 웹페이지를 영상으로 바꾸는 이 능력이 다른 영상 모델과 Wan 3.0을 가르는 핵심입니다.
Wan 3.0과 Seedance 2.5는 어떻게 다른가요?
두 모델은 2026년 8월 초에 며칠 사이로 나왔습니다. 둘 다 오디오가 얹힌 30초 클립을 한 번에 만듭니다. 레퍼런스 입력은 Seedance 2.5가 더 많이 받습니다. 이미지와 영상, 오디오를 합쳐 최대 50개입니다. Wan 3.0의 차별점은 문서와 웹페이지에서 영상을 만드는 쪽입니다. 아직 어느 쪽도 독립 벤치마크가 없고 둘 다 API 전용 비공개 모델입니다. 그래서 지금의 비교는 측정된 점수가 아니라 데모에 기대고 있습니다.