Geração de vídeo

Wan 3.0

por Alibaba

O modelo de vídeo da Alibaba, em beta público.
Clipes nativos de 30s de prompt, doc ou site.

Wan 3.0

Principais recursos

Recursos confirmados no lançamento do Wan 3.0 em beta público pela Alibaba, em agosto de 2026.

Especificações técnicas

Até 30s

30 segundos nativos numa geração só, com controle inteligente de duração.

480p a 1080p

Três faixas: 480p, 720p e 1080p. Não existe saída em 4K.

Beta público

No ar no Alibaba Cloud Model Studio e no Qwen Cloud, como wan3.0-video.

Só por API

Sem pesos abertos. A linha Wan aberta da Alibaba para no Wan 2.2.

Casos de uso

Relatório vira vídeo

Entregue um deck de resultados, uma planilha ou um pdf. O Wan 3.0 monta a sequência de vídeo com os dados e o texto de dentro.

Anúncio inteiro numa tomada

Trinta segundos cobrem um anúncio inteiro numa geração só, para a TV ou para o feed. Não sobra corte para emendar depois.

Série travada na referência

O Omni-Reference segura a personagem, o produto e o cenário em todos os planos. A sequência lê como uma peça só.

Exemplos de prompts

Plano-sequência

Um avanço sem cortes por uma ladeira molhada, luz das vitrines passando

Edit prompt

Continuidade de referência

A mesma entregadora de moto cruza três quarteirões, da neblina ao sol alto

Edit prompt

Revelação de produto

Giro de uma garrafa térmica de aço escovado sobre pedra escura, luz de estúdio

Edit prompt

Atuação

Uma cavaquinista termina a frase, baixa a mão e respira na luz baixa

Edit prompt

Revelação de paisagem

Recuo aéreo lento sobre um delta de rio enquanto a neblina abre no nascer do sol

Edit prompt

Tipografia no quadro

Falésia no fim da tarde com um letreiro limpo no terço inferior

Edit prompt

Visão geral

O Wan 3.0 é o modelo mais recente da linha de vídeo Wan, do Tongyi Lab da Alibaba, lançado em beta público em 6 de agosto de 2026. A Alibaba resume o salto como sair “de gerar um quadro para contar uma história inteira”. Na prática, são três coisas: clipes nativos de 30 segundos numa passada, áudio gerado junto com a imagem e uma entrada que vai além do prompt e alcança documentos, decks e páginas web. Ele roda no Alibaba Cloud Model Studio e no Qwen Cloud como o modelo wan3.0-video, com preço de API por segundo em três faixas de resolução.

Documento virando vídeo é a novidade

A capacidade que separa o Wan 3.0 do resto é o Omni-Reference. Além de texto, imagem, áudio e vídeo, ele lê arquivos estruturados: doc, xls, ppt, pdf, txt, key, pages, numbers e md, mais qualquer URL de página web. Depois monta uma sequência de vídeo com o que encontrou lá dentro. A Alibaba descreve isso como transformar “dados estáticos e cheios de texto em conteúdo de vídeo de qualidade realista”. Entregue o deck do trimestre ou a ficha técnica de um produto e o que volta é um clipe pronto, não um storyboard. Nenhum outro modelo de vídeo relevante lê documentos assim hoje.

A tomada longa, numa passada só

Trinta segundos de geração contínua é mais ou menos o dobro do que a linha fazia no Wan 2.7. O salto muda a unidade de trabalho, não só o número. Um anúncio inteiro, uma cena curta ou uma revelação lenta cabem em uma geração. Antes, essas peças eram montadas a partir de vários clipes que depois precisavam casar em luz, ritmo e continuidade. O controle inteligente de duração ajusta o tamanho ao briefing, então uma batida curta não sai esticada com segundos vazios.

Uma tomada longa também pede outro tipo de prompt. Trinta segundos precisam de arco: um começo, uma virada e um fim. Descreva como o quadro evolui, não só o que tem dentro dele. Duração sem virada é só um clipe lento, e é assim que a geração de vídeo longo costuma ser desperdiçada.

Referência e edição precisa no Wan 3.0

O Omni-Reference aceita até 20 ativos de referência. Ele segura a personagem, o produto ou o cenário ao longo do clipe e de um plano para o outro, e é isso que faz uma sequência ler como uma peça só. Rotular cada referência no prompt pesa tanto quanto enviá-la.

A edição agora vive dentro do próprio modelo, não numa ferramenta separada. O Wan 3.0 aceita edição por instrução e por referência: você seleciona um intervalo de tempo, regera só aquele trecho e o resto fica intacto. Dá para mexer no visual, na ação e até nas falas da personagem. A imprensa chinesa resumiu a mudança como sair “do gacha para a produção”, uma passada controlável no lugar de rodar de novo sem parar.

Renderização, áudio e texto

A Alibaba chama o alvo visual de “renderização de qualidade realista”, com foco claro em gente: rosto e pele detalhados, emoção natural e contida, microexpressões amarradas ao gesto. A customização de retrato desce até a estrutura óssea e o detalhe do olho. O áudio é gerado na mesma passada da imagem, então o ritmo entra no prompt. Nomeie a cama sonora, marque a batida, e som e imagem caem juntos. O texto na tela também melhorou, com renderização de texto longo em 12 idiomas e gráficos, fórmulas e infográficos mais limpos. Ainda assim, os analistas notam que a qualidade do áudio e o texto dentro do quadro têm espaço para crescer.

Resolução do Wan 3.0 e o mito do 4K

O Wan 3.0 entrega em 480p, 720p e 1080p. Não existe faixa de 4K. As alegações de “o Wan 3.0 faz 4K” que circulam na busca não vêm da Alibaba: a listagem do próprio modelo cobra exatamente três faixas e não menciona 4K em lugar nenhum. Trate o 4K, e também qualquer tabela com “60B de parâmetros” ou “pesos abertos Apache 2.0”, como invenção até a Alibaba publicar um model card.

Sobre os pesos abertos

O Wan 3.0 é fechado, só por API. Nenhum peso apareceu na organização Wan-AI do Hugging Face, na Wan-Video do GitHub nem no ModelScope. Os pesos abertos publicados pela Alibaba param no Wan 2.2, sob Apache 2.0, e as gerações 2.5, 2.6 e 2.7 foram todas modelos comerciais de API. Para um time que precisa rodar em servidor próprio, o Wan 2.2 continua sendo o Wan mais novo que dá para baixar. É esse detalhe que decide se a linha cabe ou não num pipeline self-hosted.

Wan 3.0 e o Morphic

O Wan 3.0 não está no catálogo do Morphic. O Morphic roda hoje uma linha ampla de vídeo, com Seedance, Kling e Veo, então dá para gerar vídeo agora e escolher o modelo que serve ao plano. E os hábitos de prompt acima seguem valendo em todos eles: escrever a tomada longa como um arco, rotular cada referência e colocar o ritmo dentro do prompt. Treinar isso agora não custa nada, e é o que faz você criar como profissional sem equipe nem equipamento por perto.

Preços simples

Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.

Basic

$9/ mês
cobrado como $0 por ano

1100 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Standard

$24/ mês
cobrado como $0 por ano

3625 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Pro

$45/ mês
cobrado como $0 por ano

6350 compartilhado mensal créditos

1 usuário

+ até 4 mais com custo adicional

Todos os modelos

Workflows

Pro Max

$170/ mês
cobrado como $0 por ano

24650 compartilhado mensal créditos

1 usuário

+ até 9 mais com custo adicional

Todos os modelos

Workflows

Enterprise

Para limites maiores

Personalizado

termos de preços e cobrança

Créditos de alto volume
Limites de vagas personalizados
Todos os modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

grátis para sempre

Até 20 créditos
apenas 1 usuário
Modelos limitados
Workflows

Perguntas frequentes

O que é o Wan 3.0?
O Wan 3.0 é o modelo de vídeo mais recente do Tongyi Lab, da Alibaba, em beta público desde 6 de agosto de 2026. Ele gera clipes nativos de 30 segundos em até 1080p, com áudio na mesma passada. A marca registrada é o Omni-Reference: além de texto, imagem, áudio e vídeo, ele aceita documentos, planilhas, slides, pdfs e páginas web, e monta vídeo a partir deles. Está disponível no Alibaba Cloud Model Studio e no Qwen Cloud, como o modelo wan3.0-video, com o acesso pelo wan.video chegando aos membros aos poucos.
Qual a duração dos clipes do Wan 3.0?
Até 30 segundos numa geração só, com duração inteligente: o tamanho do clipe acompanha o prompt, então uma cena curta não sai esticada com segundos vazios. É o dobro do teto de 15 segundos do Wan 2.7. E foi pensado para uma tomada contínua, não para fragmentos curtos costurados depois.
O que o Wan 3.0 cria a partir de um documento?
O Wan 3.0 aceita arquivos doc, xls, ppt, pdf, txt, key, pages, numbers e md, além de URLs de páginas web. Ele lê o conteúdo e gera uma sequência de vídeo a partir dele, o que a Alibaba descreve como transformar dados estáticos e cheios de texto em vídeo pronto. Virar vídeo a partir de documento e de página web é justamente o que mais separa o Wan 3.0 dos outros modelos de vídeo de hoje.
O Wan 3.0 escreve texto com acentos e ç no quadro?
A Alibaba diz que o texto na tela melhorou, com renderização de texto longo em 12 idiomas e gráficos, fórmulas e infográficos mais limpos. Ela não publicou quais são esses 12 idiomas, então não existe confirmação de que o português está na lista. E os próprios analistas apontam que o texto dentro do quadro ainda tem espaço para crescer. Na prática, vale testar a palavra acentuada num clipe curto antes de fechar a peça, e deixar o letreiro para a edição se o acento sair torto.
O Wan 3.0 é open source?
Não. O Wan 3.0 é um modelo fechado, só por API, e nenhum peso foi publicado no Hugging Face, no GitHub ou no ModelScope. O último flagship de vídeo com peso aberto da Alibaba continua sendo o Wan 2.2, sob Apache 2.0, lançado em 2025. Se rodar em servidor próprio é requisito, o Wan 2.2 ainda é o Wan mais novo que dá para baixar. E qualquer site anunciando pesos do Wan 3.0 ou download grátis não está oferecendo o modelo de verdade.
Como o Wan 3.0 se compara ao Seedance 2.5?
Os dois chegaram com poucos dias de diferença no começo de agosto de 2026, e os dois geram clipes de 30 segundos numa passada só, com áudio. O Seedance 2.5 aceita mais entradas de referência, até 50 entre imagem, vídeo e áudio. Já o diferencial do Wan 3.0 é montar vídeo a partir de documentos e páginas web. Nenhum dos dois tem benchmark independente ainda, e ambos são lançamentos fechados, só por API, então qualquer comparação hoje se apoia em demonstração, não em nota medida.