Wan 3.0
por Alibaba
O modelo de vídeo da Alibaba, em beta público.
Clipes nativos de 30s de prompt, doc ou site.

Principais recursos
Recursos confirmados no lançamento do Wan 3.0 em beta público pela Alibaba, em agosto de 2026.
Especificações técnicas
Até 30s
30 segundos nativos numa geração só, com controle inteligente de duração.
480p a 1080p
Três faixas: 480p, 720p e 1080p. Não existe saída em 4K.
Beta público
No ar no Alibaba Cloud Model Studio e no Qwen Cloud, como wan3.0-video.
Só por API
Sem pesos abertos. A linha Wan aberta da Alibaba para no Wan 2.2.
Casos de uso
Relatório vira vídeo
Entregue um deck de resultados, uma planilha ou um pdf. O Wan 3.0 monta a sequência de vídeo com os dados e o texto de dentro.
Anúncio inteiro numa tomada
Trinta segundos cobrem um anúncio inteiro numa geração só, para a TV ou para o feed. Não sobra corte para emendar depois.
Série travada na referência
O Omni-Reference segura a personagem, o produto e o cenário em todos os planos. A sequência lê como uma peça só.
Exemplos de prompts
Continuidade de referência
A mesma entregadora de moto cruza três quarteirões, da neblina ao sol alto
Edit promptRevelação de produto
Giro de uma garrafa térmica de aço escovado sobre pedra escura, luz de estúdio
Edit promptRevelação de paisagem
Recuo aéreo lento sobre um delta de rio enquanto a neblina abre no nascer do sol
Edit promptVisão geral
O Wan 3.0 é o modelo mais recente da linha de vídeo Wan, do Tongyi Lab da Alibaba, lançado em beta público em 6 de agosto de 2026. A Alibaba resume o salto como sair “de gerar um quadro para contar uma história inteira”. Na prática, são três coisas: clipes nativos de 30 segundos numa passada, áudio gerado junto com a imagem e uma entrada que vai além do prompt e alcança documentos, decks e páginas web. Ele roda no Alibaba Cloud Model Studio e no Qwen Cloud como o modelo wan3.0-video, com preço de API por segundo em três faixas de resolução.
Documento virando vídeo é a novidade
A capacidade que separa o Wan 3.0 do resto é o Omni-Reference. Além de texto, imagem, áudio e vídeo, ele lê arquivos estruturados: doc, xls, ppt, pdf, txt, key, pages, numbers e md, mais qualquer URL de página web. Depois monta uma sequência de vídeo com o que encontrou lá dentro. A Alibaba descreve isso como transformar “dados estáticos e cheios de texto em conteúdo de vídeo de qualidade realista”. Entregue o deck do trimestre ou a ficha técnica de um produto e o que volta é um clipe pronto, não um storyboard. Nenhum outro modelo de vídeo relevante lê documentos assim hoje.
A tomada longa, numa passada só
Trinta segundos de geração contínua é mais ou menos o dobro do que a linha fazia no Wan 2.7. O salto muda a unidade de trabalho, não só o número. Um anúncio inteiro, uma cena curta ou uma revelação lenta cabem em uma geração. Antes, essas peças eram montadas a partir de vários clipes que depois precisavam casar em luz, ritmo e continuidade. O controle inteligente de duração ajusta o tamanho ao briefing, então uma batida curta não sai esticada com segundos vazios.
Uma tomada longa também pede outro tipo de prompt. Trinta segundos precisam de arco: um começo, uma virada e um fim. Descreva como o quadro evolui, não só o que tem dentro dele. Duração sem virada é só um clipe lento, e é assim que a geração de vídeo longo costuma ser desperdiçada.
Referência e edição precisa no Wan 3.0
O Omni-Reference aceita até 20 ativos de referência. Ele segura a personagem, o produto ou o cenário ao longo do clipe e de um plano para o outro, e é isso que faz uma sequência ler como uma peça só. Rotular cada referência no prompt pesa tanto quanto enviá-la.
A edição agora vive dentro do próprio modelo, não numa ferramenta separada. O Wan 3.0 aceita edição por instrução e por referência: você seleciona um intervalo de tempo, regera só aquele trecho e o resto fica intacto. Dá para mexer no visual, na ação e até nas falas da personagem. A imprensa chinesa resumiu a mudança como sair “do gacha para a produção”, uma passada controlável no lugar de rodar de novo sem parar.
Renderização, áudio e texto
A Alibaba chama o alvo visual de “renderização de qualidade realista”, com foco claro em gente: rosto e pele detalhados, emoção natural e contida, microexpressões amarradas ao gesto. A customização de retrato desce até a estrutura óssea e o detalhe do olho. O áudio é gerado na mesma passada da imagem, então o ritmo entra no prompt. Nomeie a cama sonora, marque a batida, e som e imagem caem juntos. O texto na tela também melhorou, com renderização de texto longo em 12 idiomas e gráficos, fórmulas e infográficos mais limpos. Ainda assim, os analistas notam que a qualidade do áudio e o texto dentro do quadro têm espaço para crescer.
Resolução do Wan 3.0 e o mito do 4K
O Wan 3.0 entrega em 480p, 720p e 1080p. Não existe faixa de 4K. As alegações de “o Wan 3.0 faz 4K” que circulam na busca não vêm da Alibaba: a listagem do próprio modelo cobra exatamente três faixas e não menciona 4K em lugar nenhum. Trate o 4K, e também qualquer tabela com “60B de parâmetros” ou “pesos abertos Apache 2.0”, como invenção até a Alibaba publicar um model card.
Sobre os pesos abertos
O Wan 3.0 é fechado, só por API. Nenhum peso apareceu na organização Wan-AI do Hugging Face, na Wan-Video do GitHub nem no ModelScope. Os pesos abertos publicados pela Alibaba param no Wan 2.2, sob Apache 2.0, e as gerações 2.5, 2.6 e 2.7 foram todas modelos comerciais de API. Para um time que precisa rodar em servidor próprio, o Wan 2.2 continua sendo o Wan mais novo que dá para baixar. É esse detalhe que decide se a linha cabe ou não num pipeline self-hosted.
Wan 3.0 e o Morphic
O Wan 3.0 não está no catálogo do Morphic. O Morphic roda hoje uma linha ampla de vídeo, com Seedance, Kling e Veo, então dá para gerar vídeo agora e escolher o modelo que serve ao plano. E os hábitos de prompt acima seguem valendo em todos eles: escrever a tomada longa como um arco, rotular cada referência e colocar o ritmo dentro do prompt. Treinar isso agora não custa nada, e é o que faz você criar como profissional sem equipe nem equipamento por perto.
Preços simples
Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.
Basic
1100 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Standard
3625 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Pro
6350 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Pro Max
24650 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Enterprise
Para limites maiores
Personalizado
termos de preços e cobrança

Free
Para experimentar
$0
grátis para sempre
Perguntas frequentes
ChatGPT Images 2.5
OpenAI
Detalhe mais nítido e edição que não bagunça o resto do quadro. O modelo de imagem da OpenAI, de setembro de 2026.
Lyria 3.5
Google DeepMind
O melhor modelo de música do Google. Músicas inteiras, com voz e letra.
MiniMax H3 Max Turbo
fal.ai
O nível rápido do H3 da fal. O dobro da velocidade, quase igual.
Inworld TTS 2
Inworld
Noventa e cinco vozes, 100+ idiomas. A fala começa em menos de um segundo.