Wan 3.0
de Alibaba
Modelo de video de Alibaba, en beta pública.
Clips nativos de 30s desde texto, docs o sitios.

Funciones clave
Funciones confirmadas en el lanzamiento en beta pública de Wan 3.0 de Alibaba, agosto de 2026.
Especificaciones técnicas
Hasta 30s
30 segundos nativos en una sola corrida, con control de duración inteligente.
480p a 1080p
Tres niveles: 480p, 720p y 1080p. No hay salida en 4K.
Beta pública
Activo en Alibaba Cloud Model Studio y en Qwen Cloud como wan3.0-video.
Solo API
Sin pesos abiertos. La línea abierta de Alibaba se detiene en Wan 2.2.
Casos de uso
Del reporte al video
Le das la presentación del trimestre, una hoja o un pdf. Arma una secuencia con los datos y el texto de adentro.
Un anuncio en una sola toma
Treinta segundos alcanzan para el spot completo de tu emprendimiento, en una generación, sin cortes que empatar después.
Serie fiel a la referencia
Omni-Reference sostiene al mismo personaje, producto o local en todas las tomas, así la serie se lee como una sola pieza.
Ejemplos de prompts
Toma larga continua
Un solo plano avanza por un mercado al amanecer, los toldos se van abriendo
Edit promptContinuidad con referencias
El mismo repartidor en moto cruza tres cuadras, de la neblina al mediodía
Edit promptRevelación de producto
Un frasco de salsa artesanal gira sobre piedra oscura, luz de estudio suave
Edit promptInterpretación de personaje
Un guitarrista cierra la última frase, baja la mano y respira, luz tenue
Edit promptPaisaje que se revela
Retroceso aéreo lento sobre un valle de agaves mientras se levanta la niebla
Edit promptTipografía en cuadro
Acantilado costero a la hora dorada con un titular limpio en la parte baja
Edit promptDescripción general
Wan 3.0 es el modelo más reciente de la línea de video Wan, del Tongyi Lab de Alibaba. Salió en beta pública el 6 de agosto de 2026. Alibaba lo resume como el salto “de generar un cuadro a contar una historia completa”. En la práctica son tres cosas. Clips nativos de 30 segundos en una sola pasada. Audio que nace junto con la imagen. Y una entrada que ya no se limita al prompt: también lee documentos, presentaciones y páginas web. Corre en Alibaba Cloud Model Studio y en Qwen Cloud como el modelo wan3.0-video. El cobro es por segundo, en tres niveles de resolución.
El video desde documentos es lo grande
La función que separa a Wan 3.0 del resto se llama Omni-Reference. Además de texto, imagen, audio y video, lee archivos estructurados: doc, xls, ppt, pdf, txt, key, pages, numbers y md, más cualquier URL de una página web. Con eso adentro arma una secuencia de video. Alibaba lo plantea como convertir “datos estáticos y cargados de texto en contenido de video de nivel realidad”. Le pasas la presentación del trimestre o la ficha técnica de un producto. Lo que sale es un clip terminado, no un storyboard. Hoy ningún otro modelo de video de uso masivo lee documentos así.
La toma larga, en una sola pasada
Treinta segundos continuos son casi el doble de lo que daba la línea en Wan 2.7. Lo que cambia ahí no es la cifra, sino la unidad de trabajo. Un spot completo, una escena corta o una revelación lenta caben dentro de una sola generación. Ya no hay que armarlas con varios clips que después se emparejan en luz, ritmo y continuidad. El control de duración inteligente ajusta el largo a lo que pediste. Un momento breve no se rellena con segundos vacíos.
Una toma larga también pide otro tipo de prompt. Treinta segundos necesitan un arco: un inicio, un giro y un final. Por eso conviene describir cómo evoluciona el cuadro y no solo qué hay dentro de él. Sin ese giro sale apenas un clip lento. Es la forma más común de desperdiciar la generación larga.
Referencias y edición precisa
Omni-Reference acepta hasta 20 archivos de referencia. Sostiene a un personaje, un producto o un set parejo dentro del clip y de una toma a otra. Eso es lo que hace que una secuencia se lea como una sola pieza. Etiquetar cada referencia en el prompt pesa tanto como subirla.
La edición ya vive dentro del mismo modelo y no en una herramienta aparte. Wan 3.0 admite edición por instrucción y por referencia: seleccionas un intervalo de tiempo y regeneras solo esa parte. El resto queda intacto. También ajustas lo visual, la acción y hasta las líneas de un personaje. La prensa china describió el cambio como pasar “de la gacha a la producción”. Es una pasada controlable en lugar de tiradas infinitas.
Render, audio y texto
Alibaba llama a su objetivo visual “render de nivel realidad”, con el foco puesto en las personas: rostros y piel con detalle, emoción natural y contenida, microexpresiones amarradas a los gestos. La personalización del retrato llega hasta la estructura ósea y el detalle del ojo. El audio se genera en la misma pasada que la imagen, así que el ritmo se escribe en el prompt: nombra la base sonora, marca el golpe y la imagen y el sonido caen juntos. El texto en pantalla también mejoró, con textos largos en 12 idiomas y gráficas, fórmulas e infografías más limpias. Aun así, quienes lo probaron señalan que la calidad del audio y el texto dentro del cuadro todavía tienen camino por recorrer.
La resolución y el mito del 4K
Wan 3.0 sale en 480p, 720p y 1080p. No hay nivel 4K. Las afirmaciones de “Wan 3.0 en 4K” que circulan en los resultados de búsqueda no vienen de Alibaba: su propio listado del modelo cobra exactamente tres niveles y en ninguna parte menciona 4K. Trata el 4K como un invento hasta que Alibaba publique una ficha del modelo. Lo mismo con las tablas de especificaciones que hablan de “60B de parámetros” o de “pesos abiertos Apache 2.0”.
Sobre los pesos abiertos
Wan 3.0 es un modelo cerrado, solo por API. No han aparecido pesos en la organización Wan-AI de Hugging Face, en la organización Wan-Video de GitHub ni en ModelScope. Los pesos abiertos que Alibaba sí publicó se detienen en Wan 2.2, bajo Apache 2.0. Las generaciones 2.5, 2.6 y 2.7 fueron todas modelos comerciales por API. Para un equipo que necesita autoalojar, Wan 2.2 sigue siendo el Wan descargable más nuevo. Ese detalle define si la línea encaja o no en una infraestructura propia.
Wan 3.0 y Morphic
Wan 3.0 no está en el catálogo de Morphic. Hoy Morphic corre una línea amplia de video, con Seedance, Kling y Veo entre sus modelos. Puedes generar video ahora mismo y elegir el que le queda a cada toma. Los hábitos de prompt de arriba se trasladan a todos: escribir la toma larga como un arco, etiquetar cada referencia y meter el ritmo dentro del prompt. Practicarlos desde hoy no te cuesta nada.
Precios simples
Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.
Basic
1100 mensual créditos
1 usuario
Todos los modelos
Workflows
Standard
3625 mensual créditos
1 usuario
Todos los modelos
Workflows
Pro
6350 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Pro Max
24650 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Enterprise
Para límites más altos
Personalizado
términos de precios y facturación

Free
Para experimentar
$0
gratis para siempre
Preguntas frecuentes
ChatGPT Images 2.5
OpenAI
El modelo de imagen de OpenAI, de septiembre de 2026. Más detalle, ediciones precisas, más rápido.
Lyria 3.5
Google DeepMind
El mejor modelo musical de Google. Canciones con estructura, voz y letra.
MiniMax H3 Max Turbo
fal.ai
El nivel rápido del H3 afinado por fal. El doble de rápido, casi igual de bueno.
Inworld TTS 2
Inworld
95 voces y más de 100 idiomas. La voz arranca en menos de un segundo.