Generación de video

Wan 3.0

de Alibaba

Modelo de video de Alibaba, en beta pública.
Clips nativos de 30s desde texto, docs o sitios.

Wan 3.0

Funciones clave

Funciones confirmadas en el lanzamiento en beta pública de Wan 3.0 de Alibaba, agosto de 2026.

Especificaciones técnicas

Hasta 30s

30 segundos nativos en una sola corrida, con control de duración inteligente.

480p a 1080p

Tres niveles: 480p, 720p y 1080p. No hay salida en 4K.

Beta pública

Activo en Alibaba Cloud Model Studio y en Qwen Cloud como wan3.0-video.

Solo API

Sin pesos abiertos. La línea abierta de Alibaba se detiene en Wan 2.2.

Casos de uso

Del reporte al video

Le das la presentación del trimestre, una hoja o un pdf. Arma una secuencia con los datos y el texto de adentro.

Un anuncio en una sola toma

Treinta segundos alcanzan para el spot completo de tu emprendimiento, en una generación, sin cortes que empatar después.

Serie fiel a la referencia

Omni-Reference sostiene al mismo personaje, producto o local en todas las tomas, así la serie se lee como una sola pieza.

Ejemplos de prompts

Toma larga continua

Un solo plano avanza por un mercado al amanecer, los toldos se van abriendo

Edit prompt

Continuidad con referencias

El mismo repartidor en moto cruza tres cuadras, de la neblina al mediodía

Edit prompt

Revelación de producto

Un frasco de salsa artesanal gira sobre piedra oscura, luz de estudio suave

Edit prompt

Interpretación de personaje

Un guitarrista cierra la última frase, baja la mano y respira, luz tenue

Edit prompt

Paisaje que se revela

Retroceso aéreo lento sobre un valle de agaves mientras se levanta la niebla

Edit prompt

Tipografía en cuadro

Acantilado costero a la hora dorada con un titular limpio en la parte baja

Edit prompt

Descripción general

Wan 3.0 es el modelo más reciente de la línea de video Wan, del Tongyi Lab de Alibaba. Salió en beta pública el 6 de agosto de 2026. Alibaba lo resume como el salto “de generar un cuadro a contar una historia completa”. En la práctica son tres cosas. Clips nativos de 30 segundos en una sola pasada. Audio que nace junto con la imagen. Y una entrada que ya no se limita al prompt: también lee documentos, presentaciones y páginas web. Corre en Alibaba Cloud Model Studio y en Qwen Cloud como el modelo wan3.0-video. El cobro es por segundo, en tres niveles de resolución.

El video desde documentos es lo grande

La función que separa a Wan 3.0 del resto se llama Omni-Reference. Además de texto, imagen, audio y video, lee archivos estructurados: doc, xls, ppt, pdf, txt, key, pages, numbers y md, más cualquier URL de una página web. Con eso adentro arma una secuencia de video. Alibaba lo plantea como convertir “datos estáticos y cargados de texto en contenido de video de nivel realidad”. Le pasas la presentación del trimestre o la ficha técnica de un producto. Lo que sale es un clip terminado, no un storyboard. Hoy ningún otro modelo de video de uso masivo lee documentos así.

La toma larga, en una sola pasada

Treinta segundos continuos son casi el doble de lo que daba la línea en Wan 2.7. Lo que cambia ahí no es la cifra, sino la unidad de trabajo. Un spot completo, una escena corta o una revelación lenta caben dentro de una sola generación. Ya no hay que armarlas con varios clips que después se emparejan en luz, ritmo y continuidad. El control de duración inteligente ajusta el largo a lo que pediste. Un momento breve no se rellena con segundos vacíos.

Una toma larga también pide otro tipo de prompt. Treinta segundos necesitan un arco: un inicio, un giro y un final. Por eso conviene describir cómo evoluciona el cuadro y no solo qué hay dentro de él. Sin ese giro sale apenas un clip lento. Es la forma más común de desperdiciar la generación larga.

Referencias y edición precisa

Omni-Reference acepta hasta 20 archivos de referencia. Sostiene a un personaje, un producto o un set parejo dentro del clip y de una toma a otra. Eso es lo que hace que una secuencia se lea como una sola pieza. Etiquetar cada referencia en el prompt pesa tanto como subirla.

La edición ya vive dentro del mismo modelo y no en una herramienta aparte. Wan 3.0 admite edición por instrucción y por referencia: seleccionas un intervalo de tiempo y regeneras solo esa parte. El resto queda intacto. También ajustas lo visual, la acción y hasta las líneas de un personaje. La prensa china describió el cambio como pasar “de la gacha a la producción”. Es una pasada controlable en lugar de tiradas infinitas.

Render, audio y texto

Alibaba llama a su objetivo visual “render de nivel realidad”, con el foco puesto en las personas: rostros y piel con detalle, emoción natural y contenida, microexpresiones amarradas a los gestos. La personalización del retrato llega hasta la estructura ósea y el detalle del ojo. El audio se genera en la misma pasada que la imagen, así que el ritmo se escribe en el prompt: nombra la base sonora, marca el golpe y la imagen y el sonido caen juntos. El texto en pantalla también mejoró, con textos largos en 12 idiomas y gráficas, fórmulas e infografías más limpias. Aun así, quienes lo probaron señalan que la calidad del audio y el texto dentro del cuadro todavía tienen camino por recorrer.

La resolución y el mito del 4K

Wan 3.0 sale en 480p, 720p y 1080p. No hay nivel 4K. Las afirmaciones de “Wan 3.0 en 4K” que circulan en los resultados de búsqueda no vienen de Alibaba: su propio listado del modelo cobra exactamente tres niveles y en ninguna parte menciona 4K. Trata el 4K como un invento hasta que Alibaba publique una ficha del modelo. Lo mismo con las tablas de especificaciones que hablan de “60B de parámetros” o de “pesos abiertos Apache 2.0”.

Sobre los pesos abiertos

Wan 3.0 es un modelo cerrado, solo por API. No han aparecido pesos en la organización Wan-AI de Hugging Face, en la organización Wan-Video de GitHub ni en ModelScope. Los pesos abiertos que Alibaba sí publicó se detienen en Wan 2.2, bajo Apache 2.0. Las generaciones 2.5, 2.6 y 2.7 fueron todas modelos comerciales por API. Para un equipo que necesita autoalojar, Wan 2.2 sigue siendo el Wan descargable más nuevo. Ese detalle define si la línea encaja o no en una infraestructura propia.

Wan 3.0 y Morphic

Wan 3.0 no está en el catálogo de Morphic. Hoy Morphic corre una línea amplia de video, con Seedance, Kling y Veo entre sus modelos. Puedes generar video ahora mismo y elegir el que le queda a cada toma. Los hábitos de prompt de arriba se trasladan a todos: escribir la toma larga como un arco, etiquetar cada referencia y meter el ritmo dentro del prompt. Practicarlos desde hoy no te cuesta nada.

Precios simples

Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.

Basic

$9/ mes
facturado como $0 por año

1100 mensual créditos

1 usuario

Todos los modelos

Workflows

Standard

$24/ mes
facturado como $0 por año

3625 mensual créditos

1 usuario

Todos los modelos

Workflows

Pro

$45/ mes
facturado como $0 por año

6350 compartidos mensual créditos

1 usuario

+ hasta 4 más con costo adicional

Todos los modelos

Workflows

Pro Max

$170/ mes
facturado como $0 por año

24650 compartidos mensual créditos

1 usuario

+ hasta 9 más con costo adicional

Todos los modelos

Workflows

Enterprise

Para límites más altos

Personalizado

términos de precios y facturación

Créditos de alto volumen
Límites de asientos personalizados
Todos los modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

gratis para siempre

Hasta 20 créditos
Solo 1 usuario
Modelos limitados
Workflows

Preguntas frecuentes

¿Qué es Wan 3.0?
Wan 3.0 es el modelo de video más reciente del Tongyi Lab de Alibaba. Está en beta pública desde el 6 de agosto de 2026. Genera clips nativos de 30 segundos de hasta 1080p, con el audio en la misma pasada. Su función distintiva es Omni-Reference: además de texto, imagen, audio y video, acepta documentos, hojas de cálculo, presentaciones, pdfs y páginas web. Con eso arma el video. Está disponible en Alibaba Cloud Model Studio y en Qwen Cloud como el modelo wan3.0-video.
¿Ya salió Wan 3.0?
Sí. Alibaba lo lanzó en beta pública el 6 de agosto de 2026, en Alibaba Cloud Model Studio y en Qwen Cloud. El acceso más amplio en wan.video va llegando poco a poco a los miembros. El ID del modelo (wan3.0-video), los niveles de resolución y el cobro por segundo de la API ya están publicados. Es decir, es un modelo vivo y no el rumor que fue durante julio de 2026.
¿Qué tan largos son los clips de Wan 3.0?
Hasta 30 segundos en una sola corrida. La duración inteligente ajusta el largo al prompt, así una escena corta no se rellena con segundos vacíos. Es el doble del techo de 15 segundos de Wan 2.7. Y está pensado para una toma continua, no para pedazos cortos pegados después.
¿Wan 3.0 es gratis?
No. Es un modelo cerrado, solo por API, y se cobra por segundo generado en Alibaba Cloud Model Studio y en Qwen Cloud. Tampoco hay pesos para descargar. Cualquier sitio que ofrezca Wan 3.0 gratis o sus pesos no está dando el modelo real. Si lo que quieres es generar video hoy mismo, Morphic corre Seedance, Kling y Veo, entre otros.
¿Qué puede armar Wan 3.0 a partir de un documento?
Acepta archivos doc, xls, ppt, pdf, txt, key, pages, numbers y md, más las URL de páginas web. Lee el contenido y genera una secuencia de video con él. Alibaba lo describe como convertir datos estáticos y llenos de texto en video terminado. Pasar de un documento o una página web a video es lo que más lo separa de los otros modelos de hoy.
¿Cómo se compara Wan 3.0 con Seedance 2.5?
Los dos salieron con días de diferencia a principios de agosto de 2026. Y los dos generan clips de 30 segundos en una pasada, con audio. Seedance 2.5 acepta más entradas de referencia, hasta 50 entre imagen, video y audio. Lo distintivo de Wan 3.0 es armar video desde documentos y páginas web. Todavía no hay benchmarks independientes de ninguno, y ambos son cerrados y solo por API. Cualquier comparación de hoy se apoya en demos, no en puntajes medidos.