Wan 3.0
von Alibaba
Alibabas neuestes Videomodell, Public Beta.
30 s am Stück aus Prompt, Dokument oder Webseite.

Hauptfunktionen
Die Funktionen stammen aus Alibabas Ankündigung zur Public Beta von Wan 3.0 im August 2026.
Technische Spezifikationen
Bis 30 s
Native 30 Sekunden in einem Durchlauf, mit intelligenter Längensteuerung.
480p bis 1080p
Drei Stufen: 480p, 720p und 1080p. Eine 4K-Ausgabe gibt es nicht.
Public Beta
Läuft auf Alibaba Cloud Model Studio und Qwen Cloud als wan3.0-video.
Nur API
Keine offenen Gewichte. Alibabas offene Wan-Reihe endet bei Wan 2.2.
Anwendungsfälle
Quartalsbericht als Video
Übergeben Sie eine Präsentation, eine Tabelle oder ein PDF. Wan 3.0 baut aus Zahlen und Text darin eine Videosequenz.
Werbespot in einem Zug
30 Sekunden decken einen klassischen Spot in einer Generierung ab. Nichts muss danach zusammengesetzt und angeglichen werden.
Serie mit fester Referenz
Omni-Reference hält Figur, Produkt und Schauplatz über alle Einstellungen. Die Reihe für den Onlineshop wirkt wie aus einem Guss.
Prompt-Beispiele
Lange Einstellung
Eine ununterbrochene Fahrt durch eine regennasse Altstadtgasse im Morgenlicht
Edit promptReferenz bleibt gleich
Derselbe Fahrradkurier quert drei Straßenzüge, Frühnebel bis Mittagslicht
Edit promptLandschaft öffnet sich
Langsamer Rückflug über ein Flussdelta, der Nebel weicht bei Sonnenaufgang
Edit promptÜberblick
Wan 3.0 ist das jüngste Modell in der Wan-Videoreihe von Alibabas Tongyi Lab, seit dem 6. August 2026 in der Public Beta. Alibaba beschreibt den Sprung als Weg „von der Erzeugung eines Einzelbildes zum Erzählen einer ganzen Geschichte“. Konkret heißt das: 30 Sekunden am Stück, Ton gemeinsam mit dem Bild und eine Eingabe, die über den Prompt hinausreicht. Dokumente, Foliensätze und Webseiten gehören dazu. Das Modell läuft auf Alibaba Cloud Model Studio und Qwen Cloud als wan3.0-video, abgerechnet pro Sekunde über drei Auflösungsstufen.
Video aus Dokumenten ist die eigentliche Neuerung
Omni-Reference hebt Wan 3.0 vom Feld ab. Neben Text, Bild, Ton und Video liest das Modell strukturierte Dateien: doc, xls, ppt, pdf, txt, key, pages, numbers und md, dazu jede Webseiten-URL. Aus dem Inhalt baut es eine Videosequenz. Alibaba nennt das den Schritt von „statischen, textlastigen Daten“ zu Videomaterial in Realitätsqualität. Übergeben Sie ein Quartalsdeck oder ein Datenblatt, kommt ein fertiger Clip zurück und kein Storyboard. Kein anderes verbreitetes Videomodell liest Dokumente heute auf diese Weise.
Für Agenturen und Marketing-Teams im Mittelstand verschiebt das den Beginn der Arbeit. Das Material für den Clip liegt meist längst vor, als Bericht oder als Foliensatz. Die Abstimmung mit dem Kunden dreht sich dann um Inhalte und nicht um ein leeres Prompt-Feld.
Die lange Einstellung in einem Durchlauf
30 Sekunden ohne Unterbrechung sind rund doppelt so viel wie bei Wan 2.7. Der Sprung ändert dabei nicht nur eine Zahl, sondern die Arbeitseinheit. Ein kompletter Werbespot, eine kurze Szene oder eine langsame Auflösung passen in eine einzige Generierung. Zuvor mussten mehrere Clips zusammengesetzt und in Licht, Tempo und Anschluss angeglichen werden. Die intelligente Längensteuerung richtet die Dauer am Briefing aus, kurze Momente werden also nicht mit leeren Sekunden gestreckt.
Eine lange Einstellung verlangt außerdem einen anderen Prompt. 30 Sekunden brauchen einen Bogen: einen Anfang, eine Wendung, ein Ende. Beschreiben Sie deshalb, wie sich das Bild entwickelt, und nicht nur, was darin zu sehen ist. Länge ohne Wendung bleibt ein langsamer Clip, und genau daran scheitert Langform am häufigsten.
Referenzkontrolle und genaue Bearbeitung
Omni-Reference nimmt bis zu 20 Referenzen an. Figur, Produkt oder Schauplatz bleiben über den Clip und von Einstellung zu Einstellung gleich. Erst dadurch liest sich eine Sequenz als ein Stück Arbeit. Wichtig ist, jede Referenz im Prompt zu benennen und nicht nur beizulegen.
Die Bearbeitung steckt jetzt im Modell selbst und nicht in einem zweiten Werkzeug. Wan 3.0 arbeitet anweisungs- und referenzbasiert: Sie markieren einen Zeitabschnitt und rechnen nur diesen Teil neu. Der Rest bleibt unangetastet. Anpassen lassen sich das Bild, die Handlung und auch die Zeilen einer Figur. Chinesische Berichte beschrieben den Wechsel als Weg „vom Glücksspiel zur Produktion“, also als kontrollierten Durchlauf statt endloser Wiederholungen.
Rendering, Ton und Schrift
Als visuelles Ziel nennt Alibaba ein Rendering in Realitätsqualität, mit klarem Fokus auf Menschen: fein aufgelöste Gesichter und Haut, zurückhaltende Emotion und Mikromimik, die zur Geste passt. Dazu kommt eine Porträtanpassung bis hin zu Knochenbau und Augendetail. Der Ton entsteht im selben Durchlauf wie das Bild. Rhythmus gehört deshalb in den Prompt: Nennen Sie das Klangbett und setzen Sie den Akzent, dann fallen Bild und Ton zusammen. Auch Schrift im Bild hat zugelegt, mit langen Textpassagen in 12 Sprachen sowie saubereren Diagrammen, Formeln und Infografiken. Rezensenten merken allerdings an, dass Tonqualität und Schrift im Bild noch Luft nach oben haben.
Auflösung und der 4K-Mythos
Wan 3.0 gibt 480p, 720p und 1080p aus. Eine 4K-Stufe gibt es nicht. Die Behauptung „Wan 3.0 kann 4K“, die in Suchergebnissen kursiert, stammt nicht von Alibaba. Die eigene Modellübersicht führt genau drei Stufen und erwähnt 4K an keiner Stelle. Behandeln Sie 4K deshalb wie Tabellen mit „60 Milliarden Parametern“ oder „offenen Gewichten unter Apache 2.0“: als erfunden, solange Alibaba keine Model Card veröffentlicht.
Zu den offenen Gewichten
Wan 3.0 ist geschlossen und nur über die API erreichbar. Weder in der Hugging-Face-Organisation Wan-AI noch in der GitHub-Organisation Wan-Video oder auf ModelScope sind Gewichte aufgetaucht. Alibabas veröffentlichte offene Gewichte enden bei Wan 2.2 unter Apache 2.0. Die Generationen 2.5, 2.6 und 2.7 waren allesamt kommerzielle API-Modelle. Für ein Team mit Pflicht zum Eigenbetrieb bleibt Wan 2.2 damit das neueste herunterladbare Wan. An diesem Punkt entscheidet sich, ob die Reihe überhaupt in eine selbst gehostete Pipeline passt.
Wan 3.0 und Morphic
Wan 3.0 steht nicht im Morphic-Katalog. Morphic führt heute eine breite Videoauswahl, darunter Seedance, Kling und Veo. Sie erzeugen also schon jetzt Video und wählen dazu das Modell, das zur Einstellung passt. Die Prompt-Gewohnheiten von oben tragen über alle Modelle hinweg: die lange Einstellung als Bogen schreiben, jede Referenz benennen, das Tempo in den Prompt legen. Ein Entwurf gegen diese Regeln kostet Sie nichts.
Einfache Preise
Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.
Basic
1100 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Standard
3625 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Pro
6350 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Pro Max
24650 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Enterprise
Für höhere Limits
Individuell
Preis- und Abrechnungsbedingungen

Free
Zum Ausprobieren
$0
dauerhaft kostenlos
Häufig gestellte Fragen
ChatGPT Images 2.5
OpenAI
OpenAIs Bildmodell, erschienen im September 2026. Schärfere Details, präzise Edits, kürzere Wartezeit.
Lyria 3.5
Google DeepMind
Googles bestklingendes Musikmodell. Ganze Songs mit Aufbau und Gesang.
MiniMax H3 Max Turbo
fal.ai
Das Tempo-Modell von fal, aus H3 Max. Doppelt so schnell, fast gleiche Optik.
Inworld TTS 2
Inworld
Eine Stimme, über 100 Sprachen. 95 Stimmen, erster Ton in Echtzeit.