Video-Generierung

Wan 3.0

von Alibaba

Alibabas neuestes Videomodell, Public Beta.
30 s am Stück aus Prompt, Dokument oder Webseite.

Wan 3.0

Hauptfunktionen

Die Funktionen stammen aus Alibabas Ankündigung zur Public Beta von Wan 3.0 im August 2026.

Technische Spezifikationen

Bis 30 s

Native 30 Sekunden in einem Durchlauf, mit intelligenter Längensteuerung.

480p bis 1080p

Drei Stufen: 480p, 720p und 1080p. Eine 4K-Ausgabe gibt es nicht.

Public Beta

Läuft auf Alibaba Cloud Model Studio und Qwen Cloud als wan3.0-video.

Nur API

Keine offenen Gewichte. Alibabas offene Wan-Reihe endet bei Wan 2.2.

Anwendungsfälle

Quartalsbericht als Video

Übergeben Sie eine Präsentation, eine Tabelle oder ein PDF. Wan 3.0 baut aus Zahlen und Text darin eine Videosequenz.

Werbespot in einem Zug

30 Sekunden decken einen klassischen Spot in einer Generierung ab. Nichts muss danach zusammengesetzt und angeglichen werden.

Serie mit fester Referenz

Omni-Reference hält Figur, Produkt und Schauplatz über alle Einstellungen. Die Reihe für den Onlineshop wirkt wie aus einem Guss.

Prompt-Beispiele

Lange Einstellung

Eine ununterbrochene Fahrt durch eine regennasse Altstadtgasse im Morgenlicht

Edit prompt

Referenz bleibt gleich

Derselbe Fahrradkurier quert drei Straßenzüge, Frühnebel bis Mittagslicht

Edit prompt

Produkt im Licht

Studiodrehung eines gebürsteten Stahlkessels auf dunklem Schiefer

Edit prompt

Darstellung

Eine Geigerin beendet die Phrase, senkt den Bogen und atmet aus

Edit prompt

Landschaft öffnet sich

Langsamer Rückflug über ein Flussdelta, der Nebel weicht bei Sonnenaufgang

Edit prompt

Schrift im Bild

Steilküste zur goldenen Stunde mit einer klaren Bauchbinde

Edit prompt

Überblick

Wan 3.0 ist das jüngste Modell in der Wan-Videoreihe von Alibabas Tongyi Lab, seit dem 6. August 2026 in der Public Beta. Alibaba beschreibt den Sprung als Weg „von der Erzeugung eines Einzelbildes zum Erzählen einer ganzen Geschichte“. Konkret heißt das: 30 Sekunden am Stück, Ton gemeinsam mit dem Bild und eine Eingabe, die über den Prompt hinausreicht. Dokumente, Foliensätze und Webseiten gehören dazu. Das Modell läuft auf Alibaba Cloud Model Studio und Qwen Cloud als wan3.0-video, abgerechnet pro Sekunde über drei Auflösungsstufen.

Video aus Dokumenten ist die eigentliche Neuerung

Omni-Reference hebt Wan 3.0 vom Feld ab. Neben Text, Bild, Ton und Video liest das Modell strukturierte Dateien: doc, xls, ppt, pdf, txt, key, pages, numbers und md, dazu jede Webseiten-URL. Aus dem Inhalt baut es eine Videosequenz. Alibaba nennt das den Schritt von „statischen, textlastigen Daten“ zu Videomaterial in Realitätsqualität. Übergeben Sie ein Quartalsdeck oder ein Datenblatt, kommt ein fertiger Clip zurück und kein Storyboard. Kein anderes verbreitetes Videomodell liest Dokumente heute auf diese Weise.

Für Agenturen und Marketing-Teams im Mittelstand verschiebt das den Beginn der Arbeit. Das Material für den Clip liegt meist längst vor, als Bericht oder als Foliensatz. Die Abstimmung mit dem Kunden dreht sich dann um Inhalte und nicht um ein leeres Prompt-Feld.

Die lange Einstellung in einem Durchlauf

30 Sekunden ohne Unterbrechung sind rund doppelt so viel wie bei Wan 2.7. Der Sprung ändert dabei nicht nur eine Zahl, sondern die Arbeitseinheit. Ein kompletter Werbespot, eine kurze Szene oder eine langsame Auflösung passen in eine einzige Generierung. Zuvor mussten mehrere Clips zusammengesetzt und in Licht, Tempo und Anschluss angeglichen werden. Die intelligente Längensteuerung richtet die Dauer am Briefing aus, kurze Momente werden also nicht mit leeren Sekunden gestreckt.

Eine lange Einstellung verlangt außerdem einen anderen Prompt. 30 Sekunden brauchen einen Bogen: einen Anfang, eine Wendung, ein Ende. Beschreiben Sie deshalb, wie sich das Bild entwickelt, und nicht nur, was darin zu sehen ist. Länge ohne Wendung bleibt ein langsamer Clip, und genau daran scheitert Langform am häufigsten.

Referenzkontrolle und genaue Bearbeitung

Omni-Reference nimmt bis zu 20 Referenzen an. Figur, Produkt oder Schauplatz bleiben über den Clip und von Einstellung zu Einstellung gleich. Erst dadurch liest sich eine Sequenz als ein Stück Arbeit. Wichtig ist, jede Referenz im Prompt zu benennen und nicht nur beizulegen.

Die Bearbeitung steckt jetzt im Modell selbst und nicht in einem zweiten Werkzeug. Wan 3.0 arbeitet anweisungs- und referenzbasiert: Sie markieren einen Zeitabschnitt und rechnen nur diesen Teil neu. Der Rest bleibt unangetastet. Anpassen lassen sich das Bild, die Handlung und auch die Zeilen einer Figur. Chinesische Berichte beschrieben den Wechsel als Weg „vom Glücksspiel zur Produktion“, also als kontrollierten Durchlauf statt endloser Wiederholungen.

Rendering, Ton und Schrift

Als visuelles Ziel nennt Alibaba ein Rendering in Realitätsqualität, mit klarem Fokus auf Menschen: fein aufgelöste Gesichter und Haut, zurückhaltende Emotion und Mikromimik, die zur Geste passt. Dazu kommt eine Porträtanpassung bis hin zu Knochenbau und Augendetail. Der Ton entsteht im selben Durchlauf wie das Bild. Rhythmus gehört deshalb in den Prompt: Nennen Sie das Klangbett und setzen Sie den Akzent, dann fallen Bild und Ton zusammen. Auch Schrift im Bild hat zugelegt, mit langen Textpassagen in 12 Sprachen sowie saubereren Diagrammen, Formeln und Infografiken. Rezensenten merken allerdings an, dass Tonqualität und Schrift im Bild noch Luft nach oben haben.

Auflösung und der 4K-Mythos

Wan 3.0 gibt 480p, 720p und 1080p aus. Eine 4K-Stufe gibt es nicht. Die Behauptung „Wan 3.0 kann 4K“, die in Suchergebnissen kursiert, stammt nicht von Alibaba. Die eigene Modellübersicht führt genau drei Stufen und erwähnt 4K an keiner Stelle. Behandeln Sie 4K deshalb wie Tabellen mit „60 Milliarden Parametern“ oder „offenen Gewichten unter Apache 2.0“: als erfunden, solange Alibaba keine Model Card veröffentlicht.

Zu den offenen Gewichten

Wan 3.0 ist geschlossen und nur über die API erreichbar. Weder in der Hugging-Face-Organisation Wan-AI noch in der GitHub-Organisation Wan-Video oder auf ModelScope sind Gewichte aufgetaucht. Alibabas veröffentlichte offene Gewichte enden bei Wan 2.2 unter Apache 2.0. Die Generationen 2.5, 2.6 und 2.7 waren allesamt kommerzielle API-Modelle. Für ein Team mit Pflicht zum Eigenbetrieb bleibt Wan 2.2 damit das neueste herunterladbare Wan. An diesem Punkt entscheidet sich, ob die Reihe überhaupt in eine selbst gehostete Pipeline passt.

Wan 3.0 und Morphic

Wan 3.0 steht nicht im Morphic-Katalog. Morphic führt heute eine breite Videoauswahl, darunter Seedance, Kling und Veo. Sie erzeugen also schon jetzt Video und wählen dazu das Modell, das zur Einstellung passt. Die Prompt-Gewohnheiten von oben tragen über alle Modelle hinweg: die lange Einstellung als Bogen schreiben, jede Referenz benennen, das Tempo in den Prompt legen. Ein Entwurf gegen diese Regeln kostet Sie nichts.

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$9/ Monat
abgerechnet als $0 pro Jahr

1100 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3625 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6350 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Pro Max

$170/ Monat
abgerechnet als $0 pro Jahr

24650 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Was ist Wan 3.0?
Wan 3.0 ist das neueste Videomodell von Alibabas Tongyi Lab, seit dem 6. August 2026 in der Public Beta. Es erzeugt native 30-Sekunden-Clips mit bis zu 1080p, den Ton im selben Durchlauf. Kennzeichen ist Omni-Reference: Neben Text, Bild, Ton und Video nimmt das Modell Dokumente, Tabellen, Folien, PDFs und Webseiten an und baut daraus Video. Erreichbar ist es über Alibaba Cloud Model Studio und Qwen Cloud als Modell wan3.0-video. Abgerechnet wird pro Sekunde, über drei Auflösungsstufen.
Was macht Wan 3.0 aus einem Dokument?
Wan 3.0 nimmt doc, xls, ppt, pdf, txt, key, pages, numbers und md an, dazu Webseiten-URLs. Es liest den Inhalt und erzeugt daraus eine Videosequenz. Alibaba beschreibt das als den Weg von statischen, textlastigen Daten zum fertigen Video. Genau diese Fähigkeit unterscheidet Wan 3.0 von den anderen aktuellen Videomodellen. Für Agenturen und Marketing-Teams liegt darin der praktische Hebel: Der vorhandene Bericht ist bereits die Eingabe.
Ist Wan 3.0 Open Source?
Nein. Wan 3.0 ist geschlossen und nur über die API erreichbar. Auf Hugging Face, GitHub oder ModelScope sind keine Gewichte erschienen. Alibabas letztes offenes Video-Flaggschiff bleibt Wan 2.2 unter Apache 2.0, veröffentlicht 2025. Wer selbst hosten muss, greift also weiterhin zu Wan 2.2. Jede Seite, die Gewichte oder einen kostenlosen Download für Wan 3.0 anbietet, führt nicht das echte Modell.
Ist Wan 3.0 DSGVO-konform?
Darüber entscheidet nicht das Modell, sondern der Anbieter und Ihr Vertrag. Wan 3.0 ist geschlossen und nur über die API nutzbar, es läuft auf Alibaba Cloud Model Studio und Qwen Cloud. Offene Gewichte gibt es nicht, ein Betrieb auf eigener Infrastruktur scheidet damit aus. Alles, was Sie übergeben, auch ein Bericht oder eine interne Präsentation, verlässt also Ihr Haus. Klären Sie Speicherort, Aufbewahrung und Auftragsverarbeitung vorab mit dem Anbieter. Wer selbst hosten muss, bleibt bei Wan 2.2.
Wie lang sind Clips aus Wan 3.0?
Bis zu 30 Sekunden in einem Durchlauf. Eine intelligente Längensteuerung richtet die Dauer am Prompt aus, kurze Szenen werden also nicht gestreckt. Das ist doppelt so viel wie die 15 Sekunden bei Wan 2.7. Gedacht ist die Länge für die durchgehende Einstellung und nicht für aneinandergesetzte Fragmente.
Wie schlägt sich Wan 3.0 gegen Seedance 2.5?
Beide erschienen Anfang August 2026 im Abstand weniger Tage, und beide liefern 30 Sekunden in einem Durchlauf samt Ton. Seedance 2.5 nimmt mehr Referenzen an, bis zu 50 aus Bild, Video und Ton. Die Besonderheit von Wan 3.0 ist das Video aus Dokumenten und Webseiten. Unabhängige Benchmarks gibt es für keines der beiden Modelle, und beide sind geschlossene API-Modelle. Ein Vergleich stützt sich heute also auf Demos und nicht auf gemessene Werte.