Wan 3.0: 30 Sekunden, All-in-One-Referenz, ein Modell
Wan 3.0 ist Alibabas neues All-in-One-Videomodell: Text-zu-Video, Bild-zu-Video und Referenz-zu-Video vereint in einem einzigen Modell, bis zu 30 Sekunden pro Take, mit bis zu 10 Referenzbildern und Referenz-Audio im Mix. Es ist jetzt im Generator unten verfügbar: gleiche Prompt-Box, gleiche Credits — 480p für viele Entwürfe, 1080p für den finalen Schnitt.
- Was es ist
- Alibaba Clouds Wan-KI-Videomodell der nächsten Generation (veröffentlicht im August 2026): eine All-in-One-Architektur, die Text-zu-Video, Bild-zu-Video und Referenz-zu-Video in einem Modell vereint.
- Video
- Bis zu 30 Sekunden pro Take (doppelt so lang wie bei Wan 2.7), in 480p/720p/1080p — Audio an oder aus, der Preis bleibt gleich.
- Referenzen
- Omni-Referenz: bis zu 10 Referenzbilder + 5 Referenzvideos + 5 Referenz-Audio-Clips in einem Durchgang gemischt — Charakter, Szene und Stimme auf einen Schlag fixiert.
- Auf Molyin
- Live — jetzt unten generieren: Text-zu-Video, Bild-zu-Video (erstes Bild / erstes und letztes Bild) und Referenz-zu-Video, 2–30 Sekunden, zu denselben Credits wie alles andere.
Fakten auf dieser Seite verifiziert am 2026-08-12.
Live am Release-Tag — Kamera läuft
Wan 3.0 ist unten einsatzbereit: Text-zu-Video, Bild-zu-Video (erstes Bild / erstes und letztes Bild) und Referenz-zu-Video auf einem 2-bis-30-Sekunden-Regler in 480p/720p/1080p, in derselben Prompt-Box zu denselben Credits. Iteriere in 480p, um Credits zu sparen, und wechsle dann zu 1080p für den finalen Schnitt.
Was ist Wan 3.0?
Wan 3.0 ist Alibaba Clouds Wan-Videomodell der nächsten Generation, und das Stichwort lautet All-in-One: In der letzten Generation waren Text-zu-Video, Bild-zu-Video und Referenz-zu-Video drei separate Modelle — diese Generation vereint sie zu einem. Du gibst dem Modell einfach deine Assets, und es findet selbst heraus, was zu tun ist. Die Dauer pro Take verdoppelt sich von 15 Sekunden bei Wan 2.7 auf 30, das Limit für Referenzbilder steigt von 5 auf 10, und zum ersten Mal kannst du Referenz-Audio einmischen: das Gesicht eines Charakters, die Stimmung einer Szene, das Timbre einer Stimme — alles mit einem Prompt festgelegt.
Zwei weitere Änderungen sind unauffällig, aber praktisch: Das Ausgabe-Audio wechselt von dauerhaft an zu wahlweise an oder aus (gleicher Preis) — wer eine saubere Vorlage für die Postproduktion will, muss die Tonspur nicht mehr nachträglich entfernen. Und eine neue 480p-Sparstufe halbiert die Kosten für Entwürfe. Auch die Seitenverhältnis-Auswahl bekommt einen cleveren adaptiven Standard: Lässt du sie leer, wählt das Modell das Format anhand deiner Assets und deiner Absicht.
Unser Ansatz bleibt derselbe wie immer: Integration am Tag der Veröffentlichung. Wan 3.0 ist jetzt in unserem KI-Videogenerator verfügbar und teilt sich ein Credit-System mit der Wan-2.7-Familie, Seedance, Kling und Veo — jedes Modell in einem Modell-Hub. Ein 30-sekündiger Film, heute gedreht.
Wan 3.0 im Überblick
Ein Modell übernimmt die gesamte Vorproduktion — Schreiben, Filmen, Vertonen, Überarbeiten — ganz ohne Toolwechsel.
30 Sekunden in einem Durchgang
Die Dauer pro Take verdoppelt sich von 15 auf 30 Sekunden: längere Erzählbögen, vollständigere Aktionen — ein Prompt filmt den ganzen Take, ohne Segmente zusammenzustückeln.
Omni-Referenz, gemischte Feeds
Bis zu 10 Referenzbilder + 5 Referenzvideos + 5 Referenz-Audio-Clips in derselben Eingabe: Bilder fixieren den Look, Videos die Bewegung, Audio die Stimme — nimm aus jeder Quelle, was du brauchst.
Audio an oder aus
Schalte es ein für ein fertiges Stück mit Ton; schalte es aus für eine saubere Vorlage, die du in der Postproduktion vertonst — gleicher Preis, deine Entscheidung. Zum ersten Mal bietet die Wan-Familie diesen Schalter.
Die 480p-Sparstufe
Eine neue 480p-Stufe: Entwerfe, überarbeite und erkunde Ideen hier zuerst für etwa ein Viertel der 1080p-Kosten — dann führe denselben Prompt für den finalen Schnitt auf einer höheren Stufe erneut aus.
Adaptives Smart-Framing
Die Format-Auswahl bekommt einen adaptiven Standard: Lässt du sie leer, wählt das Modell das Format anhand deiner Referenz-Assets und deiner Absicht. Du brauchst exakte Kontrolle? Die fünf expliziten Formate bleiben verfügbar.
Erstes und letztes Bild intakt
Das erste Bild legt den Anfang fest, erstes und letztes Bild bestimmen beide Enden — die markanten Bild-zu-Video-Steuerungen bleiben vollständig erhalten. Anfang und Ende gehören dir; das Modell übernimmt die Mitte.
Wan 3.0 vs. Wan 2.7
Spezifikation für Spezifikation — und beide Spalten sind live auf Molyin. 3.0 punktet bei langen Videos und Omni-Referenz; 2.7 behält die Videobearbeitung und den 1080p-Preisvorteil. Wähle nach Bedarf, ganz ohne Grübeln.
| Funktion | Wan 2.7 | Wan 3.0 |
|---|---|---|
| Max. Dauer pro Take | 15 Sekunden (10 s bei Referenz-zu-Video) | 30 Sekunden |
| Referenzeingaben | ≤5 Bilder + ≤5 Videos, ≤5 kombiniert | ≤10 Bilder + ≤5 Videos + ≤5 Audio |
| Ausgabe-Audio | Immer an, kein Schalter | An oder aus, gleicher Preis |
| Auflösungsstufen | 720p / 1080p | 480p / 720p / 1080p (neue Sparstufe) |
| Seitenverhältnis | Fünf explizite Formate | adaptiver Smart-Standard + fünf explizite |
| Videobearbeitung & -verlängerung | Ja — Wan 2.7 Video Edit + Videoverlängerung | Nein — für Bearbeitungen Wan 2.7 Video Edit nutzen |
Molyin bietet derzeit Text-zu-Video, Bild-zu-Video (erstes/letztes Bild) und Referenz-zu-Video mit 2–30 Sekunden in 480p/720p/1080p — Credits funktionieren in beiden Familien.
Wan 3.0 im gesamten Lineup
| Modell | Rolle im Lineup | Verfügbarkeit | Auf Molyin |
|---|---|---|---|
| Wan 3.0 | Omni-Referenz-Flaggschiff, 30 s + drei Auflösungsstufen | Veröffentlicht im August 2026 | Live — auf dieser Seite generieren |
| Wan 2.7 | Klassisches Arbeitspferd, 1080p-Preisvorteil | Allgemein verfügbar | Live |
| Wan 2.7 Video Edit | Spezialist für Videobearbeitung (Restyling / Elemente austauschen) | Allgemein verfügbar | Live |
| MiniMax H3 | Natives 2K + Audio immer an | Allgemein verfügbar | Live |
| Seedance 2.5 | 30-Sekunden-Takes, sekundengenau inszeniert | Allgemein verfügbar | Live |
| Kling 3.0 | Konkurrenz-Flaggschiff, Referenzen mit benannten Elementen | Allgemein verfügbar | Live |
Verfügbarkeit geprüft am 6. August 2026.
Das segmentierte 30-Sekunden-Drehbuch
Das Prompt-Muster, das die langen Takes von Wan 3.0 zusammenhält: die Szene einmal etablieren, dann sekundengenaue Segmente wie eine Shotliste inszenieren. Direkt aus unserem vollständigen Prompt-Guide — so bleibt ein 30-Sekunden-Take kohärent.
[Globales Setup] + [Start-End-Sekunden] + [Bildinhalt & Kamera] + optional [Übergang]
Zeitsegment
Explizite Start- und Endsekunden (z. B. 0–5s, 5–12s). 30 Sekunden in 3–5 Segmente zu schneiden ist am stabilsten.
Bild & Kamera
Was in diesem Segment passiert und wie sich die Kamera bewegt — Aktionsdichte passend zur Segmentlänge.
Globales Setup
Ein Eröffnungsabsatz, der Stil, Farbton, Stimmung und harte No-Gos für den gesamten Clip fixiert.
Übergang
Wie Segmente verbunden werden: natürlicher Schnitt, Überblendung, Wischeffekt — benenne es einfach.
Wan 3.0 FAQ
Die Fragen, die Creator wirklich stellen, direkt beantwortet.
Starte noch heute mit Molyin
Melde dich kostenlos an und verwandle deine erste Idee in Minuten in ein filmisches Video.