Alibaba · Tongyi Lab
Wan 3.0: 30-sekündige KI-Videos in einem Durchgang, mit eigenem Sound
Wan 3.0 ist der All-in-One-KI-Videogenerator von Alibaba. Er verwandelt einen Prompt, ein Bild oder ein Set von Referenzen in beliebige Längen von 2 bis 30 Sekunden in einer einzigen Anfrage – bei bis zu 1080p und 30 fps. Dialoge, Musik und Soundeffekte werden im selben Job gerendert. Auf Popcraft ab 11 Credits pro Sekunde.
Im Video-Studio, auf Canvas-Boards und via MCP-Connector
- 2–30 s
- beliebige volle Sekunde, ein Durchgang
- 1080p 30 fps
- Ebenfalls 480p- und 720p-Optionen
- 4 · 5 · 5 Ref.
- Bilder, Clips, Audio
- 11 Cr / s
- bei 480p — 330 für 30 s
Native 30s-Dauer
Alibabas wichtigstes Feature: „vollständigeres Storytelling und kreative Freiheit“ durch einen nativen 30-Sekunden-Durchgang. Oben sehen Sie den Hero-Film an sechs Zeitpunkten und was Uhr sowie Datei über die für diese Seite generierten Clips aussagen.
1s
6s
12s
18s
24s
29s| Anfrage | Geliefert | Bearbeitungszeit |
|---|---|---|
| 30 s · 1080p · nur Text | 30,02 s · 1920×1080 · Stereo | 5 Min. 38 s |
| 5 s · 720p · nur Text | 5,04 s · 1280×720 · Stereo | 1 Min. 37 s |
| 3 s und 10 s · aus einem 6-s-Referenzclip | 3,02 s und 10,03 s · Clip gab Bewegung vor, nicht Länge | ≈ je 1 Min. 25 s |
Die Bearbeitungszeit entspricht dem Zeitraum vom Absenden bis zur fertigen Datei auf Popcraft, September 2026. Jeder Clip landete innerhalb weniger Hundertstelsekunden der Anfrage – die Credits, die Sie vorab sehen, sind also genau die Credits, die Sie verbrauchen.
Immersives Erlebnis: Realismus, Textur und Sounddesign
Alibabas Worte: „erhöhter Realismus, Textur und Sounddesign“. Drei Filme, drei Looks — Live-Action, Feature-Style CG, Brand Fantasy — jeweils eine Anfrage, ein durchgehender Take, 30 Sekunden, wobei der Soundtrack im selben Durchgang generiert wurde. Nur der Prompt wurde geändert.
Vorhang
Der Hero-Film von oben: eine Peking-Oper-Darstellerin vom Schminkspiegel über den Backstage-Flur durch den Samtvorhang vor ein volles Haus. Trommeln schwellen an, ein Gong ertönt, das Publikum jubelt.
Fuchsgeist
Ein neunschwänziger Fuchs sprintet über laternenbeleuchtete Dächer, springt über eine Lücke, während Laternen wirbeln, schwebt vor dem Vollmond und landet auf dem Glockenturm. Malerischer 3D-Look allein durch einen Text-Prompt.
Verkaufsautomat
Ein Mädchen im gelben Regenmantel drückt in einer regnerischen Gasse einen Knopf und wird durch das Glas in eine bunte Welt gezogen, wo ein Maskottchen ihr eine Dose reicht. Prickeln wird zu Feuerwerk, und die Kamera zieht sich zurück in die Gasse.
Jeder Film wird hier so gezeigt, wie er geliefert wurde: kein Schnitt, keine zusätzliche Musik. Entwürfe in 480p kosten je 330 Credits; 1080p liegt bei 1.200.
Was ist Wan 3.0?
Wan 3.0 (万相 3.0) ist das Videomodell von Alibabas Tongyi Lab, das seit dem 6. August 2026 in der öffentlichen Beta ist und am 24. August offiziell startete. Alibaba nennt es ein All-in-One-Referenz-Videomodell: ein Modell für Text-to-Video, Image-to-Video, First-and-Last-Frame-Steuerung und Generierung aus gemischten Referenzen, statt separater Modelle für jede Aufgabe. Es ist ausschließlich über API verfügbar — es gibt keine Open Weights — und Popcraft nutzt die Prime Edition, die schnellere der beiden von Alibaba angebotenen Versionen.
Alibaba Cloud Model Studio Guide und API-Referenz für wan3.0-video; offizielles Wan 3.0 Repository README; Launch-Zusammenfassung der Alibaba Developer Community. Die obigen Behauptungen stammen von Alibaba; die Messungen auf dieser Seite von uns.
“Generiert stabil bis zu 30 Sekunden Video pro Anfrage bei 30 Bildern pro Sekunde.”
Länge
“Gibt nativ Dialoge, Hintergrundmusik und Soundeffekte aus — keine Postproduktion für Synchronisation nötig.”
Sound
“Konsistenz von Aussehen, Kleidung, Requisiten, Umgebung und visuellem Stil; Push-, Pull-, Pan- und Tracking-Kamerabewegungen.”
Konsistenz und Kamera
- Native 30s-Dauer“Vollständigeres Storytelling und kreative Freiheit.”Auf Popcraft: Jede Länge von 2 bis 30 Sekunden, ein Durchgang.
- Omni-Creation“Bis zu 20 Referenz-Assets, inklusive Dokumenten- und Webseiten-Parsing.”Auf Popcraft: 4 Bilder, 5 Clips, 5 Audio-Dateien. Dokumente und Webseiten folgen noch.
- Pixelgenaue Konsistenz“Höhere Ergebnissicherheit für Produktions-Workflows.”Auf Popcraft: Ja — siehe die Standbilder unten.
- Immersives Erlebnis“Erhöhter Realismus, Textur und Sounddesign.”Auf Popcraft: Ja — Dialog, Musik und Effekte werden mit dem Bild generiert.
- Präzise Videobearbeitung“Kontrollierteres Editieren zur Steigerung der kreativen Effizienz.”Noch nicht auf Popcraft — nutzen Sie Seedance 2.5 oder Gemini Omni zum Bearbeiten oder Erweitern.
Omni-Creation: Bilder, Clips und Audio in einem Prompt
Alibabas zweites Hauptmerkmal — Generierung aus multimodalem Input. Auf Popcraft bedeutet das bis zu 4 Bilder, 5 Videoclips und 5 Audioclips in einer einzigen Anfrage, die im Prompt als Image 1, Video 1 oder Audio 1 in der Reihenfolge ihres Anhängens benannt werden. Alibabas Plattform parst auch Dokumente und Webseiten; dieser Teil ist auf Popcraft noch nicht verfügbar.
Subjekte, Produkte und Sets
Ein Character-Sheet fixiert Gesicht und Garderobe; ein Produktfoto das Objekt; ein Location-Still das Set. Das Modell behält bei, was im Bild ist; beschreiben Sie Abweichungen daher explizit. Zwei Bilder mit „first frame“ und „last frame“ im Prompt werden stattdessen zu Keyframes.
JPEG, PNG, WEBP oder BMP · 240 bis 8.000 px pro Seite · je 20 MB
Die Frau aus Image 1 geht in der Dämmerung die Straße aus Image 2 entlang, die Kamera fährt neben ihr her. Haare, Mantel und Tasche exakt wie in Image 1 beibehalten.
Bewegung, Kamera und Performance
Ein Clip überträgt Kamerapfad, Blocking und Performance in die neue Aufnahme. Kombinieren Sie ihn mit einem Bild, und das Motiv des Bildes führt die Bewegung des Clips im Set des Clips aus. Der Clip gibt die Bewegung vor, nicht die Länge — diese bestimmt der Schieberegler.
MP4 oder MOV · 1 bis 15 s pro Clip und insgesamt 15 s · je 100 MB
Der Mann aus Image 1 steht zwischen den Säulen. Folge exakt der Kamerabewegung von Video 1: ein tiefer Weitwinkel, der nach rechts in eine Dreiviertel-Nahaufnahme schwenkt.
Klangfarbe einer Stimme oder Beat eines Tracks
Alibabas Rezept: Das Audio liefert die Stimme oder den Rhythmus, und der gesprochene Text kommt in den Prompt; das Modell generiert Sprache und Mundbewegung zusammen. Es ist kein reines Lip-Sync-Tool für Aufnahmen — nutzen Sie dafür ein Avatar-Modell wie OmniHuman.
WAV oder MP3 · 1 bis 15 s pro Clip und insgesamt 15 s · je 15 MB
Nimm die Klangfarbe von Audio 1 und lass den Charakter sagen: „Wirklich? Das klingt toll — wann bist du zurück?“ Die generierte Sprache steuert die natürliche Mundbewegung.
Keyframes und Referenzen lassen sich nicht mischen. Zwei als Start- und Endbild markierte Bilder ergeben allein einen Keyframe-Clip; alles andere — Motive, Clips, Audio — lässt sich bis zu den obigen Limits frei kombinieren.
Pixelgenaue Konsistenz
Alibabas drittes Hauptmerkmal: „Verbesserung der Ergebnissicherheit für Produktions-Workflows“ — die Modellbeschreibung hebt die Beibehaltung von Charakter- und Referenzdetails über Frames hinweg hervor. Hier die Darstellerin aus dem Hero-Film an drei Zeitpunkten, 28 Sekunden auseinander.
1 s
12 s
29 sWie man Wan 3.0 promptet
Das Modell plant den gesamten Clip basierend auf dem Prompt. Der Prompt muss also definieren, um welche Art von Clip es sich handelt. Unsere Ergebnisse blieben stabil, wenn wir die Kontinuität benannten — eine ununterbrochene Aufnahme oder eine nummerierte Liste von Shots. Der Rest ergibt sich daraus.
Sagen Sie „keine Schnitte“, dann timen Sie die Beats
Beginnen Sie mit „one continuous take, no cuts, no transitions“, geben Sie jedem Sekundenabschnitt eine Aufgabe und ein Kamera-Verb, behalten Sie ein Hauptmotiv im Bild und schreiben Sie den Sound als eigenen Satz. Der Hero-Film wurde genau so geschrieben und kam ohne einen einzigen Schnitt zurück.
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe. 0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes. 6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build. 16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder. 24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes. Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
- Referenzen benennen
- Image 1, Video 1, Audio 1 — nummeriert pro Typ in der Reihenfolge des Anhängens — und sagen Sie, wofür sie da sind: „Image 1 ist der Charakter; Video 1 ist die Kamerabewegung“.
- Sound steuern
- Standardmäßig erstellt das Modell Dialoge, Musik und Effekte. Fordern Sie explizit an, was Sie möchten — „Regen und eine ferne Straßenbahn, kein Dialog“ — oder schalten Sie den Audio-Switch für eine lautlose Datei aus.
- Treue zu Vorgaben
- Bei einem Bild behält das Modell bei, was darauf zu sehen ist. Für große Änderungen — Wetter, Kleidung, ein anderes Set — beschreiben Sie den Wechsel explizit, anstatt zu erwarten, dass der Prompt das Bild einfach überschreibt.
- Ein Hauptmotiv beibehalten
- Eine einzelne Figur, ein definierter Kameraweg und die Worte „no cuts“ lieferten uns jedes Mal einen sauberen Take. Bei Menschenmengen, Händen und kleinen Requisiten wird jedes Videomodell, auch dieses, unschärfer.
- Günstig entwerfen, hochwertig liefern
- 480p nutzt dasselbe Modell zu einem Viertel des 1080p-Preises. Validieren Sie die Story in 480p und rendern Sie den Gewinner dann in 1080p mit demselben Prompt und denselben Referenzen neu.
Wan 3.0 vs. Seedance 2.5 vs. Gemini Omni 1.1 Flash
Drei Modelle auf Popcraft, die Sound mit dem Bild generieren. Wans Vorteil ist der günstigste 30-Sekunden-Take auf der Plattform und hohe Wiedergabetreue der Referenzen; Seedance punktet bei der Anzahl der Referenzen und Bearbeitung; Omni bietet 4K und 40 Sekunden durch Erweiterung. Wählen Sie je nach Aufgabe.
| Fähigkeit | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| Längster Clip aus einer Anfrage | 30 s in einem Durchgang | 30 s | 40 s durch Szenen-Erweiterung (30 s bei 4K) |
| Auflösungen | 480p / 720p / 1080p bei 30 fps | Bis zu 1080p | 360p Draft bis 4K |
| Nativer Sound | Dialog, Musik, Effekte; abschaltbar | Ja | Sprache, Musik, Soundeffekte |
| Referenzbilder | Bis zu 4 | Bis zu 30 | Bis zu 10 |
| Referenzvideos | Bis zu 5, 15 s insgesamt | Bis zu 10 | Bis zu 3 |
| Referenzaudio | Bis zu 5, 15 s insgesamt | Bis zu 10 | — |
| Clip bearbeiten/erweitern | — (nutzen Sie Seedance 2.5 oder Omni) | Editieren; davor/danach erweitern | Editieren; in 10-s-Schritten erweitern |
| Ein 30-Sekunden-Entwurf | 330 Credits bei 480p | Pro Sekunde, nach Auflösung | 150 Credits bei 360p |
Wan-Zahlen stammen aus Alibabas Model Studio Guide; die Popcraft-Limits entsprechen der aktuellen Auswahl im Tool. Anbieter-Limits können sich ändern; der Picker zeigt immer die aktuelle Verfügbarkeit. Komplette Vergleiche: Seedance 2.5 · Gemini Omni 1.1 Flash.
Wan 3.0 Preise auf Popcraft
Abgerechnet wird pro gelieferter Sekunde, nach Auflösung. Das Anhängen von Referenzen ist kostenlos. Da die gelieferte Länge der Anfrage entspricht, ist der vorab angezeigte Preis genau das, was Sie zahlen.
Jeder Plan enthält Credits; die Preisseite listet die aktuellen Raten für alle Modelle. Downloads im Gratis-Tarif enthalten ein Popcraft-Wasserzeichen, das in den kostenpflichtigen Plänen entfernt wird.
Wofür Alibaba Wan 3.0 empfiehlt
Die drei Szenarien aus Alibabas offiziellem Launch-Material und wie man sie auf Popcraft umsetzt.
- 01
Short-Video-Content: Dramatisierung und Werbe-Teaser
Alibabas Entertainment-Szenario. Bis zu 30 Sekunden narrative Handlung aus einem Prompt, inklusive Sound.
- 02
E-Commerce: Produktpräsentation aus einem Bild
Alibabas E-Commerce-Szenario — „Produktbild plus Beschreibung hochladen, dynamische Präsentation erhalten“. Fügen Sie das Foto als Image 1 an.
- 03
Bildung: Inszenierte Szenario-Simulationen
Alibabas Bildungs-Szenario — ein Arztgespräch oder ein Support-Anruf, inszeniert per Prompt mit generiertem Dialog.
- 04
Entwurf in 480p, Lieferung in 1080p
Die Popcraft-Ergänzung: 11 Credits pro Sekunde bei 480p machen einen 30-Sekunden-Entwurf günstig (330 Credits), bevor Sie sich für 1080p entscheiden.
Wan 3.0 — Häufig gestellte Fragen
Alibabas All-in-One-Videomodell vom Tongyi Lab, seit 6. August 2026 in der Beta. Ein Modell deckt Text-to-Video, Image-to-Video, Keyframe-Steuerung und Multi-Referenz-Generierung ab. Es produziert Längen von 2 bis 30 Sekunden in einem Durchgang bei 30 fps und generiert Dialoge, Musik und Soundeffekte direkt mit.
Jede volle Sekunde von 2 bis 30 in einem Durchgang — keine Kette von Erweiterungen, kein Zusammenfügen. Auf Popcraft stellen Sie die Länge per Schieberegler ein; die Datei entspricht exakt der Anfrage. In unseren Tests lagen alle Clips innerhalb von Hundertstelsekunden der Wunschlänge.
Standardmäßig ja. Laut Alibaba gibt das Modell nativ Dialoge, BGM und Soundeffekte aus. Der Audio-Switch auf Popcraft erlaubt es jedoch, den Ton auszuschalten, sodass die Datei keine Audiospur enthält.
Hängen Sie bis zu 4 Bilder, 5 Video- und 5 Audioclips an und beziehen Sie sich im Prompt auf sie (Image 1, Video 1 etc.). Bilder liefern Charaktere oder Szenen; Videos liefern Bewegung und Kamera; Audio liefert Stimme oder Rhythmus. Videos und Audio sind auf insgesamt 15 Sekunden begrenzt. Keyframes (Start/Endbild) können nicht mit anderen Referenzen gemischt werden.
Dafür wurde das Modell gebaut. Alibaba nennt Konsistenz von Charakteren, Kleidung und Umgebung als Hauptmerkmal. In unseren Tests blieb die Identität eines Character-Sheets über 30 Sekunden und komplexe Kamerabewegungen stabil. Wan 3.0 orientiert sich stark am Bild — für kreative Abweichungen sollten Sie diese explizit beschreiben.
Aktuell nicht direkt auf Popcraft. Wan 3.0 nutzt Clips als Referenz für Bewegung; zum Erweitern oder Editieren von Material nutzen Sie Seedance 2.5 oder Gemini Omni 1.1 Flash.
Das Modell nutzt Audio-Referenzen für die Klangfarbe, während der Text im Prompt steht; Sprache und Mundbewegung werden dann zusammen generiert. Es ist kein reines „Mouth-to-Recording“-Tool. Für Talking-Head-Clips basierend auf einer spezifischen Aufnahme nutzen Sie ein Avatar-Modell wie OmniHuman.
Wan 3.0 wird pro Sekunde berechnet: 11 Credits bei 480p, 20 bei 720p und 40 bei 1080p. Ein 30-Sekunden-Entwurf in 480p kostet 330 Credits; in 1080p sind es 1.200. Der Preis wird vor der Generierung angezeigt. Gratis-Downloads haben ein Wasserzeichen.
Dreißig Sekunden, eine Anfrage. Testen Sie es zuerst in 480p.
Entwerfen Sie für 330 Credits, prüfen Sie die Story und rendern Sie dann in 1080p — oder bringen Sie Character-Sheet und Clip zusammen.
Weiter erkunden
Ähnliche Modelle
Seedance 2.5 generiert bis zu 30 Sekunden Video in einem einzigen Durchgang, mit bis zu 50 Referenz-Assets, steuerbarer Videobearbeitung, hochpräziser zeitlicher Verlängerung, jedem Seitenverhältnis von 0,4 bis 2,5 und nativem Prompting in über 10 Sprachen. Jetzt live auf Popcraft.
Gemini Omni 1.1 Flash ist das Videomodell von Google, das Videos aus beliebigen Eingaben erstellt und bearbeitet. Bis zu 40 Sekunden durch Szenenerweiterung, 1080p- und 4K-Ausgabe, Interpolation des ersten und letzten Frames, bis zu 10 Referenzbilder sowie zusammen mit dem Bild generierte Sprache, Musik und Soundeffekte. Jetzt live auf Popcraft.
MiniMax H3 generiert 2K-Videos mit 24 fps und synchronisiertem Stereo-Soundtrack — Effekte, Atmo und Dialoge in einem Schritt. Multi-Shot aus einem Prompt, 5 bis 15 Sekunden. Jetzt auf Popcraft.
Generiere filmreifes 4K-Video aus Text, Bildern oder Clips mit Seedance 2.0 auf Popcraft. Nativ synchronisierter Ton, Multi-Shot-Sequenzen und gestochen scharfes Detail bis 4K (2160p).