NEWDeine nächste virale UGC-Anzeige ist nur einen Klick entfernt. Erlebe Studio.Anzeige erstellen
PopcraftPopcraft
Neues Videomodell

Alibaba · Tongyi Lab

Wan 3.0: 30-sekündige KI-Videos in einem Durchgang, mit eigenem Sound

Wan 3.0 ist der All-in-One-KI-Videogenerator von Alibaba. Er verwandelt einen Prompt, ein Bild oder ein Set von Referenzen in beliebige Längen von 2 bis 30 Sekunden in einer einzigen Anfrage – bei bis zu 1080p und 30 fps. Dialoge, Musik und Soundeffekte werden im selben Job gerendert. Auf Popcraft ab 11 Credits pro Sekunde.

Im Video-Studio, auf Canvas-Boards und via MCP-Connector

2–30 s
beliebige volle Sekunde, ein Durchgang
1080p 30 fps
Ebenfalls 480p- und 720p-Optionen
4 · 5 · 5 Ref.
Bilder, Clips, Audio
11 Cr / s
bei 480p — 330 für 30 s
00Sekunden, ein Take
One-Take · generiertes Audio · kein Schnitt

Native 30s-Dauer

Alibabas wichtigstes Feature: „vollständigeres Storytelling und kreative Freiheit“ durch einen nativen 30-Sekunden-Durchgang. Oben sehen Sie den Hero-Film an sechs Zeitpunkten und was Uhr sowie Datei über die für diese Seite generierten Clips aussagen.

1 Sekunde: Extreme Nahaufnahme des geschminkten Gesichts der Darstellerin im Schminkspiegel1s
6 Sekunden: Sie erhebt sich in ihrem purpurroten und goldenen Gewand vom Spiegel6s
12 Sekunden: Der Backstage-Korridor, Bühnenhelfer drücken sich an die Wände, während sie vorbeigeht12s
18 Sekunden: Ihre Hand auf dem roten Samtvorhang18s
24 Sekunden: Durch den Vorhang ins Bühnenlicht, das von Laternen beleuchtete Haus öffnet sich dahinter24s
29 Sekunden: Der Wasserärmel wird vor einem vollen Theater unter roten Laternen gehoben29s
Eine Darstellerin, ein Gewand, eine Farbabstimmung vom Spiegel bis zur Bühne — Garderobe, Korridor, Vorhang, volles Haus, in einer einzigen, ungeschnittenen Anfrage.
Geliefert vs. Angefordert
AnfrageGeliefertBearbeitungszeit
30 s · 1080p · nur Text30,02 s · 1920×1080 · Stereo5 Min. 38 s
5 s · 720p · nur Text5,04 s · 1280×720 · Stereo1 Min. 37 s
3 s und 10 s · aus einem 6-s-Referenzclip3,02 s und 10,03 s · Clip gab Bewegung vor, nicht Länge≈ je 1 Min. 25 s

Die Bearbeitungszeit entspricht dem Zeitraum vom Absenden bis zur fertigen Datei auf Popcraft, September 2026. Jeder Clip landete innerhalb weniger Hundertstelsekunden der Anfrage – die Credits, die Sie vorab sehen, sind also genau die Credits, die Sie verbrauchen.

Immersives Erlebnis: Realismus, Textur und Sounddesign

Alibabas Worte: „erhöhter Realismus, Textur und Sounddesign“. Drei Filme, drei Looks — Live-Action, Feature-Style CG, Brand Fantasy — jeweils eine Anfrage, ein durchgehender Take, 30 Sekunden, wobei der Soundtrack im selben Durchgang generiert wurde. Nur der Prompt wurde geändert.

Live-Action30.0s1 takelive action

Vorhang

Der Hero-Film von oben: eine Peking-Oper-Darstellerin vom Schminkspiegel über den Backstage-Flur durch den Samtvorhang vor ein volles Haus. Trommeln schwellen an, ein Gong ertönt, das Publikum jubelt.

Feature CG30.0s1 take3D-CG look

Fuchsgeist

Ein neunschwänziger Fuchs sprintet über laternenbeleuchtete Dächer, springt über eine Lücke, während Laternen wirbeln, schwebt vor dem Vollmond und landet auf dem Glockenturm. Malerischer 3D-Look allein durch einen Text-Prompt.

Brand Fantasy30.0s1 takebrand fantasy

Verkaufsautomat

Ein Mädchen im gelben Regenmantel drückt in einer regnerischen Gasse einen Knopf und wird durch das Glas in eine bunte Welt gezogen, wo ein Maskottchen ihr eine Dose reicht. Prickeln wird zu Feuerwerk, und die Kamera zieht sich zurück in die Gasse.

Jeder Film wird hier so gezeigt, wie er geliefert wurde: kein Schnitt, keine zusätzliche Musik. Entwürfe in 480p kosten je 330 Credits; 1080p liegt bei 1.200.

Was ist Wan 3.0?

Wan 3.0 (万相 3.0) ist das Videomodell von Alibabas Tongyi Lab, das seit dem 6. August 2026 in der öffentlichen Beta ist und am 24. August offiziell startete. Alibaba nennt es ein All-in-One-Referenz-Videomodell: ein Modell für Text-to-Video, Image-to-Video, First-and-Last-Frame-Steuerung und Generierung aus gemischten Referenzen, statt separater Modelle für jede Aufgabe. Es ist ausschließlich über API verfügbar — es gibt keine Open Weights — und Popcraft nutzt die Prime Edition, die schnellere der beiden von Alibaba angebotenen Versionen.

Alibaba Cloud Model Studio Guide und API-Referenz für wan3.0-video; offizielles Wan 3.0 Repository README; Launch-Zusammenfassung der Alibaba Developer Community. Die obigen Behauptungen stammen von Alibaba; die Messungen auf dieser Seite von uns.

In Alibabas Worten
  1. Generiert stabil bis zu 30 Sekunden Video pro Anfrage bei 30 Bildern pro Sekunde.

    Länge

  2. Gibt nativ Dialoge, Hintergrundmusik und Soundeffekte aus — keine Postproduktion für Synchronisation nötig.

    Sound

  3. Konsistenz von Aussehen, Kleidung, Requisiten, Umgebung und visuellem Stil; Push-, Pull-, Pan- und Tracking-Kamerabewegungen.

    Konsistenz und Kamera

Alibabas fünf Hauptmerkmale
  1. Native 30s-DauerVollständigeres Storytelling und kreative Freiheit.Auf Popcraft: Jede Länge von 2 bis 30 Sekunden, ein Durchgang.
  2. Omni-CreationBis zu 20 Referenz-Assets, inklusive Dokumenten- und Webseiten-Parsing.Auf Popcraft: 4 Bilder, 5 Clips, 5 Audio-Dateien. Dokumente und Webseiten folgen noch.
  3. Pixelgenaue KonsistenzHöhere Ergebnissicherheit für Produktions-Workflows.Auf Popcraft: Ja — siehe die Standbilder unten.
  4. Immersives ErlebnisErhöhter Realismus, Textur und Sounddesign.Auf Popcraft: Ja — Dialog, Musik und Effekte werden mit dem Bild generiert.
  5. Präzise VideobearbeitungKontrollierteres Editieren zur Steigerung der kreativen Effizienz.Noch nicht auf Popcraft — nutzen Sie Seedance 2.5 oder Gemini Omni zum Bearbeiten oder Erweitern.

Omni-Creation: Bilder, Clips und Audio in einem Prompt

Alibabas zweites Hauptmerkmal — Generierung aus multimodalem Input. Auf Popcraft bedeutet das bis zu 4 Bilder, 5 Videoclips und 5 Audioclips in einer einzigen Anfrage, die im Prompt als Image 1, Video 1 oder Audio 1 in der Reihenfolge ihres Anhängens benannt werden. Alibabas Plattform parst auch Dokumente und Webseiten; dieser Teil ist auf Popcraft noch nicht verfügbar.

Image 1 … Image 4

Subjekte, Produkte und Sets

Ein Character-Sheet fixiert Gesicht und Garderobe; ein Produktfoto das Objekt; ein Location-Still das Set. Das Modell behält bei, was im Bild ist; beschreiben Sie Abweichungen daher explizit. Zwei Bilder mit „first frame“ und „last frame“ im Prompt werden stattdessen zu Keyframes.

JPEG, PNG, WEBP oder BMP · 240 bis 8.000 px pro Seite · je 20 MB

Die Frau aus Image 1 geht in der Dämmerung die Straße aus Image 2 entlang, die Kamera fährt neben ihr her. Haare, Mantel und Tasche exakt wie in Image 1 beibehalten.
Video 1 … Video 5

Bewegung, Kamera und Performance

Ein Clip überträgt Kamerapfad, Blocking und Performance in die neue Aufnahme. Kombinieren Sie ihn mit einem Bild, und das Motiv des Bildes führt die Bewegung des Clips im Set des Clips aus. Der Clip gibt die Bewegung vor, nicht die Länge — diese bestimmt der Schieberegler.

MP4 oder MOV · 1 bis 15 s pro Clip und insgesamt 15 s · je 100 MB

Der Mann aus Image 1 steht zwischen den Säulen. Folge exakt der Kamerabewegung von Video 1: ein tiefer Weitwinkel, der nach rechts in eine Dreiviertel-Nahaufnahme schwenkt.
Audio 1 … Audio 5

Klangfarbe einer Stimme oder Beat eines Tracks

Alibabas Rezept: Das Audio liefert die Stimme oder den Rhythmus, und der gesprochene Text kommt in den Prompt; das Modell generiert Sprache und Mundbewegung zusammen. Es ist kein reines Lip-Sync-Tool für Aufnahmen — nutzen Sie dafür ein Avatar-Modell wie OmniHuman.

WAV oder MP3 · 1 bis 15 s pro Clip und insgesamt 15 s · je 15 MB

Nimm die Klangfarbe von Audio 1 und lass den Charakter sagen: „Wirklich? Das klingt toll — wann bist du zurück?“ Die generierte Sprache steuert die natürliche Mundbewegung.

Keyframes und Referenzen lassen sich nicht mischen. Zwei als Start- und Endbild markierte Bilder ergeben allein einen Keyframe-Clip; alles andere — Motive, Clips, Audio — lässt sich bis zu den obigen Limits frei kombinieren.

Pixelgenaue Konsistenz

Alibabas drittes Hauptmerkmal: „Verbesserung der Ergebnissicherheit für Produktions-Workflows“ — die Modellbeschreibung hebt die Beibehaltung von Charakter- und Referenzdetails über Frames hinweg hervor. Hier die Darstellerin aus dem Hero-Film an drei Zeitpunkten, 28 Sekunden auseinander.

Das geschminkte Gesicht der Darstellerin im Schminkspiegel nach 1 Sekunde1 s
Dieselbe Darstellerin im Backstage-Korridor nach 12 Sekunden12 s
Dieselbe Darstellerin auf der Bühne vor vollem Haus nach 29 Sekunden29 s
Gleiches Gesicht, gleicher Kopfschmuck, gleiches Gewand vom Spiegel bis zur Bühne. Fügen Sie ein Character-Sheet oder ein Produktfoto als Image 1 hinzu und das Modell behält bei, was Sie ihm geben. In unseren Tests wurde ein quadratisches Produktbild originalgetreu in einem 16:9-Frame reproduziert, und ein sechssekündiger Referenzclip steuerte ein drei- und ein zehnsekündiges Ergebnis, ohne das Motiv zu verändern.

Wie man Wan 3.0 promptet

Das Modell plant den gesamten Clip basierend auf dem Prompt. Der Prompt muss also definieren, um welche Art von Clip es sich handelt. Unsere Ergebnisse blieben stabil, wenn wir die Kontinuität benannten — eine ununterbrochene Aufnahme oder eine nummerierte Liste von Shots. Der Rest ergibt sich daraus.

Für einen One-Take

Sagen Sie „keine Schnitte“, dann timen Sie die Beats

Beginnen Sie mit „one continuous take, no cuts, no transitions“, geben Sie jedem Sekundenabschnitt eine Aufgabe und ein Kamera-Verb, behalten Sie ein Hauptmotiv im Bild und schreiben Sie den Sound als eigenen Satz. Der Hero-Film wurde genau so geschrieben und kam ohne einen einzigen Schnitt zurück.

ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe.
0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes.
6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build.
16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder.
24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes.
Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
Referenzen benennen
Image 1, Video 1, Audio 1 — nummeriert pro Typ in der Reihenfolge des Anhängens — und sagen Sie, wofür sie da sind: „Image 1 ist der Charakter; Video 1 ist die Kamerabewegung“.
Sound steuern
Standardmäßig erstellt das Modell Dialoge, Musik und Effekte. Fordern Sie explizit an, was Sie möchten — „Regen und eine ferne Straßenbahn, kein Dialog“ — oder schalten Sie den Audio-Switch für eine lautlose Datei aus.
Treue zu Vorgaben
Bei einem Bild behält das Modell bei, was darauf zu sehen ist. Für große Änderungen — Wetter, Kleidung, ein anderes Set — beschreiben Sie den Wechsel explizit, anstatt zu erwarten, dass der Prompt das Bild einfach überschreibt.
Ein Hauptmotiv beibehalten
Eine einzelne Figur, ein definierter Kameraweg und die Worte „no cuts“ lieferten uns jedes Mal einen sauberen Take. Bei Menschenmengen, Händen und kleinen Requisiten wird jedes Videomodell, auch dieses, unschärfer.
Günstig entwerfen, hochwertig liefern
480p nutzt dasselbe Modell zu einem Viertel des 1080p-Preises. Validieren Sie die Story in 480p und rendern Sie den Gewinner dann in 1080p mit demselben Prompt und denselben Referenzen neu.

Wan 3.0 vs. Seedance 2.5 vs. Gemini Omni 1.1 Flash

Drei Modelle auf Popcraft, die Sound mit dem Bild generieren. Wans Vorteil ist der günstigste 30-Sekunden-Take auf der Plattform und hohe Wiedergabetreue der Referenzen; Seedance punktet bei der Anzahl der Referenzen und Bearbeitung; Omni bietet 4K und 40 Sekunden durch Erweiterung. Wählen Sie je nach Aufgabe.

FähigkeitWan 3.0Seedance 2.5Gemini Omni 1.1 Flash
Längster Clip aus einer Anfrage30 s in einem Durchgang30 s40 s durch Szenen-Erweiterung (30 s bei 4K)
Auflösungen480p / 720p / 1080p bei 30 fpsBis zu 1080p360p Draft bis 4K
Nativer SoundDialog, Musik, Effekte; abschaltbarJaSprache, Musik, Soundeffekte
ReferenzbilderBis zu 4Bis zu 30Bis zu 10
ReferenzvideosBis zu 5, 15 s insgesamtBis zu 10Bis zu 3
ReferenzaudioBis zu 5, 15 s insgesamtBis zu 10
Clip bearbeiten/erweitern— (nutzen Sie Seedance 2.5 oder Omni)Editieren; davor/danach erweiternEditieren; in 10-s-Schritten erweitern
Ein 30-Sekunden-Entwurf330 Credits bei 480pPro Sekunde, nach Auflösung150 Credits bei 360p

Wan-Zahlen stammen aus Alibabas Model Studio Guide; die Popcraft-Limits entsprechen der aktuellen Auswahl im Tool. Anbieter-Limits können sich ändern; der Picker zeigt immer die aktuelle Verfügbarkeit. Komplette Vergleiche: Seedance 2.5 · Gemini Omni 1.1 Flash.

Wan 3.0 Preise auf Popcraft

Abgerechnet wird pro gelieferter Sekunde, nach Auflösung. Das Anhängen von Referenzen ist kostenlos. Da die gelieferte Länge der Anfrage entspricht, ist der vorab angezeigte Preis genau das, was Sie zahlen.

480p
11 Credits / s
Entwürfe
30 s = 330 Credits
720p
20 Credits / s
Social Media
15 s = 300 Credits
1080p
40 Credits / s
Hero-Platzierungen
30 s = 1.200 Credits

Jeder Plan enthält Credits; die Preisseite listet die aktuellen Raten für alle Modelle. Downloads im Gratis-Tarif enthalten ein Popcraft-Wasserzeichen, das in den kostenpflichtigen Plänen entfernt wird.

Wofür Alibaba Wan 3.0 empfiehlt

Die drei Szenarien aus Alibabas offiziellem Launch-Material und wie man sie auf Popcraft umsetzt.

  • 01

    Short-Video-Content: Dramatisierung und Werbe-Teaser

    Alibabas Entertainment-Szenario. Bis zu 30 Sekunden narrative Handlung aus einem Prompt, inklusive Sound.

  • 02

    E-Commerce: Produktpräsentation aus einem Bild

    Alibabas E-Commerce-Szenario — „Produktbild plus Beschreibung hochladen, dynamische Präsentation erhalten“. Fügen Sie das Foto als Image 1 an.

  • 03

    Bildung: Inszenierte Szenario-Simulationen

    Alibabas Bildungs-Szenario — ein Arztgespräch oder ein Support-Anruf, inszeniert per Prompt mit generiertem Dialog.

  • 04

    Entwurf in 480p, Lieferung in 1080p

    Die Popcraft-Ergänzung: 11 Credits pro Sekunde bei 480p machen einen 30-Sekunden-Entwurf günstig (330 Credits), bevor Sie sich für 1080p entscheiden.

Wan 3.0 — Häufig gestellte Fragen

Alibabas All-in-One-Videomodell vom Tongyi Lab, seit 6. August 2026 in der Beta. Ein Modell deckt Text-to-Video, Image-to-Video, Keyframe-Steuerung und Multi-Referenz-Generierung ab. Es produziert Längen von 2 bis 30 Sekunden in einem Durchgang bei 30 fps und generiert Dialoge, Musik und Soundeffekte direkt mit.

Jede volle Sekunde von 2 bis 30 in einem Durchgang — keine Kette von Erweiterungen, kein Zusammenfügen. Auf Popcraft stellen Sie die Länge per Schieberegler ein; die Datei entspricht exakt der Anfrage. In unseren Tests lagen alle Clips innerhalb von Hundertstelsekunden der Wunschlänge.

Standardmäßig ja. Laut Alibaba gibt das Modell nativ Dialoge, BGM und Soundeffekte aus. Der Audio-Switch auf Popcraft erlaubt es jedoch, den Ton auszuschalten, sodass die Datei keine Audiospur enthält.

Hängen Sie bis zu 4 Bilder, 5 Video- und 5 Audioclips an und beziehen Sie sich im Prompt auf sie (Image 1, Video 1 etc.). Bilder liefern Charaktere oder Szenen; Videos liefern Bewegung und Kamera; Audio liefert Stimme oder Rhythmus. Videos und Audio sind auf insgesamt 15 Sekunden begrenzt. Keyframes (Start/Endbild) können nicht mit anderen Referenzen gemischt werden.

Dafür wurde das Modell gebaut. Alibaba nennt Konsistenz von Charakteren, Kleidung und Umgebung als Hauptmerkmal. In unseren Tests blieb die Identität eines Character-Sheets über 30 Sekunden und komplexe Kamerabewegungen stabil. Wan 3.0 orientiert sich stark am Bild — für kreative Abweichungen sollten Sie diese explizit beschreiben.

Aktuell nicht direkt auf Popcraft. Wan 3.0 nutzt Clips als Referenz für Bewegung; zum Erweitern oder Editieren von Material nutzen Sie Seedance 2.5 oder Gemini Omni 1.1 Flash.

Das Modell nutzt Audio-Referenzen für die Klangfarbe, während der Text im Prompt steht; Sprache und Mundbewegung werden dann zusammen generiert. Es ist kein reines „Mouth-to-Recording“-Tool. Für Talking-Head-Clips basierend auf einer spezifischen Aufnahme nutzen Sie ein Avatar-Modell wie OmniHuman.

Wan 3.0 wird pro Sekunde berechnet: 11 Credits bei 480p, 20 bei 720p und 40 bei 1080p. Ein 30-Sekunden-Entwurf in 480p kostet 330 Credits; in 1080p sind es 1.200. Der Preis wird vor der Generierung angezeigt. Gratis-Downloads haben ein Wasserzeichen.

Dreißig Sekunden, eine Anfrage. Testen Sie es zuerst in 480p.

Entwerfen Sie für 330 Credits, prüfen Sie die Story und rendern Sie dann in 1080p — oder bringen Sie Character-Sheet und Clip zusammen.

Weiter erkunden

Ähnliche Modelle