NEWVotre prochaine publicité UGC virale est à portée de clic. Découvrez Studio.Créer une publicité
PopcraftPopcraft
Nouveau modèle vidéo

Alibaba · Tongyi Lab

Wan 3.0 : vidéo IA de 30 secondes en un seul passage, avec son intégré

Wan 3.0 est le générateur vidéo IA tout-en-un d'Alibaba. Il transforme un prompt, une image ou un ensemble de références en une vidéo de n'importe quelle durée entre 2 et 30 secondes en une seule requête, jusqu'en 1080p à 30 ips, et génère les dialogues, la musique et les effets sonores simultanément. Sur Popcraft, à partir de 11 crédits la seconde.

Dans le studio vidéo, les tableaux Canvas et le connecteur MCP

2–30 s
seconde entière, un seul passage
1080p 30 ips
niveaux 480p et 720p aussi
4 · 5 · 5 réf.
images, clips, audio
11 cr / s
à 480p — 330 pour 30 s
00secondes, prise unique
prise unique · audio généré · sans montage

Durée native de 30s

La fonctionnalité phare d'Alibaba : "une narration plus complète et une liberté créative totale" grâce à un passage natif de 30 secondes. Voici le film principal ci-dessus découpé en six moments clés, et les données réelles des clips générés pour cette page.

1 seconde : gros plan extrême sur le visage maquillé de l'artiste dans le miroir de la loge1s
6 secondes : elle se lève du miroir vêtue de sa robe pourpre et or6s
12 secondes : le couloir des coulisses, les techniciens se collant aux murs sur son passage12s
18 secondes : sa main sur le rideau de velours rouge18s
24 secondes : passage à travers le rideau sous la lumière de la scène, la salle éclairée par des lanternes s'ouvrant derrière24s
29 secondes : la manche d'eau levée devant un théâtre bondé sous des lanternes rouges29s
Une seule interprète, une seule robe, un seul étalonnage du miroir à la scène — loge, couloir, rideau, salle comble, en une seule requête sans coupure.
Livré par rapport à la demande
RequêteLivréTemps réel
30 s · 1080p · texte seul30,02 s · 1920×1080 · stéréo5 min 38 s
5 s · 720p · texte seul5,04 s · 1280×720 · stéréo1 min 37 s
3 s et 10 s · d'après un clip de référence de 6 s3,02 s et 10,03 s · le clip a dicté le mouvement, pas la durée≈ 1 min 25 s chaque

Le temps réel correspond au délai entre l'envoi et le fichier sur Popcraft, septembre 2026. Chaque clip est arrivé à quelques centièmes de seconde près de la demande : les crédits affichés avant la génération sont donc bien les crédits dépensés.

Expérience immersive : réalisme, textures et design sonore

Selon les mots d'Alibaba : "réalisme accru, texture et design sonore". Trois films, trois styles — prise de vue réelle, CG de type long-métrage, fantastique publicitaire — chacun en une seule requête, une prise continue, 30 secondes, avec la bande sonore générée simultanément. Seul le prompt a changé.

Prise de vue réelle30.0s1 takelive action

Le Rideau

Le film principal : une interprète de l'opéra de Pékin du miroir de sa loge jusqu'à la scène. Les tambours montent, un gong résonne, la salle exulte.

CG Long-métrage30.0s1 take3D-CG look

Esprit renard

Un renard à neuf queues sprinte sur des toits éclairés par des lanternes, saute dans le vide alors que les lanternes s'éparpillent, se détache sur la pleine lune et atterrit sur le clocher. Style 3D pictural à partir d'un simple prompt texte.

Fantastique publicitaire30.0s1 takebrand fantasy

Distributeur automatique

Une fille en imperméable jaune appuie sur un bouton dans une ruelle pluvieuse et se retrouve aspirée à travers la vitre dans un monde aux couleurs pop où une mascotte lui tend une canette. Le pétillant devient feu d'artifice, et la caméra recule vers la ruelle.

Chaque film ici est présenté tel que livré : aucun montage, aucune musique ajoutée. Les brouillons en 480p coûtent 330 crédits ; le 1080p est à 1 200.

Qu'est-ce que Wan 3.0 ?

Wan 3.0 (万相 3.0) est le modèle vidéo du Tongyi Lab d'Alibaba, en bêta publique depuis le 6 août 2026 et lancé le 24 août. Alibaba le décrit comme un modèle vidéo de référence tout-en-un : un seul modèle pour le texte-en-vidéo, l'image-en-vidéo, le contrôle de la première et dernière image et la génération à partir de références mixtes, au lieu d'un modèle par tâche. Il est disponible uniquement via API — aucun poids n'est ouvert — et Popcraft exploite l'édition Prime, la plus rapide des deux versions d'Alibaba.

Guide Alibaba Cloud Model Studio et référence API pour wan3.0-video ; README officiel du dépôt Wan 3.0 ; résumé de lancement de la communauté de développeurs d'Alibaba. Les affirmations ci-dessus sont celles d'Alibaba ; les mesures sur cette page sont les nôtres.

Selon Alibaba
  1. Génère de manière stable jusqu'à 30 secondes de vidéo par requête, à 30 images par seconde.

    Durée

  2. Produit nativement les dialogues, la musique de fond et les effets sonores — pas de doublage en post-production.

    Son

  3. Cohérence de l'apparence des personnages, des vêtements, des accessoires, de l'environnement et du style visuel ; mouvements de caméra poussés, tirés, panoramiques et suivis.

    Cohérence et caméra

Les cinq fonctionnalités phares d'Alibaba
  1. Durée native de 30sUne narration plus complète et une liberté créative totale.Sur Popcraft : n'importe quelle durée de 2 à 30 secondes, un seul passage.
  2. Omni-CreationJusqu'à 20 actifs de référence, avec analyse de documents et de pages web.Sur Popcraft : 4 images, 5 clips, 5 audio. Documents et pages web pas encore disponibles.
  3. Cohérence au pixel prèsAméliorer la certitude de livraison pour les flux de production.Sur Popcraft : oui — voir les arrêts sur image ci-dessous.
  4. Expérience immersiveRéalisme accru, texture et design sonore.Sur Popcraft : oui — dialogues, musique et effets générés avec l'image.
  5. Montage vidéo de précisionÉdition plus contrôlable pour booster l'efficacité créative.Pas encore sur Popcraft — utilisez Seedance 2.5 ou Gemini Omni pour éditer ou étendre.

Omni-Creation : images, clips et audio dans un seul prompt

La deuxième fonctionnalité clé d'Alibaba : générer à partir d'entrées multimodales. Sur Popcraft, cela signifie jusqu'à 4 images, 5 clips vidéo et 5 clips audio par requête, chacun nommé dans le prompt comme Image 1, Video 1 ou Audio 1 selon l'ordre d'ajout. La plateforme d'Alibaba analyse aussi les documents et pages web ; cette partie n'est pas encore sur Popcraft.

Image 1 … Image 4

Sujets, produits et décors

Une fiche personnage verrouille un visage et une garde-robe ; une photo de produit verrouille l'objet ; une photo de lieu verrouille le décor. Le modèle conserve ce qui est dans l'image, décrivez donc explicitement les changements souhaités. Deux images avec "première image" et "dernière image" dans le prompt deviennent des images clés (keyframes).

JPEG, PNG, WEBP ou BMP · 240 à 8 000 px de côté · 20 Mo chacun

La femme de l'Image 1 marche dans la rue de l'Image 2 au crépuscule, la caméra la suit de côté. Gardez ses cheveux, son manteau et son sac exactement comme sur l'Image 1.
Video 1 … Video 5

Mouvement, caméra et performance

Un clip transmet sa trajectoire caméra, son placement et sa performance au nouveau plan. Associez-le à une image et le sujet de l'image effectuera le mouvement du clip sur le décor du clip. Le clip définit le mouvement, pas la durée — c'est le curseur qui s'en charge.

MP4 ou MOV · 1 à 15 s chacun et 15 s au total · 100 Mo chacun

L'homme de l'Image 1 se tient entre les piliers. Suivez exactement le mouvement de caméra de Video 1 : un plan large en contre-plongée tournant à droite vers un gros plan de trois-quarts.
Audio 1 … Audio 5

Timbre de voix ou rythme

La méthode Alibaba : l'audio porte la voix ou le rythme, et la réplique est écrite dans le prompt ; le modèle génère la parole et le mouvement de la bouche ensemble. Ce n'est pas un outil de synchronisation labiale sur enregistrement — pour cela, utilisez un modèle d'avatar comme OmniHuman.

WAV ou MP3 · 1 à 15 s chacun et 15 s au total · 15 Mo chacun

Prenez le timbre de Audio 1 et faites dire au personnage : "Vraiment ? Ça a l'air super — quand reviens-tu ?" La parole générée commande un mouvement naturel de la bouche.

Les images clés et les références ne se mélangent pas. Deux images marquées comme première et dernière image créent un clip basé sur ces images clés uniquement ; tout le reste — images de sujet, clips, audio — se combine librement dans les limites ci-dessus.

Cohérence au pixel près

La troisième fonctionnalité phare d'Alibaba : "améliorer la certitude de livraison pour les flux de production" — la fiche technique souligne la préservation des détails du personnage et des références à travers les images. Voici la même interprète du film principal à trois moments, espacés de 28 secondes.

Le visage maquillé de l'interprète dans le miroir de la loge à 1 seconde1 s
La même interprète dans le couloir des coulisses à 12 secondes12 s
La même interprète sur scène devant la salle comble à 29 secondes29 s
Même visage, même coiffe, même robe du miroir à la scène. Joignez une fiche personnage ou une photo de produit comme Image 1 et le modèle conserve ce que vous lui donnez ; lors de nos tests, une photo de produit carrée a été reproduite fidèlement dans un cadre 16:9, et un clip de référence de six secondes a piloté des résultats de trois et dix secondes sans changer le sujet.

Comment prompter Wan 3.0

Le modèle planifie tout le clip à partir du prompt, celui-ci doit donc définir la nature du clip. Nos rendus sont restés stables dès que nous avons précisé la continuité — prise unique sans coupure, ou liste numérotée de plans. Le reste en découle.

Pour une prise unique

Spécifiez "no cuts", puis cadencez les temps forts

Commencez par "one continuous take, no cuts, no transitions", donnez à chaque segment de secondes une action et un verbe de caméra, gardez un seul sujet principal dans le cadre, et écrivez le son dans sa propre phrase. Le film principal a été écrit exactement ainsi et nous est revenu sans une seule coupure.

ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe.
0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes.
6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build.
16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder.
24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes.
Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
Nommez les références
Image 1, Video 1, Audio 1 — numérotées par type selon l'ordre d'ajout — et précisez l'usage : "Image 1 est le personnage ; Video 1 est le mouvement de caméra".
Dirigez le son
Par défaut, le modèle génère dialogues, musique et effets. Demandez ce que vous voulez — "pluie et tramway lointain, pas de dialogue" — ou désactivez l'interrupteur Audio pour un fichier muet.
Fidélité avant tout
Avec une image, le modèle garde son contenu. Pour un changement majeur — météo, garde-robe, décor différent — décrivez le changement explicitement au lieu d'espérer que le prompt l'emporte sur l'image.
Un seul sujet principal
Un seul personnage, une trajectoire caméra définie et les mots "no cuts" nous ont donné une prise propre à chaque fois. Les foules et petits accessoires sont là où tous les modèles vidéo, celui-ci inclus, perdent en précision.
Maquette éco, rendu final pro
Le 480p utilise le même modèle pour un quart du prix du 1080p. Validez votre histoire en 480p, puis relancez le meilleur rendu en 1080p avec les mêmes prompts et références.

Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash

Trois modèles sur Popcraft générant du son avec l'image. L'atout de Wan est la prise de 30 secondes la moins chère et une grande fidélité aux références ; Seedance excelle par son nombre de références et l'édition ; Omni propose la 4K et 40 secondes par extension. Choisissez selon le projet.

CapacitéWan 3.0Seedance 2.5Gemini Omni 1.1 Flash
Plus long clip en une requête30 s en un seul passage30 s40 s par extension (30 s en 4K)
Résolutions480p / 720p / 1080p à 30 ipsJusqu'à 1080pBrouillon 360p jusqu'à 4K
Audio natifDialogues, musique, effets ; désactivableOuiParole, musique, effets sonores
Images de référenceJusqu'à 4Jusqu'à 30Jusqu'à 10
Vidéos de référenceJusqu'à 5, 15 s au totalJusqu'à 10Jusqu'à 3
Audio de référenceJusqu'à 5, 15 s au totalJusqu'à 10
Éditer ou étendre un clip— (utilisez Seedance 2.5 ou Omni)Édition ; extension avant ou aprèsÉdition ; extension par segments de 10 s
Brouillon de 30 secondes330 crédits en 480pPar seconde, selon résolution150 crédits en 360p

Les chiffres Wan proviennent du guide Alibaba Model Studio ; les limites Popcraft sont celles disponibles aujourd'hui. Les plafonds des fournisseurs évoluent ; le sélecteur affiche toujours le maximum actuel. Comparatifs complets : Seedance 2.5 · Gemini Omni 1.1 Flash.

Tarifs Wan 3.0 sur Popcraft

Facturation par seconde livrée, selon la résolution. L'ajout de références est gratuit. Comme la durée livrée correspond à la demande, le prix affiché avant génération est le prix payé.

480p
11 crédits / s
Brouillons
30 s = 330 crédits
720p
20 crédits / s
Réseaux sociaux
15 s = 300 crédits
1080p
40 crédits / s
Contenus premium
30 s = 1 200 crédits

Chaque forfait inclut des crédits ; la page des tarifs liste les taux actuels pour tous les modèles. Les téléchargements en version gratuite comportent un filigrane Popcraft, retiré avec les forfaits payants.

Usages recommandés par Alibaba pour Wan 3.0

Les trois scénarios issus du matériel de lancement d'Alibaba, et comment les réaliser sur Popcraft.

  • 01

    Contenu vidéo court : dramatisation et teasers publicitaires

    Le scénario divertissement d'Alibaba. Jusqu'à 30 secondes de récit multi-plans à partir d'un seul prompt, son inclus.

  • 02

    E-commerce : présentation de produit à partir d'une image

    Le scénario e-commerce d'Alibaba — "téléchargez une image produit et une description, obtenez une présentation dynamique". Joignez la photo en Image 1.

  • 03

    Éducation : simulations de scénarios mis en scène

    Le scénario éducation d'Alibaba — une consultation médicale ou un appel de support mis en scène via prompt, avec dialogue généré.

  • 04

    Maquette en 480p, livraison en 1080p

    L'avantage Popcraft : à 11 crédits la seconde en 480p, validez un brouillon de 30 secondes pour 330 crédits avant de passer au 1080p.

Wan 3.0 — foire aux questions

Le modèle vidéo tout-en-un d'Alibaba (Tongyi Lab), lancé fin août 2026. Il gère le texte-en-vidéo, l'image-en-vidéo, les images clés et les multi-références pour produire des clips de 2 à 30 secondes en un seul passage à 30 ips, avec génération simultanée des dialogues, de la musique et des effets sonores.

De 2 à 30 secondes entières, en un seul passage — sans chaîne d'extension ni assemblage. Sur Popcraft, vous réglez la durée avec un curseur et recevez un fichier exact ; le prix payé correspond précisément aux secondes demandées.

Oui, par défaut. Le modèle produit nativement dialogues, musique et effets sonores spécifiés dans le prompt. L'interrupteur Audio sur Popcraft permet de le désactiver pour obtenir un fichier totalement muet.

Joignez jusqu'à 4 images, 5 clips vidéo et 5 clips audio. Nommez-les dans votre prompt (Image 1, Video 1, Audio 1) selon leur ordre d'ajout. Les images fixent les personnages ou décors, les vidéos le mouvement, et l'audio la voix ou le rythme. Vidéos et audios sont limités à 15 secondes au total. Deux images marquées "first frame" et "last frame" créent un clip entre ces deux points et ne peuvent pas être mélangées à d'autres références.

C'est sa force principale. Alibaba met en avant la cohérence de l'apparence, des vêtements et des décors. Wan 3.0 respecte fidèlement l'image fournie : pour des changements créatifs majeurs par rapport à une référence, vous devez les décrire explicitement.

Pas directement sur Popcraft aujourd'hui. Wan 3.0 utilise un clip joint comme référence de mouvement ou de sujet. Pour étendre ou modifier une séquence existante, utilisez Seedance 2.5 ou Gemini Omni 1.1 Flash.

Non, les références audio servent à capturer un timbre de voix ou un rythme, tandis que le texte parlé doit être écrit dans le prompt. Le modèle génère alors la voix et le mouvement des lèvres ensemble. Pour un enregistrement vocal spécifique pilotant un visage, utilisez un modèle d'avatar comme OmniHuman.

La facturation se fait par seconde livrée : 11 crédits en 480p, 20 en 720p et 40 en 1080p. Un brouillon de 30 secondes en 480p coûte 330 crédits. Le prix est affiché avant la génération selon vos réglages.

Trente secondes, une seule requête. Essayez d'abord en 480p.

Créez votre brouillon pour 330 crédits, validez l'histoire, puis lancez le rendu final en 1080p — ou mariez une fiche personnage et un clip de référence.

Continuez à explorer

Modèles associés