Alibaba · Tongyi Lab
Wan 3.0 : vidéo IA de 30 secondes en un seul passage, avec son intégré
Wan 3.0 est le générateur vidéo IA tout-en-un d'Alibaba. Il transforme un prompt, une image ou un ensemble de références en une vidéo de n'importe quelle durée entre 2 et 30 secondes en une seule requête, jusqu'en 1080p à 30 ips, et génère les dialogues, la musique et les effets sonores simultanément. Sur Popcraft, à partir de 11 crédits la seconde.
Dans le studio vidéo, les tableaux Canvas et le connecteur MCP
- 2–30 s
- seconde entière, un seul passage
- 1080p 30 ips
- niveaux 480p et 720p aussi
- 4 · 5 · 5 réf.
- images, clips, audio
- 11 cr / s
- à 480p — 330 pour 30 s
Durée native de 30s
La fonctionnalité phare d'Alibaba : "une narration plus complète et une liberté créative totale" grâce à un passage natif de 30 secondes. Voici le film principal ci-dessus découpé en six moments clés, et les données réelles des clips générés pour cette page.
1s
6s
12s
18s
24s
29s| Requête | Livré | Temps réel |
|---|---|---|
| 30 s · 1080p · texte seul | 30,02 s · 1920×1080 · stéréo | 5 min 38 s |
| 5 s · 720p · texte seul | 5,04 s · 1280×720 · stéréo | 1 min 37 s |
| 3 s et 10 s · d'après un clip de référence de 6 s | 3,02 s et 10,03 s · le clip a dicté le mouvement, pas la durée | ≈ 1 min 25 s chaque |
Le temps réel correspond au délai entre l'envoi et le fichier sur Popcraft, septembre 2026. Chaque clip est arrivé à quelques centièmes de seconde près de la demande : les crédits affichés avant la génération sont donc bien les crédits dépensés.
Expérience immersive : réalisme, textures et design sonore
Selon les mots d'Alibaba : "réalisme accru, texture et design sonore". Trois films, trois styles — prise de vue réelle, CG de type long-métrage, fantastique publicitaire — chacun en une seule requête, une prise continue, 30 secondes, avec la bande sonore générée simultanément. Seul le prompt a changé.
Le Rideau
Le film principal : une interprète de l'opéra de Pékin du miroir de sa loge jusqu'à la scène. Les tambours montent, un gong résonne, la salle exulte.
Esprit renard
Un renard à neuf queues sprinte sur des toits éclairés par des lanternes, saute dans le vide alors que les lanternes s'éparpillent, se détache sur la pleine lune et atterrit sur le clocher. Style 3D pictural à partir d'un simple prompt texte.
Distributeur automatique
Une fille en imperméable jaune appuie sur un bouton dans une ruelle pluvieuse et se retrouve aspirée à travers la vitre dans un monde aux couleurs pop où une mascotte lui tend une canette. Le pétillant devient feu d'artifice, et la caméra recule vers la ruelle.
Chaque film ici est présenté tel que livré : aucun montage, aucune musique ajoutée. Les brouillons en 480p coûtent 330 crédits ; le 1080p est à 1 200.
Qu'est-ce que Wan 3.0 ?
Wan 3.0 (万相 3.0) est le modèle vidéo du Tongyi Lab d'Alibaba, en bêta publique depuis le 6 août 2026 et lancé le 24 août. Alibaba le décrit comme un modèle vidéo de référence tout-en-un : un seul modèle pour le texte-en-vidéo, l'image-en-vidéo, le contrôle de la première et dernière image et la génération à partir de références mixtes, au lieu d'un modèle par tâche. Il est disponible uniquement via API — aucun poids n'est ouvert — et Popcraft exploite l'édition Prime, la plus rapide des deux versions d'Alibaba.
Guide Alibaba Cloud Model Studio et référence API pour wan3.0-video ; README officiel du dépôt Wan 3.0 ; résumé de lancement de la communauté de développeurs d'Alibaba. Les affirmations ci-dessus sont celles d'Alibaba ; les mesures sur cette page sont les nôtres.
“Génère de manière stable jusqu'à 30 secondes de vidéo par requête, à 30 images par seconde.”
Durée
“Produit nativement les dialogues, la musique de fond et les effets sonores — pas de doublage en post-production.”
Son
“Cohérence de l'apparence des personnages, des vêtements, des accessoires, de l'environnement et du style visuel ; mouvements de caméra poussés, tirés, panoramiques et suivis.”
Cohérence et caméra
- Durée native de 30s“Une narration plus complète et une liberté créative totale.”Sur Popcraft : n'importe quelle durée de 2 à 30 secondes, un seul passage.
- Omni-Creation“Jusqu'à 20 actifs de référence, avec analyse de documents et de pages web.”Sur Popcraft : 4 images, 5 clips, 5 audio. Documents et pages web pas encore disponibles.
- Cohérence au pixel près“Améliorer la certitude de livraison pour les flux de production.”Sur Popcraft : oui — voir les arrêts sur image ci-dessous.
- Expérience immersive“Réalisme accru, texture et design sonore.”Sur Popcraft : oui — dialogues, musique et effets générés avec l'image.
- Montage vidéo de précision“Édition plus contrôlable pour booster l'efficacité créative.”Pas encore sur Popcraft — utilisez Seedance 2.5 ou Gemini Omni pour éditer ou étendre.
Omni-Creation : images, clips et audio dans un seul prompt
La deuxième fonctionnalité clé d'Alibaba : générer à partir d'entrées multimodales. Sur Popcraft, cela signifie jusqu'à 4 images, 5 clips vidéo et 5 clips audio par requête, chacun nommé dans le prompt comme Image 1, Video 1 ou Audio 1 selon l'ordre d'ajout. La plateforme d'Alibaba analyse aussi les documents et pages web ; cette partie n'est pas encore sur Popcraft.
Sujets, produits et décors
Une fiche personnage verrouille un visage et une garde-robe ; une photo de produit verrouille l'objet ; une photo de lieu verrouille le décor. Le modèle conserve ce qui est dans l'image, décrivez donc explicitement les changements souhaités. Deux images avec "première image" et "dernière image" dans le prompt deviennent des images clés (keyframes).
JPEG, PNG, WEBP ou BMP · 240 à 8 000 px de côté · 20 Mo chacun
La femme de l'Image 1 marche dans la rue de l'Image 2 au crépuscule, la caméra la suit de côté. Gardez ses cheveux, son manteau et son sac exactement comme sur l'Image 1.
Mouvement, caméra et performance
Un clip transmet sa trajectoire caméra, son placement et sa performance au nouveau plan. Associez-le à une image et le sujet de l'image effectuera le mouvement du clip sur le décor du clip. Le clip définit le mouvement, pas la durée — c'est le curseur qui s'en charge.
MP4 ou MOV · 1 à 15 s chacun et 15 s au total · 100 Mo chacun
L'homme de l'Image 1 se tient entre les piliers. Suivez exactement le mouvement de caméra de Video 1 : un plan large en contre-plongée tournant à droite vers un gros plan de trois-quarts.
Timbre de voix ou rythme
La méthode Alibaba : l'audio porte la voix ou le rythme, et la réplique est écrite dans le prompt ; le modèle génère la parole et le mouvement de la bouche ensemble. Ce n'est pas un outil de synchronisation labiale sur enregistrement — pour cela, utilisez un modèle d'avatar comme OmniHuman.
WAV ou MP3 · 1 à 15 s chacun et 15 s au total · 15 Mo chacun
Prenez le timbre de Audio 1 et faites dire au personnage : "Vraiment ? Ça a l'air super — quand reviens-tu ?" La parole générée commande un mouvement naturel de la bouche.
Les images clés et les références ne se mélangent pas. Deux images marquées comme première et dernière image créent un clip basé sur ces images clés uniquement ; tout le reste — images de sujet, clips, audio — se combine librement dans les limites ci-dessus.
Cohérence au pixel près
La troisième fonctionnalité phare d'Alibaba : "améliorer la certitude de livraison pour les flux de production" — la fiche technique souligne la préservation des détails du personnage et des références à travers les images. Voici la même interprète du film principal à trois moments, espacés de 28 secondes.
1 s
12 s
29 sComment prompter Wan 3.0
Le modèle planifie tout le clip à partir du prompt, celui-ci doit donc définir la nature du clip. Nos rendus sont restés stables dès que nous avons précisé la continuité — prise unique sans coupure, ou liste numérotée de plans. Le reste en découle.
Spécifiez "no cuts", puis cadencez les temps forts
Commencez par "one continuous take, no cuts, no transitions", donnez à chaque segment de secondes une action et un verbe de caméra, gardez un seul sujet principal dans le cadre, et écrivez le son dans sa propre phrase. Le film principal a été écrit exactement ainsi et nous est revenu sans une seule coupure.
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe. 0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes. 6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build. 16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder. 24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes. Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
- Nommez les références
- Image 1, Video 1, Audio 1 — numérotées par type selon l'ordre d'ajout — et précisez l'usage : "Image 1 est le personnage ; Video 1 est le mouvement de caméra".
- Dirigez le son
- Par défaut, le modèle génère dialogues, musique et effets. Demandez ce que vous voulez — "pluie et tramway lointain, pas de dialogue" — ou désactivez l'interrupteur Audio pour un fichier muet.
- Fidélité avant tout
- Avec une image, le modèle garde son contenu. Pour un changement majeur — météo, garde-robe, décor différent — décrivez le changement explicitement au lieu d'espérer que le prompt l'emporte sur l'image.
- Un seul sujet principal
- Un seul personnage, une trajectoire caméra définie et les mots "no cuts" nous ont donné une prise propre à chaque fois. Les foules et petits accessoires sont là où tous les modèles vidéo, celui-ci inclus, perdent en précision.
- Maquette éco, rendu final pro
- Le 480p utilise le même modèle pour un quart du prix du 1080p. Validez votre histoire en 480p, puis relancez le meilleur rendu en 1080p avec les mêmes prompts et références.
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Trois modèles sur Popcraft générant du son avec l'image. L'atout de Wan est la prise de 30 secondes la moins chère et une grande fidélité aux références ; Seedance excelle par son nombre de références et l'édition ; Omni propose la 4K et 40 secondes par extension. Choisissez selon le projet.
| Capacité | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| Plus long clip en une requête | 30 s en un seul passage | 30 s | 40 s par extension (30 s en 4K) |
| Résolutions | 480p / 720p / 1080p à 30 ips | Jusqu'à 1080p | Brouillon 360p jusqu'à 4K |
| Audio natif | Dialogues, musique, effets ; désactivable | Oui | Parole, musique, effets sonores |
| Images de référence | Jusqu'à 4 | Jusqu'à 30 | Jusqu'à 10 |
| Vidéos de référence | Jusqu'à 5, 15 s au total | Jusqu'à 10 | Jusqu'à 3 |
| Audio de référence | Jusqu'à 5, 15 s au total | Jusqu'à 10 | — |
| Éditer ou étendre un clip | — (utilisez Seedance 2.5 ou Omni) | Édition ; extension avant ou après | Édition ; extension par segments de 10 s |
| Brouillon de 30 secondes | 330 crédits en 480p | Par seconde, selon résolution | 150 crédits en 360p |
Les chiffres Wan proviennent du guide Alibaba Model Studio ; les limites Popcraft sont celles disponibles aujourd'hui. Les plafonds des fournisseurs évoluent ; le sélecteur affiche toujours le maximum actuel. Comparatifs complets : Seedance 2.5 · Gemini Omni 1.1 Flash.
Tarifs Wan 3.0 sur Popcraft
Facturation par seconde livrée, selon la résolution. L'ajout de références est gratuit. Comme la durée livrée correspond à la demande, le prix affiché avant génération est le prix payé.
Chaque forfait inclut des crédits ; la page des tarifs liste les taux actuels pour tous les modèles. Les téléchargements en version gratuite comportent un filigrane Popcraft, retiré avec les forfaits payants.
Usages recommandés par Alibaba pour Wan 3.0
Les trois scénarios issus du matériel de lancement d'Alibaba, et comment les réaliser sur Popcraft.
- 01
Contenu vidéo court : dramatisation et teasers publicitaires
Le scénario divertissement d'Alibaba. Jusqu'à 30 secondes de récit multi-plans à partir d'un seul prompt, son inclus.
- 02
E-commerce : présentation de produit à partir d'une image
Le scénario e-commerce d'Alibaba — "téléchargez une image produit et une description, obtenez une présentation dynamique". Joignez la photo en Image 1.
- 03
Éducation : simulations de scénarios mis en scène
Le scénario éducation d'Alibaba — une consultation médicale ou un appel de support mis en scène via prompt, avec dialogue généré.
- 04
Maquette en 480p, livraison en 1080p
L'avantage Popcraft : à 11 crédits la seconde en 480p, validez un brouillon de 30 secondes pour 330 crédits avant de passer au 1080p.
Wan 3.0 — foire aux questions
Le modèle vidéo tout-en-un d'Alibaba (Tongyi Lab), lancé fin août 2026. Il gère le texte-en-vidéo, l'image-en-vidéo, les images clés et les multi-références pour produire des clips de 2 à 30 secondes en un seul passage à 30 ips, avec génération simultanée des dialogues, de la musique et des effets sonores.
De 2 à 30 secondes entières, en un seul passage — sans chaîne d'extension ni assemblage. Sur Popcraft, vous réglez la durée avec un curseur et recevez un fichier exact ; le prix payé correspond précisément aux secondes demandées.
Oui, par défaut. Le modèle produit nativement dialogues, musique et effets sonores spécifiés dans le prompt. L'interrupteur Audio sur Popcraft permet de le désactiver pour obtenir un fichier totalement muet.
Joignez jusqu'à 4 images, 5 clips vidéo et 5 clips audio. Nommez-les dans votre prompt (Image 1, Video 1, Audio 1) selon leur ordre d'ajout. Les images fixent les personnages ou décors, les vidéos le mouvement, et l'audio la voix ou le rythme. Vidéos et audios sont limités à 15 secondes au total. Deux images marquées "first frame" et "last frame" créent un clip entre ces deux points et ne peuvent pas être mélangées à d'autres références.
C'est sa force principale. Alibaba met en avant la cohérence de l'apparence, des vêtements et des décors. Wan 3.0 respecte fidèlement l'image fournie : pour des changements créatifs majeurs par rapport à une référence, vous devez les décrire explicitement.
Pas directement sur Popcraft aujourd'hui. Wan 3.0 utilise un clip joint comme référence de mouvement ou de sujet. Pour étendre ou modifier une séquence existante, utilisez Seedance 2.5 ou Gemini Omni 1.1 Flash.
Non, les références audio servent à capturer un timbre de voix ou un rythme, tandis que le texte parlé doit être écrit dans le prompt. Le modèle génère alors la voix et le mouvement des lèvres ensemble. Pour un enregistrement vocal spécifique pilotant un visage, utilisez un modèle d'avatar comme OmniHuman.
La facturation se fait par seconde livrée : 11 crédits en 480p, 20 en 720p et 40 en 1080p. Un brouillon de 30 secondes en 480p coûte 330 crédits. Le prix est affiché avant la génération selon vos réglages.
Trente secondes, une seule requête. Essayez d'abord en 480p.
Créez votre brouillon pour 330 crédits, validez l'histoire, puis lancez le rendu final en 1080p — ou mariez une fiche personnage et un clip de référence.
Continuez à explorer
Modèles associés
Seedance 2.5 génère jusqu'à 30 secondes de vidéo en une seule tâche, avec jusqu'à 50 ressources de référence, de l'édition vidéo contrôlable, de l'extension temporelle haute fidélité, n'importe quel ratio d'aspect de 0,4 à 2,5 et du prompting natif dans plus de 10 langues. Disponible sur Popcraft.
Gemini Omni 1.1 Flash est le modèle vidéo de Google qui crée et modifie des vidéos à partir de n'importe quel élément en entrée. Jusqu'à 40 secondes par extension de scène, sortie 1080p et 4K, interpolation des première et dernière images, jusqu'à 10 images de référence, et paroles, musique et effets sonores générés en même temps que l'image. Disponible sur Popcraft.
MiniMax H3 génère des vidéos 2K à 24 fps avec bande-son stéréo synchronisée : effets, ambiance et dialogues. Multi-plans, 5 à 15 s, contrôle des images clés. Sur Popcraft.
Générez de la vidéo cinématographique en 4K à partir de texte, d'images ou de clips avec Seedance 2.0 sur Popcraft. Audio synchronisé natif, séquences multi-plans et détail d'une netteté absolue jusqu'en 4K (2160p).