Alibaba · Tongyi Lab
Wan 3.0: Video AI 30 saat sekaligus, lengkap dengan bunyinya sendiri
Wan 3.0 ialah penjana video AI serba boleh daripada Alibaba. Ia menukarkan prom, imej atau set rujukan menjadi sebarang tempoh dari 2 hingga 30 saat dalam satu permintaan, sehingga 1080p dan 30 fps, serta merender dialog, muzik dan kesan bunyi dalam tugasan yang sama. Di Popcraft, ia bermula dari 11 kredit sesaat.
Tersedia di studio video, papan Canvas dan penyambung MCP
- 2–30 s
- sebarang saat penuh, sekali jalan
- 1080p 30 fps
- tahap 480p dan 720p juga tersedia
- 4 · 5 · 5 rujukan
- imej, klip, audio
- 11 kr / s
- pada 480p — 330 untuk 30 s
Durasi asli 30s
Ciri utama pertama Alibaba: "penceritaan yang lebih lengkap dan kebebasan kreatif" daripada proses asli 30 saat. Filem utama di atas pada enam titik sepanjang garis masanya, dan apa yang dicatatkan oleh jam serta fail mengenai klip yang kami jana untuk halaman ini.
1s
6s
12s
18s
24s
29s| Permintaan | Dihantar | Masa sebenar |
|---|---|---|
| 30 s · 1080p · teks sahaja | 30.02 s · 1920×1080 · stereo | 5 min 38 s |
| 5 s · 720p · teks sahaja | 5.04 s · 1280×720 · stereo | 1 min 37 s |
| 3 s dan 10 s · daripada klip rujukan 6 s | 3.02 s dan 10.03 s · klip menentukan pergerakan, bukan durasi | ≈ 1 min 25 s setiap satu |
Masa sebenar ialah dari hantar-ke-fail di Popcraft, September 2026. Setiap klip dihantar dalam ralat beberapa perseratus saat daripada permintaan, jadi kredit yang anda lihat sebelum menjana adalah kredit yang anda belanjakan.
Pengalaman imersif: realisme, tekstur dan reka bentuk bunyi
Kata-kata Alibaba: "realisme, tekstur, dan reka bentuk bunyi yang ditingkatkan". Tiga filem, tiga gaya — aksi langsung, CG gaya filem, fantasi jenama — setiap satu satu permintaan, satu rakaman berterusan, 30 saat, dengan runut bunyi dijana dalam proses yang sama. Hanya prom yang diubah.
Tirai
Filem utama di atas: seorang pelakon opera Beijing dari cermin bilik persalinan, menyusuri koridor belakang pentas, melalui tirai baldu ke dewan yang dipenuhi tanglung. Bunyi gendang memuncak, gong berbunyi, penonton bersorak.
Semangat musang
Seekor musang berekor sembilan memecut di atas bumbung bercahaya tanglung, melompat melepasi jurang ketika tanglung bertaburan, terapung berlatarbelakangkan bulan penuh dan mendarat di menara loceng saat tanglung bandar mula naik. Gaya 3D artistik daripada prom teks sahaja.
Mesin layan diri
Seorang gadis berbaju hujan kuning menekan butang di lorong hujan dan ditarik melalui kaca ke dunia berwarna-warni di mana maskot menyerahkannya satu tin air. Bunyi desis menjadi bunga api, dan kamera ditarik keluar semula ke lorong tersebut.
Setiap filem di sini dipaparkan seperti yang dihantar: tanpa suntingan, tanpa muzik tambahan. Draf pada 480p adalah 330 kredit setiap satu; 1080p adalah 1,200.
Apakah itu Wan 3.0?
Wan 3.0 (万相 3.0) ialah model video dari Tongyi Lab Alibaba, dalam beta awam sejak 6 Ogos 2026 dan dilancarkan pada 24 Ogos. Alibaba memanggilnya sebagai model video rujukan serba dalam satu: satu model untuk teks-ke-video, imej-ke-video, kawalan bingkai pertama-dan-terakhir serta penjanaan daripada rujukan campuran, dan bukannya model berasingan bagi setiap tugasan. Ia hanya melalui API — tiada pemberat terbuka — dan Popcraft menjalankan edisi perdana, yang lebih pantas antara dua yang ditawarkan Alibaba.
Panduan Alibaba Cloud Model Studio dan rujukan API untuk wan3.0-video; README repositori rasmi Wan 3.0; ringkasan pelancaran komuniti pembangun Alibaba. Tuntutan di atas adalah milik Alibaba; ukuran di halaman ini adalah milik kami.
“Menjana sehingga 30 saat video secara stabil setiap permintaan, pada 30 bingkai sesaat.”
Durasi
“Mengeluarkan dialog, muzik latar dan kesan bunyi secara asli — tiada alihan suara pasca-produksi.”
Bunyi
“Konsistensi penampilan watak, pakaian, prop, persekitaran dan gaya visual; pergerakan kamera tolak, tarik, pan dan penjejakan.”
Konsistensi dan kamera
- Durasi Asli 30s“Penceritaan yang lebih lengkap dan kebebasan kreatif.”Di Popcraft: sebarang tempoh dari 2 hingga 30 saat, sekali jalan.
- Omni-Creation“Sehingga 20 aset rujukan, dengan penghuraian dokumen dan laman web.”Di Popcraft: 4 imej, 5 klip, 5 audio. Dokumen dan laman web belum tersedia.
- Konsistensi Piksel-Sempurna“Meningkatkan kepastian penghantaran untuk aliran kerja produksi.”Di Popcraft: ya — lihat gambar pegun di bawah.
- Pengalaman Imersif“Realisme, tekstur, dan reka bentuk bunyi yang ditingkatkan.”Di Popcraft: ya — dialog, muzik dan kesan dijana bersama gambar.
- Penyuntingan Video Persis“Penyuntingan yang lebih terkawal untuk meningkatkan kecekapan kreatif.”Belum ada di Popcraft — gunakan Seedance 2.5 atau Gemini Omni untuk menyunting atau menyambung.
Omni-Creation: imej, klip dan audio dalam satu prom
Ciri utama kedua Alibaba — jana daripada input pelbagai mod. Di Popcraft, itu bermakna sehingga 4 imej, 5 klip video dan 5 klip audio dalam satu permintaan, setiap satu dinamakan dalam prom sebagai Image 1, Video 1 atau Audio 1 mengikut susunan lampiran. Platform Alibaba juga menghurai dokumen dan laman web; bahagian tersebut belum ada di Popcraft.
Subjek, produk dan set
Helaian watak menetapkan wajah dan almari pakaian; foto produk menetapkan objek; gambar lokasi menetapkan set. Model mengekalkan apa yang ada dalam gambar, jadi jelaskan sebarang perubahan secara eksplisit. Dua imej dengan "bingkai pertama" dan "bingkai terakhir" dalam prom akan menjadi bingkai utama (keyframes).
JPEG, PNG, WEBP atau BMP · 240 ke 8,000 px sesisi · 20 MB setiap satu
Wanita daripada Image 1 berjalan di sepanjang jalan dalam Image 2 pada waktu senja, kamera menjejak di sisinya. Kekalkan rambut, kot dan begnya tepat seperti dalam Image 1.
Pergerakan, kamera dan persembahan
Satu klip membawa laluan kamera, 'blocking' dan persembahannya ke dalam rakaman baharu. Padankannya dengan imej dan subjek imej tersebut akan melakukan pergerakan klip pada set klip tersebut. Klip menentukan pergerakan, bukan durasi — bar lungsur yang menentukannya.
MP4 atau MOV · 1 ke 15 s setiap satu dan 15 s jumlah keseluruhan · 100 MB setiap satu
Lelaki daripada Image 1 berdiri di antara tiang. Ikuti pergerakan kamera Video 1 dengan tepat: sudut lebar rendah yang mengorbit ke kanan menjadi jarak dekat tiga suku.
Timbre suara atau rentak lagu
Resipi Alibaba: audio membawa suara atau ritma, dan baris dialog diletakkan dalam prom; model menjana pertuturan dan pergerakan mulut bersama-sama. Ia bukan alat penyelarasan mulut-rakaman — untuk itu, gunakan model avatar seperti OmniHuman.
WAV atau MP3 · 1 ke 15 s setiap satu dan 15 s jumlah keseluruhan · 15 MB setiap satu
Ambil timbre daripada Audio 1 dan biarkan watak berkata: "Biar betul? Kedengaran hebat — bila awak balik?" Pertuturan yang dijana memacu pergerakan mulut yang semula jadi.
Bingkai utama dan rujukan tidak boleh dicampur. Dua imej yang ditandakan sebagai bingkai pertama dan terakhir akan menjadi klip bingkai utama sendiri; perkara lain — imej subjek, klip, audio — boleh digabungkan secara bebas sehingga had di atas.
Konsistensi piksel-sempurna
Ciri utama ketiga Alibaba: "meningkatkan kepastian penghantaran untuk aliran kerja produksi" — helaian model menyatakan ia mengekalkan butiran watak dan rujukan merentas bingkai. Pelakon yang sama daripada filem utama pada tiga titik, dengan jarak 28 saat.
1 s
12 s
29 sCara membuat prom untuk Wan 3.0
Model merancang keseluruhan klip daripada prom, jadi prom mestilah menyatakan jenis klip tersebut. Render kami kekal stabil apabila kami menamakan kesinambungannya — satu rakaman tanpa putus, atau senarai rakaman bernombor. Selebihnya mengikut dari situ.
Sebut "no cuts", kemudian tentukan masa setiap bahagian
Mulakan dengan "one continuous take, no cuts, no transitions", berikan setiap tempoh saat satu perkara untuk dilakukan dan satu kata kerja kamera, kekalkan satu subjek utama dalam bingkai, dan tulis bunyi sebagai ayatnya sendiri. Filem utama ditulis tepat seperti ini dan dihasilkan tanpa satu pun potongan.
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Fotoreal sinematik, kontras tinggi. Pelakon opera Beijing dengan solekan muka dan jubah merah-emas. 0–6 s: jarak dekat ekstrem dalam cermin bilik persalinan yang dikelilingi mentol; dia membuka mata. 6–16 s: dia berjalan menyusuri koridor belakang pentas yang sempit, krew pentas merapat ke dinding, kamera menjejak ke belakang di hadapannya sambil bunyi gendang meningkat. 16–24 s: dia menolak tirai baldu merah yang berat ke arah cahaya pentas yang menyilaukan; kamera menghayun ke belakang bahunya. 24–30 s: pendedahan — teater yang padat di bawah cahaya tanglung merah; dia mengangkat sebelah lengan kain (water-sleeve) saat gong berbunyi. Bunyi: gendang meningkat, bunyi tapak kaki, deruan tirai, satu bunyi gong, tepukan. Tiada dialog, tiada teks di skrin.
- Namakan rujukan
- Image 1, Video 1, Audio 1 — bernombor mengikut jenis dalam susunan lampiran — dan nyatakan kegunaan setiap satu: "Image 1 is the character; Video 1 is the camera move".
- Arahkan bunyi
- Secara lalai, model menulis dialog, muzik dan kesan. Minta apa yang anda mahu — "rain and a distant tram, no dialogue" — atau matikan suis Audio untuk fail senyap.
- Butiran setia yang berani
- Diberikan imej, model mengekalkan apa yang ada di dalamnya. Untuk perubahan besar — cuaca, pakaian, set yang berbeza — jelaskan perubahan itu secara eksplisit daripada mengharapkan prom mengatasi gambar tersebut.
- Kekalkan satu subjek utama
- Satu figura, laluan kamera yang dinamakan dan perkataan "no cuts" memberikan kami rakaman yang bersih setiap kali. Orang ramai, tangan dan prop kecil adalah tempat di mana mana-mana model video, termasuk yang ini, menjadi kurang tajam.
- Draf murah, hantar mahal
- 480p adalah model yang sama pada suku harga 1080p. Buktikan jalan cerita pada 480p, kemudian render semula pemenang pada 1080p dengan prom dan rujukan yang sama.
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Tiga model di Popcraft yang semuanya menjana bunyi bersama gambar. Kelebihan Wan ialah rakaman 30 saat termurah di platform dan subjek yang kekal setia kepada rujukannya; Seedance pula pada bilangan rujukan, penyuntingan dan penyambungan; Omni pada 4K dan 40 saat melalui penyambungan. Pilih mengikut tugas.
| Keupayaan | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| Klip terpanjang dari satu permintaan | 30 s sekali jalan | 30 s | 40 s melalui penyambungan babak (30 s pada 4K) |
| Resolusi | 480p / 720p / 1080p pada 30 fps | Sehingga 1080p | Draf 360p hingga 4K |
| Audio asli | Dialog, muzik, kesan; boleh dimatikan | Ya | Pertuturan, muzik, kesan bunyi |
| Imej rujukan | Sehingga 4 | Sehingga 30 | Sehingga 10 |
| Video rujukan | Sehingga 5, jumlah 15 s | Sehingga 10 | Sehingga 3 |
| Audio rujukan | Sehingga 5, jumlah 15 s | Sehingga 10 | — |
| Sunti atau sambung klip | — (guna Seedance 2.5 atau Omni) | Sunti; sambung sebelum atau selepas | Sunti; sambung dalam segmen 10 s |
| Draf 30 saat | 330 kredit pada 480p | Sesaat, mengikut resolusi | 150 kredit pada 360p |
Angka Wan adalah daripada panduan Model Studio Alibaba; had Popcraft adalah apa yang dipaparkan oleh pemilih hari ini. Had penyedia berubah; pemilih sentiasa menunjukkan apa yang tersedia buat masa ini. Perbandingan penuh: Seedance 2.5 · Gemini Omni 1.1 Flash.
Harga Wan 3.0 di Popcraft
Dibilkan setiap saat yang dihantar, mengikut resolusi. Rujukan adalah percuma untuk dilampirkan. Kerana panjang yang dihantar sepadan dengan permintaan, harga yang ditunjukkan sebelum anda menjana adalah harga yang anda bayar.
Setiap pelan termasuk kredit; halaman harga menyenaraikan kadar semasa untuk semua model. Muat turun pelan percuma mempunyai tera air Popcraft yang jelas, yang akan dibuang dalam pelan berbayar.
Kegunaan Wan 3.0 menurut Alibaba
Tiga senario dalam bahan pelancaran Alibaba sendiri, dan cara menjalankannya di Popcraft.
- 01
Kandungan video pendek: dramatisasi plot dan teaser iklan
Senario hiburan Alibaba. Naratif pelbagai rakaman sehingga 30 saat daripada satu prom, termasuk bunyi.
- 02
E-dagang: pameran produk daripada imej produk
Senario e-dagang Alibaba — "muat naik imej produk beserta keterangan, dapatkan pameran dinamik". Lampirkan foto sebagai Image 1.
- 03
Pendidikan: simulasi senario berlakon
Senario pendidikan Alibaba — konsultasi doktor atau panggilan bantuan yang dilakonkan daripada prom, dengan dialog yang dijana.
- 04
Draf di 480p, hantar di 1080p
Tambahan Popcraft: 11 kredit sesaat pada 480p menjadikan draf 30 saat berharga 330 kredit sebelum anda komit kepada 1080p.
Wan 3.0 — soalan lazim
Model video serba dalam satu Alibaba daripada Tongyi Lab, dalam beta awam sejak 6 Ogos 2026 dan dilancarkan pada 24 Ogos. Satu model merangkumi teks-ke-video, imej-ke-video, kawalan bingkai pertama-dan-terakhir serta penjanaan pelbagai rujukan, menghasilkan sebarang panjang dari 2 hingga 30 saat dalam satu jalan pada 30 fps, dan menjana dialog, muzik latar dan kesan bunyi bersama gambar.
Sebarang saat penuh dari 2 hingga 30, dalam satu jalan — tiada rantaian sambungan, tiada jahitan. Di Popcraft anda menetapkan panjang pada satu bar lungsur dan fail yang dihantar sepadan dengan permintaan; dalam ujian kami sendiri setiap klip dihasilkan dalam ralat beberapa perseratus saat daripada panjang yang kami minta, dan anda membayar tepat untuk saat tersebut.
Secara lalai ya. Panduan Alibaba menyatakan model tersebut "mengeluarkan dialog, BGM dan kesan bunyi secara asli" dan membenarkan anda menentukan baris dialog dan bunyi dalam prom. Suis Audio di Popcraft mematikannya, dan klip yang dijana dengan suis mati tidak mempunyai trek audio langsung.
Lampirkan sehingga 4 imej, 5 klip video dan 5 klip audio dan rujuk mereka dalam prom sebagai Image 1, Video 1, Audio 1 dan seterusnya, bernombor mengikut jenis dalam susunan anda melampirkannya. Imej membawa watak, objek atau babak; video membawa pergerakan dan kamera; audio membawa suara atau rentak. Video dihadkan kepada 15 saat keseluruhan dan begitu juga audio. Dua imej dengan "first frame" dan "last frame" dalam prom akan menjadi bingkai utama, dan bingkai utama tidak boleh dicampur dengan rujukan lain.
Itulah tujuan utama model ini dibina. Alibaba menyenaraikan konsistensi penampilan watak, almari pakaian, prop dan persekitaran sebagai keupayaan utama, dan dalam ujian kami sendiri, helaian watak mengekalkan identitinya melalui pergerakan kamera klip rujukan, imej produk segi empat tepat dihasilkan semula dengan setia dalam bingkai 16:9, dan satu figura kekal konsisten merentas rakaman 30 saat. Wan 3.0 mengutamakan imej yang anda berikan — untuk perubahan kreatif besar daripada rujukan, jelaskannya secara eksplisit.
Tidak di Popcraft hari ini. Wan 3.0 menggunakan klip yang dilampirkan sebagai rujukan untuk pergerakan, kamera dan subjek; untuk menyambung atau menyunting rakaman, gunakan Seedance 2.5 atau Gemini Omni 1.1 Flash, yang semuanya mempunyai panel Sambung Video.
Alibaba menghuraikan rujukan audio sebagai membawa timbre suara dan rentak trek, dengan baris pertuturan ditulis dalam prom; model kemudian menjana pertuturan dan pergerakan mulut bersama-sama. Ia bukan alat penyelarasan mulut-rakaman. Untuk klip kepala bercakap yang dipacu oleh rakaman tertentu, gunakan model avatar seperti OmniHuman.
Wan 3.0 dibilkan setiap saat yang dihantar: 11 kredit pada 480p, 20 pada 720p dan 40 pada 1080p. Draf 30 saat pada 480p berharga 330 kredit; klip yang sama pada 1080p berharga 1,200. Setiap panjang dan resolusi menunjukkan harganya sebelum anda menjana, dan muat turun pelan percuma mempunyai tera air Popcraft yang jelas, yang dibuang dalam pelan berbayar.
Tiga puluh saat, satu permintaan. Cuba di 480p dahulu.
Buat draf untuk 330 kredit, nilai ceritanya, kemudian render pemenang pada 1080p — atau bawa helaian watak dan klip untuk digabungkan.
Teruskan meneroka
Model berkaitan
Seedance 2.5 menjana video sehingga 30 saat dalam satu tugasan, dengan sokongan sehingga 50 aset rujukan, penyuntingan video terkawal, pelanjutan masa ketepatan tinggi, mana-mana nisbah aspek 0.4 hingga 2.5, serta gesaan asli dalam lebih 10 bahasa. Kini tersedia di Popcraft.
Gemini Omni 1.1 Flash ialah model video Google yang mencipta dan mengedit video daripada sebarang input. Sehingga 40 saat melalui pelanjutan adegan, output 1080p dan 4K, interpolasi bingkai pertama dan terakhir, sehingga 10 gambar rujukan, serta pertuturan, muzik dan kesan bunyi dijana bersama visual. Kini tersedia di Popcraft.
MiniMax H3 menjana video 2K pada 24fps dengan runut bunyi stereo segerak — kesan, ambien dan dialog dalam satu tugasan. Berbilang syot dari satu gesaan, 5 hingga 15 saat, kawalan bingkai pertama dan terakhir. Kini di Popcraft.
Jana video sinematik 4K daripada teks, imej atau klip dengan Seedance 2.0 di Popcraft. Audio segerak natif, jujukan berbilang syot, dan perincian tajam sehingga 4K (2160p).