NEWIklan UGC tular anda yang seterusnya hanya satu klik sahaja. Kenali Studio.Buat iklan
PopcraftPopcraft
Model video baharu

Alibaba · Tongyi Lab

Wan 3.0: Video AI 30 saat sekaligus, lengkap dengan bunyinya sendiri

Wan 3.0 ialah penjana video AI serba boleh daripada Alibaba. Ia menukarkan prom, imej atau set rujukan menjadi sebarang tempoh dari 2 hingga 30 saat dalam satu permintaan, sehingga 1080p dan 30 fps, serta merender dialog, muzik dan kesan bunyi dalam tugasan yang sama. Di Popcraft, ia bermula dari 11 kredit sesaat.

Tersedia di studio video, papan Canvas dan penyambung MCP

2–30 s
sebarang saat penuh, sekali jalan
1080p 30 fps
tahap 480p dan 720p juga tersedia
4 · 5 · 5 rujukan
imej, klip, audio
11 kr / s
pada 480p — 330 untuk 30 s
00saat, satu rakaman
satu rakaman · audio dijana · tanpa suntingan

Durasi asli 30s

Ciri utama pertama Alibaba: "penceritaan yang lebih lengkap dan kebebasan kreatif" daripada proses asli 30 saat. Filem utama di atas pada enam titik sepanjang garis masanya, dan apa yang dicatatkan oleh jam serta fail mengenai klip yang kami jana untuk halaman ini.

1 saat: jarak dekat ekstrem wajah pelakon yang bersolek di cermin bilik persalinan1s
6 saat: dia bangun dari cermin dengan jubah merah dan emas6s
12 saat: koridor belakang pentas, krew pentas merapat ke dinding semasa dia lalu12s
18 saat: tangannya pada tirai baldu merah18s
24 saat: melalui tirai ke arah cahaya pentas, dewan penuh cahaya tanglung terbuka di belakang24s
29 saat: lengan kain (water-sleeve) diangkat ke arah teater yang penuh di bawah cahaya tanglung merah29s
Satu pelakon, satu jubah, satu gred dari cermin ke pentas — bilik persalinan, koridor, tirai, dewan penuh, dalam satu permintaan tanpa suntingan.
Dihantar vs diminta
PermintaanDihantarMasa sebenar
30 s · 1080p · teks sahaja30.02 s · 1920×1080 · stereo5 min 38 s
5 s · 720p · teks sahaja5.04 s · 1280×720 · stereo1 min 37 s
3 s dan 10 s · daripada klip rujukan 6 s3.02 s dan 10.03 s · klip menentukan pergerakan, bukan durasi≈ 1 min 25 s setiap satu

Masa sebenar ialah dari hantar-ke-fail di Popcraft, September 2026. Setiap klip dihantar dalam ralat beberapa perseratus saat daripada permintaan, jadi kredit yang anda lihat sebelum menjana adalah kredit yang anda belanjakan.

Pengalaman imersif: realisme, tekstur dan reka bentuk bunyi

Kata-kata Alibaba: "realisme, tekstur, dan reka bentuk bunyi yang ditingkatkan". Tiga filem, tiga gaya — aksi langsung, CG gaya filem, fantasi jenama — setiap satu satu permintaan, satu rakaman berterusan, 30 saat, dengan runut bunyi dijana dalam proses yang sama. Hanya prom yang diubah.

Aksi langsung30.0s1 takelive action

Tirai

Filem utama di atas: seorang pelakon opera Beijing dari cermin bilik persalinan, menyusuri koridor belakang pentas, melalui tirai baldu ke dewan yang dipenuhi tanglung. Bunyi gendang memuncak, gong berbunyi, penonton bersorak.

CG Filem30.0s1 take3D-CG look

Semangat musang

Seekor musang berekor sembilan memecut di atas bumbung bercahaya tanglung, melompat melepasi jurang ketika tanglung bertaburan, terapung berlatarbelakangkan bulan penuh dan mendarat di menara loceng saat tanglung bandar mula naik. Gaya 3D artistik daripada prom teks sahaja.

Fantasi jenama30.0s1 takebrand fantasy

Mesin layan diri

Seorang gadis berbaju hujan kuning menekan butang di lorong hujan dan ditarik melalui kaca ke dunia berwarna-warni di mana maskot menyerahkannya satu tin air. Bunyi desis menjadi bunga api, dan kamera ditarik keluar semula ke lorong tersebut.

Setiap filem di sini dipaparkan seperti yang dihantar: tanpa suntingan, tanpa muzik tambahan. Draf pada 480p adalah 330 kredit setiap satu; 1080p adalah 1,200.

Apakah itu Wan 3.0?

Wan 3.0 (万相 3.0) ialah model video dari Tongyi Lab Alibaba, dalam beta awam sejak 6 Ogos 2026 dan dilancarkan pada 24 Ogos. Alibaba memanggilnya sebagai model video rujukan serba dalam satu: satu model untuk teks-ke-video, imej-ke-video, kawalan bingkai pertama-dan-terakhir serta penjanaan daripada rujukan campuran, dan bukannya model berasingan bagi setiap tugasan. Ia hanya melalui API — tiada pemberat terbuka — dan Popcraft menjalankan edisi perdana, yang lebih pantas antara dua yang ditawarkan Alibaba.

Panduan Alibaba Cloud Model Studio dan rujukan API untuk wan3.0-video; README repositori rasmi Wan 3.0; ringkasan pelancaran komuniti pembangun Alibaba. Tuntutan di atas adalah milik Alibaba; ukuran di halaman ini adalah milik kami.

Dalam kata-kata Alibaba
  1. Menjana sehingga 30 saat video secara stabil setiap permintaan, pada 30 bingkai sesaat.

    Durasi

  2. Mengeluarkan dialog, muzik latar dan kesan bunyi secara asli — tiada alihan suara pasca-produksi.

    Bunyi

  3. Konsistensi penampilan watak, pakaian, prop, persekitaran dan gaya visual; pergerakan kamera tolak, tarik, pan dan penjejakan.

    Konsistensi dan kamera

Lima ciri utama Alibaba
  1. Durasi Asli 30sPenceritaan yang lebih lengkap dan kebebasan kreatif.Di Popcraft: sebarang tempoh dari 2 hingga 30 saat, sekali jalan.
  2. Omni-CreationSehingga 20 aset rujukan, dengan penghuraian dokumen dan laman web.Di Popcraft: 4 imej, 5 klip, 5 audio. Dokumen dan laman web belum tersedia.
  3. Konsistensi Piksel-SempurnaMeningkatkan kepastian penghantaran untuk aliran kerja produksi.Di Popcraft: ya — lihat gambar pegun di bawah.
  4. Pengalaman ImersifRealisme, tekstur, dan reka bentuk bunyi yang ditingkatkan.Di Popcraft: ya — dialog, muzik dan kesan dijana bersama gambar.
  5. Penyuntingan Video PersisPenyuntingan yang lebih terkawal untuk meningkatkan kecekapan kreatif.Belum ada di Popcraft — gunakan Seedance 2.5 atau Gemini Omni untuk menyunting atau menyambung.

Omni-Creation: imej, klip dan audio dalam satu prom

Ciri utama kedua Alibaba — jana daripada input pelbagai mod. Di Popcraft, itu bermakna sehingga 4 imej, 5 klip video dan 5 klip audio dalam satu permintaan, setiap satu dinamakan dalam prom sebagai Image 1, Video 1 atau Audio 1 mengikut susunan lampiran. Platform Alibaba juga menghurai dokumen dan laman web; bahagian tersebut belum ada di Popcraft.

Image 1 … Image 4

Subjek, produk dan set

Helaian watak menetapkan wajah dan almari pakaian; foto produk menetapkan objek; gambar lokasi menetapkan set. Model mengekalkan apa yang ada dalam gambar, jadi jelaskan sebarang perubahan secara eksplisit. Dua imej dengan "bingkai pertama" dan "bingkai terakhir" dalam prom akan menjadi bingkai utama (keyframes).

JPEG, PNG, WEBP atau BMP · 240 ke 8,000 px sesisi · 20 MB setiap satu

Wanita daripada Image 1 berjalan di sepanjang jalan dalam Image 2 pada waktu senja, kamera menjejak di sisinya. Kekalkan rambut, kot dan begnya tepat seperti dalam Image 1.
Video 1 … Video 5

Pergerakan, kamera dan persembahan

Satu klip membawa laluan kamera, 'blocking' dan persembahannya ke dalam rakaman baharu. Padankannya dengan imej dan subjek imej tersebut akan melakukan pergerakan klip pada set klip tersebut. Klip menentukan pergerakan, bukan durasi — bar lungsur yang menentukannya.

MP4 atau MOV · 1 ke 15 s setiap satu dan 15 s jumlah keseluruhan · 100 MB setiap satu

Lelaki daripada Image 1 berdiri di antara tiang. Ikuti pergerakan kamera Video 1 dengan tepat: sudut lebar rendah yang mengorbit ke kanan menjadi jarak dekat tiga suku.
Audio 1 … Audio 5

Timbre suara atau rentak lagu

Resipi Alibaba: audio membawa suara atau ritma, dan baris dialog diletakkan dalam prom; model menjana pertuturan dan pergerakan mulut bersama-sama. Ia bukan alat penyelarasan mulut-rakaman — untuk itu, gunakan model avatar seperti OmniHuman.

WAV atau MP3 · 1 ke 15 s setiap satu dan 15 s jumlah keseluruhan · 15 MB setiap satu

Ambil timbre daripada Audio 1 dan biarkan watak berkata: "Biar betul? Kedengaran hebat — bila awak balik?" Pertuturan yang dijana memacu pergerakan mulut yang semula jadi.

Bingkai utama dan rujukan tidak boleh dicampur. Dua imej yang ditandakan sebagai bingkai pertama dan terakhir akan menjadi klip bingkai utama sendiri; perkara lain — imej subjek, klip, audio — boleh digabungkan secara bebas sehingga had di atas.

Konsistensi piksel-sempurna

Ciri utama ketiga Alibaba: "meningkatkan kepastian penghantaran untuk aliran kerja produksi" — helaian model menyatakan ia mengekalkan butiran watak dan rujukan merentas bingkai. Pelakon yang sama daripada filem utama pada tiga titik, dengan jarak 28 saat.

Wajah pelakon yang bersolek di cermin bilik persalinan pada 1 saat1 s
Pelakon yang sama di koridor belakang pentas pada 12 saat12 s
Pelakon yang sama di atas pentas di hadapan dewan penuh pada 29 saat29 s
Wajah yang sama, hiasan kepala yang sama, jubah yang sama dari cermin ke pentas. Lampirkan helaian watak atau foto produk sebagai Image 1 dan model akan mengekalkan apa yang anda berikan; dalam ujian kami, gambar produk statik segi empat tepat dihasilkan semula dengan setia dalam bingkai 16:9, dan klip rujukan enam saat memacu hasil tiga saat dan sepuluh saat tanpa mengubah subjek.

Cara membuat prom untuk Wan 3.0

Model merancang keseluruhan klip daripada prom, jadi prom mestilah menyatakan jenis klip tersebut. Render kami kekal stabil apabila kami menamakan kesinambungannya — satu rakaman tanpa putus, atau senarai rakaman bernombor. Selebihnya mengikut dari situ.

Untuk satu rakaman

Sebut "no cuts", kemudian tentukan masa setiap bahagian

Mulakan dengan "one continuous take, no cuts, no transitions", berikan setiap tempoh saat satu perkara untuk dilakukan dan satu kata kerja kamera, kekalkan satu subjek utama dalam bingkai, dan tulis bunyi sebagai ayatnya sendiri. Filem utama ditulis tepat seperti ini dan dihasilkan tanpa satu pun potongan.

ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Fotoreal sinematik, kontras tinggi. Pelakon opera Beijing dengan solekan muka dan jubah merah-emas.
0–6 s: jarak dekat ekstrem dalam cermin bilik persalinan yang dikelilingi mentol; dia membuka mata.
6–16 s: dia berjalan menyusuri koridor belakang pentas yang sempit, krew pentas merapat ke dinding, kamera menjejak ke belakang di hadapannya sambil bunyi gendang meningkat.
16–24 s: dia menolak tirai baldu merah yang berat ke arah cahaya pentas yang menyilaukan; kamera menghayun ke belakang bahunya.
24–30 s: pendedahan — teater yang padat di bawah cahaya tanglung merah; dia mengangkat sebelah lengan kain (water-sleeve) saat gong berbunyi.
Bunyi: gendang meningkat, bunyi tapak kaki, deruan tirai, satu bunyi gong, tepukan. Tiada dialog, tiada teks di skrin.
Namakan rujukan
Image 1, Video 1, Audio 1 — bernombor mengikut jenis dalam susunan lampiran — dan nyatakan kegunaan setiap satu: "Image 1 is the character; Video 1 is the camera move".
Arahkan bunyi
Secara lalai, model menulis dialog, muzik dan kesan. Minta apa yang anda mahu — "rain and a distant tram, no dialogue" — atau matikan suis Audio untuk fail senyap.
Butiran setia yang berani
Diberikan imej, model mengekalkan apa yang ada di dalamnya. Untuk perubahan besar — cuaca, pakaian, set yang berbeza — jelaskan perubahan itu secara eksplisit daripada mengharapkan prom mengatasi gambar tersebut.
Kekalkan satu subjek utama
Satu figura, laluan kamera yang dinamakan dan perkataan "no cuts" memberikan kami rakaman yang bersih setiap kali. Orang ramai, tangan dan prop kecil adalah tempat di mana mana-mana model video, termasuk yang ini, menjadi kurang tajam.
Draf murah, hantar mahal
480p adalah model yang sama pada suku harga 1080p. Buktikan jalan cerita pada 480p, kemudian render semula pemenang pada 1080p dengan prom dan rujukan yang sama.

Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash

Tiga model di Popcraft yang semuanya menjana bunyi bersama gambar. Kelebihan Wan ialah rakaman 30 saat termurah di platform dan subjek yang kekal setia kepada rujukannya; Seedance pula pada bilangan rujukan, penyuntingan dan penyambungan; Omni pada 4K dan 40 saat melalui penyambungan. Pilih mengikut tugas.

KeupayaanWan 3.0Seedance 2.5Gemini Omni 1.1 Flash
Klip terpanjang dari satu permintaan30 s sekali jalan30 s40 s melalui penyambungan babak (30 s pada 4K)
Resolusi480p / 720p / 1080p pada 30 fpsSehingga 1080pDraf 360p hingga 4K
Audio asliDialog, muzik, kesan; boleh dimatikanYaPertuturan, muzik, kesan bunyi
Imej rujukanSehingga 4Sehingga 30Sehingga 10
Video rujukanSehingga 5, jumlah 15 sSehingga 10Sehingga 3
Audio rujukanSehingga 5, jumlah 15 sSehingga 10
Sunti atau sambung klip— (guna Seedance 2.5 atau Omni)Sunti; sambung sebelum atau selepasSunti; sambung dalam segmen 10 s
Draf 30 saat330 kredit pada 480pSesaat, mengikut resolusi150 kredit pada 360p

Angka Wan adalah daripada panduan Model Studio Alibaba; had Popcraft adalah apa yang dipaparkan oleh pemilih hari ini. Had penyedia berubah; pemilih sentiasa menunjukkan apa yang tersedia buat masa ini. Perbandingan penuh: Seedance 2.5 · Gemini Omni 1.1 Flash.

Harga Wan 3.0 di Popcraft

Dibilkan setiap saat yang dihantar, mengikut resolusi. Rujukan adalah percuma untuk dilampirkan. Kerana panjang yang dihantar sepadan dengan permintaan, harga yang ditunjukkan sebelum anda menjana adalah harga yang anda bayar.

480p
11 kredit / s
Draf
30 s = 330 kredit
720p
20 kredit / s
Sosial
15 s = 300 kredit
1080p
40 kredit / s
Peletakan utama
30 s = 1,200 kredit

Setiap pelan termasuk kredit; halaman harga menyenaraikan kadar semasa untuk semua model. Muat turun pelan percuma mempunyai tera air Popcraft yang jelas, yang akan dibuang dalam pelan berbayar.

Kegunaan Wan 3.0 menurut Alibaba

Tiga senario dalam bahan pelancaran Alibaba sendiri, dan cara menjalankannya di Popcraft.

  • 01

    Kandungan video pendek: dramatisasi plot dan teaser iklan

    Senario hiburan Alibaba. Naratif pelbagai rakaman sehingga 30 saat daripada satu prom, termasuk bunyi.

  • 02

    E-dagang: pameran produk daripada imej produk

    Senario e-dagang Alibaba — "muat naik imej produk beserta keterangan, dapatkan pameran dinamik". Lampirkan foto sebagai Image 1.

  • 03

    Pendidikan: simulasi senario berlakon

    Senario pendidikan Alibaba — konsultasi doktor atau panggilan bantuan yang dilakonkan daripada prom, dengan dialog yang dijana.

  • 04

    Draf di 480p, hantar di 1080p

    Tambahan Popcraft: 11 kredit sesaat pada 480p menjadikan draf 30 saat berharga 330 kredit sebelum anda komit kepada 1080p.

Wan 3.0 — soalan lazim

Model video serba dalam satu Alibaba daripada Tongyi Lab, dalam beta awam sejak 6 Ogos 2026 dan dilancarkan pada 24 Ogos. Satu model merangkumi teks-ke-video, imej-ke-video, kawalan bingkai pertama-dan-terakhir serta penjanaan pelbagai rujukan, menghasilkan sebarang panjang dari 2 hingga 30 saat dalam satu jalan pada 30 fps, dan menjana dialog, muzik latar dan kesan bunyi bersama gambar.

Sebarang saat penuh dari 2 hingga 30, dalam satu jalan — tiada rantaian sambungan, tiada jahitan. Di Popcraft anda menetapkan panjang pada satu bar lungsur dan fail yang dihantar sepadan dengan permintaan; dalam ujian kami sendiri setiap klip dihasilkan dalam ralat beberapa perseratus saat daripada panjang yang kami minta, dan anda membayar tepat untuk saat tersebut.

Secara lalai ya. Panduan Alibaba menyatakan model tersebut "mengeluarkan dialog, BGM dan kesan bunyi secara asli" dan membenarkan anda menentukan baris dialog dan bunyi dalam prom. Suis Audio di Popcraft mematikannya, dan klip yang dijana dengan suis mati tidak mempunyai trek audio langsung.

Lampirkan sehingga 4 imej, 5 klip video dan 5 klip audio dan rujuk mereka dalam prom sebagai Image 1, Video 1, Audio 1 dan seterusnya, bernombor mengikut jenis dalam susunan anda melampirkannya. Imej membawa watak, objek atau babak; video membawa pergerakan dan kamera; audio membawa suara atau rentak. Video dihadkan kepada 15 saat keseluruhan dan begitu juga audio. Dua imej dengan "first frame" dan "last frame" dalam prom akan menjadi bingkai utama, dan bingkai utama tidak boleh dicampur dengan rujukan lain.

Itulah tujuan utama model ini dibina. Alibaba menyenaraikan konsistensi penampilan watak, almari pakaian, prop dan persekitaran sebagai keupayaan utama, dan dalam ujian kami sendiri, helaian watak mengekalkan identitinya melalui pergerakan kamera klip rujukan, imej produk segi empat tepat dihasilkan semula dengan setia dalam bingkai 16:9, dan satu figura kekal konsisten merentas rakaman 30 saat. Wan 3.0 mengutamakan imej yang anda berikan — untuk perubahan kreatif besar daripada rujukan, jelaskannya secara eksplisit.

Tidak di Popcraft hari ini. Wan 3.0 menggunakan klip yang dilampirkan sebagai rujukan untuk pergerakan, kamera dan subjek; untuk menyambung atau menyunting rakaman, gunakan Seedance 2.5 atau Gemini Omni 1.1 Flash, yang semuanya mempunyai panel Sambung Video.

Alibaba menghuraikan rujukan audio sebagai membawa timbre suara dan rentak trek, dengan baris pertuturan ditulis dalam prom; model kemudian menjana pertuturan dan pergerakan mulut bersama-sama. Ia bukan alat penyelarasan mulut-rakaman. Untuk klip kepala bercakap yang dipacu oleh rakaman tertentu, gunakan model avatar seperti OmniHuman.

Wan 3.0 dibilkan setiap saat yang dihantar: 11 kredit pada 480p, 20 pada 720p dan 40 pada 1080p. Draf 30 saat pada 480p berharga 330 kredit; klip yang sama pada 1080p berharga 1,200. Setiap panjang dan resolusi menunjukkan harganya sebelum anda menjana, dan muat turun pelan percuma mempunyai tera air Popcraft yang jelas, yang dibuang dalam pelan berbayar.

Tiga puluh saat, satu permintaan. Cuba di 480p dahulu.

Buat draf untuk 330 kredit, nilai ceritanya, kemudian render pemenang pada 1080p — atau bawa helaian watak dan klip untuk digabungkan.

Teruskan meneroka

Model berkaitan