Alibaba · Tongyi Lab
Wan 3.0: Video AI 30 detik sekali jalan, lengkap dengan suaranya
Wan 3.0 adalah generator video AI all-in-one dari Alibaba. Model ini mengubah prompt, gambar, atau sekumpulan referensi menjadi durasi apa pun dari 2 hingga 30 detik dalam satu permintaan, hingga resolusi 1080p dan 30 fps, serta merender dialog, musik, dan efek suara dalam satu pengerjaan. Di Popcraft, harga mulai dari 11 kredit per detik.
Tersedia di studio video, papan Canvas, dan konektor MCP
- 2–30 dtk
- detik apa pun, sekali jalan
- 1080p 30 fps
- tersedia juga tingkatan 480p dan 720p
- 4 · 5 · 5 ref
- gambar, klip, audio
- 11 kr / dtk
- di 480p — 330 untuk 30 dtk
Durasi asli 30 detik
Fitur utama unggulan dari Alibaba: "penceritaan yang lebih lengkap dan kebebasan kreatif" dari satu proses asli 30 detik. Film utama di atas menunjukkan enam titik sepanjang garis waktunya, dan apa yang dicatat oleh jam serta file tentang klip yang kami buat untuk halaman ini.
1s
6s
12s
18s
24s
29s| Permintaan | Hasil | Waktu tunggu |
|---|---|---|
| 30 dtk · 1080p · hanya teks | 30,02 dtk · 1920×1080 · stereo | 5 mnt 38 dtk |
| 5 dtk · 720p · hanya teks | 5,04 dtk · 1280×720 · stereo | 1 mnt 37 dtk |
| 3 dtk dan 10 dtk · dari referensi klip 6 dtk | 3,02 dtk dan 10,03 dtk · klip menentukan gerakan, bukan durasi | ≈ 1 mnt 25 dtk per klip |
Waktu tunggu adalah durasi dari kirim permintaan hingga file jadi di Popcraft, September 2026. Setiap klip selesai dalam selisih beberapa seperseratus detik dari permintaan, sehingga kredit yang Anda lihat sebelum membuat adalah kredit yang benar-benar Anda gunakan.
Pengalaman imersif: realisme, tekstur, dan desain suara
Klaim Alibaba: "realisme, tekstur, dan desain suara yang ditingkatkan". Tiga film, tiga gaya — live action, CG gaya film layar lebar, fantasi brand — masing-masing satu permintaan, satu pengambilan gambar kontinu, 30 detik, dengan soundtrack yang dihasilkan dalam proses yang sama. Hanya prompt yang diubah.
Curtain
Film utama di atas: seorang penari opera Beijing dari cermin ruang ganti, menyusuri lorong belakang panggung, melewati tirai beludru menuju gedung teater penuh lampion. Suara drum meningkat, gong berbunyi, penonton bersorak.
Fox spirit
Seekor rubah ekor sembilan berlari melintasi atap rumah yang diterangi lampion, melompati celah saat lampion berhamburan, melayang dengan latar bulan purnama, dan mendarat di menara lonceng saat lampion kota membubung. Gaya 3D artistik murni dari prompt teks.
Vending machine
Seorang gadis berjas hujan kuning menekan tombol di gang yang hujan dan ditarik melalui kaca ke dunia penuh warna pop di mana sesosok maskot memberinya kaleng minuman. Desisan soda berubah menjadi kembang api, dan kamera menjauh kembali ke arah gang.
Setiap film di sini ditampilkan apa adanya: tanpa edit, tanpa tambahan musik. Draft di 480p masing-masing 330 kredit; 1080p adalah 1.200.
Apa itu Wan 3.0?
Wan 3.0 (万相 3.0) adalah model video dari Tongyi Lab milik Alibaba, dalam versi beta publik sejak 6 Agustus 2026 dan diluncurkan pada 24 Agustus. Alibaba menyebutnya sebagai model video referensi all-in-one: satu model untuk text-to-video, image-to-video, kontrol frame pertama-dan-terakhir, serta pembuatan dari referensi campuran, alih-alih menggunakan model terpisah untuk setiap tugas. Model ini hanya tersedia melalui API — tidak ada open weights — dan Popcraft menjalankan edisi prime, yang merupakan versi tercepat dari dua opsi yang ditawarkan Alibaba.
Panduan Alibaba Cloud Model Studio dan referensi API untuk wan3.0-video; README repositori resmi Wan 3.0; ringkasan peluncuran komunitas pengembang Alibaba. Klaim di atas milik Alibaba; pengukuran pada halaman ini adalah milik kami.
“Menghasilkan video hingga 30 detik per permintaan secara stabil, pada 30 frame per detik.”
Durasi
“Menghasilkan dialog, musik latar, dan efek suara secara asli — tanpa perlu sulih suara pasca-produksi.”
Suara
“Konsistensi penampilan karakter, pakaian, properti, lingkungan, dan gaya visual; gerakan kamera push, pull, pan, dan tracking.”
Konsistensi dan kamera
- Durasi Asli 30 Detik“Penceritaan yang lebih lengkap dan kebebasan kreatif.”Di Popcraft: durasi apa pun dari 2 hingga 30 detik, sekali jalan.
- Omni-Creation“Hingga 20 aset referensi, dengan pemindaian dokumen dan halaman web.”Di Popcraft: 4 gambar, 5 klip, 5 audio. Dokumen dan halaman web belum tersedia.
- Konsistensi Pixel-Perfect“Meningkatkan kepastian hasil untuk alur kerja produksi.”Di Popcraft: ya — lihat cuplikan gambar di bawah.
- Pengalaman Imersif“Realisme, tekstur, dan desain suara yang ditingkatkan.”Di Popcraft: ya — dialog, musik, dan efek dihasilkan bersama gambar.
- Pengeditan Video Presisi“Pengeditan yang lebih terkontrol untuk meningkatkan efisiensi kreatif.”Belum tersedia di Popcraft — gunakan Seedance 2.5, atau Gemini Omni untuk mengedit atau memperpanjang.
Omni-Creation: gambar, klip, dan audio dalam satu prompt
Fitur unggulan kedua Alibaba — menghasilkan karya dari input multimodal. Di Popcraft, itu berarti hingga 4 gambar, 5 klip video, dan 5 klip audio dalam satu permintaan, masing-masing dinamai dalam prompt sebagai Image 1, Video 1, atau Audio 1 sesuai urutan lampiran. Platform Alibaba juga memindai dokumen dan halaman web; bagian tersebut belum tersedia di Popcraft.
Subjek, produk, dan latar
Character sheet mengunci wajah dan kostum; foto produk mengunci objek; foto lokasi mengunci latar. Model mempertahankan apa yang ada di gambar, jadi jelaskan perubahan secara eksplisit. Dua gambar dengan keterangan "first frame" dan "last frame" dalam prompt akan menjadi keyframe.
JPEG, PNG, WEBP atau BMP · 240 hingga 8.000 px per sisi · 20 MB masing-masing
Wanita dari Image 1 berjalan di sepanjang jalan Image 2 saat senja, kamera mengikuti di sampingnya. Pertahankan rambut, mantel, dan tasnya persis seperti di Image 1.
Gerakan, kamera, dan performa
Klip membawa jalur kamera, blocking, dan performanya ke dalam adegan baru. Pasangkan dengan gambar, maka subjek gambar akan melakukan gerakan klip tersebut di latar klip tersebut. Klip menentukan gerakan, bukan durasi — gunakan slider untuk itu.
MP4 atau MOV · 1 hingga 15 dtk masing-masing dan total 15 dtk · 100 MB masing-masing
Pria dari Image 1 berdiri di antara pilar. Ikuti gerakan kamera Video 1 dengan persis: sudut lebar rendah yang mengorbit ke kanan menuju close-up tiga perempat.
Timbre suara atau ketukan trek
Rumus Alibaba: audio membawa suara atau ritme, dan baris kalimat yang diucapkan dimasukkan ke dalam prompt; model menghasilkan ucapan dan gerakan mulut secara bersamaan. Ini bukan alat sinkronisasi bibir dari rekaman — untuk itu, gunakan model avatar seperti OmniHuman.
WAV atau MP3 · 1 hingga 15 dtk masing-masing dan total 15 dtk · 15 MB masing-masing
Gunakan timbre dari Audio 1 dan buat karakter mengatakan: "Benarkah? Kedengarannya bagus — kapan kamu kembali?" Ucapan yang dihasilkan akan menggerakkan gerakan mulut yang alami.
Keyframe dan referensi tidak bisa dicampur. Dua gambar yang ditandai sebagai frame awal dan akhir akan membentuk klip keyframe tersendiri; hal lainnya — gambar subjek, klip, audio — dapat dikombinasikan bebas hingga batas di atas.
Konsistensi pixel-perfect
Fitur unggulan ketiga Alibaba: "meningkatkan kepastian hasil untuk alur kerja produksi" — kartu model menyebutnya sebagai menjaga detail karakter dan referensi di seluruh frame. Penari yang sama dari film utama di tiga titik berbeda, berjarak 28 detik.
1 dtk
12 dtk
29 dtkCara membuat prompt Wan 3.0
Model merencanakan seluruh klip dari prompt, jadi prompt harus menjelaskan jenis klip tersebut. Hasil render kami konsisten setiap kali kami menyebutkan kontinuitasnya — satu bidikan tanpa putus, atau daftar bidikan bernomor. Sisanya mengikuti dari situ.
Ucapkan "no cuts", lalu tentukan waktu ketukannya
Buka dengan "one continuous take, no cuts, no transitions", berikan setiap rentang detik satu hal untuk dilakukan dan satu kata kerja kamera, pertahankan satu subjek utama dalam bingkai, dan tulis suaranya sebagai kalimat tersendiri. Film utama dibuat persis seperti ini dan hasilnya tanpa satu pun potongan.
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe. 0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes. 6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build. 16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder. 24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes. Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
- Sebutkan referensinya
- Image 1, Video 1, Audio 1 — beri nomor sesuai jenis dalam urutan lampiran — dan jelaskan kegunaan masing-masing: "Image 1 adalah karakternya; Video 1 adalah gerakan kameranya".
- Arahkan suaranya
- Secara default, model akan menulis dialog, musik, dan efek. Mintalah apa yang Anda inginkan — "suara hujan dan trem di kejauhan, tanpa dialog" — atau matikan sakelar Audio untuk file tanpa suara.
- Gambar lebih dominan
- Jika diberikan gambar, model akan mempertahankan isinya. Untuk perubahan besar — cuaca, pakaian, latar yang berbeda — jelaskan perubahan tersebut secara eksplisit daripada berharap prompt akan mengabaikan gambar tersebut.
- Fokus pada satu subjek utama
- Satu sosok, jalur kamera yang jelas, dan kata-kata "no cuts" memberikan hasil yang bersih setiap saat. Kerumunan, tangan, dan properti kecil adalah titik di mana model video apa pun, termasuk yang satu ini, bisa melemah.
- Draft murah, hasilkan yang terbaik
- 480p menggunakan model yang sama dengan harga seperempat dari 1080p. Buktikan ceritanya di 480p, lalu render ulang versi terbaik di 1080p dengan prompt dan referensi yang sama.
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Tiga model di Popcraft yang semuanya menghasilkan suara bersama gambar. Keunggulan Wan adalah pengambilan gambar 30 detik termurah di platform ini dan subjek yang setia pada referensinya; keunggulan Seedance adalah jumlah referensi, pengeditan, dan perpanjangan; keunggulan Omni adalah 4K dan 40 detik melalui perpanjangan. Pilih berdasarkan kebutuhan tugas.
| Kemampuan | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| Klip terpanjang dari satu permintaan | 30 dtk dalam satu proses | 30 dtk | 40 dtk melalui ekstensi adegan (30 dtk pada 4K) |
| Resolusi | 480p / 720p / 1080p pada 30 fps | Hingga 1080p | 360p draft hingga 4K |
| Audio asli | Dialog, musik, efek; bisa dimatikan | Ya | Ucapan, musik, efek suara |
| Gambar referensi | Hingga 4 | Hingga 30 | Hingga 10 |
| Video referensi | Hingga 5, total 15 dtk | Hingga 10 | Hingga 3 |
| Audio referensi | Hingga 5, total 15 dtk | Hingga 10 | — |
| Edit atau perpanjang klip | — (gunakan Seedance 2.5 atau Omni) | Edit; perpanjang sebelum atau sesudah | Edit; perpanjang dalam tahap 10 dtk |
| Draft 30 detik | 330 kredit pada 480p | Per detik, sesuai resolusi | 150 kredit pada 360p |
Angka Wan berasal dari panduan Model Studio Alibaba; batas Popcraft adalah apa yang ditampilkan pemilih saat ini. Batas penyedia bisa berubah; pemilih selalu menunjukkan apa yang tersedia saat ini. Perbandingan lengkap: Seedance 2.5 · Gemini Omni 1.1 Flash.
Harga Wan 3.0 di Popcraft
Ditagih per detik hasil, berdasarkan resolusi. Referensi gratis untuk dilampirkan. Karena panjang hasil sesuai dengan permintaan, harga yang ditampilkan sebelum Anda membuat adalah harga yang Anda bayar.
Setiap paket mencakup kredit; halaman harga mencantumkan tarif saat ini untuk semua model. Unduhan paket gratis memiliki watermark Popcraft, yang akan dihapus pada paket berbayar.
Kegunaan Wan 3.0 menurut Alibaba
Tiga skenario dalam materi peluncuran Alibaba sendiri, dan cara menjalankannya di Popcraft.
- 01
Konten video pendek: dramatisasi alur cerita dan teaser iklan
Skenario hiburan Alibaba. Narasi multi-shot hingga 30 detik dari satu prompt, sudah termasuk suara.
- 02
E-commerce: etalase produk dari gambar produk
Skenario e-commerce Alibaba — "unggah gambar produk ditambah deskripsi, dapatkan etalase dinamis". Lampirkan foto sebagai Image 1.
- 03
Pendidikan: simulasi skenario yang direncanakan
Skenario pendidikan Alibaba — konsultasi dokter atau panggilan dukungan yang disusun dari prompt, dengan dialog yang dihasilkan.
- 04
Draft di 480p, kirim di 1080p
Tambahan dari Popcraft: 11 kredit per detik di 480p membuat draft 30 detik hanya 330 kredit sebelum Anda memutuskan untuk menggunakan 1080p.
Wan 3.0 — pertanyaan yang sering diajukan
Model video all-in-one dari Tongyi Lab milik Alibaba, dalam beta publik sejak 6 Agustus 2026 dan diluncurkan pada 24 Agustus. Satu model mencakup text-to-video, image-to-video, kontrol frame pertama-dan-terakhir, serta pembuatan referensi ganda, menghasilkan durasi berapa pun dari 2 hingga 30 detik dalam satu proses pada 30 fps, serta menghasilkan dialog, musik latar, dan efek suara bersama gambar.
Berapa pun detik bulat dari 2 hingga 30, dalam satu proses — tanpa rangkaian ekstensi, tanpa penyambungan. Di Popcraft, Anda mengatur durasi pada satu slider dan file yang dihasilkan sesuai dengan permintaan; dalam pengujian kami, setiap klip selesai dalam selisih beberapa seperseratus detik dari durasi yang diminta, dan Anda membayar tepat untuk detik-detik tersebut.
Secara default ya. Panduan Alibaba menyatakan model ini "menghasilkan dialog, BGM, dan efek suara secara asli" dan memungkinkan Anda menentukan baris kalimat dan suara dalam prompt. Sakelar Audio di Popcraft dapat mematikannya, dan klip yang dihasilkan dengan sakelar mati tidak akan memiliki trek audio sama sekali.
Lampirkan hingga 4 gambar, 5 klip video, dan 5 klip audio lalu rujuk dalam prompt sebagai Image 1, Video 1, Audio 1 dan seterusnya, diberi nomor sesuai jenis dalam urutan Anda melampirkannya. Gambar membawa karakter, objek, atau adegan; video membawa gerakan dan kamera; audio membawa suara atau ritme. Video dibatasi total 15 detik, begitu juga audio. Dua gambar dengan keterangan "first frame" dan "last frame" dalam prompt akan menjadi keyframe, dan keyframe tidak dapat dicampur dengan referensi lain.
Itulah tujuan model ini dibuat. Alibaba mencantumkan konsistensi penampilan karakter, kostum, properti, dan lingkungan sebagai kemampuan utama, dan dalam pengujian kami, character sheet mempertahankan identitasnya melalui gerakan kamera klip referensi, gambar produk kotak direproduksi dengan setia dalam bingkai 16:9, dan satu sosok tetap konsisten selama pengambilan gambar 30 detik. Wan 3.0 mengutamakan gambar yang Anda berikan — untuk perubahan kreatif yang besar dari referensi, jelaskan secara eksplisit.
Tidak di Popcraft saat ini. Wan 3.0 menggunakan klip yang dilampirkan sebagai referensi untuk gerakan, kamera, dan subjek; untuk memperpanjang atau mengedit cuplikan, gunakan Seedance 2.5, atau Gemini Omni 1.1 Flash, yang semuanya memiliki panel Perpanjang Video.
Alibaba menjelaskan referensi audio membawa timbre suara dan ritme trek, dengan baris kalimat yang diucapkan ditulis dalam prompt; model kemudian menghasilkan ucapan dan gerakan mulut secara bersamaan. Ini bukan alat sinkronisasi mulut dari rekaman (lip-sync). Untuk klip wajah berbicara yang didorong oleh rekaman tertentu, gunakan model avatar seperti OmniHuman.
Wan 3.0 ditagih per detik hasil: 11 kredit pada 480p, 20 pada 720p, dan 40 pada 1080p. Draft 30 detik pada 480p adalah 330 kredit; klip yang sama pada 1080p adalah 1.200. Setiap durasi dan resolusi menunjukkan harganya sebelum Anda membuat, dan unduhan tingkat gratis memiliki watermark Popcraft yang terlihat, yang akan dihapus oleh paket berbayar.
Tiga puluh detik, satu permintaan. Coba di 480p dulu.
Buat draft seharga 330 kredit, nilai ceritanya, lalu render versi terbaik di 1080p — atau bawa character sheet dan klip video untuk disatukan.
Terus jelajahi
Model terkait
Seedance 2.5 menghasilkan video hingga 30 detik dalam satu proses, dengan hingga 50 aset referensi, pengeditan video yang dapat dikontrol, perpanjangan temporal fidelitas tinggi, rasio aspek apa pun dari 0,4 hingga 2,5, dan prompting native dalam 10+ bahasa. Tersedia di Popcraft.
Gemini Omni 1.1 Flash adalah model video Google yang membuat dan mengedit video dari input apa pun. Hingga 40 detik dengan perpanjangan adegan, output 1080p dan 4K, interpolasi bingkai pertama dan terakhir, hingga 10 gambar referensi, serta ucapan, musik, dan efek suara yang dihasilkan bersama gambar. Tersedia di Popcraft.
MiniMax H3 menghasilkan video 2K pada 24fps dengan soundtrack stereo tersinkronisasi — efek, ambien, dan dialog dalam satu proses. Multi-shot dari satu prompt, 5 hingga 15 detik, kontrol bingkai awal dan akhir. Hadir di Popcraft.
Hasilkan video sinematik 4K dari teks, gambar, atau klip dengan Seedance 2.0 di Popcraft. Audio tersinkronisasi native, sekuens multi-shot, dan detail setajam silet hingga 4K (2160p).