阿里巴巴 · 通義實驗室
Wan 3.0:單次生成內建音效的 30 秒 AI 影片
Wan 3.0 是阿里巴巴全方位 AI 影片生成器。只需單次請求,即可將提示詞、圖片或參考素材集轉化為 **2 到 30 秒的任意長度**,解析度高達 1080p 和 30 fps,並在**同一次處理中渲染對白、音樂與音效**。在 Popcraft 每秒僅需 11 點起。
適用於影片工作室、Canvas 畫布及 MCP 連接器
- 2–30 秒
- 任意整數秒,一次完成
- 1080p 30 fps
- 亦提供 480p 與 720p 級別
- 4 · 5 · 5 參考素材
- 圖片、影片、音訊
- 11 點 / 秒
- 480p 費率 — 30 秒只需 330 點
原生 30 秒時長
阿里巴巴的首要主打功能:原生 30 秒生成帶來的「更完整的敘事與創作自由」。以下展示上方主打影片在時間軸上的六個節點,以及系統記錄顯示我們為此頁面生成的短片資訊。
1s
6s
12s
18s
24s
29s| 請求 | 交付 | 實際耗時 |
|---|---|---|
| 30 秒 · 1080p · 純文字 | 30.02 秒 · 1920×1080 · 立體聲 | 5 分 38 秒 |
| 5 秒 · 720p · 純文字 | 5.04 秒 · 1280×720 · 立體聲 | 1 分 37 秒 |
| 3 秒與 10 秒 · 來自一段 6 秒參考影片 | 3.02 秒與 10.03 秒 · 參考片決定動作而非長度 | 各約 1 分 25 秒 |
實際耗時為 2026 年 9 月在 Popcraft 上從提交到生成檔案的時間。每段短片的長度與請求誤差都在百分之幾秒內,因此您生成前看到的點數即為實際扣除的點數。
沉浸式體驗:真實感、質感與音效設計
阿里巴巴的描述:「提升的真實感、質感與音效設計」。三部影片,三種風格 — 真人實拍、電影級 CG、品牌奇幻 — 每部皆為**單次請求、30 秒一鏡到底**,且音效在同一次處理中生成。僅更改了提示詞。
幕起
上方的主打影片:京劇演員從化妝間鏡前走入後台走廊,穿過絲絨幕簾步入燈火通明的滿座劇場。鼓聲漸起,鑼聲響亮,全場喝采。
狐仙
九尾狐在燈火璀璨的屋頂上奔馳,躍過空隙時燈籠散落,襯著滿月懸空,最後降落在鐘樓上,全城的燈籠冉冉升起。僅靠文字提示詞達成的細膩 3D 質感。
自動販賣機
雨巷中穿著黃色雨衣的女孩按下了按鈕,被吸入玻璃進入色彩繽紛的世界,吉祥物遞給她一罐飲料。氣泡化作煙火,鏡頭拉回雨巷。
此處所有影片皆為原始交付效果:未經剪輯,未另加音樂。480p 草稿每段 330 點;1080p 為 1,200 點。
什麼是 Wan 3.0?
Wan 3.0 (万相 3.0) 是阿里巴巴通義實驗室研發的影片模型,自 2026 年 8 月 6 日起進入公開測試,並於 8 月 24 日正式發布。阿里巴巴稱其為**全方位參考影片模型**:單一模型即可處理文字轉影片、圖片轉影片、首末幀控制以及多重參考素材生成,而非每項任務使用獨立模型。該模型目前僅透過 API 提供 — 無開放權重 — Popcraft 運行的是阿里巴巴提供的兩個版本中較快速的精華版。
參考自阿里巴巴雲端模型工作室 wan3.0-video 指南與 API 文件;Wan 3.0 官方 GitHub README;阿里巴巴開發者社群發布摘要。上述聲明歸阿里巴巴所有;本頁面之測量數據為我們實測所得。
“單次請求可穩定生成長達 30 秒的影片,幀率為 30 fps。”
長度
“原生輸出對白、背景音樂與音效 — 無需後期配音。”
聲音
“人物外觀、服裝、道具、環境及視覺風格的一致性;支援推拉、搖鏡、追蹤等鏡頭語言。”
一致性與鏡頭
- 原生 30 秒時長“更完整的敘事與創作自由。”在 Popcraft 上:單次完成 2 到 30 秒的任意長度。
- 全方位創作 (Omni-Creation)“支援多達 20 個參考素材,具備文件與網頁解析能力。”在 Popcraft 上:支援 4 張圖片、5 段影片、5 個音訊。文件與網頁解析暫不支援。
- 像素級一致性“提高製作流程中的交付確定性。”在 Popcraft 上:是的 — 請參見下方的靜態截圖。
- 沉浸式體驗“提升的真實感、質感與音效設計。”在 Popcraft 上:是的 — 對白、音樂與音效隨畫面同步生成。
- 精準影片編輯“更可控的編輯能力,提升創作效率。”Popcraft 暫未支援 — 請使用 Seedance 2.5 或 Gemini Omni 進行編輯或延伸。
全方位創作:單一提示詞結合圖片、短片與音訊
阿里巴巴的第二大核心特色 — 透過多模態輸入進行生成。在 Popcraft 上,這意味著**單次請求可包含多達 4 張圖片、5 段影片和 5 段音訊**,並依附加順序在提示詞中命名為 Image 1、Video 1 或 Audio 1。阿里巴巴平台亦支援解析文件與網頁,該部分 Popcraft 尚未引進。
主體、產品與場景
人物設定圖可鎖定面容與服飾;產品照可固定物體細節;場景靜態圖可鎖定佈景。模型會保留圖片內容,如有變動請在提示詞中明確說明。在提示詞中使用「首幀 (first frame)」和「末幀 (last frame)」標註兩張圖片,即可將其作為關鍵幀。
JPEG, PNG, WEBP 或 BMP · 單邊 240 至 8,000 px · 每張 20 MB
Image 1 中的女人在黃昏時走在 Image 2 的街道上,鏡頭在她身側追蹤。保持她的頭髮、外套和提包與 Image 1 完全一致。
動態、鏡頭與表演
短片可將其鏡頭軌跡、調度與表演帶入新畫面。將其與圖片配對,圖片中的主體即可在短片的場景中執行相同的動作。短片設定的是動作而非時長 — 時長由拉桿控制。
MP4 或 MOV · 每段 1 至 15 秒,總計 15 秒 · 每個 100 MB
Image 1 中的男人站在柱子之間。完全遵循 Video 1 的鏡頭運動:低角度廣角向右環繞移動,最後變為四分之三側面特寫。
聲音音色或音軌節奏
阿里巴巴的方案:音訊提供音色或節奏,對白內容寫在提示詞中;模型會同步生成語音與口型。這並非單純的對口型工具 — 如需該功能,請使用 OmniHuman 等頭像模型。
WAV 或 MP3 · 每段 1 至 15 秒,總計 15 秒 · 每個 15 MB
採用 Audio 1 的音色讓角色說:「真的嗎?聽起來太棒了 — 你什麼時候回來?」生成的語音會帶動自然的口型變化。
**關鍵幀與參考素材不可混用。** 標註為首幀與末幀的兩張圖片會獨立構成關鍵幀短片;除此之外的所有內容 — 主體圖片、短片、音訊 — 皆可在上述限制內自由組合。
像素級一致性
阿里巴巴的第三大核心特色:「提高製作流程中的交付確定性」 — 模型說明指出其能在不同幀之間保留人物與參考素材的細節。以下展示主打影片中同一位演員在相隔 28 秒的三個時間點。
1 秒
12 秒
29 秒如何為 Wan 3.0 撰寫提示詞
模型會根據提示詞規劃整個短片,因此提示詞必須說明短片的類型。**只要我們明確定義連貫性** — 無論是單一不中斷鏡頭或編號的鏡頭列表 — 渲染效果都能保持穩定。其餘內容依此類推。
註明「無剪輯」,然後設定節奏時間點
開頭使用 **「one continuous take, no cuts, no transitions」** (一鏡到底,無剪輯,無轉場),為每個秒數區段設定一項任務與一個鏡頭動詞,保持單一主角在畫面中,並將聲音描述寫成獨立的句子。主打影片正是以此方式撰寫,生成結果完全沒有任何剪輯點。
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe. 0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes. 6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build. 16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder. 24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes. Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
- 命名參考素材
- 使用 Image 1、Video 1、Audio 1 — 依附加順序按類型編號 — 並說明各自用途:「Image 1 是角色;Video 1 是鏡頭運動」。
- 導引音效
- 預設情況下模型會編寫對白、音樂與音效。請明確要求您想要的內容 — 例如「rain and a distant tram, no dialogue」(雨聲與遠處電車聲,無對白) — 或關閉「音訊」開關以取得靜音檔案。
- 忠實呈現,大膽描述
- 提供圖片後,模型會保留其內容。對於重大的改變 — 如天氣、衣著、不同的佈景 — 請明確描述變化,而非僅指望提示詞能直接推翻圖片內容。
- 保持單一主角
- 單一人物、明確的鏡頭路徑加上「no cuts」關鍵字,每次都能給我們乾淨的鏡頭。人群、手部細節與微小道具是所有影片模型(包括此模型)較易失真的地方。
- 低價試草稿,高畫質交付
- 480p 解析度使用相同模型,價格僅為 1080p 的四分之一。先用 480p 確認故事效果,再使用相同的提示詞與參考素材以 1080p 重新渲染最終版本。
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Popcraft 上的這三款模型都能隨畫面生成音效。**Wan 的優勢在於平台上最經濟的 30 秒一鏡到底,以及對參考素材的高忠實度;Seedance 的優勢在於參考素材數量、編輯與延伸功能;Omni 則強在 4K 畫質與透過延伸可達 40 秒的長度。** 請依需求選擇。
| 能力 | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| 單次請求的最長短片 | 單次生成 30 秒 | 30 秒 | 透過場景延伸可達 40 秒 (4K 為 30 秒) |
| 解析度 | 480p / 720p / 1080p, 30 fps | 高達 1080p | 360p 草稿至 4K |
| 原生音訊 | 對白、音樂、音效;可切換關閉 | 支援 | 語音、音樂、音效 |
| 參考圖片 | 最多 4 張 | 最多 30 張 | 最多 10 張 |
| 參考影片 | 最多 5 段,總計 15 秒 | 最多 10 段 | 最多 3 段 |
| 參考音訊 | 最多 5 段,總計 15 秒 | 最多 10 段 | — |
| 編輯或延伸短片 | — (請使用 Seedance 2.5 或 Omni) | 編輯;支援前向或後向延伸 | 編輯;以 10 秒為單位延伸 |
| 30 秒草稿成本 | 480p 需 330 點 | 依解析度按秒計費 | 360p 需 150 點 |
**Wan 的數據來自阿里巴巴模型工作室指南;Popcraft 的限制為目前選取器所開放的上限。** 供應商上限可能變動;選取器始終顯示目前可用的選項。完整比較:Seedance 2.5 · Gemini Omni 1.1 Flash。
Wan 3.0 在 Popcraft 的定價
按**交付秒數**與解析度計費。附加參考素材不額外收費。由於交付長度與請求完全相符,生成前顯示的價格即為您的實際支出。
所有方案皆包含點數;價格頁面列出了所有模型的最新費率。免費方案下載的影片帶有 Popcraft 浮水印,付費方案可移除。
阿里巴巴推薦的 Wan 3.0 應用場景
阿里巴巴官方發布資料中的三個場景,以及如何在 Popcraft 上執行。
- 01
短影音內容:劇情演繹與廣告預告
阿里巴巴的娛樂場景。單一提示詞即可生成長達 30 秒的多鏡頭敘事,且包含音效。
- 02
電子商務:透過產品圖展示產品
阿里巴巴的電商場景 — 「上傳產品圖片加上描述,即可獲得動態展示」。請將照片作為 Image 1 附加。
- 03
教育:情境模擬練習
阿里巴巴的教育場景 — 透過提示詞模擬醫生諮詢或客服通話,並同步生成對白。
- 04
480p 試稿,1080p 交付
Popcraft 的加成用法:480p 每秒僅 11 點,這讓 30 秒的草稿在您決定投入 1080p 前只需花費 330 點。
Wan 3.0 — 常見問題
這是由阿里巴巴通義實驗室開發的全方位影片模型,自 2026 年 8 月 6 日起公測並於 8 月 24 日推出。單一模型涵蓋文字轉影片、圖片轉影片、首末幀控制與多參考生成,單次請求即可生成 2 至 30 秒、30 fps 的影片,並同步生成對白、背景音樂與音效。
單次生成可達 2 到 30 秒的任意整數秒 — 無需延伸鏈接,無需縫補。在 Popcraft 上,您只需透過拉桿設定長度,交付的檔案就會與請求相符;在我們的實測中,每段短片長度與請求誤差皆在百分之幾秒內,您只需支付精確的秒數點數。
預設會生成。阿里巴巴的指南指出該模型「原生輸出對白、背景音樂與音效」,並允許在提示詞中指定對話與聲音。Popcraft 上的音訊開關可將其關閉,關閉後生成的短片將不含音軌。
您可以附加最多 4 張圖片、5 段影片和 5 段音訊,並在提示詞中依附加順序將其稱為 Image 1、Video 1、Audio 1 等。圖片用於傳遞人物、物體或場景;影片傳遞動作與鏡頭;音訊則提供音色或節奏。影片與音訊參考素材的總長度各限 15 秒。若在提示詞標註「首幀」與「末幀」,兩張圖片將變為關鍵幀,且關鍵幀模式不可與其他參考素材混用。
這正是該模型的強項。阿里巴巴將角色外觀、服飾、道具與環境的一致性列為核心能力。在我們的測試中,人物設定圖在參考片帶動的鏡頭運動中依然保持身份,正方形產品照被精準還原於 16:9 畫面,且單一人像能穩定貫穿 30 秒。Wan 3.0 會優先遵循圖片細節 — 若需在參考基礎上進行大幅度創作修改,請明確描述變化。
Popcraft 目前暫未支援 Wan 3.0 的此項功能。Wan 3.0 將附加的短片視為動作與鏡頭的參考;若需延伸或編輯現有素材,請使用 Seedance 2.5 或 Gemini Omni 1.1 Flash,它們都具備「延伸影片」面板。
阿里巴巴將音訊參考描述為攜帶音色與節奏,而說話內容需寫在提示詞中;模型隨後同步生成語音與口型變化。它並非「針對特定錄音配口型」的工具。若需特定錄音驅動的對話短片,請使用 OmniHuman 等頭像模型。
Wan 3.0 按交付秒數計費:480p 為 11 點、720p 為 20 點、1080p 為 40 點。30 秒的 480p 草稿為 330 點;同長度的 1080p 影片為 1,200 點。所有長度與解析度的價格都會在生成前顯示,免費方案下載帶有 Popcraft 浮水印,付費方案可移除。
三十秒,一次請求。先用 480p 試試吧。
僅需 330 點即可生成草稿,確認劇情後再渲染 1080p 版本 — 或者帶上您的人物設定圖與參考片,讓它們在畫面中交會。
繼續探索
相關模型
Seedance 2.5 單次任務可生成長達 30 秒的影片,支援多達 50 個參考素材、可控影片編輯、高保真時間軸延展、0.4 至 2.5 的任意長寬比,以及 10 種以上語言的原生提示詞。現已於 Popcraft 上線。
Gemini Omni 1.1 Flash 是 Google 的影片模型,可從任何輸入建立和編輯影片。透過場景延伸最長可達 40 秒,支援 1080p 及 4K 輸出、首尾影格插值、最多 10 張參考圖片,並能隨畫面同步生成語音、音樂和音效。現已在 Popcraft 上線。
MiniMax H3 可生成 24fps 的 2K 影片並同步立體聲配樂,一次搞定特效、氛圍與對白。支援單一提示詞多鏡頭、5 至 15 秒、首末幀控制。現已在 Popcraft 上線。
在 Popcraft 上使用 Seedance 2.0,從文字、圖片或片段生成電影級 4K 影片。原生同步音訊、多鏡頭序列,以及最高 4K (2160p) 的極致清晰細節。