NEW下一個爆款 UGC 廣告,一鍵即成。立即體驗 Studio立即製作廣告
PopcraftPopcraft
全新影片模型

阿里巴巴 · 通義實驗室

Wan 3.0:單次生成內建音效的 30 秒 AI 影片

Wan 3.0 是阿里巴巴全方位 AI 影片生成器。只需單次請求,即可將提示詞、圖片或參考素材集轉化為 **2 到 30 秒的任意長度**,解析度高達 1080p 和 30 fps,並在**同一次處理中渲染對白、音樂與音效**。在 Popcraft 每秒僅需 11 點起。

適用於影片工作室、Canvas 畫布及 MCP 連接器

2–30
任意整數秒,一次完成
1080p 30 fps
亦提供 480p 與 720p 級別
4 · 5 · 5 參考素材
圖片、影片、音訊
11 點 / 秒
480p 費率 — 30 秒只需 330 點
00秒,一鏡到底
一鏡到底 · 生成音訊 · 無需剪輯

原生 30 秒時長

阿里巴巴的首要主打功能:原生 30 秒生成帶來的「更完整的敘事與創作自由」。以下展示上方主打影片在時間軸上的六個節點,以及系統記錄顯示我們為此頁面生成的短片資訊。

第 1 秒:化妝鏡中演員彩繪臉譜的特寫1s
第 6 秒:她身著紅金相間的戲袍從鏡前起身6s
第 12 秒:後台走廊,工作人員在她經過時靠牆避讓12s
第 18 秒:她的手觸碰紅色絲絨幕簾18s
第 24 秒:穿過幕簾進入舞台燈光,背後展現出掛滿燈籠的劇場24s
第 29 秒:在紅色燈籠下的劇場中,水袖高舉29s
**同一位演員、同一件袍服、鏡前到台上的同一色調** — 化妝間、走廊、幕簾、全場觀眾,單次不經剪輯的請求即可達成。
交付與請求對比
請求交付實際耗時
30 秒 · 1080p · 純文字30.02 秒 · 1920×1080 · 立體聲5 分 38 秒
5 秒 · 720p · 純文字5.04 秒 · 1280×720 · 立體聲1 分 37 秒
3 秒與 10 秒 · 來自一段 6 秒參考影片3.02 秒與 10.03 秒 · 參考片決定動作而非長度各約 1 分 25 秒

實際耗時為 2026 年 9 月在 Popcraft 上從提交到生成檔案的時間。每段短片的長度與請求誤差都在百分之幾秒內,因此您生成前看到的點數即為實際扣除的點數。

沉浸式體驗:真實感、質感與音效設計

阿里巴巴的描述:「提升的真實感、質感與音效設計」。三部影片,三種風格 — 真人實拍、電影級 CG、品牌奇幻 — 每部皆為**單次請求、30 秒一鏡到底**,且音效在同一次處理中生成。僅更改了提示詞。

真人實拍30.0s1 takelive action

幕起

上方的主打影片:京劇演員從化妝間鏡前走入後台走廊,穿過絲絨幕簾步入燈火通明的滿座劇場。鼓聲漸起,鑼聲響亮,全場喝采。

電影級 CG30.0s1 take3D-CG look

狐仙

九尾狐在燈火璀璨的屋頂上奔馳,躍過空隙時燈籠散落,襯著滿月懸空,最後降落在鐘樓上,全城的燈籠冉冉升起。僅靠文字提示詞達成的細膩 3D 質感。

品牌奇幻30.0s1 takebrand fantasy

自動販賣機

雨巷中穿著黃色雨衣的女孩按下了按鈕,被吸入玻璃進入色彩繽紛的世界,吉祥物遞給她一罐飲料。氣泡化作煙火,鏡頭拉回雨巷。

此處所有影片皆為原始交付效果:未經剪輯,未另加音樂。480p 草稿每段 330 點;1080p 為 1,200 點。

什麼是 Wan 3.0?

Wan 3.0 (万相 3.0) 是阿里巴巴通義實驗室研發的影片模型,自 2026 年 8 月 6 日起進入公開測試,並於 8 月 24 日正式發布。阿里巴巴稱其為**全方位參考影片模型**:單一模型即可處理文字轉影片、圖片轉影片、首末幀控制以及多重參考素材生成,而非每項任務使用獨立模型。該模型目前僅透過 API 提供 — 無開放權重 — Popcraft 運行的是阿里巴巴提供的兩個版本中較快速的精華版。

參考自阿里巴巴雲端模型工作室 wan3.0-video 指南與 API 文件;Wan 3.0 官方 GitHub README;阿里巴巴開發者社群發布摘要。上述聲明歸阿里巴巴所有;本頁面之測量數據為我們實測所得。

阿里巴巴官方描述
  1. 單次請求可穩定生成長達 30 秒的影片,幀率為 30 fps。

    長度

  2. 原生輸出對白、背景音樂與音效 — 無需後期配音。

    聲音

  3. 人物外觀、服裝、道具、環境及視覺風格的一致性;支援推拉、搖鏡、追蹤等鏡頭語言。

    一致性與鏡頭

阿里巴巴五大核心特色
  1. 原生 30 秒時長更完整的敘事與創作自由。在 Popcraft 上:單次完成 2 到 30 秒的任意長度。
  2. 全方位創作 (Omni-Creation)支援多達 20 個參考素材,具備文件與網頁解析能力。在 Popcraft 上:支援 4 張圖片、5 段影片、5 個音訊。文件與網頁解析暫不支援。
  3. 像素級一致性提高製作流程中的交付確定性。在 Popcraft 上:是的 — 請參見下方的靜態截圖。
  4. 沉浸式體驗提升的真實感、質感與音效設計。在 Popcraft 上:是的 — 對白、音樂與音效隨畫面同步生成。
  5. 精準影片編輯更可控的編輯能力,提升創作效率。Popcraft 暫未支援 — 請使用 Seedance 2.5 或 Gemini Omni 進行編輯或延伸。

全方位創作:單一提示詞結合圖片、短片與音訊

阿里巴巴的第二大核心特色 — 透過多模態輸入進行生成。在 Popcraft 上,這意味著**單次請求可包含多達 4 張圖片、5 段影片和 5 段音訊**,並依附加順序在提示詞中命名為 Image 1、Video 1 或 Audio 1。阿里巴巴平台亦支援解析文件與網頁,該部分 Popcraft 尚未引進。

Image 1 … Image 4

主體、產品與場景

人物設定圖可鎖定面容與服飾;產品照可固定物體細節;場景靜態圖可鎖定佈景。模型會保留圖片內容,如有變動請在提示詞中明確說明。在提示詞中使用「首幀 (first frame)」和「末幀 (last frame)」標註兩張圖片,即可將其作為關鍵幀。

JPEG, PNG, WEBP 或 BMP · 單邊 240 至 8,000 px · 每張 20 MB

Image 1 中的女人在黃昏時走在 Image 2 的街道上,鏡頭在她身側追蹤。保持她的頭髮、外套和提包與 Image 1 完全一致。
Video 1 … Video 5

動態、鏡頭與表演

短片可將其鏡頭軌跡、調度與表演帶入新畫面。將其與圖片配對,圖片中的主體即可在短片的場景中執行相同的動作。短片設定的是動作而非時長 — 時長由拉桿控制。

MP4 或 MOV · 每段 1 至 15 秒,總計 15 秒 · 每個 100 MB

Image 1 中的男人站在柱子之間。完全遵循 Video 1 的鏡頭運動:低角度廣角向右環繞移動,最後變為四分之三側面特寫。
Audio 1 … Audio 5

聲音音色或音軌節奏

阿里巴巴的方案:音訊提供音色或節奏,對白內容寫在提示詞中;模型會同步生成語音與口型。這並非單純的對口型工具 — 如需該功能,請使用 OmniHuman 等頭像模型。

WAV 或 MP3 · 每段 1 至 15 秒,總計 15 秒 · 每個 15 MB

採用 Audio 1 的音色讓角色說:「真的嗎?聽起來太棒了 — 你什麼時候回來?」生成的語音會帶動自然的口型變化。

**關鍵幀與參考素材不可混用。** 標註為首幀與末幀的兩張圖片會獨立構成關鍵幀短片;除此之外的所有內容 — 主體圖片、短片、音訊 — 皆可在上述限制內自由組合。

像素級一致性

阿里巴巴的第三大核心特色:「提高製作流程中的交付確定性」 — 模型說明指出其能在不同幀之間保留人物與參考素材的細節。以下展示主打影片中同一位演員在相隔 28 秒的三個時間點。

第 1 秒時化妝鏡中演員彩繪臉譜的面容1 秒
第 12 秒時後台走廊中同一位演員12 秒
第 29 秒時舞台上對著全場觀眾的同一位演員29 秒
**從化妝鏡到舞台,相同的臉孔、頭飾與戲袍。** 將人物設定圖或產品照作為 Image 1 附加,模型會保留您提供的細節;在我們的測試中,正方形的產品靜態圖在 16:9 畫面中被忠實還原,且一段 6 秒的參考影片分別帶動了 3 秒與 10 秒的生成結果,而主體保持不變。

如何為 Wan 3.0 撰寫提示詞

模型會根據提示詞規劃整個短片,因此提示詞必須說明短片的類型。**只要我們明確定義連貫性** — 無論是單一不中斷鏡頭或編號的鏡頭列表 — 渲染效果都能保持穩定。其餘內容依此類推。

針對一鏡到底

註明「無剪輯」,然後設定節奏時間點

開頭使用 **「one continuous take, no cuts, no transitions」** (一鏡到底,無剪輯,無轉場),為每個秒數區段設定一項任務與一個鏡頭動詞,保持單一主角在畫面中,並將聲音描述寫成獨立的句子。主打影片正是以此方式撰寫,生成結果完全沒有任何剪輯點。

ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe.
0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes.
6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build.
16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder.
24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes.
Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
命名參考素材
使用 Image 1、Video 1、Audio 1 — 依附加順序按類型編號 — 並說明各自用途:「Image 1 是角色;Video 1 是鏡頭運動」。
導引音效
預設情況下模型會編寫對白、音樂與音效。請明確要求您想要的內容 — 例如「rain and a distant tram, no dialogue」(雨聲與遠處電車聲,無對白) — 或關閉「音訊」開關以取得靜音檔案。
忠實呈現,大膽描述
提供圖片後,模型會保留其內容。對於重大的改變 — 如天氣、衣著、不同的佈景 — 請明確描述變化,而非僅指望提示詞能直接推翻圖片內容。
保持單一主角
單一人物、明確的鏡頭路徑加上「no cuts」關鍵字,每次都能給我們乾淨的鏡頭。人群、手部細節與微小道具是所有影片模型(包括此模型)較易失真的地方。
低價試草稿,高畫質交付
480p 解析度使用相同模型,價格僅為 1080p 的四分之一。先用 480p 確認故事效果,再使用相同的提示詞與參考素材以 1080p 重新渲染最終版本。

Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash

Popcraft 上的這三款模型都能隨畫面生成音效。**Wan 的優勢在於平台上最經濟的 30 秒一鏡到底,以及對參考素材的高忠實度;Seedance 的優勢在於參考素材數量、編輯與延伸功能;Omni 則強在 4K 畫質與透過延伸可達 40 秒的長度。** 請依需求選擇。

能力Wan 3.0Seedance 2.5Gemini Omni 1.1 Flash
單次請求的最長短片單次生成 30 秒30 秒透過場景延伸可達 40 秒 (4K 為 30 秒)
解析度480p / 720p / 1080p, 30 fps高達 1080p360p 草稿至 4K
原生音訊對白、音樂、音效;可切換關閉支援語音、音樂、音效
參考圖片最多 4 張最多 30 張最多 10 張
參考影片最多 5 段,總計 15 秒最多 10 段最多 3 段
參考音訊最多 5 段,總計 15 秒最多 10 段
編輯或延伸短片— (請使用 Seedance 2.5 或 Omni)編輯;支援前向或後向延伸編輯;以 10 秒為單位延伸
30 秒草稿成本480p 需 330 點依解析度按秒計費360p 需 150 點

**Wan 的數據來自阿里巴巴模型工作室指南;Popcraft 的限制為目前選取器所開放的上限。** 供應商上限可能變動;選取器始終顯示目前可用的選項。完整比較:Seedance 2.5 · Gemini Omni 1.1 Flash

Wan 3.0 在 Popcraft 的定價

按**交付秒數**與解析度計費。附加參考素材不額外收費。由於交付長度與請求完全相符,生成前顯示的價格即為您的實際支出。

480p
11 點 / 秒
草稿用途
30 秒 = 330 點
720p
20 點 / 秒
社群媒體
15 秒 = 300 點
1080p
40 點 / 秒
主打展示
30 秒 = 1,200 點

所有方案皆包含點數;價格頁面列出了所有模型的最新費率。免費方案下載的影片帶有 Popcraft 浮水印,付費方案可移除。

阿里巴巴推薦的 Wan 3.0 應用場景

阿里巴巴官方發布資料中的三個場景,以及如何在 Popcraft 上執行。

  • 01

    短影音內容:劇情演繹與廣告預告

    阿里巴巴的娛樂場景。單一提示詞即可生成長達 30 秒的多鏡頭敘事,且包含音效。

  • 02

    電子商務:透過產品圖展示產品

    阿里巴巴的電商場景 — 「上傳產品圖片加上描述,即可獲得動態展示」。請將照片作為 Image 1 附加。

  • 03

    教育:情境模擬練習

    阿里巴巴的教育場景 — 透過提示詞模擬醫生諮詢或客服通話,並同步生成對白。

  • 04

    480p 試稿,1080p 交付

    Popcraft 的加成用法:480p 每秒僅 11 點,這讓 30 秒的草稿在您決定投入 1080p 前只需花費 330 點。

Wan 3.0 — 常見問題

這是由阿里巴巴通義實驗室開發的全方位影片模型,自 2026 年 8 月 6 日起公測並於 8 月 24 日推出。單一模型涵蓋文字轉影片、圖片轉影片、首末幀控制與多參考生成,單次請求即可生成 2 至 30 秒、30 fps 的影片,並同步生成對白、背景音樂與音效。

單次生成可達 2 到 30 秒的任意整數秒 — 無需延伸鏈接,無需縫補。在 Popcraft 上,您只需透過拉桿設定長度,交付的檔案就會與請求相符;在我們的實測中,每段短片長度與請求誤差皆在百分之幾秒內,您只需支付精確的秒數點數。

預設會生成。阿里巴巴的指南指出該模型「原生輸出對白、背景音樂與音效」,並允許在提示詞中指定對話與聲音。Popcraft 上的音訊開關可將其關閉,關閉後生成的短片將不含音軌。

您可以附加最多 4 張圖片、5 段影片和 5 段音訊,並在提示詞中依附加順序將其稱為 Image 1、Video 1、Audio 1 等。圖片用於傳遞人物、物體或場景;影片傳遞動作與鏡頭;音訊則提供音色或節奏。影片與音訊參考素材的總長度各限 15 秒。若在提示詞標註「首幀」與「末幀」,兩張圖片將變為關鍵幀,且關鍵幀模式不可與其他參考素材混用。

這正是該模型的強項。阿里巴巴將角色外觀、服飾、道具與環境的一致性列為核心能力。在我們的測試中,人物設定圖在參考片帶動的鏡頭運動中依然保持身份,正方形產品照被精準還原於 16:9 畫面,且單一人像能穩定貫穿 30 秒。Wan 3.0 會優先遵循圖片細節 — 若需在參考基礎上進行大幅度創作修改,請明確描述變化。

Popcraft 目前暫未支援 Wan 3.0 的此項功能。Wan 3.0 將附加的短片視為動作與鏡頭的參考;若需延伸或編輯現有素材,請使用 Seedance 2.5 或 Gemini Omni 1.1 Flash,它們都具備「延伸影片」面板。

阿里巴巴將音訊參考描述為攜帶音色與節奏,而說話內容需寫在提示詞中;模型隨後同步生成語音與口型變化。它並非「針對特定錄音配口型」的工具。若需特定錄音驅動的對話短片,請使用 OmniHuman 等頭像模型。

Wan 3.0 按交付秒數計費:480p 為 11 點、720p 為 20 點、1080p 為 40 點。30 秒的 480p 草稿為 330 點;同長度的 1080p 影片為 1,200 點。所有長度與解析度的價格都會在生成前顯示,免費方案下載帶有 Popcraft 浮水印,付費方案可移除。

三十秒,一次請求。先用 480p 試試吧。

僅需 330 點即可生成草稿,確認劇情後再渲染 1080p 版本 — 或者帶上您的人物設定圖與參考片,讓它們在畫面中交會。

繼續探索

相關模型