阿里巴巴 · 通义实验室
Wan 3.0:30 秒 AI 视频一次生成,自带原声音效
Wan 3.0 是阿里巴巴推出的全能 AI 视频生成器。只需一段提示词、一张图片或一组参考素材,即可在单次请求中生成从 2 到 30 秒不等的任意长度视频,规格最高达 1080p 30 fps,并能在同一任务中渲染对话、音乐和音效。在 Popcraft 上,起步价仅为每秒 11 积分。
已上线视频工作站、Canvas 画板及 MCP 连接器
- 2–30 s
- 任意整数秒,一次生成
- 1080p 30 fps
- 亦提供 480p 和 720p 档位
- 4 · 5 · 5 参考
- 图片、视频、音频
- 11 积分 / 秒
- 480p 档位 — 30 秒仅需 330 积分
原生 30 秒时长
阿里巴巴的首个核心卖点:通过原生 30 秒生成能力提供“更完整的叙事和创作自由”。上方主打片在时间轴上的六个节点,展示了我们在生成此页面素材时的实际表现。
1s
6s
12s
18s
24s
29s| 请求 | 交付 | 生成耗时 |
|---|---|---|
| 30 s · 1080p · 纯文字 | 30.02 s · 1920×1080 · 立体声 | 5 分 38 秒 |
| 5 s · 720p · 纯文字 | 5.04 s · 1280×720 · 立体声 | 1 分 37 秒 |
| 3 s 和 10 s · 源自 6 s 参考片段 | 3.02 s 和 10.03 s · 参考片设定动作而非长度 | 每个约 1 分 25 秒 |
生成耗时指 2026 年 9 月在 Popcraft 上从提交到出片的时间。每个片段的误差都在百分之几秒内,因此生成前看到的积分预估即为您实际支付的积分。
沉浸式体验:写实感、质感与音效设计
阿里巴巴的官方描述:“提升写实感、质感和音效设计”。三部影片,三种风格 —— 实拍感、大片级 CG、商业幻想 —— 每一部都是一次请求、一个 30 秒长镜头,且音轨在同一次生成中完成,仅改变了提示词。
帘后
上方的展示影片:京剧演员从化妆镜前出发,穿过后台走廊,掀起丝绒幕布步入红灯笼满堂的戏院。鼓点渐强,锣声敲响,全场喝彩。
狐仙
一只九尾狐在灯火辉煌的屋顶上疾驰,纵身跃过空隙,满月映衬着它的身影,最终降落在钟楼上,此时满城灯笼升起。纯文字提示词生成的绘画级 3D 效果。
自动贩卖机
在阴雨的小巷里,一个穿黄雨衣的女孩按下按钮,被吸入玻璃后的缤纷世界,吉祥物递给她一罐饮料。气泡化作烟花,镜头拉回到小巷。
此处所有影片均为原始产出:无剪辑,无额外配乐。480p 预览版每部 330 积分;1080p 为 1,200 积分。
什么是 Wan 3.0?
Wan 3.0 (万相 3.0) 是阿里巴巴通义实验室推出的视频模型,自 2026 年 8 月 6 日开启公测并于 8 月 24 日正式发布。阿里巴巴将其定义为全能参考视频模型:通过单一模型即可实现文生视频、图生视频、首末帧控制及混合参考生成,无需为不同任务切换模型。该模型仅通过 API 提供(不开源),Popcraft 运行的是其“Prime”版本,即阿里巴巴提供的两个版本中速度较快的那一个。
参考自阿里云百炼平台 wan3.0-video 指南及 API 文档、Wan 3.0 官方代码库 README 以及阿里巴巴开发者社区发布总结。以上声明归阿里巴巴所有;本页面的实测数据归我们所有。
“单次请求稳定生成最高 30 秒视频,帧率为 30 fps。”
长度
“原生输出对话、背景音乐和音效 —— 无需后期配音。”
声音
“保持角色外貌、服装、道具、环境和视觉风格的一致性;支持推、拉、摇、移等镜头语言。”
一致性与镜头
- 原生 30 秒时长“更完整的叙事和创作自由。”在 Popcraft 上:2 至 30 秒任意长度,一次生成。
- 全能创作“支持多达 20 个参考资产,具备文档和网页解析能力。”在 Popcraft 上:支持 4 张图片、5 个视频、5 个音频。暂不支持文档和网页。
- 像素级一致性“提升制作流程中交付的确定性。”在 Popcraft 上:已实现 —— 详见下方的静态图展示。
- 沉浸式体验“写实感、质感和音效设计的全面提升。”在 Popcraft 上:已实现 —— 对话、音乐和特效随画面同步生成。
- 精准视频编辑“更可控的编辑功能,助力提升创作效率。”Popcraft 暂未上线 —— 请使用 Seedance 2.5 或 Gemini Omni 进行编辑或扩充。
全能创作:图片、视频和音频同框提示
阿里巴巴的第二大核心特性 —— 多模态输入生成。在 Popcraft 上,您可以在单次请求中上传多达 4 张图片、5 个视频片段和 5 条音频,并在提示词中按附件顺序分别称为 Image 1、Video 1 或 Audio 1。阿里巴巴平台还支持解析文档和网页,这部分功能 Popcraft 尚未集成。
主体、产品与场景
角色设计图可锁定面貌和服装;产品照可锁定物体;场景图可锁定置景。模型会保留图片内容,因此若需改动请明确描述。在提示词中加入“first frame”和“last frame”的两张图将转化为关键帧模式。
JPEG, PNG, WEBP 或 BMP · 单边 240 至 8,000 px · 每个 20 MB
Image 1 中的女子在黄昏时分沿着 Image 2 中的街道行走,镜头在侧面跟随。保持她的头发、大衣和提包与 Image 1 完全一致。
动作、镜头与表现
视频片段可将其镜头轨迹、调度和表现带入新镜头。配合图片使用,可让图片主体在参考片的场景中完成参考片的动作。参考片决定动作,不决定长度 —— 长度由滑块控制。
MP4 或 MOV · 每个 1 至 15 秒,总计不超过 15 秒 · 每个 100 MB
Image 1 中的男子站在柱子之间。完全遵循 Video 1 的镜头运动:低角度广角向右环绕移动,转为四分之三侧面特写。
音色或节奏参考
阿里巴巴的方案:音频提供音色或节奏,而台词写在提示词中;模型将同步生成语音和口型。这并非单纯的音视频合成工具 —— 若需特定音频驱动的数字人,请使用 OmniHuman 等模型。
WAV 或 MP3 · 每个 1 至 15 秒,总计不超过 15 秒 · 每个 15 MB
沿用 Audio 1 的音色,让角色说:“真的吗?听起来太棒了 —— 你什么时候回来?”生成的语音将驱动自然的口型变化。
关键帧与参考素材不可混用。标记为首尾帧的两张图片将独立生成关键帧片段;除此之外的所有素材 —— 主体图、视频片段、音频 —— 均可在上述限制内自由组合。
像素级一致性
阿里巴巴的第三大核心特性:“提升制作流程中交付的确定性” —— 模型官方文档将其表述为跨帧保持角色和参考细节的能力。以下是主打影片中同一位演员在相隔 28 秒的三个节点表现。
1 s
12 s
29 s如何为 Wan 3.0 编写提示词
模型会根据提示词规划整个片段,因此提示词必须说明片段类型。只要我们明确了连贯性 —— 如“一镜到底”或“带编号的镜头列表” —— 渲染效果就能保持稳定。其余细节依此类推。
明确“无剪辑”,并规划节奏点
以 “one continuous take, no cuts, no transitions” (一个连续长镜头,无剪辑,无过渡) 开头,为每个秒数区间分配一个动作和一个镜头动词,保持单一主格主体在画内,并用独立句子描述声音。主打片就是这样编写的,生成结果没有任何意外剪辑。
ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe. 0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes. 6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build. 16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder. 24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes. Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
- 指明参考编号
- 使用 Image 1、Video 1、Audio 1 —— 按上传顺序分类编号 —— 并说明用途:“Image 1 为角色;Video 1 为镜头运动”。
- 编导声音
- 默认情况下,模型会自动编写对话、音乐和特效。您可以具体要求 —— “rain and a distant tram, no dialogue” (雨声和远处的电车声,无对话) —— 或关闭音频开关生成静音文件。
- 忠于图像,大胆改动
- 提供图片时,模型会保留其中的内容。对于较大的改动 —— 气候、服装、不同的场景 —— 请明确描述变化,而非期望提示词能自动覆盖图像信息。
- 聚焦单一主体
- 单一人物、明确的镜头路径加上“no cuts”关键词,每次都能带给我们干净的长镜头。人群、手部和细小道具是所有视频模型(包括本模型)容易出现瑕疵的地方。
- 低价预览,高质交付
- 480p 与 1080p 使用相同模型,但价格仅为其四分之一。先用 480p 验证脚本,再用同样的提示词和参考素材重新渲染 1080p 成片。
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Popcraft 上支持画面与声音同步生成的三个模型。Wan 的优势在于平台上性价比最高的 30 秒长镜头以及极高的参考保真度;Seedance 强在参考数量、编辑与扩充;Omni 的优势在于 4K 画质以及通过扩充可达 40 秒的时长。 请根据任务需求选择。
| 能力项 | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| 单次请求最长片段 | 30 秒一次生成 | 30 秒 | 40 秒(通过场景扩充,4K 为 30 秒) |
| 分辨率 | 480p / 720p / 1080p @ 30 fps | 最高 1080p | 360p 预览至 4K |
| 原生音频 | 对话、音乐、特效;可关闭 | 支持 | 语音、音乐、音效 |
| 图片参考 | 最多 4 张 | 最多 30 张 | 最多 10 张 |
| 视频参考 | 最多 5 个,总计 15 秒 | 最多 10 个 | 最多 3 个 |
| 音频参考 | 最多 5 条,总计 15 秒 | 最多 10 条 | — |
| 编辑或扩充 | — (请使用 Sd 2.5 或 Omni) | 可编辑;可前后扩充 | 可编辑;按 10 秒步进扩充 |
| 30 秒预览成本 | 480p 需 330 积分 | 按分辨率每秒计费 | 360p 需 150 积分 |
Wan 的数据来源于阿里巴巴官方指南;Popcraft 的限制以当前选择器显示的为准。 供应商限额可能变动;选择器始终显示当前可用功能。完整对比:Seedance 2.5 · Gemini Omni 1.1 Flash。
Wan 3.0 在 Popcraft 上的定价
按交付秒数结合分辨率计费。参考素材免费上传。由于交付长度与请求完全匹配,生成前显示的预估价格即为最终支付价格。
所有套餐均包含积分;定价页面 列出了所有模型的当前费率。免费版下载带有 Popcraft 水印,付费套餐可移除。
阿里巴巴推荐的 Wan 3.0 场景
阿里巴巴官方发布资料中列出的三个场景,以及如何在 Popcraft 上实现它们。
- 01
短视频内容:剧情演绎与广告预热
阿里巴巴的娱乐场景方案。通过一段提示词即可生成长达 30 秒的多镜头叙事内容,且自带音效。
- 02
电商:通过产品图生成展示视频
阿里巴巴的电商场景 —— “上传一张产品图加上描述,获得动态展示视频”。将照片作为 Image 1 上传即可。
- 03
教育:模拟演练场景
阿里巴巴的教育场景 —— 通过提示词模拟医生咨询或服务电话场景,并生成同步对话内容。
- 04
480p 预览,1080p 交付
Popcraft 补充方案:480p 下每秒仅需 11 积分,在确认 1080p 渲染前,仅需 330 积分即可完成 30 秒的预览验证。
Wan 3.0 — 常见问题
Wan 3.0 是阿里巴巴通义实验室推出的全能视频模型,自 2026 年 8 月 6 日起公测。该模型涵盖了文生视频、图生视频、首末帧控制及多参考生成,支持单次生成 2 至 30 秒 30 fps 的视频,并能同步生成对话、背景音乐和音效。
单次生成最高可达 30 秒(任意整数秒) —— 无需扩充链,无需后期拼接。在 Popcraft 上,您可以通过滑块设定长度,生成的视频将与请求高度匹配。在实测中,所有片段的时长误差都在百分之几秒内,且按实际秒数计费。
默认会。阿里巴巴官方指南指出,该模型“原生输出对话、背景音乐和音效”,并允许在提示词中指定台词和声音。Popcraft 上的音频开关可将其关闭,关闭后生成的视频将不含音轨。
您可以上传多达 4 张图片、5 个视频和 5 条音频,并在提示词中按分类顺序引用它们(如 Image 1, Video 1, Audio 1)。图片用于设定角色、物体或场景;视频用于设定动作和镜头;音频用于设定音色或节奏。视频和音频的总长度上限均为 15 秒。若提示词中使用了“first frame”和“last frame”,两张图片将变为关键帧模式,此时无法混用其他参考素材。
这正是该模型的专长。阿里巴巴将保持角色外貌、服装、道具和环境的一致性作为核心能力。我们的测试表明,角色设计图在经过视频参考带来的镜头位移后仍能保持特征,正方形产品照也能在 16:9 构图中被忠实还原。Wan 3.0 倾向于遵循您提供的图像,对于偏离参考图的大胆创意,请在提示词中明确描述。
目前在 Popcraft 上暂不支持。Wan 3.0 使用附件视频作为动作、镜头和主体的参考;如需扩充或编辑现有素材,请使用 Seedance 2.5 或 Gemini Omni 1.1 Flash,它们均配有专门的“视频扩充”面板。
阿里巴巴定义的音频参考是提取音色和节奏,具体台词需写在提示词中,由模型同步生成语音和口型。它不是单纯的音频驱动工具。如果您需要由特定录音驱动的数字人片段,请使用 OmniHuman 等模型。
Wan 3.0 按交付秒数计费:480p 为 11 积分/秒,720p 为 20 积分/秒,1080p 为 40 积分/秒。480p 下的 30 秒草图需 330 积分,同等长度的 1080p 需 1,200 积分。生成前会显示最终价格。免费版下载带有 Popcraft 水印,付费套餐可移除。
30 秒,一次生成。建议先试用 480p。
只需 330 积分即可完成预览,验证叙事逻辑后再进行 1080p 渲染 —— 或者带上角色设计图和参考视频,让它们产生奇妙的化学反应。
继续探索
相关模型
Seedance 2.5 单次任务最长可生成 30 秒视频,支持最多 50 个参考素材、可控视频编辑、高保真时序延展,宽高比支持 0.4 至 2.5,原生支持 10 种以上语言输入提示词。现已在 Popcraft 上线。
Gemini Omni 1.1 Flash是谷歌推出的视频生成模型,可基于任意输入创作与编辑视频。支持场景续接最长40秒、1080P与4K输出、首尾帧插值、最多10张参考图,可同步生成人声、音乐与音效。现已在Popcraft上线。
MiniMax H3 生成 24fps 的 2K 视频,并同步配有立体声声纹——音效、环境音和对话一次完成。单提示词多镜头切换,5 至 15 秒,支持首尾帧控制。Popcraft 现已上线。
在 Popcraft 上使用 Seedance 2.0,从文本、图片或片段生成电影级 4K 视频。原生同步音频、多镜头序列,以及最高 4K (2160p) 的极致清晰细节。