NEW下一个爆款 UGC 广告,一键即达。快来体验 Studio立即制作广告
PopcraftPopcraft
全新视频模型

阿里巴巴 · 通义实验室

Wan 3.0:30 秒 AI 视频一次生成,自带原声音效

Wan 3.0 是阿里巴巴推出的全能 AI 视频生成器。只需一段提示词、一张图片或一组参考素材,即可在单次请求中生成从 2 到 30 秒不等的任意长度视频,规格最高达 1080p 30 fps,并能在同一任务中渲染对话、音乐和音效。在 Popcraft 上,起步价仅为每秒 11 积分。

已上线视频工作站、Canvas 画板及 MCP 连接器

2–30 s
任意整数秒,一次生成
1080p 30 fps
亦提供 480p 和 720p 档位
4 · 5 · 5 参考
图片、视频、音频
11 积分 / 秒
480p 档位 — 30 秒仅需 330 积分
00秒,一镜到底
一镜到底 · 自动生成音频 · 无需后期

原生 30 秒时长

阿里巴巴的首个核心卖点:通过原生 30 秒生成能力提供“更完整的叙事和创作自由”。上方主打片在时间轴上的六个节点,展示了我们在生成此页面素材时的实际表现。

1 秒处:化妆镜中演员画好脸谱的脸部特写1s
6 秒处:她身着红金戏袍从镜前起身6s
12 秒处:后台走廊,场务人员在她经过时纷纷避让靠墙12s
18 秒处:她的手抚过红丝绒幕布18s
24 秒处:穿过幕布步入舞台灯光,背后是灯火通明的戏院24s
29 秒处:面对红灯笼高挂的全场观众,水袖扬起29s
同一个演员、同一件戏袍、从镜前到舞台的同一影调 —— 化妆间、走廊、幕布、剧场,在单次不剪辑的请求中完成。
交付时长与请求对比
请求交付生成耗时
30 s · 1080p · 纯文字30.02 s · 1920×1080 · 立体声5 分 38 秒
5 s · 720p · 纯文字5.04 s · 1280×720 · 立体声1 分 37 秒
3 s 和 10 s · 源自 6 s 参考片段3.02 s 和 10.03 s · 参考片设定动作而非长度每个约 1 分 25 秒

生成耗时指 2026 年 9 月在 Popcraft 上从提交到出片的时间。每个片段的误差都在百分之几秒内,因此生成前看到的积分预估即为您实际支付的积分。

沉浸式体验:写实感、质感与音效设计

阿里巴巴的官方描述:“提升写实感、质感和音效设计”。三部影片,三种风格 —— 实拍感、大片级 CG、商业幻想 —— 每一部都是一次请求、一个 30 秒长镜头,且音轨在同一次生成中完成,仅改变了提示词。

实拍风格30.0s1 takelive action

帘后

上方的展示影片:京剧演员从化妆镜前出发,穿过后台走廊,掀起丝绒幕布步入红灯笼满堂的戏院。鼓点渐强,锣声敲响,全场喝彩。

电影级 CG30.0s1 take3D-CG look

狐仙

一只九尾狐在灯火辉煌的屋顶上疾驰,纵身跃过空隙,满月映衬着它的身影,最终降落在钟楼上,此时满城灯笼升起。纯文字提示词生成的绘画级 3D 效果。

商业幻想30.0s1 takebrand fantasy

自动贩卖机

在阴雨的小巷里,一个穿黄雨衣的女孩按下按钮,被吸入玻璃后的缤纷世界,吉祥物递给她一罐饮料。气泡化作烟花,镜头拉回到小巷。

此处所有影片均为原始产出:无剪辑,无额外配乐。480p 预览版每部 330 积分;1080p 为 1,200 积分。

什么是 Wan 3.0?

Wan 3.0 (万相 3.0) 是阿里巴巴通义实验室推出的视频模型,自 2026 年 8 月 6 日开启公测并于 8 月 24 日正式发布。阿里巴巴将其定义为全能参考视频模型:通过单一模型即可实现文生视频、图生视频、首末帧控制及混合参考生成,无需为不同任务切换模型。该模型仅通过 API 提供(不开源),Popcraft 运行的是其“Prime”版本,即阿里巴巴提供的两个版本中速度较快的那一个。

参考自阿里云百炼平台 wan3.0-video 指南及 API 文档、Wan 3.0 官方代码库 README 以及阿里巴巴开发者社区发布总结。以上声明归阿里巴巴所有;本页面的实测数据归我们所有。

阿里巴巴官方描述
  1. 单次请求稳定生成最高 30 秒视频,帧率为 30 fps。

    长度

  2. 原生输出对话、背景音乐和音效 —— 无需后期配音。

    声音

  3. 保持角色外貌、服装、道具、环境和视觉风格的一致性;支持推、拉、摇、移等镜头语言。

    一致性与镜头

阿里巴巴五大核心特性
  1. 原生 30 秒时长更完整的叙事和创作自由。在 Popcraft 上:2 至 30 秒任意长度,一次生成。
  2. 全能创作支持多达 20 个参考资产,具备文档和网页解析能力。在 Popcraft 上:支持 4 张图片、5 个视频、5 个音频。暂不支持文档和网页。
  3. 像素级一致性提升制作流程中交付的确定性。在 Popcraft 上:已实现 —— 详见下方的静态图展示。
  4. 沉浸式体验写实感、质感和音效设计的全面提升。在 Popcraft 上:已实现 —— 对话、音乐和特效随画面同步生成。
  5. 精准视频编辑更可控的编辑功能,助力提升创作效率。Popcraft 暂未上线 —— 请使用 Seedance 2.5 或 Gemini Omni 进行编辑或扩充。

全能创作:图片、视频和音频同框提示

阿里巴巴的第二大核心特性 —— 多模态输入生成。在 Popcraft 上,您可以在单次请求中上传多达 4 张图片、5 个视频片段和 5 条音频,并在提示词中按附件顺序分别称为 Image 1、Video 1 或 Audio 1。阿里巴巴平台还支持解析文档和网页,这部分功能 Popcraft 尚未集成。

Image 1 … Image 4

主体、产品与场景

角色设计图可锁定面貌和服装;产品照可锁定物体;场景图可锁定置景。模型会保留图片内容,因此若需改动请明确描述。在提示词中加入“first frame”和“last frame”的两张图将转化为关键帧模式。

JPEG, PNG, WEBP 或 BMP · 单边 240 至 8,000 px · 每个 20 MB

Image 1 中的女子在黄昏时分沿着 Image 2 中的街道行走,镜头在侧面跟随。保持她的头发、大衣和提包与 Image 1 完全一致。
Video 1 … Video 5

动作、镜头与表现

视频片段可将其镜头轨迹、调度和表现带入新镜头。配合图片使用,可让图片主体在参考片的场景中完成参考片的动作。参考片决定动作,不决定长度 —— 长度由滑块控制。

MP4 或 MOV · 每个 1 至 15 秒,总计不超过 15 秒 · 每个 100 MB

Image 1 中的男子站在柱子之间。完全遵循 Video 1 的镜头运动:低角度广角向右环绕移动,转为四分之三侧面特写。
Audio 1 … Audio 5

音色或节奏参考

阿里巴巴的方案:音频提供音色或节奏,而台词写在提示词中;模型将同步生成语音和口型。这并非单纯的音视频合成工具 —— 若需特定音频驱动的数字人,请使用 OmniHuman 等模型。

WAV 或 MP3 · 每个 1 至 15 秒,总计不超过 15 秒 · 每个 15 MB

沿用 Audio 1 的音色,让角色说:“真的吗?听起来太棒了 —— 你什么时候回来?”生成的语音将驱动自然的口型变化。

关键帧与参考素材不可混用。标记为首尾帧的两张图片将独立生成关键帧片段;除此之外的所有素材 —— 主体图、视频片段、音频 —— 均可在上述限制内自由组合。

像素级一致性

阿里巴巴的第三大核心特性:“提升制作流程中交付的确定性” —— 模型官方文档将其表述为跨帧保持角色和参考细节的能力。以下是主打影片中同一位演员在相隔 28 秒的三个节点表现。

1 秒处,化妆镜中演员画好脸谱的面部1 s
12 秒处,后台走廊中同一位演员12 s
29 秒处,面对全场观众的舞台上的同一位演员29 s
同一张脸、同一套头饰、同一件戏袍,从镜前到舞台。 将角色图或产品照作为 Image 1 附件,模型即可保持您提供的内容;在我们的测试中,一张正方形的产品静态图被忠实地还原在 16:9 构图中,而一个 6 秒的参考片段成功驱动了 3 秒和 10 秒的生成结果,且主体未发生改变。

如何为 Wan 3.0 编写提示词

模型会根据提示词规划整个片段,因此提示词必须说明片段类型。只要我们明确了连贯性 —— 如“一镜到底”或“带编号的镜头列表” —— 渲染效果就能保持稳定。其余细节依此类推。

针对一镜到底

明确“无剪辑”,并规划节奏点

“one continuous take, no cuts, no transitions” (一个连续长镜头,无剪辑,无过渡) 开头,为每个秒数区间分配一个动作和一个镜头动词,保持单一主格主体在画内,并用独立句子描述声音。主打片就是这样编写的,生成结果没有任何意外剪辑。

ONE CONTINUOUS TAKE, NO CUTS, NO TRANSITIONS, 30 s. Cinematic photoreal, high contrast. A Beijing-opera performer in painted-face makeup and a crimson-and-gold robe.
0–6 s: extreme close-up in a dressing-room mirror ringed with bulbs; she opens her eyes.
6–16 s: she walks down a narrow backstage corridor, stagehands flattening against the walls, the camera tracking backwards ahead of her as drums build.
16–24 s: she pushes through heavy red velvet curtains into blinding stage light; the camera swings behind her shoulder.
24–30 s: the reveal — a packed theatre under red lanterns; she raises one water-sleeve as a gong strikes.
Sound: drums building, footsteps, the curtain rush, one gong, applause. No dialogue, no on-screen text.
指明参考编号
使用 Image 1、Video 1、Audio 1 —— 按上传顺序分类编号 —— 并说明用途:“Image 1 为角色;Video 1 为镜头运动”。
编导声音
默认情况下,模型会自动编写对话、音乐和特效。您可以具体要求 —— “rain and a distant tram, no dialogue” (雨声和远处的电车声,无对话) —— 或关闭音频开关生成静音文件。
忠于图像,大胆改动
提供图片时,模型会保留其中的内容。对于较大的改动 —— 气候、服装、不同的场景 —— 请明确描述变化,而非期望提示词能自动覆盖图像信息。
聚焦单一主体
单一人物、明确的镜头路径加上“no cuts”关键词,每次都能带给我们干净的长镜头。人群、手部和细小道具是所有视频模型(包括本模型)容易出现瑕疵的地方。
低价预览,高质交付
480p 与 1080p 使用相同模型,但价格仅为其四分之一。先用 480p 验证脚本,再用同样的提示词和参考素材重新渲染 1080p 成片。

Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash

Popcraft 上支持画面与声音同步生成的三个模型。Wan 的优势在于平台上性价比最高的 30 秒长镜头以及极高的参考保真度;Seedance 强在参考数量、编辑与扩充;Omni 的优势在于 4K 画质以及通过扩充可达 40 秒的时长。 请根据任务需求选择。

能力项Wan 3.0Seedance 2.5Gemini Omni 1.1 Flash
单次请求最长片段30 秒一次生成30 秒40 秒(通过场景扩充,4K 为 30 秒)
分辨率480p / 720p / 1080p @ 30 fps最高 1080p360p 预览至 4K
原生音频对话、音乐、特效;可关闭支持语音、音乐、音效
图片参考最多 4 张最多 30 张最多 10 张
视频参考最多 5 个,总计 15 秒最多 10 个最多 3 个
音频参考最多 5 条,总计 15 秒最多 10 条
编辑或扩充— (请使用 Sd 2.5 或 Omni)可编辑;可前后扩充可编辑;按 10 秒步进扩充
30 秒预览成本480p 需 330 积分按分辨率每秒计费360p 需 150 积分

Wan 的数据来源于阿里巴巴官方指南;Popcraft 的限制以当前选择器显示的为准。 供应商限额可能变动;选择器始终显示当前可用功能。完整对比:Seedance 2.5 · Gemini Omni 1.1 Flash

Wan 3.0 在 Popcraft 上的定价

交付秒数结合分辨率计费。参考素材免费上传。由于交付长度与请求完全匹配,生成前显示的预估价格即为最终支付价格。

480p
11 积分 / 秒
预览草图
30 s = 330 积分
720p
20 积分 / 秒
社交媒体
15 s = 300 积分
1080p
40 积分 / 秒
主打展示
30 s = 1,200 积分

所有套餐均包含积分;定价页面 列出了所有模型的当前费率。免费版下载带有 Popcraft 水印,付费套餐可移除。

阿里巴巴推荐的 Wan 3.0 场景

阿里巴巴官方发布资料中列出的三个场景,以及如何在 Popcraft 上实现它们。

  • 01

    短视频内容:剧情演绎与广告预热

    阿里巴巴的娱乐场景方案。通过一段提示词即可生成长达 30 秒的多镜头叙事内容,且自带音效。

  • 02

    电商:通过产品图生成展示视频

    阿里巴巴的电商场景 —— “上传一张产品图加上描述,获得动态展示视频”。将照片作为 Image 1 上传即可。

  • 03

    教育:模拟演练场景

    阿里巴巴的教育场景 —— 通过提示词模拟医生咨询或服务电话场景,并生成同步对话内容。

  • 04

    480p 预览,1080p 交付

    Popcraft 补充方案:480p 下每秒仅需 11 积分,在确认 1080p 渲染前,仅需 330 积分即可完成 30 秒的预览验证。

Wan 3.0 — 常见问题

Wan 3.0 是阿里巴巴通义实验室推出的全能视频模型,自 2026 年 8 月 6 日起公测。该模型涵盖了文生视频、图生视频、首末帧控制及多参考生成,支持单次生成 2 至 30 秒 30 fps 的视频,并能同步生成对话、背景音乐和音效。

单次生成最高可达 30 秒(任意整数秒) —— 无需扩充链,无需后期拼接。在 Popcraft 上,您可以通过滑块设定长度,生成的视频将与请求高度匹配。在实测中,所有片段的时长误差都在百分之几秒内,且按实际秒数计费。

默认会。阿里巴巴官方指南指出,该模型“原生输出对话、背景音乐和音效”,并允许在提示词中指定台词和声音。Popcraft 上的音频开关可将其关闭,关闭后生成的视频将不含音轨。

您可以上传多达 4 张图片、5 个视频和 5 条音频,并在提示词中按分类顺序引用它们(如 Image 1, Video 1, Audio 1)。图片用于设定角色、物体或场景;视频用于设定动作和镜头;音频用于设定音色或节奏。视频和音频的总长度上限均为 15 秒。若提示词中使用了“first frame”和“last frame”,两张图片将变为关键帧模式,此时无法混用其他参考素材。

这正是该模型的专长。阿里巴巴将保持角色外貌、服装、道具和环境的一致性作为核心能力。我们的测试表明,角色设计图在经过视频参考带来的镜头位移后仍能保持特征,正方形产品照也能在 16:9 构图中被忠实还原。Wan 3.0 倾向于遵循您提供的图像,对于偏离参考图的大胆创意,请在提示词中明确描述。

目前在 Popcraft 上暂不支持。Wan 3.0 使用附件视频作为动作、镜头和主体的参考;如需扩充或编辑现有素材,请使用 Seedance 2.5 或 Gemini Omni 1.1 Flash,它们均配有专门的“视频扩充”面板。

阿里巴巴定义的音频参考是提取音色和节奏,具体台词需写在提示词中,由模型同步生成语音和口型。它不是单纯的音频驱动工具。如果您需要由特定录音驱动的数字人片段,请使用 OmniHuman 等模型。

Wan 3.0 按交付秒数计费:480p 为 11 积分/秒,720p 为 20 积分/秒,1080p 为 40 积分/秒。480p 下的 30 秒草图需 330 积分,同等长度的 1080p 需 1,200 积分。生成前会显示最终价格。免费版下载带有 Popcraft 水印,付费套餐可移除。

30 秒,一次生成。建议先试用 480p。

只需 330 积分即可完成预览,验证叙事逻辑后再进行 1080p 渲染 —— 或者带上角色设计图和参考视频,让它们产生奇妙的化学反应。

继续探索

相关模型