MiniMax H3
自带音轨的视频生成
MiniMax H3 一次生成 2K 画面和同步立体声轨道——音效、环境氛围和对话口型完美结合。Popcraft 现已上线。
使用 H3 创作的影片
对话、标题、预告片、品牌和产品视频、时尚、游戏界面、海报设计、特效、微距以及真实的变形宽屏画面。滚动时自动播放;点击扬声器图标开启声音。
真正的人物对白
路边咖啡馆的一位创作者正对着镜头说话。台词、口型同步以及她身后的街道环境都来自同一次生成——这是该模型核心能力的体现。
眼镜系列广告
原生 9:16 社交媒体格式。镜面镜片、雕塑感的轮廓和干净的摄影棚扫屏——在每个剪辑切换中保持品牌身份一致。
MIDNIGHT LINE
犯罪片头:分割画面、硬色块,演员卡片随鼓点切换,并配有模型生成的悬疑爵士配乐。
可用的游戏菜单
角色选择、武器自定义、清晰可读的按钮状态。渲染清晰的 UI 是大多数视频模型的弱项,而这正是展示它的原因。
THE STARS WERE LISTENING
高对比度科幻预告。巨大圆环下的渺小身影,标题从黑暗中显现,配乐随之高涨。
POPUP! Series 001
海报和收藏品设计,保持平整清晰:标题字体、系列编号以及渲染精度足以直接打印的角色。
烈火与皮革
全对比度的时尚大片——背景是火焰,前方是漆皮皮革,模特在不同镜头间保持高度一致。
LEATHER IN MOTION
黄昏、汽车与质感研究。慢速移动、单一实用光源,以及在画面上设置的干净排版。
现实世界上的绘图
在实拍的有轨电车素材上,手绘发光线条动画随车厢行进而变换形状。
纤毫毕现的微距
冠毛壁虎的极限微距,舌头舔过眼睛。皮肤纹理、湿润反光和微小动作在 2K 分辨率下完美保持。
MINIMAX, 2.35:1
品牌短片,输出分辨率为 2944 by 1248——这是真正的变形宽屏,而非 16:9 裁剪。品牌水印沿扶手整齐排布。
生成它的提示词
需求、参考板以及最终生成的影片——包含配乐、剪辑和屏幕文字,均由一次生成完成。
一段 15 秒的 16:9 轻悬疑犯罪电影片头。视觉语言:复古日本动画片头、硬边缘剪影、漫画拼贴、不对称分割画面、强几何色块、英文演职员表、少量片假名、爵士犯罪感。氛围 60% 悬疑,40% 爵士——神秘、酷炫、都市感;非恐怖,非沉重,也不是欢快的爵士视频。
动作应呈现为动态图形拼贴:黑色背景上绘制线条框,分割界限弹出,色块和面板逐个粘贴;剪影、道具特写和演职员表随着鼓点滑动、弹出并遮罩显现。
英文演职员表必须整洁可读,并可带有动画:细框绘制,名字滑入,字母逐个出现,色块遮罩显现,然后停留。不要加入中文,不要有乱码,不要拼写错误。每个角色和职位只出现一次——不重复职位,不重复姓名,一人不兼二职。
转场方式:圆形黑胶遮罩、垂直车门擦除、长投影扫过画面、红线切割、巨大字母遮罩、分割画面重组、硬色块切场。全部配合节拍。不要软溶解,不要流体变形。
音乐:原创 15 秒片头配乐,60% 悬疑 40% 爵士——持续低音、紧张的拨弦、冷色调合成器脉冲、底鼓、稀疏的刷音、一段行走低音、低沉萨克斯乐句和短促的铜管刺奏。低频和踩镲前 2 秒铺垫,3 秒到底鼓,6 秒加入爵士低音,10 秒出现萨克斯/铜管短句,最后 2 秒以紧张的和弦配合鼓点定格。不要模仿任何现有旋律。






需求中指定的六个参考板——“参考这些图片的视觉语言”。
应用场景
一次生成即可获得同步声音和剪辑,彻底改变了工作流。
首版即完整的竖屏广告
9:16 的素材自带环境音、音效和对白,让利益相关者看到的第一版不再是无声的动剪接。
会动的产品展示
为产品静止图设定首尾帧,模型会填充其中的过渡——同一个罐子,同样的光影,并被开启。
贯穿全系列的一致面孔
参考图能跨镜头(包括一镜到底内的切换)锁定身份和服装,满足常驻出镜形象的需求。
写在提示词里的分镜图
镜头移动通过指定的句式描述,确保“推镜头”就是推镜头,而非模型随意生成的动作。
无需剪辑的短片
写在提示词里的剪辑点会直接生成为一个片段中的多个镜头,且环境音在切换中保持连续。
独特优势
三大特色——第一点尤为罕见。
音画同步生成
音效、环境音和对口型对白均在同一个文件中。我们进行了四次语音转录测试,脚本台词每次都能精准同步。
单次生成内的镜头切换
根据提示词放置三个镜头和两个硬切点,交付文件中没有任何非预期的拼接,且环境音贯穿始终。
5 至 15 秒,精确到秒
在参考模式下严格遵守时长。请求 11 秒就是 11 秒,不会被四舍五入到 15 秒。
H3 对比 Seedance 2.0
我们的实测:相同的提示词和参考图,模型是唯一的变量。这是一次提示词测试,而非基准测试。由于 H3 在使用参考图时会自主决定纵横比,该项随模型自适应。
| 指标 | MiniMax H3 | Seedance 2.0 |
|---|---|---|
| 交付画面 | 1440 × 2560 · 24 fps | 1248 × 1664 · 24 fps |
| 台词转录准确度 | 逐字对应且同步,4 / 4 | 含糊不清,不同步 |
| 请求时长 → 交付时长 | 8 s → 8.000 s | 8 s → 8.08 s |
| 构图指令执行 | 否——广口瓶在画面中变小了 | 是 |
| 水印清晰度 (逐帧) | 134 / 192 | 159 / 193 |
画质不相上下,声音表现明显更优,但在指令遵循方面稍逊。两个模型的提示词均未写对话,仅要求安静的环境音——这让我们发现,如果不加限制,H3 会自作主张编写台词。
提示词指南
分为三部分。说明每个附件的用途,写一段核心创意描述,然后逐镜头描述片段——每个镜头包含切换时间、构图、运镜、对话以及动作发出的声音。
大声说出你不需要什么
反向指令必须是独立的。如需静音,请将非叙事性音乐字段设为 N/A —— 写作 "non_diegetic_music": N/A。不填该字段并不等同于静音请求。
这不是可选的。我们曾尝试一个只要求安静环境音且不写对话的提示词,结果它生成了完整的口型同步对白,甚至还念出了没人写过的产品卖点。
声场有其专用字段
环境音和动作音效不放在镜头描述中,而应填入 overall_soundscape(全片 1-4 句)。角色听不到的配乐填入 non_diegetic_music。对话内容保留在镜头描述内。
使用引号,对齐对白与镜头
屏幕上出现的文字需放在引号内。对白时长必须适配所在镜头的秒数;如果你指明了对白跨越的镜头,它也可以跨剪辑点运行。
提示词范例
三个部分,采用模型读取的字段格式integrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says: <d>[English] Yours.</d> [Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over. overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away. non_diegetic_music: N/A
在 Popcraft 上使用
H3 位于视频模型列表中。遵循三个步骤,尤其是大家容易忽略的第三步。
选择 MiniMax H3
设定时长(5 到 15 秒之间的任意整数)以及画质等级。
添加参考图并说明用途
MiniMax 警告说,未加标签的附件是出错的主因。说明图像是首帧还是尾帧;两张图则用于框定镜头。
导演声音,包括静音
编写声场描述,并将不需要的内容作为明确指令。如果留白,H3 将自行编写并表演对白。
常见问题
视频自带音效、环境音和对话,因此音频环节从“从无到有”变成了“后期修剪”。但它不是最终混音,不同素材间的音量可能不一,发布前请务必进行响度处理。
是的,除非你明确禁止。这是关于 H3 最重要的一点。我们的一条提示词只要求安静的自然环境音、完全没有写任何对白;H3 却自行撰写、演绎并对准口型地输出了一整段口播,其中还包含没有任何人输入过的产品宣传语。不填声音字段不等于静音。请务必在每次生成时导演你的声场并写下反向指令。对于受监管行业,请将其视为审核步骤而非个人偏好。
768p 请求返回短边 768 像素;720p 亦然。1080p 请求会被提升至 2K——即短边 1440 像素,这是唯一一个不按请求返回的数值。低画质档位速度快约 40%,体积仅为三分之一,但会牺牲微小文字的清晰度。
仅在不添加参考图时可以。文生视频遵循指定比例。一旦添加参考图,比例必须设为 adaptive(自适应)——且这种自适应并非确定性的,它不会简单复制参考图比例。我们的一次任务中,3:4 的参考图就生成出了 9:16 的画面。请以最终交付的文件为准。
身份一致性很好,构图稳定性稍弱。参考图能很好地锁定角色和服装,包括在多镜头内部。但构图指令的执行力不如 Seedance 2.0,产品在画面中可能会漂移。建议在每个剪辑点重复说明镜头大小和角色名称。
它们是同一个模型的两个名字。MiniMax 将其发布为 MiniMax H3;部分平台标注为 Hailuo 3.0。在 Popcraft 选择器中显示为 Hailuo 3。本页统一使用 MiniMax H3。
H3 按生成秒数计费。当前定价请见定价页。值得注意的是:768p 档位的生成速度比 2K 快约 40%,体积也小得多,如果适合你的工作,这是一个不错的折中方案。
继续探索
相关模型
Seedance 2.5 单次任务最长可生成 30 秒视频,支持最多 50 个参考素材、可控视频编辑、高保真时序延展,宽高比支持 0.4 至 2.5,原生支持 10 种以上语言输入提示词。现已在 Popcraft 上线。
在 Popcraft 上使用 Seedance 2.0,从文本、图片或片段生成电影级 4K 视频。原生同步音频、多镜头序列,以及最高 4K (2160p) 的极致清晰细节。

Seedance 2.0 Mini 是字节跳动推出的轻量版视频生成模型,相比标准版 Seedance 2.0 成本最高降低 50%,生成速度约为快速模式的 2 倍,支持文本、图像、视频、音频提示词输入。现已在 Popcraft 上线。

在 Popcraft 使用 Seedance 2.0,将图像与提示词转换为电影级视频。支持参考图转视频、首尾帧锁定、多比例输出,最高可达 4K 分辨率。