NEW下一个爆款 UGC 广告,一键即达。快来体验 Studio立即制作广告
PopcraftPopcraft
新模型

MiniMax H3

自带音轨的视频生成

MiniMax H3 一次生成 2K 画面和同步立体声轨道——音效、环境氛围和对话口型完美结合。Popcraft 现已上线。

2K 24 fps立体声 音频生成5–15s 1s 步进6 种纵横比多镜头 一镜到底
人物对话
片头序列
品牌短片
游戏界面
预告片
手绘特效
产品宣传
微距摄影

使用 H3 创作的影片

对话、标题、预告片、品牌和产品视频、时尚、游戏界面、海报设计、特效、微距以及真实的变形宽屏画面。滚动时自动播放;点击扬声器图标开启声音。

对话

真正的人物对白

路边咖啡馆的一位创作者正对着镜头说话。台词、口型同步以及她身后的街道环境都来自同一次生成——这是该模型核心能力的体现。

时尚,竖屏

眼镜系列广告

原生 9:16 社交媒体格式。镜面镜片、雕塑感的轮廓和干净的摄影棚扫屏——在每个剪辑切换中保持品牌身份一致。

片头与包装

MIDNIGHT LINE

犯罪片头:分割画面、硬色块,演员卡片随鼓点切换,并配有模型生成的悬疑爵士配乐。

界面与游戏

可用的游戏菜单

角色选择、武器自定义、清晰可读的按钮状态。渲染清晰的 UI 是大多数视频模型的弱项,而这正是展示它的原因。

预告片

THE STARS WERE LISTENING

高对比度科幻预告。巨大圆环下的渺小身影,标题从黑暗中显现,配乐随之高涨。

平面设计

POPUP! Series 001

海报和收藏品设计,保持平整清晰:标题字体、系列编号以及渲染精度足以直接打印的角色。

品牌短片

烈火与皮革

全对比度的时尚大片——背景是火焰,前方是漆皮皮革,模特在不同镜头间保持高度一致。

产品视频

LEATHER IN MOTION

黄昏、汽车与质感研究。慢速移动、单一实用光源,以及在画面上设置的干净排版。

特效

现实世界上的绘图

在实拍的有轨电车素材上,手绘发光线条动画随车厢行进而变换形状。

微距

纤毫毕现的微距

冠毛壁虎的极限微距,舌头舔过眼睛。皮肤纹理、湿润反光和微小动作在 2K 分辨率下完美保持。

超宽屏

MINIMAX, 2.35:1

品牌短片,输出分辨率为 2944 by 1248——这是真正的变形宽屏,而非 16:9 裁剪。品牌水印沿扶手整齐排布。

生成它的提示词

需求、参考板以及最终生成的影片——包含配乐、剪辑和屏幕文字,均由一次生成完成。

提示词 — 滚动查看

一段 15 秒的 16:9 轻悬疑犯罪电影片头。视觉语言:复古日本动画片头、硬边缘剪影、漫画拼贴、不对称分割画面、强几何色块、英文演职员表、少量片假名、爵士犯罪感。氛围 60% 悬疑,40% 爵士——神秘、酷炫、都市感;非恐怖,非沉重,也不是欢快的爵士视频。

动作应呈现为动态图形拼贴:黑色背景上绘制线条框,分割界限弹出,色块和面板逐个粘贴;剪影、道具特写和演职员表随着鼓点滑动、弹出并遮罩显现。

英文演职员表必须整洁可读,并可带有动画:细框绘制,名字滑入,字母逐个出现,色块遮罩显现,然后停留。不要加入中文,不要有乱码,不要拼写错误。每个角色和职位只出现一次——不重复职位,不重复姓名,一人不兼二职。

转场方式:圆形黑胶遮罩、垂直车门擦除、长投影扫过画面、红线切割、巨大字母遮罩、分割画面重组、硬色块切场。全部配合节拍。不要软溶解,不要流体变形。

音乐:原创 15 秒片头配乐,60% 悬疑 40% 爵士——持续低音、紧张的拨弦、冷色调合成器脉冲、底鼓、稀疏的刷音、一段行走低音、低沉萨克斯乐句和短促的铜管刺奏。低频和踩镲前 2 秒铺垫,3 秒到底鼓,6 秒加入爵士低音,10 秒出现萨克斯/铜管短句,最后 2 秒以紧张的和弦配合鼓点定格。不要模仿任何现有旋律。

参考图
Style reference board 1 for the MIDNIGHT LINE title sequenceStyle reference board 2 for the MIDNIGHT LINE title sequenceStyle reference board 3 for the MIDNIGHT LINE title sequenceStyle reference board 4 for the MIDNIGHT LINE title sequenceStyle reference board 5 for the MIDNIGHT LINE title sequenceStyle reference board 6 for the MIDNIGHT LINE title sequence

需求中指定的六个参考板——“参考这些图片的视觉语言”。

输出结果

单次生成。演员名单、分割画面、黑胶遮罩转换和悬疑爵士乐全都一气呵成——后期没有进行任何配乐、加字或剪辑。

应用场景

一次生成即可获得同步声音和剪辑,彻底改变了工作流。

市场营销

首版即完整的竖屏广告

9:16 的素材自带环境音、音效和对白,让利益相关者看到的第一版不再是无声的动剪接。

电子商务

会动的产品展示

为产品静止图设定首尾帧,模型会填充其中的过渡——同一个罐子,同样的光影,并被开启。

创作者

贯穿全系列的一致面孔

参考图能跨镜头(包括一镜到底内的切换)锁定身份和服装,满足常驻出镜形象的需求。

电影与预制片

写在提示词里的分镜图

镜头移动通过指定的句式描述,确保“推镜头”就是推镜头,而非模型随意生成的动作。

社交媒体

无需剪辑的短片

写在提示词里的剪辑点会直接生成为一个片段中的多个镜头,且环境音在切换中保持连续。

独特优势

三大特色——第一点尤为罕见。

罕见特性

音画同步生成

音效、环境音和对口型对白均在同一个文件中。我们进行了四次语音转录测试,脚本台词每次都能精准同步。

实用特性

单次生成内的镜头切换

根据提示词放置三个镜头和两个硬切点,交付文件中没有任何非预期的拼接,且环境音贯穿始终。

便捷特性

5 至 15 秒,精确到秒

在参考模式下严格遵守时长。请求 11 秒就是 11 秒,不会被四舍五入到 15 秒。

H3 对比 Seedance 2.0

我们的实测:相同的提示词和参考图,模型是唯一的变量。这是一次提示词测试,而非基准测试。由于 H3 在使用参考图时会自主决定纵横比,该项随模型自适应。

指标MiniMax H3Seedance 2.0
交付画面1440 × 2560 · 24 fps1248 × 1664 · 24 fps
台词转录准确度逐字对应且同步,4 / 4含糊不清,不同步
请求时长 → 交付时长8 s → 8.000 s8 s → 8.08 s
构图指令执行否——广口瓶在画面中变小了
水印清晰度 (逐帧)134 / 192159 / 193

画质不相上下,声音表现明显更优,但在指令遵循方面稍逊。两个模型的提示词均未写对话,仅要求安静的环境音——这让我们发现,如果不加限制,H3 会自作主张编写台词。

提示词指南

分为三部分。说明每个附件的用途,写一段核心创意描述,然后逐镜头描述片段——每个镜头包含切换时间、构图、运镜、对话以及动作发出的声音。

最重要的规则

大声说出你不需要什么

反向指令必须是独立的。如需静音,请将非叙事性音乐字段设为 N/A —— 写作 "non_diegetic_music": N/A。不填该字段并不等同于静音请求。

这不是可选的。我们曾尝试一个只要求安静环境音且不写对话的提示词,结果它生成了完整的口型同步对白,甚至还念出了没人写过的产品卖点。

声音

声场有其专用字段

环境音和动作音效不放在镜头描述中,而应填入 overall_soundscape(全片 1-4 句)。角色听不到的配乐填入 non_diegetic_music。对话内容保留在镜头描述内。

技巧

使用引号,对齐对白与镜头

屏幕上出现的文字需放在引号内。对白时长必须适配所在镜头的秒数;如果你指明了对白跨越的镜头,它也可以跨剪辑点运行。

提示词范例

三个部分,采用模型读取的字段格式
integrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says:
<d>[English] Yours.</d>
[Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over.

overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away.

non_diegetic_music: N/A

在 Popcraft 上使用

H3 位于视频模型列表中。遵循三个步骤,尤其是大家容易忽略的第三步。

01

选择 MiniMax H3

设定时长(5 到 15 秒之间的任意整数)以及画质等级。

02

添加参考图并说明用途

MiniMax 警告说,未加标签的附件是出错的主因。说明图像是首帧还是尾帧;两张图则用于框定镜头。

03

导演声音,包括静音

编写声场描述,并将不需要的内容作为明确指令。如果留白,H3 将自行编写并表演对白。

常见问题

视频自带音效、环境音和对话,因此音频环节从“从无到有”变成了“后期修剪”。但它不是最终混音,不同素材间的音量可能不一,发布前请务必进行响度处理。

是的,除非你明确禁止。这是关于 H3 最重要的一点。我们的一条提示词只要求安静的自然环境音、完全没有写任何对白;H3 却自行撰写、演绎并对准口型地输出了一整段口播,其中还包含没有任何人输入过的产品宣传语。不填声音字段不等于静音。请务必在每次生成时导演你的声场并写下反向指令。对于受监管行业,请将其视为审核步骤而非个人偏好。

768p 请求返回短边 768 像素;720p 亦然。1080p 请求会被提升至 2K——即短边 1440 像素,这是唯一一个不按请求返回的数值。低画质档位速度快约 40%,体积仅为三分之一,但会牺牲微小文字的清晰度。

仅在不添加参考图时可以。文生视频遵循指定比例。一旦添加参考图,比例必须设为 adaptive(自适应)——且这种自适应并非确定性的,它不会简单复制参考图比例。我们的一次任务中,3:4 的参考图就生成出了 9:16 的画面。请以最终交付的文件为准。

身份一致性很好,构图稳定性稍弱。参考图能很好地锁定角色和服装,包括在多镜头内部。但构图指令的执行力不如 Seedance 2.0,产品在画面中可能会漂移。建议在每个剪辑点重复说明镜头大小和角色名称。

它们是同一个模型的两个名字。MiniMax 将其发布为 MiniMax H3;部分平台标注为 Hailuo 3.0。在 Popcraft 选择器中显示为 Hailuo 3。本页统一使用 MiniMax H3。

H3 按生成秒数计费。当前定价请见定价页。值得注意的是:768p 档位的生成速度比 2K 快约 40%,体积也小得多,如果适合你的工作,这是一个不错的折中方案。

生成自带音效的影片

H3 已在 Popcraft 上线,与其它顶级视频模型并列。

继续探索

相关模型