NEW下一个爆款 UGC 广告,一键即达。快来体验 Studio立即制作广告
PopcraftPopcraft
实测 Gemini Omni 1.1 Flash 一整天:40秒成片与成本明细
产品2 分钟阅读

实测 Gemini Omni 1.1 Flash 一整天:40秒成片与成本明细

给不想往下读的人的简版结论。 Gemini Omni 1.1 Flash 是 Google 的一体化视频模型:输入文字、图片或一段片段,输出带原生声音的视频。1.1 版(2026 年 8 月 27 日)补上了两件真正影响实际工作的能力:场景延展到 40 秒,以及 1080p/4K 输出。它现在已经在 Popcraft 上线。我们实测体验了一整天,得到的最有价值的结论是:对一段 5 秒的片段要求“延展到总时长 20 秒”,最终会得到 25 秒的视频。

Google 标称实测结果
最长视频时长支持最长 40 秒场景延展,每次步进 10 秒单条提示词生成完整 40.0 秒视频,实际耗时 23 分钟
场景延展“最多可分析 10 秒前置上下文”5 秒源素材 → 生成 25.0 秒完整视频,原片段帧级完整保留
输出分辨率支持 360p 至 4K,“适用于专业制作”预告片输出 1080p,测试样片输出 720p;4K 分辨率下最长仅能生成 30 秒
音频生成同步生成语音、音乐、音效预告片配完整管弦乐配乐,延展片段附带暴风雨环境音
物理模拟“对重力、动能、流体动力学等物理规律有直观理解”生成 30 秒三种流体水中扩散演示,物理表现符合预期,见下文
镜头运动合作方评价:“支持动态镜头运动”无人机推进、环绕镜头表现稳定;甩镜、摇臂升起、滑动变焦会被柔化处理

周三 10:41,服务已上线。

Batch AI 在前一日夜间已在测试网关上切换了该模型。首先说明来自对方的两项既定规则,这将直接决定你可以如何使用该模型:分辨率标识为“4K”,实际返回分辨率为 3840×2160;场景延展是协议层面的正式模式,并非提示词取巧手段。以下所有内容均为我方实际测试得到的结果。

第一个测试任务我们故意选了平淡的内容:螺旋楼梯上的守塔人,垂直画幅,5 秒时长,720p 分辨率。约 2 分钟后生成结果返回,成片时长 5.01 秒,还额外附带了没人要求的风雨背景音。这就是 Omni 的默认行为:Google 开发者文档注明该模型“会自动为视频匹配合适的音轨”,除非明确禁用,否则每次生成都默认执行。

在 Popcraft 上通过单条提示词由 Gemini Omni 1.1 Flash 生成的 40 秒预告片

11:20,延展出来的片段比我们要求的长了 5 秒

这才是本篇文章真正有价值的核心内容。我们上传了一段5秒的片段,输入了一行描述:“看守人走到灯廊上,点亮了灯”,然后要求生成总时长为20秒的视频。

最终返回的视频文件时长为 25.0 秒。

这不是 bug。Google 官方发布说明标注,场景延展“以 10 秒为单位递增,累计最长支持 40 秒”,即必须按完整单位叠加:原 5 秒 + 10 秒 + 10 秒。新文件的前 5 秒与原素材完全一致,风雨音效也无缝衔接,成片效果非常出色——只是它不是我们要求的 20 秒。

因此给所有基于该模型开发的开发者一条规则,这也是 Popcraft 视频延展面板现在针对 5 秒源素材提供 15、25、35 秒选项,而非规整的 10/20/30/40 秒的原因:你只能落在“源素材 + 若干个完整段落”上。 我们按实际生成返回的视频秒数计费,而非你输入的目标时长。

“视频延展以 10 秒为单位递增,累计最长支持 40 秒。”—— Google,Omni 1.1 Flash 发布公告

12:05 四十秒,一条提示词

接下来是我们真正想要的效果:一支好莱坞风格预告片《蔓越莓海盗》,16:9 画幅、1080p 分辨率、时长 40 秒,仅提交一次请求即可生成。Popcraft 会为你自动串联场景延展流程:输入一条提示词,即可直接输出完整的 40 秒视频文件。

本次生成耗时 23 分钟,超出了我们预估的 15 分钟,这部分是我们参数调校的问题。最终成片刚好 40.0 秒,分辨率 1920×1080,配乐在对应节点自然递进。四段生成内容的船长、船只、青橙色调完全统一。这种连贯性正是官方提到的 10 秒上下文窗口的实际效果,也是该模型最核心的优势。

Omni 40秒生成样片:海面上散落蔓越莓,三艘船只航行其中

这里说一下模型出错的地方,其实问题出在我们这边。当时的提示词是一段 240 词的密集描述,包含 5 个情节节点:暴风雨、船长、装满蔓越莓的宝箱、敌船、火炮收尾。Omni 保留了全部元素,但打乱了出现顺序:蔓越莓喷洒的画面在第 8 秒就出现了,早于本该打开的宝箱,而且宝箱全程也没有清晰的开启镜头。对于该模型来说,冗长的提示词不会直接失败,而是会被压缩重排。

15:10,好吧,那我们就来认真测试一下其宣称的物理效果

用预告片做物理效果测试并不可靠:画面元素过多,没人能准确判断蔓越莓弹跳的物理表现是否符合常理。因此我们编写了当天最朴素的提示词:黑色水槽中盛有静止的水。每10秒段落仅呈现一种流体效果:橙色液滴滴落、靛蓝色墨水晕开、逆光下的白色颜料雾团。无人物、无剧情,镜头缓慢环绕一周,1080p 分辨率时长30秒,仅单一请求。

这是当天该模型生成的最出色的内容。水滴落下时形成标准的皇冠形水花,回落轨迹完全符合真实水体运动规律;靛蓝色墨羽随后从后方涌来,穿过先前那滴橙色染料交融,两种颜色都没有糊成一片;白色颜料雾团出现时背光均匀穿透,先前的两种流体仍在下方,仍在运动。全程镜头弧线连贯没有重置,10 秒、20 秒的拼接处完全无法察觉断点。

我们建议优先使用低成本草稿流程测试:先生成 4 组 10 秒 720p 的测试样片(墨水、蜂蜜、多米诺骨牌、牛顿摆),每个耗时约 2 分钟。墨水与牛顿摆效果优秀,蜂蜜动态稍显夸张,多米诺骨牌顺序正确但缺少物理重量感。最终选定墨水主题生成 30 秒版本,成片质量反而优于草稿样片。但预告片并非如此,在预告片中,更长的时长意味着对故事进行更多的压缩。在没有故事需要压缩的情况下,延展时长只会带来纯正向的效果提升。

从本次实测结果来看,Google 关于流体动力学的那句话并非营销话术。

16:40,以及宣称的镜头表现

Vertex 提示词指南中列出了模型预置支持的运镜术语:drone、dolly、pan、tilt、tracking、crane、orbit、whip pan,以及一个被标注为进阶、并非官方支持的 dolly zoom。

因此我们在同一段30秒镜头中请求了上述所有运镜效果,取景沿用上午测试过的同一座灯塔,提示词中每节拍指定一种运镜。

对照提示词,逐段对运镜完成度进行评分:

  • 无人机推进镜头:符合预期。镜头贴浪尖滑行、爬升越过玄武岩岸,精准在指定时间抵达灯室位置,是全天测试中表现最出色的 10 秒镜头。
  • 环绕镜头:符合预期。最后 10 秒从守塔人身后开始环绕,经过侧面,最终拉远至对侧全景,全程灯塔形态保持一致无崩坏。
  • 甩镜切向船只:不符合预期。船只确实出现在海平面远处,但镜头是缓慢漂移过去,而非干脆利落地甩过去,模型把快速运动柔化处理成了慢移。
  • 越过灯室的摇臂升起:部分符合预期。摇臂升起出现在前半段(提示词并未要求此处升起),而提示词指定的后半段反倒没有执行。
  • 低角度推进 + 移焦:不符合预期。最终输出为全景镜头,未执行指定运镜。
  • 滑动变焦:我们在 30 秒测试中主动排除了该运镜。在更早的 10 秒测试中,模型将滑动变焦输出为普通推进镜头,且 Google 官方文档也标注该功能“暂未正式支持”,因此该结果属于合理范围。

两处意料之外的表现。在两段镜头衔接处,镜头直接穿过灯室玻璃找到里面的守塔人,随后跟随她开门走到外廊。我们用场景检测工具验证过,整段文件没有任何剪辑断点——模型自行生成了一个过渡,从无人机的位置切换到她的位置,这一点完成得非常出色。不足的地方是:灯室里她的头发是盘起的,几秒后走到外廊时却变成了披散状态。Google 官方模型说明中已经标注“跨编辑一致性”“复杂运动”是已知缺陷,这段演示就是该问题的实际体现。

结合10秒与30秒测试的规律来看:平缓舒展的运镜(无人机、环绕、弧线、推拉)表现稳定;而快切、光学特效类运镜(甩镜、滑动变焦)会被模型柔化处理。如果需要干脆利落的快镜头,建议单独生成短片段后手动剪辑拼接。

提示词使用经验与预告片测试的结论一致:明确指定运镜名称,每节拍仅一种,使用 Google 官方指南中的标准术语,慢节奏运镜就可以准确生成。如果只描述主观感受(例如“宏大”“有动感”),最终无论怎么写都只会得到缓慢推进的镜头。

相比 Omni Flash 1.0 实际更新了什么?

Google官方页面对两个版本使用了完全相同的能力说明表,因此实际差异反而非常直白:

功能项Omni Flash(2026年5月)Omni 1.1 Flash(2026年8月)
文生视频支持支持
图生视频不支持支持
参考素材(图/视频)不支持最多10张图片、3段视频
首尾帧插帧不支持支持
视频编辑支持支持
场景延展不支持支持,最长可延展至40秒
输出分辨率仅720p360p / 720p / 1080p / 4K
音频生成语音、音乐、音效语音、音乐、音效
内容溯源SynthID、C2PASynthID、C2PA

初代“Gemini Omni 发布公告”中宣称的物理与常识理解能力(“对重力、动能、流体动力学等物理规律的直观感知优化”)在新版本中得到了保留,我们也专门针对这一点做了验证,测试结果见下文。而 Google 本次重点宣传的是记忆能力:“每一条指令都建立在上一条的基础之上。角色保持一致、物理逻辑连贯、场景状态可被记忆”。做完那支 40 秒预告片之后,我们对这句话后半部分的认可程度超出了自己的预期。

无需切换模式,如何下达不同类型的指令?

并没有单独的切换开关,这点需要一点时间适应。Google 官方指南说明:“建议优先通过提示词控制效果,仅在提示词无法达成目标时再使用任务参数。”你上传的素材与输入的描述文本,就是控制行为的开关。

  • 未附加任何素材:执行文生视频。
  • 附加1张图片:该图片将作为视频起始帧。
  • 附加2张图片,同时在提示词中注明“首帧”“尾帧”:在两张图片之间做插值过渡。未注明关键词时,两张图片将作为主体参考素材。
  • 附加最多10张图片:作为主体参考,画面中的人物、物品将保持一致性。
  • 附加视频 + 提示词“让这里下雪”:执行编辑,保留原镜头、时长与构图。
  • 附加视频 + 提示词“延展这段视频”:执行场景延展。

最后有两个容易踩坑的细节。如果你上传了视频片段并描述后续内容,但没有使用“延展”关键词,模型会将请求识别为编辑操作,最终返回与原素材时长一致的视频。在 Popcraft 的“延展视频”面板中系统会自动添加该关键词;若通过 API 或 MCP 调用,则需要你手动添加。

给首次生成40秒视频用户的实用提醒

这不是通用技巧清单,而是按踩坑优先级排列的3个最容易遇到的问题。

每段落仅指定一个动作。 Google 指南中记载了时间码语法,该语法与10秒分段的逻辑完美适配。这才是我们本该发出的那条预告片提示词:

黄昏暴雨中的海盗盖伦帆船,骷髅旗,破损黑帆。单镜头连续拍摄,无场景切换。 [0-10秒] 船只破浪前行,镜头抬升落到甲板。 [10-20秒] 留胡子的船长把着舵轮发令,船员齐声呼应。 [20-30秒] 他在船头打开铁箱,里面满是红色蔓越莓。 [30-40秒] 敌船开火,他举起弯刀时蔓越莓在慢镜头中四散飞溅。 画面要求:变形宽银幕光晕、青橙色调、管弦乐配乐、无屏幕文字。

明确说出你需要的内容,包括“什么都不要”。 留白本身也是一种有效请求。官方指南中给出的否定式示例包括“无对白”“无音乐,仅风声与水声”,这类写法可以正常生效。注意:不在提示词中提及音效,不等于要求关闭音效。

编辑时提示词尽量精简,不要过度描述。 Google 官方原话:“视频编辑场景下简洁提示词效果最佳,过于细致的描述可能导致非预期改动。” 只需说明需要修改的内容,加上“其余保持不变”即可,不要额外输入多余文字。

与 Seedance 2.5、Veo 3.1 的定位对比

我们同时接入多款视频模型,因为没有任何一款能适配所有场景。Omni 的优势是:单次请求即可生成最长40秒、最高4K分辨率且自带音频的完整长片段。Seedance 2.5 支持更多参考素材(30张图、10段视频),可实现区域精确编辑。Veo 3.1 适合8秒以内需要精确帧控制的场景。需求是单条完整成片带配乐:优先用 Omni。需求是产品出镜,要求12个镜头里外观完全一致:优先用 Seedance。

Popcraft 平台按实际生成的视频秒数与分辨率计费:720p 用于草稿预览,1080p 用于交付成品,4K 用于重点镜头且最长仅支持30秒。你只需在滑块上选择3-40秒范围内的时长即可,平台会在后台自动完成分段拼接;滑块仅提供模型可稳定支持的时长选项,生成前显示的费用即为最终实际扣费金额。

亲自上手测试

Gemini Omni 1.1 Flash 现已接入 视频生成器、Canvas 画板以及 MCP 连接器。你可免费上手体验,初始赠送 100 积分,无需绑定信用卡。建议按照我们的实测流程操作:先生成 720p 分辨率的 10 秒片段预览效果,确认满意后再进行延展;也可以上传你已有的满意片段,在此基础上延展。本次测试的预告片及延展样片已完整上传至 模型介绍页,均为未编辑原片,包含完整音频;你刚才看到的就是两段 30 秒测试样片。

参考资料:Google《Gemini Omni 发布公告》《Gemini Omni 1.1 Flash 更强可控性正式上线》公告、Google DeepMind 发布的 Gemini Omni Flash 官方模型说明、Gemini 企业代理平台中 Omni Flash 与 Omni 1.1 Flash 的产品页、Gemini API 开发者文档。所有实测数据为本站2026年9月3日实际测试所得。

常见问题

什么是 Gemini Omni 1.1 Flash?
这是 Google 推出的视频生成模型,DeepMind 称该模型是迈向“可基于任意输入创作、编辑任何内容”的重要一步,首发以视频能力为核心。单一模型即可覆盖文生视频、图生视频、首尾帧插帧、主体参考、视频编辑、场景延展功能,同时可同步生成语音、配乐与音效。1.1 版本于 2026 年 8 月 27 日正式上线。
Gemini Omni 生成的视频最长支持多少时长?
单次生成长度上限为10秒。场景延展会以10秒为单位逐段拼接,最长累计可达40秒,每次拼接时模型会读取前10秒内容保证连贯性。在 Popcraft 平台你只需通过滑块选择3-40秒之间的任意时长,平台会自动根据你的单条提示词完成分段拼接流程。4K分辨率下最长仅支持生成30秒。
Omni 1.1 相比 Omni Flash 1.0 新增了哪些功能?
本次新增场景延展、首尾帧插帧、1080p/4K 输出、参考视频支持功能。Google 官方模型页标注:1.0 版本仅支持 720p 输出,不支持图生视频、参考素材、关键帧与场景延展;1.1 版本已完整支持上述全部功能。
如何在 Popcraft 上试用 Gemini Omni 1.1 Flash?
打开视频生成器,选择 Gemini Omni 1.1 Flash 模型,设定时长与分辨率,可按需添加参考素材或源视频,点击生成即可。新用户可免费获得 100 积分,无需绑定信用卡;该模型同时已接入 Canvas 画板,也可通过 Popcraft MCP 连接器调用。

想要亲自体验吗?立即开始使用 Popcraft。

试用 Gemini Omni 1.1 Flash