谷歌 · Gemini Omni 1.1 Flash
基于任意输入创作并编辑视频
谷歌 Omni Flash 是集视频生成、编辑与延展功能于一体的单一模型:支持输入文本、图片或视频片段,输出将自动搭配原生语音、音乐与音效。1.1 版本新增场景延展功能,最长支持40 秒,新增首尾帧控制,以及1080p 与 4K 分辨率输出。
现已在视频工作室、Canvas 以及 MCP 连接器中可用
- 3s
- 10s
- 20s
- 30s
- 40s
描述场景、镜头、光影与氛围,系统将自动生成适配音频。
图片作为参考基准与起始画面,提示词用于指定画面动态变化。
该模型可从首帧动画过渡至末帧,支持视角旋转、缩放及无缝循环。
照片内的人物与物体在整段视频中保持一致。
编辑时将保留您未指定修改的全部内容;延长操作每次追加 10 秒时长。
Google 为 Omni 内置的核心特性
以下是模型说明文档与发布公告中重点提及的三项特性,以及它们对于长视频生成的实际意义。下述所有特性说明均来自谷歌官方;页面下方的演示渲染样例为本平台实测产出。
跨片段 10 秒上下文记忆
Omni 1.1 在延展场景时会分析最多前 10 秒的上下文内容,而早期模型仅会参考最后 1 秒的画面。这也是 40 秒分段生成的长视频能够全程保持船长、船只与画面风格一致的原因。
物理规则与世界常识
谷歌表示该模型具备对重力、动能与流体动力学的直观理解,同时结合 Gemini 内置的历史、科学与文化知识库:水流会呈现真实的喷溅效果,帆船也会符合物理规律倾斜航行。
每段视频均搭载 SynthID 与 C2PA 溯源标识
所有生成的视频均内置谷歌隐形SynthID 数字水印,并支持内容凭证标准(C2PA),生成的成品视频可直接发布并可溯源归属,这一特性已成为越来越多平台的强制要求。
资料来源:Google《Gemini Omni 发布介绍》、《Gemini Omni 1.1 Flash 为开发提供更强可控性》博文、DeepMind 模型说明文档,以及 Gemini 企业智能体平台模型页面。
两段由模型原生生成的演示示例
这两段视频均在 Popcraft 生成,为原始输出效果 —— 未经过编辑,也未添加配乐。左侧预告片为单次 40 秒、1080p 分辨率生成请求。右侧为 5 秒原片段,以及将该片段场景延展至 25 秒后的效果。
支持最长40秒任意时长,Popcraft为您自动完成续接。
谷歌发布公告中将该功能称为场景延展:视频“以 10 秒为单位逐步延长,累计最长可达 40 秒”。在 Popcraft 平台您无需手动分段操作:只需通过滑块一次性选择 3 至 40 秒任意时长,Popcraft 将基于您的单条提示词自动完成链式延展流程,最终输出完整统一的视频文件、连贯叙事与完整音轨。下方为该预告片生成过程中 6 个节点的预览效果。
1s
8s
15s
22s
29s
36s任意时长,自动连贯
您只需选择 3 至 40 秒的目标时长,Popcraft 将在后台自动运行 Google 场景延展链路 —— 无需规划分段,也无需手动拼接片段,仅按实际输出的视频秒数付费。
生成分辨率
谷歌官方描述:“输出画质精致清晰,支持1080P与4K分辨率,可直接用于专业制作”。在Popcraft中,4K分辨率下续接最长可达30秒。
首尾帧
1.1 版本新增功能:指定镜头的起始帧与结束帧后,Omni 会自动生成两帧之间的连贯视频,支持复杂环绕运镜、缩放转场、无缝循环等效果。
人声、音乐、音效
根据模型文档说明,音频将随画面同步生成。您可在提示词中指定音频需求,例如:收音机播放声、无人声、仅环境音,模型将按要求执行。
上传您的图片或视频
同一模型可读取参考素材、执行编辑与延展操作。Google 官方建议通过提示词明确需求:说明需要保留的内容、需要修改的内容,需要延展时直接注明“延展”即可。
主体参考
上传人物、商品或地点的参考照片,再描述所需场景。模型会在整个视频中保持角色与物品的一致性,即使是多段拼接的长视频也不会出现偏差。
无需训练步骤,无需角色文件。使用同一主体不同角度的两张参考照片,效果优于单张。
参考照片中的女性在黄金时刻的海滩上朝向镜头行走,发丝随风飘动,身后是海浪。
视频编辑
上传片段并说明需要修改的内容。Google 官方建议:“简单的提示词最适合视频编辑”—— 模型会自动保留您未提及的所有元素。
输出将保留原素材的时长与画幅规格,并按此时长计费。
生成大雪效果,其余内容保持不变。
场景延长
上传已有视频并设置目标总时长。原视频会逐帧完整保留,新增内容将以 10 秒为单位接续生成并延续原有音频,模型会读取原视频最多前 10 秒内容以保证连贯性。
如需续接视频,请在提示词中加入“续接”关键词;若您遗漏该词,Popcraft会在视频续接面板自动补加。未添加该关键词时,模型会将请求识别为视频编辑操作。续接仅支持在视频末尾追加内容。
延长这段视频:完整延续船只靠岸、船员向岸上抛缆绳的原场景,所有细节保持一致。
Omni 对比 Seedance 2.5 与 Veo 3.1
以下三款模型均支持同步生成画面与音频。Omni 的优势为单模型即可支持最长 40 秒场景延展与 4K 输出;Seedance 的优势在于参考数量与区域精确编辑;Veo 的优势在于 8 秒帧控制。请根据实际需求选择。
| 功能特性 | Gemini Omni 1.1 Flash | Seedance 2.5 | Veo 3.1 |
|---|---|---|---|
| 单次请求最长生成时长 | 通过场景延长可达 40 秒(4K 分辨率下为 30 秒) | 30 秒 | 8 秒 |
| 最高支持分辨率 | 4K (3840×2160),最低可输出 360p 草稿规格 | 1080p | 1080p |
| 原生同步音频 | 人声、音乐、音效 | 支持 | 支持 |
| 参考图片 | 最多 10 个 | 最多 30 个(+10 视频,+10 音频) | 最多 3 个 |
| 参考视频 | 最多 3 个 | 最多 10 个 | 1(扩展时长) |
| 视频剪辑 | 对话式交互;保留未提及内容 | 可控编辑,区域精准 | — |
| 视频时长扩展 | 每次延长10秒,最长40秒,保留10秒上下文 | 可向前/向后扩展,最长30秒 | 每步延长7秒 |
| 内容溯源 | SynthID + C2PA 内容凭证 | — | SynthID |
Omni 官方参数来自 Google 模型说明页与发布公告;Popcraft 展示的限制为当前选择器实际开放的可用范围。服务商上限可能发生变动,选择器将始终显示当前可使用的配置。
适合单次完整指令即可高效完成的场景
以往需要拆分多段素材再拼接的工作
落地页首屏宣传视频
单文件生成,支持 3 至 40 秒任意时长(4K 分辨率下最长 30 秒),并自带独立配乐。例如将滑块设为 24 秒,Popcraft 将自动为您完成多段续接。
预告片与预热短片
单次连贯渲染即可完成铺垫、转折、高潮完整叙事,同步搭配递进配乐
固定出镜角色的广告短片
仅需少量产品或出镜人照片,即可在所有镜头中保持形象一致
重制拍摄素材
可修改实拍素材的天气、着装或时段,时长与镜头保持不变。
创意可视化拆解
谷歌发布公告中特别指出这一点:“仅需简短提示词即可生成清晰易懂的讲解内容”,配合可视化内容拆解复杂概念。
链式提示词编写
谷歌官方指南建议提示词应包含场景描述、镜头运动、光线与氛围,同时支持使用时间码语法标记事件。本页面上方的预告片实测显示:模型会执行请求的内容,但也会重新调整内容顺序——原因是单分段内请求的内容过多。
每10秒一个动作,标注时间码
将剧情节点按时间序列编写 —— Google 官方文档标注了 [0-3s] … [3-6s] … 这种语法格式。每 10 秒分段仅安排一项明确的动作;模型会根据提示词规划分段,因此请直接给出完整时序方案。
将画面风格(调色、镜头、氛围)放在末尾单独一行,不要在开头写大段描述。如需单镜头不间断拍摄,请注明:“单镜头连续拍摄,无场景切换”。
黄昏暴风雨中的海盗盖伦帆船,骷髅旗,破损的黑色船帆。单镜头连续拍摄,无场景切换。\n[0-10秒] 船只破浪前行,镜头抬升至甲板。\n[10-20秒] 留胡子的船长掌舵发令,船员齐声呼应。\n[20-30秒] 他在船头打开铁箱,箱内满是红色蔓越莓。\n[30-40秒] 敌船开火,他拔出弯刀时蔓越莓慢镜头散落。\n画面风格:变形镜头光晕、蓝琥珀色调、管弦乐配乐、无屏幕文字。
堆砌式预告片文案
上方预告片实际提交的提示词为:在一整段未分段的文本中写入了 5 个情节节点、宝箱揭晓、敌船出现与结局。模型保留了船只、船长与整体风格,但打乱了情节的出现顺序。
蔓越莓喷射动画在第8秒时加载完成,但宝箱始终没有清晰打开。冗长的提示词不会导致生成失败,只会被模型压缩处理。
好莱坞大片风格预告片《蔓越莓海盗》。史诗真人电影质感:变形镜头光晕、深邃蓝琥珀调色、体积感海雾、35mm胶片颗粒…… [五个情节节点,单段落,240字]
- 输入“延长”
- “续接”关键词是触发视频延长的开关。在视频续接面板操作时,Popcraft会自动补加该关键词;通过API or MCP调用时请自行添加。续接仅支持在视频末尾追加内容,暂不支持在开头插入。
- 画面帧也需要文字描述
- 上传两张图片时默认仅作为主体参考,如需生成转场动画,请明确标注“首帧”与“末帧”并描述过渡效果。
- 指定音效
- 谷歌官方说明:“默认情况下模型将尝试生成适配的音轨”。您可使用简单否定词控制音频,例如“无人声”“无额外音效”;也可直接描述所需音频,如:收音机播放声、帆布上的雨声、弦乐渐强。
- 编辑指令保持简洁
- 谷歌官方指南再次强调:“描述过于详细的提示词可能会引发非预期改动”。只需指明需要修改的内容,追加“其余部分保持不变”即可,无需额外描述。
计费说明
Omni 按实际输出秒数及分辨率计费。由于 Popcraft 仅提供模型可精准生成的时长选项,生成前显示的价格即为最终支付价格。
草稿与社交场景。10秒片段消耗150积分,完整40秒消耗600积分。
交付品质。上方演示的 40 秒预告片消耗920 积分:单次请求,已包含音频生成费用。
原生3840×2160分辨率,适用于主视觉展示。最长支持30秒,完整30秒4K连贯视频消耗1350积分。
常见问题
这是谷歌推出的视频生成模型,DeepMind 将其描述为“我们迈向通用生成模型的下一步:可基于任意输入创作、编辑任何内容,首先从视频能力起步”。该单一模型支持文生视频、图生视频、首尾帧插帧、主体参考、视频编辑、场景延展功能,生成视频时会同步配套语音、音乐与音效。2026年8月27日发布的1.1版本新增了场景延展、关键帧控制以及1080p/4K输出支持。
单次生成最长为10秒;视频续接将以10秒为单位递增,累计最长可达40秒。在Popcraft中,您仅需通过滑块选择3至40秒之间的任意时长,平台将根据您的提示词自动完成续接流程;滑块仅提供模型可支持的时长选项,费用将按实际生成时长结算。4K分辨率下最长可生成30秒;首尾帧插值视频为单次生成,时长范围为3至10秒。
默认会生成音频。根据谷歌官方说明,模型“将尝试生成适配的音轨”,支持生成人声、背景音乐与音效。您可在提示词中指定音频需求,如需静音可添加“无人声”“无音乐”等描述。生成完成后,您也可以在Popcraft时间轴中替换或叠加音频。
上传原视频后选择目标总时长即可。原视频画面将完整保留,系统会以10秒为单位在末尾追加续接内容,同时会读取原视频最多10秒的内容保证画面连贯性。例如5秒的原视频仅可续接为15、25或35秒,无法生成20秒版本。Popcraft仅提供模型可支持的时长选项,并按实际生成时长计费。续接仅支持在视频末尾追加内容。
可以。请上传源文件并描述需要修改的内容。谷歌建议使用简洁的编辑提示词,并补充“其余部分保持不变”;模型会保留所有未提及的元素。生成结果将保留原视频的时长与画面构图,费用按源视频时长计算。暂不支持编辑人声对话内容。
4K分辨率为3840×2160,每秒消耗的积分为720p分辨率的3倍,这是因为其运算资源消耗也对应为3倍。每一段4K视频在服务端渲染需要数分钟,因此连贯生成上限设为30秒。在生成前,系统会显示所有时长与分辨率对应的积分消耗。
这是因为视频是以每10秒为一段逐次延展生成的,模型会自行规划每一段的叙事节奏。请使用谷歌官方时间码语法,每10秒仅安排一个明确的动作,避免冗余的电影化铺垫。过于密集的多节奏预告片内容会被模型压缩或重排,30秒内安排3个核心节奏点可以获得稳定的输出效果。
所有通过Omni生成的视频均内置谷歌不可见SynthID水印,同时支持C2PA内容凭证,可验证内容来源且不会影响视频画面效果。Popcraft付费套餐用户对生成视频享有商用权限;免费版下载的视频会带有可见Popcraft水印,升级付费套餐后可移除。您需自行对提示词、参考素材中涉及的肖像权及内容合规性负责。
继续探索
相关模型
Seedance 2.5 单次任务最长可生成 30 秒视频,支持最多 50 个参考素材、可控视频编辑、高保真时序延展,宽高比支持 0.4 至 2.5,原生支持 10 种以上语言输入提示词。现已在 Popcraft 上线。
MiniMax H3 生成 24fps 的 2K 视频,并同步配有立体声声纹——音效、环境音和对话一次完成。单提示词多镜头切换,5 至 15 秒,支持首尾帧控制。Popcraft 现已上线。
在 Popcraft 上使用 Seedance 2.0,从文本、图片或片段生成电影级 4K 视频。原生同步音频、多镜头序列,以及最高 4K (2160p) 的极致清晰细节。

Seedance 2.0 Mini 是字节跳动推出的轻量版视频生成模型,相比标准版 Seedance 2.0 成本最高降低 50%,生成速度约为快速模式的 2 倍,支持文本、图像、视频、音频提示词输入。现已在 Popcraft 上线。
