NEW下一个爆款 UGC 广告,一键即达。快来体验 Studio立即制作广告
PopcraftPopcraft
Popcraft 新功能上线

谷歌 · Gemini Omni 1.1 Flash

基于任意输入创作并编辑视频

谷歌 Omni Flash 是集视频生成、编辑与延展功能于一体的单一模型:支持输入文本、图片或视频片段,输出将自动搭配原生语音、音乐与音效。1.1 版本新增场景延展功能,最长支持40 秒,新增首尾帧控制,以及1080p 与 4K 分辨率输出。

现已在视频工作室、Canvas 以及 MCP 连接器中可用

场景延展:单次请求即可生成 3 至 40 秒任意时长单滑块选择任意时长 · Popcraft自动完成续接 · 4K分辨率最长30秒
  1. 3s
  2. 10s
  3. 20s
  4. 30s
  5. 40s
上传素材类型决定生成功能
谷歌官方指引:通过提示词控制效果,无需切换模式
无素材
文生视频

描述场景、镜头、光影与氛围,系统将自动生成适配音频。

1 张图片
图生视频

图片作为参考基准与起始画面,提示词用于指定画面动态变化。

2 张图片 + “首尾帧”
帧插值补全

该模型可从首帧动画过渡至末帧,支持视角旋转、缩放及无缝循环。

最多 10 张图片
主体参考

照片内的人物与物体在整段视频中保持一致。

1 段视频 + “修改…” 或 “延长…”
编辑或延长

编辑时将保留您未指定修改的全部内容;延长操作每次追加 10 秒时长。

Google 为 Omni 内置的核心特性

以下是模型说明文档与发布公告中重点提及的三项特性,以及它们对于长视频生成的实际意义。下述所有特性说明均来自谷歌官方;页面下方的演示渲染样例为本平台实测产出。

一致性

跨片段 10 秒上下文记忆

Omni 1.1 在延展场景时会分析最多前 10 秒的上下文内容,而早期模型仅会参考最后 1 秒的画面。这也是 40 秒分段生成的长视频能够全程保持船长、船只与画面风格一致的原因。

真实质感

物理规则与世界常识

谷歌表示该模型具备对重力、动能与流体动力学的直观理解,同时结合 Gemini 内置的历史、科学与文化知识库:水流会呈现真实的喷溅效果,帆船也会符合物理规律倾斜航行。

内容溯源

每段视频均搭载 SynthID 与 C2PA 溯源标识

所有生成的视频均内置谷歌隐形SynthID 数字水印,并支持内容凭证标准(C2PA),生成的成品视频可直接发布并可溯源归属,这一特性已成为越来越多平台的强制要求。

资料来源:Google《Gemini Omni 发布介绍》、《Gemini Omni 1.1 Flash 为开发提供更强可控性》博文、DeepMind 模型说明文档,以及 Gemini 企业智能体平台模型页面。

两段由模型原生生成的演示示例

这两段视频均在 Popcraft 生成,为原始输出效果 —— 未经过编辑,也未添加配乐。左侧预告片为单次 40 秒、1080p 分辨率生成请求。右侧为 5 秒原片段,以及将该片段场景延展至 25 秒后的效果。

Gemini Omni 1.1 Flash1920×108040.0s1 request生成音频蔓越莓海盗 好莱坞预告片风格提示词示例:暴风雨、盖伦帆船、船长、装满蔓越莓的宝箱、敌舰、炮火齐射。单次请求即可生成完整40秒视频,自带管弦乐配乐,总耗时23分钟。
输入 5秒
输出 25秒
720×128025.0s+2 legs生成音频直接延长,无需重新生成 长片段的前 5 秒为原文件逐帧原样保留。仅通过一行提示词“他走到灯廊上,点亮镜头”即追加了两段 10 秒内容,且风暴音效在拼接处自然过渡。
关于场景延展的说明:模型会以 10 秒为单位追加内容。若请求将 5 秒片段“延长到 20 秒”,最终将得到 25 秒视频。Popcraft 仅提供模型可实际生成的时长选项,并按最终输出时长计费。

支持最长40秒任意时长,Popcraft为您自动完成续接。

谷歌发布公告中将该功能称为场景延展:视频“以 10 秒为单位逐步延长,累计最长可达 40 秒”。在 Popcraft 平台您无需手动分段操作:只需通过滑块一次性选择 3 至 40 秒任意时长,Popcraft 将基于您的单条提示词自动完成链式延展流程,最终输出完整统一的视频文件、连贯叙事与完整音轨。下方为该预告片生成过程中 6 个节点的预览效果。

第1秒:骷髅旗下方,盖伦帆船冲破风暴巨浪1s
第8秒:船长举起弯刀,蔓越莓在空中飞溅8s
第15秒:日落时分,大胡子船长紧握船舵,船员伫立在他身后15s
第22秒:船长在船舵旁高声下达命令22s
第29秒:日落海面散落着蔓越莓,三艘船只航行其上29s
第36秒:船长嘶吼的特写,身后船帆已然破损36s
四段生成内容中船长、船只、画面品质均保持一致—— 这是 10 秒上下文窗口的运行效果。仅故事发生顺序出现了偏差:蔓越莓喷洒出现在宝箱打开之前。这属于提示词使用技巧(下文会说明),并非模型本身的限制。
场景延长
40 总秒数

任意时长,自动连贯

您只需选择 3 至 40 秒的目标时长,Popcraft 将在后台自动运行 Google 场景延展链路 —— 无需规划分段,也无需手动拼接片段,仅按实际输出的视频秒数付费

输出
4K 或 1080p

生成分辨率

谷歌官方描述:“输出画质精致清晰,支持1080P与4K分辨率,可直接用于专业制作”。在Popcraft中,4K分辨率下续接最长可达30秒。

关键帧
2

首尾帧

1.1 版本新增功能:指定镜头的起始帧与结束帧后,Omni 会自动生成两帧之间的连贯视频,支持复杂环绕运镜、缩放转场、无缝循环等效果。

音效
3 种音频

人声、音乐、音效

根据模型文档说明,音频将随画面同步生成。您可在提示词中指定音频需求,例如:收音机播放声、无人声、仅环境音,模型将按要求执行。

根据本平台实测总结的实用经验:每 10 秒分段内仅安排一个明确动作。若在 40 秒视频内塞入 5 个情节节点,内容会被压缩并打乱顺序;30 秒内安排 3 个节点则可保留原有叙事顺序。

上传您的图片或视频

同一模型可读取参考素材、执行编辑与延展操作。Google 官方建议通过提示词明确需求:说明需要保留的内容、需要修改的内容,需要延展时直接注明“延展”即可。

最多 10 张图片

主体参考

上传人物、商品或地点的参考照片,再描述所需场景。模型会在整个视频中保持角色与物品的一致性,即使是多段拼接的长视频也不会出现偏差。

无需训练步骤,无需角色文件。使用同一主体不同角度的两张参考照片,效果优于单张。

参考照片中的女性在黄金时刻的海滩上朝向镜头行走,发丝随风飘动,身后是海浪。
1 段视频 + 一处修改

视频编辑

上传片段并说明需要修改的内容。Google 官方建议:“简单的提示词最适合视频编辑”—— 模型会自动保留您未提及的所有元素。

输出将保留原素材的时长与画幅规格,并按此时长计费。

生成大雪效果,其余内容保持不变。
1 段视频 + “延长”

场景延长

上传已有视频并设置目标总时长。原视频会逐帧完整保留,新增内容将以 10 秒为单位接续生成并延续原有音频,模型会读取原视频最多前 10 秒内容以保证连贯性。

如需续接视频,请在提示词中加入“续接”关键词;若您遗漏该词,Popcraft会在视频续接面板自动补加。未添加该关键词时,模型会将请求识别为视频编辑操作。续接仅支持在视频末尾追加内容。

延长这段视频:完整延续船只靠岸、船员向岸上抛缆绳的原场景,所有细节保持一致。
未指定帧指令时,上传的两张图片将作为参考素材使用。如需启用首尾帧插值生成,请明确说明:“将第一张图作为起始帧,第二张图作为结束帧,并描述过渡过程”。

Omni 对比 Seedance 2.5 与 Veo 3.1

以下三款模型均支持同步生成画面与音频。Omni 的优势为单模型即可支持最长 40 秒场景延展与 4K 输出;Seedance 的优势在于参考数量与区域精确编辑;Veo 的优势在于 8 秒帧控制。请根据实际需求选择。

功能特性Gemini Omni 1.1 FlashSeedance 2.5Veo 3.1
单次请求最长生成时长通过场景延长可达 40 秒(4K 分辨率下为 30 秒)30 秒8 秒
最高支持分辨率4K (3840×2160),最低可输出 360p 草稿规格1080p1080p
原生同步音频人声、音乐、音效支持支持
参考图片最多 10 个最多 30 个(+10 视频,+10 音频)最多 3 个
参考视频最多 3 个最多 10 个1(扩展时长)
视频剪辑对话式交互;保留未提及内容可控编辑,区域精准
视频时长扩展每次延长10秒,最长40秒,保留10秒上下文可向前/向后扩展,最长30秒每步延长7秒
内容溯源SynthID + C2PA 内容凭证SynthID

Omni 官方参数来自 Google 模型说明页与发布公告;Popcraft 展示的限制为当前选择器实际开放的可用范围。服务商上限可能发生变动,选择器将始终显示当前可使用的配置。

适合单次完整指令即可高效完成的场景

以往需要拆分多段素材再拼接的工作

网页场景

落地页首屏宣传视频

单文件生成,支持 3 至 40 秒任意时长(4K 分辨率下最长 30 秒),并自带独立配乐。例如将滑块设为 24 秒,Popcraft 将自动为您完成多段续接。

电影

预告片与预热短片

单次连贯渲染即可完成铺垫、转折、高潮完整叙事,同步搭配递进配乐

电商场景

固定出镜角色的广告短片

仅需少量产品或出镜人照片,即可在所有镜头中保持形象一致

社交发帖

重制拍摄素材

可修改实拍素材的天气、着装或时段,时长与镜头保持不变。

讲解演示

创意可视化拆解

谷歌发布公告中特别指出这一点:“仅需简短提示词即可生成清晰易懂的讲解内容”,配合可视化内容拆解复杂概念。

链式提示词编写

谷歌官方指南建议提示词应包含场景描述、镜头运动、光线与氛围,同时支持使用时间码语法标记事件。本页面上方的预告片实测显示:模型会执行请求的内容,但也会重新调整内容顺序——原因是单分段内请求的内容过多。

正确示范

每10秒一个动作,标注时间码

将剧情节点按时间序列编写 —— Google 官方文档标注了 [0-3s] … [3-6s] … 这种语法格式。每 10 秒分段仅安排一项明确的动作;模型会根据提示词规划分段,因此请直接给出完整时序方案。

将画面风格(调色、镜头、氛围)放在末尾单独一行,不要在开头写大段描述。如需单镜头不间断拍摄,请注明:“单镜头连续拍摄,无场景切换”。

黄昏暴风雨中的海盗盖伦帆船,骷髅旗,破损的黑色船帆。单镜头连续拍摄,无场景切换。\n[0-10秒] 船只破浪前行,镜头抬升至甲板。\n[10-20秒] 留胡子的船长掌舵发令,船员齐声呼应。\n[20-30秒] 他在船头打开铁箱,箱内满是红色蔓越莓。\n[30-40秒] 敌船开火,他拔出弯刀时蔓越莓慢镜头散落。\n画面风格:变形镜头光晕、蓝琥珀色调、管弦乐配乐、无屏幕文字。
错误示范

堆砌式预告片文案

上方预告片实际提交的提示词为:在一整段未分段的文本中写入了 5 个情节节点、宝箱揭晓、敌船出现与结局。模型保留了船只、船长与整体风格,但打乱了情节的出现顺序。

蔓越莓喷射动画在第8秒时加载完成,但宝箱始终没有清晰打开。冗长的提示词不会导致生成失败,只会被模型压缩处理。

好莱坞大片风格预告片《蔓越莓海盗》。史诗真人电影质感:变形镜头光晕、深邃蓝琥珀调色、体积感海雾、35mm胶片颗粒…… [五个情节节点,单段落,240字]
输入“延长”
“续接”关键词是触发视频延长的开关。在视频续接面板操作时,Popcraft会自动补加该关键词;通过API or MCP调用时请自行添加。续接仅支持在视频末尾追加内容,暂不支持在开头插入。
画面帧也需要文字描述
上传两张图片时默认仅作为主体参考,如需生成转场动画,请明确标注“首帧”与“末帧”并描述过渡效果。
指定音效
谷歌官方说明:“默认情况下模型将尝试生成适配的音轨”。您可使用简单否定词控制音频,例如“无人声”“无额外音效”;也可直接描述所需音频,如:收音机播放声、帆布上的雨声、弦乐渐强。
编辑指令保持简洁
谷歌官方指南再次强调:“描述过于详细的提示词可能会引发非预期改动”。只需指明需要修改的内容,追加“其余部分保持不变”即可,无需额外描述。

计费说明

Omni 按实际输出秒数及分辨率计费。由于 Popcraft 仅提供模型可精准生成的时长选项,生成前显示的价格即为最终支付价格。

720p
15 积分/秒

草稿与社交场景。10秒片段消耗150积分,完整40秒消耗600积分。

1080p
23 积分/秒

交付品质。上方演示的 40 秒预告片消耗920 积分:单次请求,已包含音频生成费用。

4K
45 积分/秒

原生3840×2160分辨率,适用于主视觉展示。最长支持30秒,完整30秒4K连贯视频消耗1350积分。

编辑操作按源片段时长计费;延展操作按最终总输出时长计费。此外提供 360p 草稿档位,每秒消耗 5 积分 —— Google 标注该档位生成速度比 720p 最高快 60%,可用于在选定分辨率前测试提示词效果。所有套餐均包含积分,定价页面可查看全部模型的当前费率。

常见问题

这是谷歌推出的视频生成模型,DeepMind 将其描述为“我们迈向通用生成模型的下一步:可基于任意输入创作、编辑任何内容,首先从视频能力起步”。该单一模型支持文生视频、图生视频、首尾帧插帧、主体参考、视频编辑、场景延展功能,生成视频时会同步配套语音、音乐与音效。2026年8月27日发布的1.1版本新增了场景延展、关键帧控制以及1080p/4K输出支持。

单次生成最长为10秒;视频续接将以10秒为单位递增,累计最长可达40秒。在Popcraft中,您仅需通过滑块选择3至40秒之间的任意时长,平台将根据您的提示词自动完成续接流程;滑块仅提供模型可支持的时长选项,费用将按实际生成时长结算。4K分辨率下最长可生成30秒;首尾帧插值视频为单次生成,时长范围为3至10秒。

默认会生成音频。根据谷歌官方说明,模型“将尝试生成适配的音轨”,支持生成人声、背景音乐与音效。您可在提示词中指定音频需求,如需静音可添加“无人声”“无音乐”等描述。生成完成后,您也可以在Popcraft时间轴中替换或叠加音频。

上传原视频后选择目标总时长即可。原视频画面将完整保留,系统会以10秒为单位在末尾追加续接内容,同时会读取原视频最多10秒的内容保证画面连贯性。例如5秒的原视频仅可续接为15、25或35秒,无法生成20秒版本。Popcraft仅提供模型可支持的时长选项,并按实际生成时长计费。续接仅支持在视频末尾追加内容。

可以。请上传源文件并描述需要修改的内容。谷歌建议使用简洁的编辑提示词,并补充“其余部分保持不变”;模型会保留所有未提及的元素。生成结果将保留原视频的时长与画面构图,费用按源视频时长计算。暂不支持编辑人声对话内容。

4K分辨率为3840×2160,每秒消耗的积分为720p分辨率的3倍,这是因为其运算资源消耗也对应为3倍。每一段4K视频在服务端渲染需要数分钟,因此连贯生成上限设为30秒。在生成前,系统会显示所有时长与分辨率对应的积分消耗。

这是因为视频是以每10秒为一段逐次延展生成的,模型会自行规划每一段的叙事节奏。请使用谷歌官方时间码语法,每10秒仅安排一个明确的动作,避免冗余的电影化铺垫。过于密集的多节奏预告片内容会被模型压缩或重排,30秒内安排3个核心节奏点可以获得稳定的输出效果。

所有通过Omni生成的视频均内置谷歌不可见SynthID水印,同时支持C2PA内容凭证,可验证内容来源且不会影响视频画面效果。Popcraft付费套餐用户对生成视频享有商用权限;免费版下载的视频会带有可见Popcraft水印,升级付费套餐后可移除。您需自行对提示词、参考素材中涉及的肖像权及内容合规性负责。

不想分段生成5个片段?试试单次提交请求即可完成?

可以先生成10秒720p分辨率的版本预览效果,满意后再延展场景;也可以上传你已有的满意片段,直接在此基础上进行延展。

继续探索

相关模型