Google · Gemini Omni 1.1 Flash
從任何輸入建立與編輯影片
Google 的 Omni Flash 是一款集影片生成、編輯與延伸於一身的模型——輸入文字、圖片或影片片段,即可產出帶有專屬語音、音樂和音效的影片。1.1 版新增了可將場景延伸至 40 秒的功能、首尾影格控制,以及 1080p 和 4K 輸出。
已在影片工作室、Canvas 及 MCP 連接器中上線
- 3s
- 10s
- 20s
- 30s
- 40s
描述場景、鏡頭、光線與氛圍。音訊將自動配合生成。
影像是引導或起點;提示詞則指定什麼會移動。
模型會從第一幀動畫播放到最後一幀——包含環繞、縮放與無縫循環。
照片中的角色與物件在整段影片中保持一致。
編輯會保留你未提及的所有內容;延長則每次追加 10 秒。
Google 為 Omni 注入的功能
模型說明卡與發布文章開頭強調的三件事,以及它們對長片段為何重要。以下所有聲明皆來自 Google;下方的算繪結果則出自我們之手。
跨鏡頭的十秒記憶
Omni 1.1 在延伸場景時會分析長達 10 秒的先前脈絡——早期模型僅參考最後 1 秒。這就是為什麼一段 40 秒的鏈結能在四個段落中維持相同的船長、船隻與色調。
物理與世界知識
Google 描述其具備對重力、動能與流體力學的直覺理解,並結合 Gemini 對歷史、科學與文化的知識——水花噴湧如同真實的水,大帆船傾側如同真正的船。
每段影片皆套用 SynthID 與 C2PA
每支生成的影片都帶有 Google 隱形的 SynthID 浮水印,並支援 Content Credentials (C2PA),因此主要片段在發布時可驗證其來源——這已是越來越多平台的必要條件。
資料來源:Google 的「Introducing Gemini Omni」與「Gemini Omni 1.1 Flash lets you build with more control」文章、DeepMind 模型卡,以及 Gemini Enterprise Agent Platform 模型頁面。
兩段示範,直接來自模型
這兩部影片都是在 Popcraft 上生成的,並以原始交付狀態呈現——未經剪輯、未加配樂。預告片是一次 40 秒的 1080p 生成請求。右側的對比組是一段 5 秒的短片,以及同一短片經場景延長至 25 秒後的版本。
任意長度,最長 40 秒。Popcraft 為你自動串接。
Google 的發布文章稱之為場景延伸:影片「以 10 秒為單位增長,累計總長度最多 40 秒」。在 Popcraft 上,您完全不需要手動管理。只需在一個滑桿上選擇 3 到 40 秒的任意長度,Popcraft 會自動鏈結延伸流程,從您的單一提示詞開始,最終交付一個檔案、一個故事、一條配樂。以下是預告片在六個時間點的畫面。
1s
8s
15s
22s
29s
36s任意長度,自動串接
選擇 3 到 40 秒,Popcraft 會在幕後為你執行 Google 的延長鏈——無需規劃片段、無需拼接短片——而且你只需為實際交付的秒數付費。
製作解析度
Google 的原話:「精緻、高解析度的 1080p 或 4K 輸出,可直接用於專業製作」。在 Popcraft 上,4K 串接最長可達 30 秒。
首尾影格
1.1 版新功能:指定鏡頭的起始與結束影格,Omni 便會生成兩者之間的連續影片——複雜的攝影機環繞、縮放轉場、無縫循環。
語音、音樂、音效
模型說明卡上列為隨畫面同步生成。在提示詞中指定即可——收音機播放聲、無對話、僅環境音——模型就會照做。
使用您自己的圖片或影片
同一個模型可讀取參考素材、進行編輯與延長。Google 的建議是依賴提示詞:指明應保留的內容、指明應變更的內容,要延長時就說「延長」。
主體參考
附上人物、產品或地點的照片,並描述場景。模型會在整段影片中維持角色與物件的一致性,包括長片段中的各個段落。
無需訓練步驟,也無需角色檔案。同一主體不同角度的兩張照片,效果勝過單張。
參考照片中的女子在黃金時刻的沙灘上朝鏡頭走來,髮絲隨風飄揚,身後是層層海浪。
影片編輯
附加一段短片並說明需要變更的部分。Google 的官方建議:「簡單的提示詞最適合用於影片編輯」——模型會保留你未提及的元素。
輸出會維持與來源相同的長度與畫面構圖,並依該長度計費。
讓雪下得更大。其餘部分維持不變。
場景延長
附上影片片段並選擇較長的總長度。原始內容會逐格保留,新畫面以 10 秒為一段接續附加且延續音效,模型會讀取片段中最多 10 秒的內容以維持連貫性。
請輸入「extend」——如果你忘了,Popcraft 會在延伸影片面板中自動為你加上,因為若沒有這個詞,模型會將請求視為編輯。延伸只會在結尾追加。
延長這段影片:延續完全相同的場景,直到船隻抵達碼頭,船員將繩索拋向岸邊。
Omni 與 Seedance 2.5 及 Veo 3.1 並列比較
三款模型皆能隨畫面同步生成音訊。Omni 的優勢在於單一模型即可將場景延伸至 40 秒並輸出 4K;Seedance 的優勢在於參考數量與區域精準編輯;Veo 的優勢在於 8 秒的影格控制。請依工作需求挑選。
| 功能 | Gemini Omni 1.1 Flash | Seedance 2.5 | Veo 3.1 |
|---|---|---|---|
| 單次請求最長片段 | 40 秒(透過場景延長,4K 下為 30 秒) | 30 秒 | 8 秒 |
| 最高解析度 | 4K(3840×2160),最低支援 360p 草稿層級 | 1080p | 1080p |
| 原生音訊 | 語音、音樂、音效 | 是 | 是 |
| 參考圖片 | 最多 10 個 | 最多 30 個(+10 部影片、+10 段音訊) | 最多 3 個 |
| 參考影片 | 最多 3 個 | 最多 10 個 | 1(擴充) |
| 影片剪輯 | 對話式;保留你未提及的內容 | 可控且區域精準 | — |
| 影片延長 | 以 10 秒為單位延長至 40 秒,含 10 秒上下文 | 向前或向後,最長 30 秒 | 每步驟 +7 秒 |
| 來源追溯 | SynthID + C2PA 內容憑證 | — | SynthID |
Omni 的數據來自 Google 的模型頁面與發布文章;Popcraft 的限制則是選擇器目前所呈現的數值。供應商的上限會變動;選擇器一律顯示當前可用的規格。
適合單一長指令一次到位的場景
過去需要五段片段再拼接的任何內容。
著陸頁主視覺
3 到 40 秒的任意長度(4K 為 30 秒),附帶專屬配樂,全部在一個檔案中。將滑桿設為 24,Popcraft 會為你自動串接延伸。
預告片與搶先看
完整的敘事弧線——鋪陳、揭露、高潮——在一次連續算圖中完成,搭配漸強的背景音樂。
固定主角的廣告短片
只需幾張產品或主持人的照片,就能讓每個鏡頭中的他們保持一致。
重塑你的拍攝畫面
在真實影片上變更天氣、服裝或一天中的時段,長度與鏡頭維持不變。
將想法視覺化拆解
Google 的發布文章特別點出這一點:「從簡短提示詞生成引人入勝的解說」,並搭配能拆解複雜概念的視覺效果。
鏈結的提示詞撰寫
Google 的指南要求提供場景描述、攝影機運動、燈光與氛圍,並提供事件的時間碼語法。此處的其他內容皆來自上方的預告片:它完成了我們的要求,也重新排序了我們的要求,因為我們在每個段落中要求了太多。
每 10 秒一個動作,並附上時間碼
將節拍寫成定時序列——Google 官方指南記載了 [0-3s] … [3-6s] … 語法。每個 10 秒片段分配一項明確的任務;模型會根據提示詞規劃片段,所以請把計畫給它。
將視覺風格(色調、鏡頭、氛圍)以短短一行寫在結尾,而非在開頭寫一大段。若要一鏡到底,請明確說明:「單一連續鏡頭,無場景切換」。
黃昏暴風雨中的海盜大帆船,骷髏旗,破損的黑帆。單一連續鏡頭,無場景切換。\n[0-10s] 船隻破浪前行;鏡頭升至甲板。\n[10-20s] 鬍子船長在舵輪旁高聲下令;船員大聲回應。\n[20-30s] 他打開船首的鐵箱;裡面裝滿了紅色蔓越莓。\n[30-40s] 敵船開火;他舉起彎刀,蔓越莓以慢動作四散。\n視覺風格:變形鏡頭光暈、青橙調色、管弦樂配樂、無畫面文字。
密集的預告片段落
這是我們實際為上方預告片送出的內容:五個節拍、寶箱揭曉、敵對船隻與結局,全部寫在一個不間斷的段落中。模型保留了船隻、船長與色調,但調換了順序。
蔓越莓噴霧落在第 8 秒;寶箱始終沒有清楚打開。密集的提示詞不會失敗,只會被壓縮。
好萊塢大片預告片,「蔓越莓海盜」。史詩級實拍電影視覺風格:變形鏡頭光暈、深青橙調色、體積海霧、35mm 底片顆粒……【五個節拍,一個段落,240 字】
- 使用「extend」
- 進行延伸時,該詞就是開關。如果缺少,Popcraft 會在延伸影片面板中自動加上;若透過 API 或 MCP 操作,請自行輸入。延伸只會在結尾追加——不支援在開頭前置。
- 影格也需要文字描述
- 兩張圖片會被視為主題參考,除非你明確指定「第一影格」和「最後影格」並描述轉場效果。
- 指導音效
- Google 指南:「預設情況下,模型會嘗試生成合適的音軌。」請使用簡單的否定指令——「無對話」、「無額外音效」——或直接指定你想要的內容:收音機播放聲、雨打畫布聲、弦樂漸強。
- 保持剪輯簡潔
- 再次引用 Google 的指南:「過度描述的提示詞可能導致非預期的變更。」請指明要變更的部分,加上「其餘部分保持不變」,然後停止。
費用說明
Omni 按實際交付的秒數與解析度計費。由於 Popcraft 只提供模型能精確達到的長度,你在生成前看到的價格就是最終付費金額。
草稿與社群用途。10 秒影片為 150 點數;完整 40 秒為 600 點數。
交付品質。上方 40 秒的預告片花費 920 點數——一次請求,包含音效。
原生 3840×2160 適用於主打版面。上限為 30 秒;完整 30 秒 4K 序列為 1,350 點數。
常見問題
Google 的影片模型,DeepMind 將其描述為「我們邁向能從任何輸入建立與編輯任何內容的模型的下一步——從影片開始」。單一模型涵蓋文字轉影片、圖片轉影片、首尾影格插值、主體參考、影片編輯與場景延伸,並為每段影片生成語音、音樂和音效。1.1 版本於 2026 年 8 月 27 日發布,新增了延伸、關鍵影格及 1080p/4K 輸出功能。
每次生成最長可達 10 秒;場景延伸會以 10 秒為單位遞增影片長度,累計最長可達 40 秒。在 Popcraft 上,你只需透過單一滑桿選擇 3 到 40 秒之間的任意長度,Popcraft 會根據你的單一提示詞自動串接延伸流程;滑桿只會提供模型能產出的長度選項,而你只需為實際取得的秒數付費。在 4K 解析度下,串接上限為 30 秒,而首尾影格影片屬於單次生成,因此長度為 3 到 10 秒。
預設情況下是的——Google 的指南指出模型「會嘗試生成合適的音軌」,模型說明卡也列出了語音、音樂和音效。你可以在提示詞中指定,包括在需要靜音時加入「無對話」或「無音樂」。你也可以事後在 Popcraft 時間軸上替換或疊加音訊。
附加一段影片片段並選擇你想要的總長度。原始內容會逐幀保留,並以完整的 10 秒段落追加至結尾,同時會讀取片段中最長 10 秒的內容以保持連貫性。因此,一段 5 秒的片段會變成 15、25 或 35 秒——絕不會是 20 秒。Popcraft 只提供模型能產出的長度,並按實際秒數計費。延伸只會在結尾追加。
可以。請附上來源並描述變更內容。Google 建議使用簡單的編輯提示詞,並加上「其餘部分保持不變」;模型會保留您未提及的元素。產出結果會維持原始片段的長度與構圖,並依來源片段的長度計費。目前不支援編輯口語對話。
4K 以 3840×2160 渲染,每秒費用是 720p 費率的三倍,因為它使用三倍的運算資源。每段 4K 片段在上游需要數分鐘,因此序列在 30 秒時停止。每種長度與解析度都會在生成前顯示其點數價格。
因為每個 10 秒片段都是前一段的延伸,且模型會自行規劃節奏。請使用 Google 的時間碼語法,每 10 秒給予一個明確的動作,並捨棄電影語言的填充內容。密集的五拍預告片會被壓縮或重新排序;30 秒內的三拍則能維持。
每部 Omni 影片都帶有 Google 的隱形 SynthID 浮水印,並支援 C2PA 內容憑證,可在不影響影片外觀的情況下驗證來源。Popcraft 付費方案會授予你所生成影片的商業使用權;免費方案下載的影片會帶有可見的 Popcraft 浮水印,付費方案則會移除。你仍須對提示詞及參考媒體中的肖像與內容自行負責。
繼續探索
相關模型
Seedance 2.5 單次任務可生成長達 30 秒的影片,支援多達 50 個參考素材、可控影片編輯、高保真時間軸延展、0.4 至 2.5 的任意長寬比,以及 10 種以上語言的原生提示詞。現已於 Popcraft 上線。
MiniMax H3 可生成 24fps 的 2K 影片並同步立體聲配樂,一次搞定特效、氛圍與對白。支援單一提示詞多鏡頭、5 至 15 秒、首末幀控制。現已在 Popcraft 上線。
在 Popcraft 上使用 Seedance 2.0,從文字、圖片或片段生成電影級 4K 影片。原生同步音訊、多鏡頭序列,以及最高 4K (2160p) 的極致清晰細節。

Seedance 2.0 Mini 是字節跳動最輕量的影片方案——比標準版 Seedance 2.0 便宜最多 50%,速度約為 Fast 的 2 倍,支援文字、影像、影片及音訊提示詞。現已在 Popcraft 上線。
