給不想往下看的讀者的簡短版本。 Gemini Omni 1.1 Flash 是 Google 一款全能影片模型:輸入文字、圖片或影片片段,就能輸出自帶聲音的影片。1.1 版本(2026 年 8 月 27 日)新增了兩項對實際工作至關重要的功能:場景延伸至 40 秒,以及 1080p/4K 輸出。現已於 Popcraft 上線。我們花了一天時間測試,學到最實用的一件事是:從 5 秒片段「延伸至 20 秒」,實際會得到 25 秒。
| Google 官方說法 | 我們的實測結果 | |
|---|---|---|
| 最長片段 | 透過場景延伸達 40 秒,以 10 秒為增量 | 單一提示詞生成 40.0 秒,耗時 23 分鐘 |
| 延伸 | 「分析先前最多 10 秒的上下文」 | 5 秒來源 → 25.0 秒檔案,原始影格逐格保留 |
| 解析度 | 360p 至 4K,「可投入專業製作」 | 1080p 預告片、720p 測試;4K 串接在 30 秒停止 |
| 音訊 | 語音、音樂、音效搭配畫面 | 預告片配有管弦樂配樂,延伸片段配有暴風雨環境音 |
| 物理 | 「直觀理解重力、動能和流體動力學等力量」 | 一段 30 秒的水中墨跡作品,包含三種表現合理的流體,見下方 |
| 攝影機 | 合作夥伴引言:「動態攝影機運動」 | 無人機和環繞每次都成功;快速橫搖、升降鏡頭和 dolly zoom 會被柔化 |
星期三,10:41。開始了。
Batch AI 在前一晚於他們的測試閘道上開啟了這個模型。先說明他們那邊的兩個事實,因為由他們決定你怎麼使用這東西:解析度字串是「4K」,而且確實會回傳 3840×2160,另外 extension 在 API 上是正式模式,不是提示詞花招。以下其他內容都是我們在按按鈕測試。
第一個任務刻意設計得很無聊。一個守塔人在螺旋樓梯上,直式,5 秒,720p。大約兩分鐘後回傳了 5.01 秒的影片,還附帶了沒人要求的風雨聲軌。這就是 Omni 的預設行為:Google 的開發者指南寫道,模型「會嘗試為影片生成合適的音軌」,而且每次都會這麼做,除非你明確告訴它不要。

11:20。那個比我們要求的多 5 秒的延伸
這才是這篇文章值回票價的部分。我們附上了那段 5 秒的影片,寫了一行提示詞(「守燈人走上燈廊並點亮油燈」),然後要求生成總長 20 秒的影片。
回傳的檔案長度為 25.0 秒。
這不是 bug。Google 的發布文章寫道,延伸功能「以 10 秒為單位遞增,累計總長度最多 40 秒」,而且它指的是完整的遞增單位:5 加 10 再加 10。新檔案的前五秒就是我們的原始片段,逐位元組完全一致,暴風雨的音效也無縫跨越了接合處。看起來棒極了。只是它不是 20 秒。
所以給所有使用這款模型的人一條規則,也是 Popcraft 的延伸面板現在對 5 秒來源列出 15、25 和 35,而非整齊的 10/20/30/40 的原因:你只能落在來源加上完整段落的長度上。我們計費的是實際回傳的秒數,而不是你輸入的數字。
「以 10 秒為單位延伸影片,累計總長度最多 40 秒。」——Google,Omni 1.1 Flash 發布文章
12:05. 四十秒,一組提示詞
接著是我們真正想要的:一部好萊塢預告片,「蔓越莓海盜」,16:9,1080p,40 秒,單一請求。Popcraft 會自動為你串接延伸流程:輸入一組提示詞,輸出一個 40 秒的檔案。
花了 23 分鐘。我們自己的預估說是 15 分鐘,所以那是我們需要重新調整的。結果正好是 40.0 秒,1920×1080,配樂的管弦樂編曲在大概對的地方漸強。同一位船長、同一艘船、同樣的青橙調色貫穿全部四個段落。這種一致性正是發布文章中提到的 10 秒上下文視窗在發揮作用,也是這個模型最有力的論點。

以下是它出錯的地方,以及為什麼是我們的錯。提示詞是一個多達 240 字的密集段落,包含五個節拍:暴風雨、船長、裝滿蔓越莓的寶箱、敵船、大砲收尾。Omni 保留了每個元素,但重新排列了順序。蔓越莓噴濺出現在第八秒,早於本該釋放它的寶箱,而且寶箱始終沒有明顯打開。密集的提示詞在這款模型上不會失敗,而是會被壓縮。
15:10。好吧,我們來好好測試一下物理模擬的說法
那支預告片是個糟糕的物理測試:同時發生太多事,沒人能說得準蔓越莓彈跳得對不對。所以我們寫了當天最無聊的提示詞。一座盛著靜水的黑色水槽。每 10 秒段落一種流體:一滴橙色水滴落入、一團靛藍墨水湧出,然後是一朵從背後打光的白色顏料雲。沒有人物、沒有故事、一個緩慢的攝影機弧形運動,30 秒 1080p,一次請求。
這是模型整天生成的最佳作品。水滴落下,激起一頂皇冠狀的水花,然後像真實的水一樣塌落回去。靛藍墨柱在後方捲起,穿過橙色區域時兩種顏色都沒有暈染成模糊的一片。當白色雲霧湧入時,背光穿透散射其中,而先前的流體依然在底層清晰可見,持續流動。攝影機的弧形運動貫穿了全部三個段落,從未重置。看看十秒和二十秒處的接合點:我們找不到任何痕跡。
先從較便宜的草稿開始,因為這是我們推薦的工作流程。四支 10 秒 720p 的變體(墨水、蜂蜜、骨牌、牛頓擺)各花了大約兩分鐘。墨水和牛頓擺效果不錯,蜂蜜有點太躁動了,骨牌按正確順序倒下但缺乏重量感。墨水勝出,我們寫了 30 秒版本,而 30 秒版本回傳的結果比草稿更好。預告片的情況則不然,更長的長度意味著故事被壓縮得更厲害。當沒有故事需要壓縮時,延伸就只有好處。
根據這些證據來看,Google 關於流體動力學的那句話,並不是行銷話術。
16:40。還有攝影機的宣稱
我們在 Google 發表資料中不斷看到的另一個宣稱是關於攝影機的。模型頁面上的一段合作夥伴引言稱讚其「動態攝影機運動」,而 Vertex 提示詞指南列出了模型被教導的詞彙:drone、dolly、pan、tilt、tracking、crane、orbit、whip pan,以及一個被標記為進階且未正式支援的「dolly zoom」。
所以我們在同一個 30 秒鏡頭中要求了以上全部,場景是早上的同一座燈塔,提示詞的每個節拍對應一個運鏡。
逐個運鏡評分,對照提示詞:
- 無人機接近。 成功。掠過浪尖,攀升過玄武岩,在我們指定的秒數準時抵達燈室。這是模型整天給我們最棒的十秒攝影機運動。
- 環繞。 成功。最後十秒從守塔人背後環繞,經過側面,到另一側的遠景,而燈塔始終是同一座燈塔。
- 快速橫搖至船隻。 失敗。船在那裡,在地平線上顯得渺小,但攝影機是漂移過去而非快速對準。模型把快速運動柔化成了慢速。
- 升降鏡頭越過燈室上升。 一半。上升發生在第一段,也就是提示詞沒有要求的地方,而非提示詞確實有要求的第二段。
- 低角度推進搭配移焦。 失敗。最終停在遠景。
- Dolly zoom。 我們刻意將它從 30 秒提示詞中排除。在先前 10 秒的測試中,它回傳的結果只是普通的推進,而 Google 自己的指南將其歸類為「非官方支援」,所以這個結果很合理。
兩件沒人要求的事。在第一段與第二段之間,攝影機直接穿過燈室玻璃找到裡面的守塔人,然後跟著她走出門來到觀景台。檔案中沒有任何剪接點(我們用場景偵測器跑過一遍),所以模型自己發明了一個轉場,從無人機的位置轉到她那裡。這是個不錯的發明。比較不好的是:她的頭髮在燈室裡是盤起來的,幾秒後到了觀景台卻放了下來。Google 的模型說明卡將「編輯間的一致性」和「複雜運動」列為已知限制,而這就是實際呈現的樣子。
在 10 秒和 30 秒的測試中,我們發現的規律是:緩慢、大範圍的運動(無人機、環繞、弧形、推軌)都很可靠,而快速或光學類的運動(快速橫搖、dolly zoom)則會被柔化成較平緩的效果。如果你的鏡頭需要俐落的瞬間切換,請把它獨立生成為短片段,再剪接進去。
提示詞的教訓跟預告片的一樣。用 Google 自己指南中的詞彙命名運鏡,每個節拍一個,慢的運鏡就會準時出現。描述一種感覺(「橫掃」、「動態」),結果無論如何都是緩慢推進。
從 Omni Flash 1.0 到底改變了什麼?
Google 的模型頁面為兩個版本使用了相同的能力表格,因此差異顯得格外誠實:
| 能力 | Omni Flash(2026 年 5 月) | Omni 1.1 Flash(2026 年 8 月) |
|---|---|---|
| 文字生成影片 | 是 | 是 |
| 圖片生成影片 | 不支援 | 支援 |
| 參考圖片 / 影片 | 不支援 | 最多 10 張圖片、3 部影片 |
| 首影格與尾影格 | 不支援 | 支援 |
| 影片編輯 | 支援 | 支援 |
| 延伸影片 | 不支援 | 支援,最長 40 秒 |
| 輸出解析度 | 僅 720p | 360p、720p、1080p、4K |
| 聲音生成 | 語音、音樂、音效 | 語音、音樂、音效 |
| 來源標記 | SynthID、C2PA | SynthID、C2PA |
原始「Introducing Gemini Omni」文章中關於物理與世界知識的宣稱(「對重力、動能和流體動力學等力量的直覺理解有所提升」)延續了下來,我們也刻意回頭測試了那一部分,如下所示。不過,Google 主打的是記憶力:「每個指令都建立在前一個之上。你的角色保持一致,物理規則經得起考驗,場景也會記住之前發生的事。」看完預告片後,我們對這句話後半段的信任度比預期高出許多。
不切換模式的話,你要怎麼告訴它該做什麼?
你不需要,而這需要一點時間來習慣。Google 的指南:「我們建議主要依賴提示詞,僅在提示詞無效時才使用 task 參數。」你附加什麼、寫下什麼,就是切換的關鍵。
- 未附加任何內容:文字生成影片。
- 一張圖片:該圖片成為第一個影格。
- 兩張圖片,加上「first frame」和「last frame」字詞:在兩者之間進行插值。若沒有這些字詞,兩張圖片則作為主體參考。
- 最多十張圖片:主體參考;人物與物件保持一致。
- 一部影片加上「make it snow」:保留鏡頭、長度與構圖的編輯。
- 一部影片加上「extend this video」:場景延伸。
最後兩點最容易讓人出錯。如果你附加了一段影片並描述後續內容,卻沒有使用 extend 這個詞,模型會將其視為編輯,並回傳相同長度。Popcraft 會在「延伸影片」面板上自動為你加上這個關鍵字;若透過 API 或 MCP 操作,則需要自行撰寫。
在同事第一次進行 40 秒算圖前,我們會告訴他們什麼
不是技巧清單。三件事,按照它們會讓你踩雷的順序排列。
每個段落一個動作。 Google 的指南記載了時間碼語法,而且它完美對應到 10 秒段落。這是我們當初應該送出的預告片提示詞:
黃昏暴風雨中的海盜帆船,骷髏旗,破損的黑帆。單一連續鏡頭,無場景剪接。 [0-10s] 船隻衝破海浪;攝影機升至甲板。 [10-20s] 鬍子船長在舵輪旁高聲下令;船員大聲回應。 [20-30s] 他打開船首的一個鐵箱;裡面溢滿了紅色蔓越莓。 [30-40s] 敵船開火;蔓越莓以慢動作四散,同時他舉起彎刀。 視覺風格:變形鏡頭光暈、青橙調色、管弦樂配樂、無畫面文字。
說出你想聽到的,包括什麼都不要。 靜音也是一種請求。「沒有對話」、「沒有音樂,只有風聲和水聲」是指南自己舉的簡單否定範例,而且確實有效。在提示詞中完全不提聲音,跟要求沒有聲音是不一樣的。
用比你覺得足夠的更少的字來編輯。 直接引用 Google:「簡單的提示詞最適合影片編輯。過度描述性的提示詞可能導致非預期的變更。」說出變更內容,加上「其他部分保持不變」,然後停止打字。
它與 Seedance 2.5 及 Veo 3.1 相比的定位
我們提供多款影片模型,因為沒有任何一款能贏得所有鏡頭。Omni 的優勢在於單一長片段,最長 40 秒、最高 4K,自帶聲音,只需一次請求。Seedance 2.5 能接受更多參考素材(30 張圖片、10 部影片),並進行區域精確編輯。Veo 3.1 在 8 秒內提供精準的影格控制。案子只需要一支主打片段和配樂:從 Omni 開始。案子的產品必須在十二個鏡頭中看起來完全一致:從 Seedance 開始。
Popcraft 的費用按交付的秒數計算,依解析度區分:720p 用於草稿,1080p 用於交付,4K 用於主打鏡頭,串接上限為 30 秒。在滑桿上選擇 3 到 40 秒之間的任意長度;Popcraft 會在幕後自動串接延伸作業,滑桿只會提供模型能達到的長度選項,而你在生成前看到的數字就是你要支付的金額。
自己去把它玩壞吧
Gemini Omni 1.1 Flash 現已加入影片生成器,以及 Canvas 畫板和 MCP 連接器。免費體驗提供 100 點數,無需綁卡。照我們的方式做:先以 720p 生成 10 秒,評估效果後再延伸,或是帶入你已經喜歡的片段來延伸。預告片及其延伸版本都在模型頁面上,未經剪輯,聲音一應俱全;那兩段 30 秒的測試就是你剛才看過的。
資料來源:Google 的「Introducing Gemini Omni」和「Gemini Omni 1.1 Flash lets you build with more control」文章、Google DeepMind 的 Gemini Omni Flash 模型說明卡、Gemini Enterprise Agent Platform 的 Omni Flash 和 Omni 1.1 Flash 模型頁面,以及 Gemini API 開發者指南。測量數據為我們自行量測,日期為 2026 年 9 月 3 日。



