NEW下一個爆款 UGC 廣告,一鍵即成。立即體驗 Studio立即製作廣告
PopcraftPopcraft
我們讓 Gemini Omni 1.1 Flash 跑了一整天。這是那支 40 秒短片,以及它花了多少錢。
產品閱讀時間 2 分鐘

我們讓 Gemini Omni 1.1 Flash 跑了一整天。這是那支 40 秒短片,以及它花了多少錢。

給不想往下看的讀者的簡短版本。 Gemini Omni 1.1 Flash 是 Google 一款全能影片模型:輸入文字、圖片或影片片段,就能輸出自帶聲音的影片。1.1 版本(2026 年 8 月 27 日)新增了兩項對實際工作至關重要的功能:場景延伸至 40 秒,以及 1080p/4K 輸出。現已於 Popcraft 上線。我們花了一天時間測試,學到最實用的一件事是:從 5 秒片段「延伸至 20 秒」,實際會得到 25 秒。

Google 官方說法我們的實測結果
最長片段透過場景延伸達 40 秒,以 10 秒為增量單一提示詞生成 40.0 秒,耗時 23 分鐘
延伸「分析先前最多 10 秒的上下文」5 秒來源 → 25.0 秒檔案,原始影格逐格保留
解析度360p 至 4K,「可投入專業製作」1080p 預告片、720p 測試;4K 串接在 30 秒停止
音訊語音、音樂、音效搭配畫面預告片配有管弦樂配樂,延伸片段配有暴風雨環境音
物理「直觀理解重力、動能和流體動力學等力量」一段 30 秒的水中墨跡作品,包含三種表現合理的流體,見下方
攝影機合作夥伴引言:「動態攝影機運動」無人機和環繞每次都成功;快速橫搖、升降鏡頭和 dolly zoom 會被柔化

星期三,10:41。開始了。

Batch AI 在前一晚於他們的測試閘道上開啟了這個模型。先說明他們那邊的兩個事實,因為由他們決定你怎麼使用這東西:解析度字串是「4K」,而且確實會回傳 3840×2160,另外 extension 在 API 上是正式模式,不是提示詞花招。以下其他內容都是我們在按按鈕測試。

第一個任務刻意設計得很無聊。一個守塔人在螺旋樓梯上,直式,5 秒,720p。大約兩分鐘後回傳了 5.01 秒的影片,還附帶了沒人要求的風雨聲軌。這就是 Omni 的預設行為:Google 的開發者指南寫道,模型「會嘗試為影片生成合適的音軌」,而且每次都會這麼做,除非你明確告訴它不要。

一段由 Gemini Omni 1.1 Flash 在 Popcraft 上透過單一提示詞生成的 40 秒預告片

11:20。那個比我們要求的多 5 秒的延伸

這才是這篇文章值回票價的部分。我們附上了那段 5 秒的影片,寫了一行提示詞(「守燈人走上燈廊並點亮油燈」),然後要求生成總長 20 秒的影片。

回傳的檔案長度為 25.0 秒。

這不是 bug。Google 的發布文章寫道,延伸功能「以 10 秒為單位遞增,累計總長度最多 40 秒」,而且它指的是完整的遞增單位:5 加 10 再加 10。新檔案的前五秒就是我們的原始片段,逐位元組完全一致,暴風雨的音效也無縫跨越了接合處。看起來棒極了。只是它不是 20 秒。

所以給所有使用這款模型的人一條規則,也是 Popcraft 的延伸面板現在對 5 秒來源列出 15、25 和 35,而非整齊的 10/20/30/40 的原因:你只能落在來源加上完整段落的長度上。我們計費的是實際回傳的秒數,而不是你輸入的數字。

「以 10 秒為單位延伸影片,累計總長度最多 40 秒。」——Google,Omni 1.1 Flash 發布文章

12:05. 四十秒,一組提示詞

接著是我們真正想要的:一部好萊塢預告片,「蔓越莓海盜」,16:9,1080p,40 秒,單一請求。Popcraft 會自動為你串接延伸流程:輸入一組提示詞,輸出一個 40 秒的檔案。

花了 23 分鐘。我們自己的預估說是 15 分鐘,所以那是我們需要重新調整的。結果正好是 40.0 秒,1920×1080,配樂的管弦樂編曲在大概對的地方漸強。同一位船長、同一艘船、同樣的青橙調色貫穿全部四個段落。這種一致性正是發布文章中提到的 10 秒上下文視窗在發揮作用,也是這個模型最有力的論點。

三艘船航行在撒滿蔓越莓的海面上,取自 40 秒的 Omni 算圖

以下是它出錯的地方,以及為什麼是我們的錯。提示詞是一個多達 240 字的密集段落,包含五個節拍:暴風雨、船長、裝滿蔓越莓的寶箱、敵船、大砲收尾。Omni 保留了每個元素,但重新排列了順序。蔓越莓噴濺出現在第八秒,早於本該釋放它的寶箱,而且寶箱始終沒有明顯打開。密集的提示詞在這款模型上不會失敗,而是會被壓縮。

15:10。好吧,我們來好好測試一下物理模擬的說法

那支預告片是個糟糕的物理測試:同時發生太多事,沒人能說得準蔓越莓彈跳得對不對。所以我們寫了當天最無聊的提示詞。一座盛著靜水的黑色水槽。每 10 秒段落一種流體:一滴橙色水滴落入、一團靛藍墨水湧出,然後是一朵從背後打光的白色顏料雲。沒有人物、沒有故事、一個緩慢的攝影機弧形運動,30 秒 1080p,一次請求。

這是模型整天生成的最佳作品。水滴落下,激起一頂皇冠狀的水花,然後像真實的水一樣塌落回去。靛藍墨柱在後方捲起,穿過橙色區域時兩種顏色都沒有暈染成模糊的一片。當白色雲霧湧入時,背光穿透散射其中,而先前的流體依然在底層清晰可見,持續流動。攝影機的弧形運動貫穿了全部三個段落,從未重置。看看十秒和二十秒處的接合點:我們找不到任何痕跡。

先從較便宜的草稿開始,因為這是我們推薦的工作流程。四支 10 秒 720p 的變體(墨水、蜂蜜、骨牌、牛頓擺)各花了大約兩分鐘。墨水和牛頓擺效果不錯,蜂蜜有點太躁動了,骨牌按正確順序倒下但缺乏重量感。墨水勝出,我們寫了 30 秒版本,而 30 秒版本回傳的結果比草稿更好。預告片的情況則不然,更長的長度意味著故事被壓縮得更厲害。當沒有故事需要壓縮時,延伸就只有好處。

根據這些證據來看,Google 關於流體動力學的那句話,並不是行銷話術。

16:40。還有攝影機的宣稱

我們在 Google 發表資料中不斷看到的另一個宣稱是關於攝影機的。模型頁面上的一段合作夥伴引言稱讚其「動態攝影機運動」,而 Vertex 提示詞指南列出了模型被教導的詞彙:drone、dolly、pan、tilt、tracking、crane、orbit、whip pan,以及一個被標記為進階且未正式支援的「dolly zoom」。

所以我們在同一個 30 秒鏡頭中要求了以上全部,場景是早上的同一座燈塔,提示詞的每個節拍對應一個運鏡。

逐個運鏡評分,對照提示詞:

  • 無人機接近。 成功。掠過浪尖,攀升過玄武岩,在我們指定的秒數準時抵達燈室。這是模型整天給我們最棒的十秒攝影機運動。
  • 環繞。 成功。最後十秒從守塔人背後環繞,經過側面,到另一側的遠景,而燈塔始終是同一座燈塔。
  • 快速橫搖至船隻。 失敗。船在那裡,在地平線上顯得渺小,但攝影機是漂移過去而非快速對準。模型把快速運動柔化成了慢速。
  • 升降鏡頭越過燈室上升。 一半。上升發生在第一段,也就是提示詞沒有要求的地方,而非提示詞確實有要求的第二段。
  • 低角度推進搭配移焦。 失敗。最終停在遠景。
  • Dolly zoom。 我們刻意將它從 30 秒提示詞中排除。在先前 10 秒的測試中,它回傳的結果只是普通的推進,而 Google 自己的指南將其歸類為「非官方支援」,所以這個結果很合理。

兩件沒人要求的事。在第一段與第二段之間,攝影機直接穿過燈室玻璃找到裡面的守塔人,然後跟著她走出門來到觀景台。檔案中沒有任何剪接點(我們用場景偵測器跑過一遍),所以模型自己發明了一個轉場,從無人機的位置轉到她那裡。這是個不錯的發明。比較不好的是:她的頭髮在燈室裡是盤起來的,幾秒後到了觀景台卻放了下來。Google 的模型說明卡將「編輯間的一致性」和「複雜運動」列為已知限制,而這就是實際呈現的樣子。

在 10 秒和 30 秒的測試中,我們發現的規律是:緩慢、大範圍的運動(無人機、環繞、弧形、推軌)都很可靠,而快速或光學類的運動(快速橫搖、dolly zoom)則會被柔化成較平緩的效果。如果你的鏡頭需要俐落的瞬間切換,請把它獨立生成為短片段,再剪接進去。

提示詞的教訓跟預告片的一樣。用 Google 自己指南中的詞彙命名運鏡,每個節拍一個,慢的運鏡就會準時出現。描述一種感覺(「橫掃」、「動態」),結果無論如何都是緩慢推進。

從 Omni Flash 1.0 到底改變了什麼?

Google 的模型頁面為兩個版本使用了相同的能力表格,因此差異顯得格外誠實:

能力Omni Flash(2026 年 5 月)Omni 1.1 Flash(2026 年 8 月)
文字生成影片
圖片生成影片不支援支援
參考圖片 / 影片不支援最多 10 張圖片、3 部影片
首影格與尾影格不支援支援
影片編輯支援支援
延伸影片不支援支援,最長 40 秒
輸出解析度僅 720p360p、720p、1080p、4K
聲音生成語音、音樂、音效語音、音樂、音效
來源標記SynthID、C2PASynthID、C2PA

原始「Introducing Gemini Omni」文章中關於物理與世界知識的宣稱(「對重力、動能和流體動力學等力量的直覺理解有所提升」)延續了下來,我們也刻意回頭測試了那一部分,如下所示。不過,Google 主打的是記憶力:「每個指令都建立在前一個之上。你的角色保持一致,物理規則經得起考驗,場景也會記住之前發生的事。」看完預告片後,我們對這句話後半段的信任度比預期高出許多。

不切換模式的話,你要怎麼告訴它該做什麼?

你不需要,而這需要一點時間來習慣。Google 的指南:「我們建議主要依賴提示詞,僅在提示詞無效時才使用 task 參數。」你附加什麼、寫下什麼,就是切換的關鍵。

  • 未附加任何內容:文字生成影片。
  • 一張圖片:該圖片成為第一個影格。
  • 兩張圖片,加上「first frame」和「last frame」字詞:在兩者之間進行插值。若沒有這些字詞,兩張圖片則作為主體參考。
  • 最多十張圖片:主體參考;人物與物件保持一致。
  • 一部影片加上「make it snow」:保留鏡頭、長度與構圖的編輯。
  • 一部影片加上「extend this video」:場景延伸。

最後兩點最容易讓人出錯。如果你附加了一段影片並描述後續內容,卻沒有使用 extend 這個詞,模型會將其視為編輯,並回傳相同長度。Popcraft 會在「延伸影片」面板上自動為你加上這個關鍵字;若透過 API 或 MCP 操作,則需要自行撰寫。

在同事第一次進行 40 秒算圖前,我們會告訴他們什麼

不是技巧清單。三件事,按照它們會讓你踩雷的順序排列。

每個段落一個動作。 Google 的指南記載了時間碼語法,而且它完美對應到 10 秒段落。這是我們當初應該送出的預告片提示詞:

黃昏暴風雨中的海盜帆船,骷髏旗,破損的黑帆。單一連續鏡頭,無場景剪接。 [0-10s] 船隻衝破海浪;攝影機升至甲板。 [10-20s] 鬍子船長在舵輪旁高聲下令;船員大聲回應。 [20-30s] 他打開船首的一個鐵箱;裡面溢滿了紅色蔓越莓。 [30-40s] 敵船開火;蔓越莓以慢動作四散,同時他舉起彎刀。 視覺風格:變形鏡頭光暈、青橙調色、管弦樂配樂、無畫面文字。

說出你想聽到的,包括什麼都不要。 靜音也是一種請求。「沒有對話」、「沒有音樂,只有風聲和水聲」是指南自己舉的簡單否定範例,而且確實有效。在提示詞中完全不提聲音,跟要求沒有聲音是不一樣的。

用比你覺得足夠的更少的字來編輯。 直接引用 Google:「簡單的提示詞最適合影片編輯。過度描述性的提示詞可能導致非預期的變更。」說出變更內容,加上「其他部分保持不變」,然後停止打字。

它與 Seedance 2.5 及 Veo 3.1 相比的定位

我們提供多款影片模型,因為沒有任何一款能贏得所有鏡頭。Omni 的優勢在於單一長片段,最長 40 秒、最高 4K,自帶聲音,只需一次請求。Seedance 2.5 能接受更多參考素材(30 張圖片、10 部影片),並進行區域精確編輯。Veo 3.1 在 8 秒內提供精準的影格控制。案子只需要一支主打片段和配樂:從 Omni 開始。案子的產品必須在十二個鏡頭中看起來完全一致:從 Seedance 開始。

Popcraft 的費用按交付的秒數計算,依解析度區分:720p 用於草稿,1080p 用於交付,4K 用於主打鏡頭,串接上限為 30 秒。在滑桿上選擇 3 到 40 秒之間的任意長度;Popcraft 會在幕後自動串接延伸作業,滑桿只會提供模型能達到的長度選項,而你在生成前看到的數字就是你要支付的金額。

自己去把它玩壞吧

Gemini Omni 1.1 Flash 現已加入影片生成器,以及 Canvas 畫板和 MCP 連接器。免費體驗提供 100 點數,無需綁卡。照我們的方式做:先以 720p 生成 10 秒,評估效果後再延伸,或是帶入你已經喜歡的片段來延伸。預告片及其延伸版本都在模型頁面上,未經剪輯,聲音一應俱全;那兩段 30 秒的測試就是你剛才看過的。

資料來源:Google 的「Introducing Gemini Omni」和「Gemini Omni 1.1 Flash lets you build with more control」文章、Google DeepMind 的 Gemini Omni Flash 模型說明卡、Gemini Enterprise Agent Platform 的 Omni Flash 和 Omni 1.1 Flash 模型頁面,以及 Gemini API 開發者指南。測量數據為我們自行量測,日期為 2026 年 9 月 3 日。

常見問題

什麼是 Gemini Omni 1.1 Flash?
Google 的影片模型,DeepMind 將其描述為邁向能從任何輸入建立與編輯任何內容的模型的一步,並從影片開始。單一模型涵蓋文字轉影片、圖片轉影片、首尾影格插值、主體參考、影片編輯與場景延伸,還能同步生成語音、音樂與音效。1.1 版於 2026 年 8 月 27 日發布。
Gemini Omni 影片最長可以多長?
每次生成作業最長為 10 秒。場景延伸以 10 秒為單位增長影片,累計最長可達 40 秒,模型會讀取先前最多 10 秒的內容以維持連貫性。在 Popcraft 上,你可以用一個滑桿選擇 3 到 40 秒之間的任意長度,Popcraft 會根據你的單一提示詞自動串接延伸流程。在 4K 解析度下,串接會在 30 秒時停止。
Omni 1.1 相較於 Omni Flash 1.0 有什麼新功能?
新增了場景延伸、首尾影格插值、1080p 與 4K 輸出,以及參考影片功能。在 Google 的模型頁面上,1.0 的卡片列出圖片轉影片、參考、關鍵影格與延伸為不支援,且僅支援 720p;而 1.1 的卡片則將上述功能全部列為支援。
我要如何在 Popcraft 上試用 Gemini Omni 1.1 Flash?
開啟影片生成器,選擇 Gemini Omni 1.1 Flash,挑選長度和解析度,如果有參考素材或來源影片就加入,然後生成。免費開始使用,提供 100 點數且無需信用卡,也可在 Canvas 畫板和透過 Popcraft MCP 連接器使用。

準備好親自體驗了嗎?立即開始使用 Popcraft。

試用 Gemini Omni 1.1 Flash