Versi ringkas, untuk anda yang tidak mahu membaca keseluruhan artikel. Gemini Omni 1.1 Flash ialah model video serba guna Google: masukkan teks, gambar atau klip video, dapatkan output video lengkap dengan bunyi. Versi 1.1 (27 Ogos 2026) menambah dua ciri penting untuk kerja sebenar: pelanjutan adegan sehingga 40 saat dan output resolusi 1080p/4K. Kini ia sudah tersedia di Popcraft. Kami telah mengujinya sepanjang hari, dan penemuan paling berguna ialah: arahan "lanjutkan sehingga 20 saat" pada klip 5 saat akan menghasilkan klip 25 saat.
| Kata Google | Hasil ujian kami | |
|---|---|---|
| Tempoh klip maksimum | 40 s melalui pelanjutan adegan, dalam kenaikan 10 s | 40.0 s daripada satu gesaan, masa pemprosesan 23 minit |
| Pelanjutan | "Menganalisis konteks sebelum ini sehingga 10 saat" | Sumber 5 s → fail 25.0 s, video asal dikekalkan bingkai demi bingkai |
| Resolusi | 360p hingga 4K, "sesuai untuk pengeluaran profesional" | Treler 1080p, ujian 720p; rantaian 4K berhenti pada 30 s |
| Audio | Ucapan, muzik, kesan bunyi seiring dengan gambar | Skor orkestra pada treler, bunyi ribut pada klip pelanjutan |
| Fizik | "Memahami secara intuitif daya seperti graviti, tenaga kinetik dan dinamik bendalir" | Ujian dakwat dalam air 30 s dengan tiga cecair yang berkelakuan betul, dipaparkan di bawah |
| Pergerakan kamera | Petikan rakan kongsi: "pergerakan kamera dinamik" | Drone dan orbit menjadi setiap kali; whip pan (pusingan pantas), crane (kren) dan dolly zoom dilembutkan |
Rabu, 10:41. Sistem sudah berjalan.
Batch AI mengaktifkan model itu pada gateway ujian mereka pada malam sebelumnya. Dua fakta dari pihak mereka dahulu, kerana dua fakta itulah yang menentukan cara anda menggunakan model ini: nilai resolusi ialah "4K" dan ia benar-benar memulangkan 3840×2160, dan pelanjutan ialah mod sebenar pada peringkat API, bukan helah gesaan. Semua yang lain di bawah ini adalah hasil kami menekan butang sendiri.
Tugasan pertama sengaja dibuat membosankan. Penjaga rumah api di tangga berpusing, menegak, 5 saat, 720p. Ia dikembalikan dalam masa kira-kira dua minit dengan tempoh 5.01 saat berserta bunyi angin dan hujan pada trek yang tidak diminta oleh sesiapa. Ini adalah tetapan lalai Omni: panduan pembangun Google menyatakan model ini "akan cuba menjana trek audio yang sesuai untuk video", dan ia berbuat demikian setiap kali melainkan anda mengarahkannya untuk tidak berbuat demikian.

11:20. Hasil pelanjutan 5 saat lebih lama daripada permintaan kami
Ini adalah bahagian yang paling berharga dalam catatan ini. Kami melampirkan klip 5 saat tersebut, menulis satu baris arahan ("penjaga itu melangkah keluar ke galeri lampu dan menyalakan lampu"), kemudian meminta video keseluruhan selama 20 saat.
Fail video yang diterima mempunyai panjang 25.0 saat.
Ini bukan pepijat. Catatan pelancaran Google menyatakan pelanjutan video berfungsi "dalam kenaikan 10 saat sehingga jumlah panjang terkumpul 40 saat", dan ia merujuk kepada kenaikan penuh: 5 + 10 + 10. Lima saat pertama fail baharu adalah salinan tepat video asal kami, malah bunyi ribut juga bersambung lancar di titik cantuman. Hasilnya sangat baik. Cuma ia bukan 20 saat seperti yang diminta.
Oleh itu, satu peraturan untuk sesiapa yang membangun di atas model ini, dan sebab panel Sambung di Popcraft kini menyenaraikan 15, 25 dan 35 saat untuk klip sumber 5 saat berbanding nilai kemas 10/20/30/40: anda hanya boleh mendarat pada tempoh sumber campur bahagian penuh 10 saat. Kami mengecas saat yang dipulangkan, bukan nombor yang anda taip.
"Panjangkan video dalam kenaikan 10 saat sehingga jumlah panjang terkumpul 40 saat." — Google, catatan pelancaran Omni 1.1 Flash
12:05. Empat puluh saat, satu gesaan
Kemudian yang sebenarnya kami mahukan: sebuah treler Hollywood, "Pirates of the Cranberries", 16:9, 1080p, 40 saat, satu permintaan sahaja. Popcraft menyambung proses pelanjutan secara automatik untuk anda: satu gesaan masuk, satu fail 40 saat keluar.
Proses mengambil masa 23 minit. Anggaran awal kami ialah 15 minit, jadi ini adalah kesilapan di pihak kami yang perlu diperhalusi. Hasil akhir tepat 40.0 saat, resolusi 1920×1080, dengan muzik orkestra yang dimainkan pada bahagian yang sesuai. Watak kapten, kapal, serta gred warna teal-amber kekal konsisten merentasi kesemua empat bahagian video. Konsistensi ini adalah hasil fungsi tetingkap konteks 10 saat yang dinyatakan semasa pelancaran, dan ini adalah kelebihan utama model ini.

Berikut adalah kesilapan yang berlaku, dan puncanya adalah daripada pihak kami. Gesaan yang digunakan ialah perenggan padat 240 patah perkataan dengan lima elemen: ribut, kapten, peti harta karun penuh beri kranberi, kapal lawan, dan tembakan meriam sebagai penamat. Omni mengekalkan kesemua elemen tersebut tetapi menyusun semula urutannya. Semburan beri kranberi muncul pada saat kelapan, sebelum peti yang sepatutnya melepaskannya, dan peti itu pula tidak pernah kelihatan terbuka dengan jelas. Gesaan yang terlalu padat tidak menyebabkan model gagal. Sebaliknya, kandungannya dimampatkan.
15:10. Baiklah, kami akan uji tuntas dakwaan fizik ini
Treler itu ialah ujian fizik yang buruk: terlalu banyak perkara berlaku, dan tiada siapa boleh menentukan sama ada kranberi melantun dengan betul. Oleh itu, kami menulis gesaan yang paling membosankan sepanjang hari. Sebuah tangki hitam berisi air tenang. Satu bendalir untuk setiap fasa 10 saat: setitik oren jatuh ke dalam, kepulan dakwat nila, kemudian awan pigmen putih yang disinari dari belakang. Tiada manusia, tiada cerita, satu lengkok kamera yang perlahan, 30 saat pada 1080p, satu permintaan.
Ini adalah perkara terbaik yang dihasilkan oleh model ini sepanjang hari. Titisan itu jatuh dan menghasilkan percikan berbentuk mahkota yang runtuh semula seperti sifat air. Kepulan nila bergulung masuk di belakangnya dan berbaur menerusi warna oren tanpa mana-mana warna comot menjadi kabur. Apabila awan putih tiba, cahaya belakang tersebar melaluinya dan cecair sebelumnya masih ada di bawah, masih bergerak. Lengkok kamera kekal merentasi ketiga-tiga fasa dan tidak pernah ditetapkan semula. Perhatikan titik cantuman pada saat kesepuluh dan kedua puluh: kami tidak dapat menemuinya.
Kami mulakan dengan draf yang lebih murah dahulu, kerana itulah aliran kerja yang kami syorkan. Empat varian 720p 10 saat (dakwat, madu, domino, buaian Newton) masing-masing mengambil masa lebih kurang dua minit. Hasil dakwat dan buaian Newton adalah baik, madu sedikit terlalu bersemangat, manakala domino jatuh mengikut urutan yang betul tetapi tanpa kesan berat. Dakwat menang, kami menulis versi 30 saat, dan versi 30 saat itu kembali lebih baik daripada draf. Ini tidak berlaku pada treler, di mana panjang yang lebih menyebabkan cerita menjadi lebih mampat. Tanpa cerita yang perlu dimampatkan, pelanjutan adegan memberikan faedah semata-mata.
Berdasarkan bukti ujian ini, pernyataan Google mengenai dinamik bendalir bukan sekadar promosi pemasaran.
16:40. Dan dakwaan kamera tersebut
Satu lagi dakwaan yang selalu kami baca dalam bahan pelancaran Google adalah berkaitan kamera. Petikan rakan kongsi di halaman model memuji "pergerakan kamera dinamik"nya, dan panduan gesaan Vertex menyenaraikan istilah yang diajar kepada model: drone, dolly, pan, tilt, penjejakan, crane, orbit, whip pan, serta "dolly zoom" yang ditandakan sebagai ciri lanjutan dan tidak disokong secara rasmi.
Oleh itu, kami meminta kesemua pergerakan itu dalam satu rakaman 30 saat, menggunakan rumah api yang sama seperti pada waktu pagi, dengan satu pergerakan untuk setiap bahagian gesaan.
Markah diberikan untuk setiap pergerakan, dibandingkan dengan gesaan:
- Drone approach (dron menghampiri). Berjaya. Kamera meluncur di atas puncak ombak, mendaki batuan basalt, dan tiba di bilik lampu tepat pada saat yang kami minta. Ini pergerakan kamera terbaik yang kami peroleh sepanjang hari.
- Orbit. Berjaya. Sepuluh saat terakhir mengelilingi penjaga itu dari belakang, melalui sisi profil, sehingga ke pandangan luas di bahagian bertentangan, dan rumah api itu kekal rumah api yang sama sepanjang pergerakan.
- Whip pan ke arah bot. Tidak. Bot itu ada, kecil di ufuk, tetapi kamera hanyut ke arahnya dan bukannya menyentap. Model melembutkan pergerakan pantas itu menjadi pergerakan perlahan.
- Crane up di atas bilik lampu. Separuh. Pergerakan menaik berlaku pada bahagian pertama, tempat gesaan tidak memintanya, dan bukan pada bahagian kedua, tempat gesaan memintanya.
- Low-angle push-in (mendekat dari sudut rendah) dengan rack focus. Tidak. Ia berakhir dengan pandangan luas sebaliknya.
- Dolly zoom. Kami sengaja tidak memasukkannya dalam gesaan 30 saat. Dalam ujian 10 saat terdahulu, ia kembali sebagai pergerakan mendekat biasa, dan panduan Google sendiri meletakkannya di bawah "tidak disokong secara rasmi", jadi yang itu adil.
Dua perkara yang tidak diminta oleh sesiapa. Di antara bahagian pertama dan kedua, kamera menembusi terus kaca bilik lampu untuk mencari penjaga di dalamnya, kemudian mengikutnya keluar pintu ke galeri lampu. Tiada satu pun potongan di dalam fail tersebut (kami telah menjalankan pengesan adegan ke atasnya), jadi model tersebut telah mencipta peralihan sendiri untuk berpindah dari kedudukan dron ke kedudukan wanita itu. Ia adalah ciptaan yang baik. Yang kurang baik: rambutnya diikat kemas di dalam bilik lampu tetapi longgar di galeri lampu hanya beberapa saat kemudian. Kad model Google menyenaraikan "ketekalan merentas suntingan" dan "gerakan kompleks" sebagai had yang diketahui, dan inilah rupa sebenar had tersebut dalam penggunaan.
Corak yang diperhatikan merentas ujian 10 dan 30 saat ialah pergerakan perlahan dan meluas (drone, orbit, arc, dolly) adalah stabil, manakala pergerakan pantas atau optik (whip pan, dolly zoom) dibundarkan menjadi sesuatu yang lebih lembut. Sekiranya rakaman anda memerlukan sentapan, jana ia sebagai klip pendek berasingan kemudian cantumkan.
Pengajaran dalam penggunaan gesaan adalah sama seperti kes treler. Nyatakan nama pergerakan, satu untuk setiap bahagian, menggunakan istilah daripada panduan rasmi Google, dan pergerakan perlahan akan dihasilkan dengan tepat. Jika anda hanya menghuraikan perasaan seperti "menyeluruh" atau "dinamik", anda tetap akan mendapat pergerakan kamera masuk perlahan sahaja.
Apakah perbezaan sebenar berbanding Omni Flash 1.0?
Halaman model Google menggunakan jadual keupayaan yang sama untuk kedua-dua versi, jadi perbezaan yang dinyatakan adalah sangat telus:
| Keupayaan | Omni Flash (Mei 2026) | Omni 1.1 Flash (Ogos 2026) |
|---|---|---|
| Teks-ke-video | Ya | Ya |
| Imej-ke-video | Tidak disokong | Disokong |
| Imej / video rujukan | Tidak disokong | Sehingga 10 imej, 3 video |
| Bingkai pertama dan terakhir | Tidak disokong | Disokong |
| Suntingan video | Disokong | Disokong |
| Lanjutkan video | Tidak disokong | Disokong, sehingga 40 saat |
| Resolusi output | 720p sahaja | 360p, 720p, 1080p, 4K |
| Penjanaan bunyi | Ucapan, muzik, kesan | Ucapan, muzik, kesan |
| Provenans | SynthID, C2PA | SynthID, C2PA |
Dakwaan mengenai fizik dan pengetahuan dunia daripada catatan asal "Memperkenalkan Gemini Omni" ("pemahaman intuitif yang lebih baik terhadap daya seperti graviti, tenaga kinetik dan dinamik bendalir") masih dikekalkan, dan kami kembali menguji dakwaan itu secara khusus, seperti di bawah. Walau bagaimanapun, perkara yang Google tonjolkan ialah memori: "setiap arahan dibina di atas arahan sebelumnya. Watak anda kekal konsisten, fizik berfungsi dengan betul dan adegan mengingati perkara yang berlaku sebelum ini." Selepas treler tersebut, kami lebih mempercayai separuh kedua ayat itu daripada yang kami jangkakan.
Bagaimana memberikan arahan tanpa perlu menukar mod?
Tidak ada tetapan sedemikian, dan anda memerlukan sedikit masa untuk membiasakan diri dengan ini. Panduan Google menyatakan: "kami mengesyorkan agar anda utamakan penggunaan gesaan, dan hanya gunakan parameter tugas sekiranya gesaan tidak memberikan hasil yang diingini." Fail yang anda lampirkan dan huraian yang anda tulis adalah yang menentukan jenis operasi yang akan dijalankan.
- Tiada fail dilampirkan: mod teks-ke-video.
- Satu imej: imej tersebut akan menjadi bingkai pertama.
- Dua imej ditambah perkataan "bingkai pertama" dan "bingkai terakhir": interpolasi antara kedua-dua imej. Tanpa perkataan tersebut, dua imej akan dianggap sebagai rujukan subjek.
- Sehingga sepuluh imej: rujukan subjek; orang dan objek akan kekal konsisten.
- Video ditambah arahan "buat salji turun": suntingan yang mengekalkan sudut rakaman, tempoh dan bingkai.
- Video ditambah arahan "lanjutkan video ini": pelanjutan adegan.
Kedua-dua perkara ini sering tidak disedari pengguna. Jika anda melampirkan klip dan menerangkan sambungan tanpa menggunakan perkataan extend, model akan menganggapnya sebagai suntingan dan mengeluarkan klip dengan tempoh yang sama. Popcraft akan menambah kata kunci tersebut secara automatik di panel Sambung Video; manakala pengguna API atau MCP perlu menulisnya sendiri.
Perkara yang akan kami beritahu rakan sekerja sebelum mereka menjana klip 40 saat pertama
Ini bukan senarai petua. Tiga perkara utama, mengikut urutan yang paling kerap menimbulkan masalah.
Satu tindakan untuk setiap bahagian. Panduan Google mendokumentasikan sintaks kod masa, dan ia sepadan sepenuhnya dengan bahagian 10 saat. Ini adalah gesaan treler yang sepatutnya kami hantar:
Kapal lanun galleon ketika ribut pada waktu senja, bendera tengkorak, layar hitam koyak. Rakaman berterusan satu bahagian, tiada potongan adegan. [0-10s] Kapal membelah ombak; kamera naik ke atas dek. [10-20s] Kapten berjanggut di roda kemudi menjerit arahan; anak kapal membalas dengan sorakan. [20-30s] Dia membuka peti besi di haluan kapal; peti itu penuh dengan beri kranberi merah. [30-40s] Kapal lawan menembak; beri kranberi bertaburan dalam gerakan perlahan ketika dia mengangkat pedang. Gaya visual: suar anamorfik, gred warna teal-amber, muzik orkestra, tiada teks di skrin.
Nyatakan dengan jelas apa yang anda mahu dengar, termasuk jika anda mahu tiada apa-apa. Keheningan juga merupakan satu permintaan. Contoh seperti "tiada dialog", "tiada muzik, hanya bunyi angin dan air" adalah contoh penafian ringkas daripada panduan itu sendiri, dan ia berfungsi dengan baik. Tidak menyebut perkara berkaitan bunyi dalam gesaan bukanlah sama dengan meminta supaya tiada bunyi dihasilkan.
Sunting menggunakan perkataan sesedikit mungkin. Petua terus daripada Google: "Gesaan ringkas memberikan hasil terbaik untuk penyuntingan video. Gesaan yang terlalu terperinci boleh menyebabkan perubahan yang tidak diingini." Nyatakan sahaja perubahan yang dikehendaki, tambah frasa "kekalkan semua perkara lain", dan berhenti menulis.
Kedudukan berbanding Seedance 2.5 dan Veo 3.1
Kami menyediakan pelbagai model video kerana tiada satu model yang unggul untuk semua jenis rakaman. Kelebihan Omni ialah menjana satu klip panjang sehingga 40 saat dan resolusi sehingga 4K lengkap dengan bunyi, hanya dengan satu permintaan. Seedance 2.5 menyokong lebih banyak rujukan (30 imej, 10 video) dan membolehkan suntingan tepat mengikut kawasan. Veo 3.1 memberikan kawalan bingkai yang sangat tepat untuk klip 8 saat. Untuk arahan yang memerlukan satu klip utama dengan muzik: mulakan dengan Omni. Untuk arahan yang memerlukan produk kelihatan sama merentas dua belas rakaman: mulakan dengan Seedance.
Kos di Popcraft dikira mengikut saat video yang dihasilkan, berdasarkan resolusi: 720p untuk draf, 1080p untuk hasil akhir, 4K untuk klip utama dengan had panjang maksimum 30 saat. Pilih mana-mana panjang antara 3 hingga 40 saat pada peluncur; Popcraft akan menjalankan lanjutan automatik di latar belakang, peluncur hanya memaparkan panjang yang disokong oleh model, dan jumlah kos yang dipaparkan sebelum penjanaan adalah jumlah sebenar yang akan dikenakan.
Cuba sendiri dan terokai hadnya
Gemini Omni 1.1 Flash kini tersedia di penjana video, papan kerja Canvas dan penyambung MCP. Anda boleh mencubanya secara percuma dengan 100 kredit awal, tiada kad kredit diperlukan. Ikut cara kami: 10 saat pada 720p dahulu, nilaikannya, kemudian lanjutkan; atau bawa klip sedia ada yang anda suka dan lanjutkan klip itu. Treler serta klip pelanjutan yang tidak disunting, lengkap dengan bunyi, boleh didapati di halaman model; kedua-dua ujian 30 saat pula adalah klip yang baru anda tonton.
Sumber: Catatan Google "Memperkenalkan Gemini Omni" dan "Gemini Omni 1.1 Flash membolehkan pembinaan dengan kawalan lebih baik", kad model Google DeepMind untuk Gemini Omni Flash, halaman model Gemini Enterprise Agent Platform untuk Omni Flash dan Omni 1.1 Flash, serta panduan pembangun API Gemini. Semua ukuran adalah ujian sendiri kami, dijalankan pada 3 September 2026.



