Versi singkatnya, bagi yang tidak akan membaca lebih lanjut. Gemini Omni 1.1 Flash adalah model video serbaguna dari Google: teks, gambar, atau klip masuk, video lengkap dengan suaranya keluar. Versi 1.1 (27 Agustus 2026) menambahkan dua hal yang penting untuk pekerjaan nyata: perpanjangan adegan hingga 40 detik dan output 1080p/4K. Sekarang sudah tersedia di Popcraft. Kami menghabiskan satu hari menggunakannya, dan hal paling berguna yang kami pelajari adalah bahwa "perpanjang hingga 20 detik" dari klip 5 detik akan menghasilkan 25 detik.
| Kata Google | Hasil kami | |
|---|---|---|
| Klip terpanjang | 40 dtk dengan perpanjangan adegan, dalam kelipatan 10 dtk | 40,0 dtk dari satu prompt, 23 menit waktu proses |
| Perpanjangan | "Menganalisis hingga 10 detik konteks sebelumnya" | Sumber 5 dtk → file 25,0 dtk, aslinya dipertahankan bingkai demi bingkai |
| Resolusi | 360p hingga 4K, "siap untuk produksi profesional" | Trailer 1080p, tes 720p; rantai 4K berhenti di 30 dtk |
| Audio | Ucapan, musik, efek suara bersama gambar | Skor orkestra pada trailer, latar badai pada perpanjangan |
| Fisika | "Pemahaman intuitif tentang gaya seperti gravitasi, energi kinetik, dan dinamika fluida" | Karya tinta dalam air 30 dtk dengan tiga cairan yang berperilaku wajar, di bawah |
| Kamera | Kutipan mitra: "pergerakan kamera dinamis" | Drone dan orbit selalu berhasil; whip pan, crane, dan dolly zoom dilembutkan |
Rabu, 10:41. Kita mulai.
Batch AI mengaktifkan model di gateway pengujian mereka pada malam sebelumnya. Dua fakta dari sisi mereka terlebih dahulu, karena kedua fakta itulah yang menentukan bagaimana Anda menggunakan model ini: string resolusinya adalah "4K" dan benar-benar menghasilkan 3840×2160, serta perpanjangan adalah mode tersendiri di level API, bukan trik prompt. Semua hal lainnya di bawah ini adalah kami yang menekan tombol.
Tugas pertama sengaja dibuat membosankan. Seorang penjaga mercusuar di tangga spiral, vertikal, 5 detik, 720p. Hasilnya kembali dalam sekitar dua menit dengan durasi 5,01 detik, lengkap dengan angin dan hujan di trek audio yang tidak diminta siapa pun. Itulah default Omni: panduan pengembang Google menyatakan model "akan mencoba menghasilkan trek audio yang sesuai untuk sebuah video", dan memang begitu setiap kali, kecuali Anda memintanya untuk tidak melakukannya di dalam prompt.

11:20. Perpanjangan yang 5 detik lebih panjang dari yang kami minta
Inilah bagian yang sepadan dengan harga postingan ini. Kami melampirkan klip 5 detik, menulis satu baris ("penjaga itu melangkah keluar ke galeri lampu dan menyalakan lampunya"), dan meminta total 20 detik.
File yang dihasilkan berdurasi 25,0 detik.
Bukan bug. Postingan peluncuran Google menyatakan perpanjangan bekerja "dalam kelipatan 10 detik hingga total panjang kumulatif 40 detik", dan yang dimaksud adalah kelipatan bulat: 5 ditambah 10 ditambah 10. Lima detik pertama dari file baru adalah asli milik kami, byte demi byte, dan audio badai berlanjut mulus melintasi sambungannya. Hasilnya tampak hebat. Hanya saja bukan 20 detik.
Jadi aturan bagi siapa pun yang membangun di atas model ini, dan alasan panel Extend Popcraft sekarang mencantumkan 15, 25, dan 35 untuk sumber 5 detik alih-alih angka rapi 10/20/30/40: Anda hanya bisa mendarat di sumber ditambah segmen utuh. Kami menagih detik yang dihasilkan, bukan angka yang Anda ketikkan.
"Perpanjang video dalam kelipatan 10 detik hingga total panjang kumulatif 40 detik." — Google, postingan peluncuran Omni 1.1 Flash
12:05. Empat puluh detik, satu prompt
Lalu yang sebenarnya kami inginkan: trailer Hollywood, "Pirates of the Cranberries", 16:9, 1080p, 40 detik, satu permintaan. Popcraft secara otomatis merantai proses perpanjangan untuk Anda: satu prompt masuk, satu file 40 detik keluar.
Butuh 23 menit. Estimasi kami sendiri menyebut 15, jadi itu tanggung jawab kami untuk menyetel ulang. Hasilnya tepat 40,0 detik, 1920×1080, dengan musik orkestra yang mengembang di tempat yang kurang lebih tepat. Kapten yang sama, kapal yang sama, gradasi teal-dan-amber yang sama di keempat segmen. Konsistensi itu adalah hasil kerja jendela konteks 10 detik dari postingan peluncuran, dan itulah argumen terkuat untuk model ini.

Inilah yang salah, dan mengapa itu kesalahan kami. Prompt-nya adalah paragraf padat 240 kata dengan lima adegan: badai, kapten, peti harta karun penuh cranberry, kapal saingan, dan finale meriam. Omni mempertahankan setiap elemen tetapi mengacak urutannya. Semprotan cranberry muncul di detik kedelapan, sebelum peti yang seharusnya melepaskannya, dan peti itu tidak pernah terbuka dengan jelas. Prompt padat tidak gagal pada model ini. Prompt tersebut dipadatkan.
15:10. Baiklah, kami akan menguji klaim fisika dengan benar
Trailer tersebut adalah uji fisika yang buruk: terlalu banyak yang terjadi, dan tidak ada yang bisa mengatakan apakah sebuah cranberry memantul dengan benar. Jadi kami menulis prompt paling membosankan hari itu. Sebuah tangki hitam berisi air diam. Satu cairan per segmen 10 detik: setetes oranye jatuh ke dalamnya, kepulan tinta indigo, lalu awan pigmen putih yang disinari dari belakang. Tanpa orang, tanpa cerita, satu lengkungan kamera lambat, 30 detik pada 1080p, satu permintaan.
Ini adalah hal terbaik yang dihasilkan model ini sepanjang hari. Tetesannya menghantam dan memercikkan crown splash yang runtuh kembali seperti halnya air. Semburan indigo bergulung di belakangnya dan melipat melalui warna oranye tanpa kedua warna tersebut tercoreng menjadi kabur. Ketika awan putih tiba, cahaya latar menyebar menembusnya dan cairan sebelumnya masih ada di bawahnya, masih bergerak. Lengkungan kamera bertahan melalui ketiga segmen dan tidak pernah direset. Perhatikan sambungannya di detik kesepuluh dan kedua puluh: kami tidak dapat menemukannya.
Draf kami yang lebih murah terlebih dahulu, karena itulah alur kerja yang kami rekomendasikan. Empat varian 720p 10 detik (tinta, madu, domino, ayunan Newton) masing-masing memakan waktu sekitar dua menit. Tinta dan ayunan hasilnya bagus, madu sedikit terlalu bersemangat, domino jatuh dalam urutan yang benar tetapi tanpa bobot. Tinta menang, kami menulis versi 30 detik, dan versi 30 detik hasilnya lebih baik dari draf. Tidak demikian dengan trailer, di mana durasi lebih panjang berarti lebih banyak kompresi cerita. Tanpa cerita untuk dikompresi, perpanjangan adalah keuntungan murni.
Pernyataan Google tentang dinamika fluida, berdasarkan bukti ini, bukanlah sekadar pemasaran.
16:40. Dan klaim kameranya
Klaim lain yang terus kami baca di materi peluncuran Google adalah tentang kamera. Kutipan mitra di halaman model memuji "gerakan kamera dinamis"-nya, dan panduan prompt Vertex mencantumkan kosakata yang diajarkan kepada model: drone, dolly, pan, tilt, tracking, crane, orbit, whip pan, dan "dolly zoom" yang ditandai sebagai lanjutan dan tidak didukung secara resmi.
Jadi kami meminta semuanya dalam satu shot 30 detik, pada mercusuar yang sama dari pagi hari, satu gerakan per ketukan prompt.
Dinilai gerakan demi gerakan, terhadap prompt:
- Pendekatan drone. Ya. Menyusuri puncak ombak, mendaki basal, tiba di lentera tepat pada detik yang kami minta. Sepuluh detik pergerakan kamera terbaik yang diberikan model ini kepada kami sepanjang hari.
- Orbit. Ya. Sepuluh detik terakhir mengitari penjaga dari belakang, melalui profil, hingga sudut lebar di sisi jauh, dan mercusuar tetap mercusuar yang sama sepanjang waktu.
- Whip pan ke perahu. Tidak. Perahu itu ada di sana, kecil di cakrawala, tetapi kamera melayang ke arahnya alih-alih bergerak cepat. Model melembutkan gerakan cepat menjadi lambat.
- Crane ke atas melewati lentera. Setengah. Kenaikan terjadi di segmen pertama, padahal prompt tidak memintanya, dan tidak di segmen kedua, padahal prompt memintanya.
- Push-in sudut rendah dengan rack focus. Tidak. Malah berakhir pada sudut lebar.
- Dolly zoom. Kami sengaja tidak memasukkannya ke dalam prompt 30 detik. Dalam tes 10 detik sebelumnya, hasilnya kembali sebagai push-in biasa, dan panduan Google sendiri mengkategorikannya sebagai "tidak didukung secara resmi", jadi yang satu ini wajar.
Dua hal yang tidak diminta siapa pun. Antara segmen pertama dan kedua, kamera menembus langsung kaca lentera untuk menemukan penjaga di dalamnya, lalu mengikutinya keluar pintu menuju galeri. Tidak ada potongan di mana pun dalam file ini (kami menjalankan pendeteksi adegan pada file tersebut), jadi model menciptakan transisi untuk berpindah dari posisi drone ke posisinya. Itu penemuan yang bagus. Yang kurang bagus: rambutnya disanggul di dalam lentera dan terurai di galeri beberapa detik kemudian. Kartu model Google mencantumkan "konsistensi di seluruh pengeditan" dan "gerakan kompleks" sebagai keterbatasan yang diketahui, dan beginilah wujudnya dalam praktik.
Polanya, baik pada uji 10 maupun 30 detik, adalah bahwa gerakan lambat dan menyapu (drone, orbit, arc, dolly) dapat diandalkan, sementara gerakan cepat atau optik (whip pan, dolly zoom) menjadi lebih halus. Jika shot Anda memerlukan sentakan cepat, hasilkan sebagai klip pendek tersendiri lalu sisipkan saat editing.
Pelajaran prompting-nya sama dengan trailer. Sebutkan gerakannya, satu per ketukan, dalam kosakata dari panduan Google sendiri, dan yang lambat akan tiba tepat waktu. Deskripsikan sebuah perasaan ("sweeping", "dynamic") dan Anda akan mendapatkan push-in lambat bagaimanapun juga.
Apa yang sebenarnya berubah dari Omni Flash 1.0?
Halaman model Google menggunakan tabel kapabilitas yang sama untuk kedua versi, jadi perbedaannya sangat jujur:
| Kapabilitas | Omni Flash (Mei 2026) | Omni 1.1 Flash (Agu 2026) |
|---|---|---|
| Teks-ke-video | Ya | Ya |
| Gambar-ke-video | Tidak didukung | Didukung |
| Gambar / video referensi | Tidak didukung | Hingga 10 gambar, 3 video |
| Bingkai pertama dan terakhir | Tidak didukung | Didukung |
| Pengeditan video | Didukung | Didukung |
| Memperpanjang video | Tidak didukung | Didukung, hingga 40 dtk |
| Resolusi keluaran | Hanya 720p | 360p, 720p, 1080p, 4K |
| Pembuatan suara | Ucapan, musik, efek | Ucapan, musik, efek |
| Penanda asal | SynthID, C2PA | SynthID, C2PA |
Klaim fisika dan pengetahuan dunia dari postingan asli "Introducing Gemini Omni" ("pemahaman intuitif yang lebih baik tentang gaya seperti gravitasi, energi kinetik, dan dinamika fluida") tetap berlaku, dan kami sengaja kembali mengujinya, di bawah ini. Namun, hal yang diunggulkan Google adalah memori: "setiap instruksi dibangun di atas yang sebelumnya. Karakter Anda tetap konsisten, fisikanya tetap berlaku, dan adegan mengingat apa yang terjadi sebelumnya." Setelah trailer, kami lebih memercayai paruh kedua kalimat itu dari yang kami duga.
Bagaimana cara memberitahunya apa yang harus dilakukan tanpa pergantian mode?
Anda tidak melakukannya, dan itu perlu waktu sejenak untuk membiasakan diri. Panduan Google: "kami merekomendasikan untuk mengandalkan terutama pada prompting dan menggunakan parameter task hanya ketika prompting tidak berhasil." Apa yang Anda lampirkan dan apa yang Anda tulis adalah sakelarnya.
- Tidak ada lampiran: teks-ke-video.
- Satu gambar: menjadi bingkai pertama.
- Dua gambar, ditambah kata "first frame" dan "last frame" (bingkai pertama dan bingkai terakhir): interpolasi di antaranya. Tanpa kata-kata tersebut, dua gambar menjadi referensi subjek.
- Hingga sepuluh gambar: referensi subjek; orang dan objek tetap konsisten.
- Sebuah video ditambah "make it snow" (buat bersalju): pengeditan yang mempertahankan shot, panjang, dan pembingkaian.
- Sebuah video ditambah "extend this video" (perpanjang video ini): perpanjangan adegan.
Dua yang terakhir sering menjebak orang. Jika Anda melampirkan klip dan mendeskripsikan kelanjutannya tanpa kata extend, model akan memperlakukannya sebagai pengeditan dan mengembalikan panjang yang sama. Popcraft menambahkan kata kunci tersebut untuk Anda di panel Extend Video; dari API atau MCP, Anda harus menuliskannya sendiri.
Apa yang akan kami sampaikan kepada rekan sebelum render 40 detik pertama mereka
Bukan daftar tips. Tiga hal, sesuai urutan saat masing-masing akan merepotkan Anda.
Satu aksi per segmen. Panduan Google mendokumentasikan sintaks timecode, dan itu cocok sempurna dengan segmen 10 detik. Inilah prompt trailer yang seharusnya kami kirim:
Kapal bajak laut di tengah badai saat senja, bendera tengkorak, layar hitam robek. Shot kontinu tunggal, tanpa potongan adegan. [0-10s] Kapal menerjang ombak; kamera naik ke geladak. [10-20s] Kapten berjanggut di kemudi meneriakkan perintah; kru membalas dengan sorakan. [20-30s] Dia membuka peti besi di haluan; isinya melimpah dengan cranberry merah. [30-40s] Kapal rival menembak; cranberry berhamburan dalam gerakan lambat saat dia mengangkat pedangnya. Tampilan: flare anamorfik, grade teal-dan-amber, skor orkestra, tanpa teks di layar.
Katakan apa yang ingin Anda dengar, termasuk ketiadaan. Keheningan adalah sebuah permintaan. "Tanpa dialog", "tanpa musik, hanya angin dan air" adalah contoh negatif sederhana dari panduan itu sendiri, dan itu berhasil. Tidak menyertakan suara dalam prompt tidak sama dengan meminta tanpa suara.
Edit dengan kata lebih sedikit dari yang terasa tepat. Langsung dari Google: "Prompt sederhana bekerja paling baik untuk pengeditan video. Prompt yang terlalu deskriptif dapat menyebabkan perubahan yang tidak diinginkan." Sebutkan perubahannya, tambahkan "pertahankan semua elemen lainnya tetap tidak berubah", berhenti mengetik.
Di mana posisinya di samping Seedance 2.5 dan Veo 3.1
Kami menghosting beberapa model video karena tidak ada satu pun yang memenangkan setiap shot. Keunggulan Omni adalah klip panjang tunggal, hingga 40 detik dan hingga 4K, dengan suaranya sendiri, dari satu permintaan. Seedance 2.5 menerima jauh lebih banyak referensi (30 gambar, 10 video) dan melakukan pengeditan presisi wilayah. Veo 3.1 memberikan kontrol bingkai ketat pada 8 detik. Brief dengan satu klip hero dan skor musik: mulai dengan Omni. Brief dengan produk yang harus terlihat identik di dua belas shot: mulai dengan Seedance.
Biaya di Popcraft adalah per detik yang dikirimkan, berdasarkan resolusi: 720p untuk draf, 1080p untuk pengiriman, 4K untuk slot hero dengan rantai dibatasi pada 30 detik. Pilih panjang apa pun dari 3 hingga 40 detik pada slider; Popcraft secara otomatis merantai perpanjangan di balik layar, slider hanya menawarkan panjang yang dapat dicapai model, dan angka yang Anda lihat sebelum menghasilkan adalah angka yang Anda bayar.
Silakan coba dan patahkan sendiri
Gemini Omni 1.1 Flash sekarang tersedia di generator video, serta di board Canvas dan konektor MCP. Gratis untuk memulai dengan 100 kredit dan tanpa kartu. Lakukan seperti kami: 10 detik pada 720p terlebih dahulu, nilai hasilnya, lalu perpanjang, atau bawa klip yang sudah Anda sukai dan perpanjang klip tersebut. Trailer dan perpanjangannya ada di halaman model, tanpa edit, lengkap dengan suara dan semuanya; dua tes 30 detik adalah yang baru saja Anda tonton.
Sumber: Postingan Google "Introducing Gemini Omni" dan "Gemini Omni 1.1 Flash lets you build with more control", kartu model Google DeepMind untuk Gemini Omni Flash, halaman model Gemini Enterprise Agent Platform untuk Omni Flash dan Omni 1.1 Flash, serta panduan pengembang Gemini API. Pengukuran adalah milik kami, dari 3 September 2026.



