Google · Gemini Omni 1.1 Flash
あらゆる入力から動画を作成・編集
GoogleのOmni Flashは動画生成、編集、拡張に対応する単一モデルです。テキスト、画像、またはクリップを入力すると、独自の音声、音楽、効果音を含む動画を出力します。バージョン1.1では、シーン拡張が40秒まで可能になり、最初と最後のフレーム制御、1080pおよび4K出力が追加されました。
ビデオスタジオ、Canvas、MCPコネクタで利用可能
- 3s
- 10s
- 20s
- 30s
- 40s
シーン、カメラ、照明、雰囲気を記述してください。それに合わせた音声が自動生成されます。
画像がガイドまたは出発点となり、プロンプトで何が動くかを指定します。
モデルが最初のフレームから最後のフレームまでアニメーション化し、軌道、ズーム、シームレスなループを生成します。
写真内の人物やオブジェクトは、クリップ全体で一貫性を保ちます。
編集では指定しなかった部分はそのまま保持され、延長では10秒ずつ追加されます。
GoogleがOmniに組み込んだもの
モデルカードとローンチ投稿で最初に掲げられている3つのポイントと、それらが長いクリップにおいて重要な理由です。以下の主張はすべてGoogleによるもので、下のレンダリング結果は当社によるものです。
カット間で10秒間の記憶を保持
Omni 1.1はシーンを拡張する際、最大10秒前のコンテキストを分析します。従来のモデルは最後の1秒のみを参照していました。だからこそ、40秒のチェーンでも4つのレグ全体で同じ船長、船、グレードが維持されるのです。
物理法則と世界知識
Googleは、重力、運動エネルギー、流体力学を直感的に理解する能力と、Geminiの歴史・科学・文化に関する知識が組み合わされていると説明しています。水は水らしく噴出し、ガレオン船は船らしく傾きます。
すべてのクリップにSynthIDとC2PAを適用
生成されたすべての動画には、Googleの不可視のSynthID透かしが埋め込まれ、コンテンツクレデンシャル(C2PA)に対応しているため、ヒーロークリップの出処を検証可能な状態で公開できます。これはますます多くのプラットフォームで求められる要件です。
出典:Googleの「Introducing Gemini Omni」および「Gemini Omni 1.1 Flash lets you build with more control」の投稿、DeepMindモデルカード、Gemini Enterprise Agent Platformモデルページ。
モデルから直接出力された2つのデモンストレーション
どちらもPopcraftで生成されたものをそのまま表示しています。編集なし、音楽の追加もなしです。トレーラーは1080pで40秒の単一リクエストです。右側のペアは5秒のクリップと、それをシーン拡張して25秒にした同じクリップです。
最大40秒まで任意の長さを設定可能。Popcraftが自動で連鎖処理します。
Googleのローンチ投稿ではシーン拡張と呼ばれています。「10秒単位で最大累計40秒まで」動画が伸びます。Popcraftではそれを個別に管理する必要はありません。1つのスライダーで3秒から40秒まで任意の長さを選ぶだけで、Popcraftが単一プロンプトから拡張プロセスを自動チェーンし、1つのファイル、1つのストーリー、1つのサウンドトラックとして返します。以下はそのトレーラーの6つの時点での様子です。
1s
8s
15s
22s
29s
36s長さ自由、自動連結
3秒から40秒を選択すると、PopcraftがバックグラウンドでGoogleの拡張チェーンを実行します。レッグの計画もクリップの結合も不要で、生成された秒数分だけお支払いいただきます。
生成解像度
Googleの言葉によれば、「プロフェッショナルな制作にそのまま使える、洗練された高解像度の1080pまたは4K出力」です。Popcraftでは、4Kの連鎖は30秒まで実行されます。
最初と最後のフレーム
1.1の新機能:ショットの開始フレームと終了フレームを指定すると、Omniがその間の連続した動画を生成します。複雑なカメラオービット、ズームトランジション、シームレスなループなどが可能です。
音声、音楽、効果音
モデルカードには映像に合わせて生成されると記載されています。プロンプトで指示してください。ラジオの音、セリフなし、アンビエントのみなど、指定通りに生成されます。
画像や動画を持ち込む
同じモデルが参照の読み取り、編集、拡張を行います。Googleのガイドラインではプロンプトに依存することを推奨しています。残すべきものを指定し、変更すべきものを指定し、拡張する場合は「extend」と指示します。
被写体参照
人物、製品、または場所の写真を添付し、シーンを説明してください。モデルはクリップ全体を通じてキャラクターとオブジェクトの一貫性を保持します。長いクリップの各レグ間でも同様です。
トレーニングもキャラクターファイルも不要。同じ被写体を別アングルから撮った2枚の写真があれば、1枚よりも優れた結果が得られます。
参考写真の女性がゴールデンアワーのビーチをカメラに向かって歩き、髪が風に揺れ、背後には波が打ち寄せている。
動画編集
クリップを添付して、何を変えるべきかを指定します。Google自身のアドバイス:「シンプルなプロンプトが動画編集に最適」 — モデルは指定されなかった要素を保持します。
出力はソースと同じ長さ・フレーミングを維持し、その長さで課金されます。
大雪を降らせて。他はすべてそのままにして。
シーンの延長
クリップを添付し、より長い合計時間を選択します。元の映像はフレーム単位で保持され、新しい映像が10秒のレグで追加され音声も引き継がれます。モデルは連続性のためにクリップの最大10秒を読み取ります。
「extend」と入力してください。忘れた場合でもPopcraftが動画拡張パネルで自動的に追加します。この単語がないと、モデルはリクエストを編集として処理してしまうためです。拡張は末尾にのみ追加されます。
この動画を延長:ボートが桟橋に到着し、乗組員がロープを岸に投げ込む、まったく同じシーンを続けてください。
OmniとSeedance 2.5、Veo 3.1の比較
3つのモデルはいずれも映像に合わせて音声を生成します。Omniの強みは単一モデルでの40秒シーン拡張と4K出力、Seedanceの強みは参照数と領域精密編集、Veoの強みは8秒でのフレーム制御です。用途に合わせて選んでください。
| 機能 | Gemini Omni 1.1 Flash | Seedance 2.5 | Veo 3.1 |
|---|---|---|---|
| 1リクエストで生成できる最長クリップ | シーン延長で40秒(4Kでは30秒) | 30秒 | 8秒 |
| 最高解像度 | 4K(3840×2160)、360pドラフト階層まで対応 | 1080p | 1080p |
| ネイティブオーディオ | 音声、音楽、効果音 | はい | はい |
| 参照画像 | 最大10 | 最大30(+動画10、+オーディオ10) | 最大3 |
| 参照動画 | 最大3 | 最大10 | 1(拡張) |
| 動画編集 | 対話型。言及しなかった内容も保持 | 制御可能、領域単位で精密 | — |
| 動画拡張 | 10秒刻みで最大40秒、10秒のコンテキスト | 前後に最大30秒まで | ステップごとに+7秒 |
| 出所証明 | SynthID + C2PAコンテンツクレデンシャル | — | SynthID |
Omniの数値はGoogleのモデルページおよびローンチ投稿に基づくもので、Popcraftの上限は現在ピッカーで表示されているものです。プロバイダーの上限は変更されますが、ピッカーには常に現在利用可能なものが表示されます。
長く大規模な単一リクエストが効果を発揮する場面
かつては5つのクリップと結合が必要だったあらゆる作業。
ランディングページのメインビジュアル
3秒から40秒(4Kでは30秒)までの任意の長さを、独自のスコア付きで1つのファイルに出力します。スライダーを24に設定すると、Popcraftが拡張を自動で連鎖処理します。
トレーラーとティーザー
導入、公開、クライマックスという完全なアークを、音楽が盛り上がる中、ひとつの連続レンダリングで。
一貫したスターを起用した広告
商品やプレゼンターの写真を数枚用意するだけで、すべてのショットで同一の外観を維持できます。
撮影した映像を作り変える
実写映像の天気、服装、時間帯を変更できます。長さやカメラワークはそのままです。
アイデアを視覚的に分解
Googleのローンチ投稿では「短いプロンプトから複雑なアイデアを視覚的に紐解く説得力のある解説」として特に取り上げられています。
チェーン向けのプロンプト作成
Googleのガイドではシーンの説明、カメラムーブメント、ライティング、ムードが求められており、イベント用のタイムコード構文も提供されています。それ以外のここにある情報はすべて上記のトレーラーから得たものです。要求通りに実行し、要求した順序を入れ替えました。レグあたりの要求が多すぎたためです。
10秒ごとに1つのアクション、タイムコード付き
ビートをタイムシーケンスとして記述します。Google独自のガイドでは[0-3s] … [3-6s] …という構文が文書化されています。各10秒レッグには明確なタスクを1つ与えます。モデルはプロンプトからレッグを計画するため、計画を提示してください。
ルック(グレード、レンズ、雰囲気)は冒頭の長文ではなく、末尾の短い1行で指定します。途切れないワンショットにする場合は、「単一の連続ショット、シーンカットなし」と明記してください。
夕暮れの嵐の中を進む海賊ガレオン船、骸骨の旗、破れた黒い帆。単一の連続ショット、シーンカットなし。\n[0-10s] 船が波を突き進み、カメラが甲板へと上昇する。\n[10-20s] 髭面の船長が舵輪の前で命令を叫び、乗組員が応える。\n[20-30s] 船首で鉄の宝箱を開けると、赤いクランベリーが溢れ出る。\n[30-40s] 敵船が砲撃し、彼がカットラスを振り上げる中、クランベリーがスローモーションで飛び散る。\nルック:アナモルフィックフレア、ティール&アンバーのグレーディング、オーケストラのスコア、画面内テキストなし。
情報過多なトレーラーの長文
これは上記のトレーラーのために実際に送信した内容です。5つのビート、宝箱の公開、ライバル船、フィナーレを1つの途切れない段落にまとめました。モデルは船、船長、色調を維持したまま、順序を入れ替えました。
クランベリースプレーは8秒の時点で登場しましたが、宝箱が明確に開くことはありませんでした。高密度なプロンプトは失敗するのではなく、圧縮されるのです。
ハリウッド大作トレーラー、「クランベリーの海賊」。壮大な実写シネマルック:アナモルフィックレンズフレア、深いティール&アンバーのグレーディング、ボリューメトリックな海の霧、35mmフィルムグレイン… [5つのビート、1段落、240語]
- 「extend」と指定する
- 拡張の場合、その単語が切り替えの役割を果たします。Popcraftは動画拡張パネルで不足している場合に自動追加しますが、APIやMCPからは自分で記述してください。拡張は末尾にのみ追加され、先頭に追加する機能はありません。
- フレームにも言葉が必要
- 「最初のフレーム」「最後のフレーム」と指定してトランジションを説明しない限り、2枚の画像は被写体の参照として扱われます。
- サウンドを演出する
- Googleのガイド:「デフォルトでは、モデルは適切なオーディオトラックを生成しようとします。」シンプルな否定表現「セリフなし」「追加の効果音なし」を使うか、ラジオの音、キャンバスに当たる雨、ストリングスの盛り上がりなど、希望するものを具体的に指定してください。
- 編集はシンプルに
- Googleのガイドにも「過度に詳細なプロンプトは意図しない変更を招くことがあります」とあります。変更点を指定し、「それ以外はすべてそのままにして」と添えて、そこで止めます。
料金について
Omniは解像度ごとに生成された秒数単位で請求されます。Popcraftはモデルが正確に生成できる長さのみを提供するため、生成前に表示される料金がそのままお支払い金額になります。
下書きやSNS向け。10秒のクリップは150クレジット、フル40秒は600クレジットです。
出力品質。上記の40秒のトレーラーは920クレジットです。1回のリクエストで、音声込みの料金です。
メイン配置用のネイティブ3840×2160。上限は30秒で、30秒のフル4Kチェーンは1,350クレジットです。
よくある質問
Googleの動画モデルで、DeepMindは「あらゆる入力から何でも作成・編集できるモデルへの次のステップ。まずは動画から」と説明しています。1つのモデルでテキストから動画、画像から動画、最初と最後のフレームの補間、被写体参照、動画編集、シーン拡張に対応し、すべてのクリップで音声、音楽、効果音を生成します。2026年8月27日にリリースされたバージョン1.1では、拡張、キーフレーム、1080p/4K出力が追加されました。
各生成パスは最大10秒です。シーン拡張では10秒単位で動画を延長し、累積で最大40秒まで生成できます。Popcraftでは、1つのスライダーで3秒から40秒まで任意の長さを選択するだけで、1つのプロンプトから拡張プロセスを自動で連鎖させます。スライダーにはモデルが生成可能な長さのみが表示され、生成された秒数に対してのみ課金されます。4Kでは連鎖は30秒で停止し、最初と最後のフレームからの動画は単一パスのため、3秒から10秒となります。
デフォルトでは、はい。Googleのガイドによると、モデルは「適切なオーディオトラックを生成しようとします」とされており、モデルカードには音声、音楽、効果音が記載されています。プロンプトで指示を出し、無音にしたい場合は「セリフなし」や「音楽なし」を含めてください。Popcraftのタイムラインで後からオーディオを置き換えたり、重ねたりすることもできます。
クリップを添付し、希望する合計長さを選択します。元のクリップはフレーム単位で保持され、10秒単位のセグメントが末尾に追加されます。連続性のため、クリップの最大10秒分が読み取られます。したがって、5秒のクリップは15秒、25秒、35秒になり、20秒にはなりません。Popcraftはモデルが生成可能な長さのみを提供し、その秒数に対して正確に課金します。拡張は末尾にのみ追加されます。
はい。ソースを添付し、変更内容を説明してください。Googleはシンプルな編集プロンプトと「それ以外はすべてそのままにして」の追加を推奨しており、モデルは言及されなかった要素を保持します。結果は元の長さとフレーミングを維持し、ソースクリップの長さに対して課金されます。音声ダイアログの編集はサポートされていません。
4Kは3840×2160でレンダリングされ、3倍の計算リソースを使用するため、720pの3倍の秒単価がかかります。各4Kセグメントは上流で数分かかるため、チェーンは30秒で停止します。生成前に、すべての長さと解像度のクレジット価格が表示されます。
各10秒セグメントは前のセグメントの拡張であり、モデルがビートを自ら計画するためです。Googleのタイムコード構文を使用して10秒ごとに1つの明確なアクションを指定し、映画的なつなぎは省いてください。5ビートの高密度なトレーラーは圧縮や並べ替えの対象になりますが、30秒で3ビートなら維持されます。
すべてのOmni動画にはGoogleの不可視なSynthID透かしが含まれており、C2PAコンテンツクレデンシャルに対応しています。これらはクリップの見た目に影響を与えずに出所を検証します。Popcraftの有料プランでは生成した動画の商用利用権が付与されます。無料プランのダウンロードにはPopcraftの透かしが表示されますが、有料プランでは削除されます。プロンプトや参照メディアに含まれる肖像やコンテンツについての責任はユーザーにあります。
さらに探索
関連モデル
Seedance 2.5は、1回のジョブで最大30秒の動画を生成できます。最大50個のアセットを参照でき、動画編集の制御、高忠実度の時間軸拡張、0.4から2.5までの任意のアスペクト比、10以上の言語でのネイティブプロンプトに対応しています。Popcraftで公開中。
MiniMax H3は、24fpsの2K動画と同期したステレオ音源(効果音、環境音、台詞)を一度に生成。1つのプロンプトからマルチショット生成、5〜15秒、最初と最後のフレーム制御に対応。Popcraftで公開中。
Popcraft で Seedance 2.0 を使い、テキスト・画像・クリップから映画品質の 4K 動画を生成。ネイティブ同期音声、マルチショットシーケンス、最大 4K (2160p) の極めて精細なディテール。

Seedance 2.0 MiniはByteDanceの最も軽量な動画生成ティアです。標準のSeedance 2.0より最大50%安く、Fastより約2倍高速で、テキスト、画像、動画、音声のプロンプトに対応。Popcraftで公開中。
