Seedance 2.5 · ByteDance
1回の生成で30秒
広告全体、製品デモ、シーンのビートが、5つのクリップをつなぎ合わせるのではなく、1回の30秒生成として返ってきます。最大50個のアセットで一貫性を保ち、再生成なしで後から編集できます。
Popcraftで公開中。Seedance 2.0と並んで提供。
30秒、2本
ByteDance独自のデモ映像2本。モデルが想定する長さで制作されています。それぞれ1回の生成で、映像、カメラワークの変化、音声が同時に生成され、後からの編集は一切行われていません。
注目すべきポイント
4つの向上点は、映像が実写として見えるか、生成物として見えるかを左右する細部です。
空間に従う光
瞳のキャッチライトは奥行きのあるガラスのように見え、光の方向、減衰、反射は描き込みではなくシーンの物理法則に従います。
軌道を維持する動き
プッシュ、プル、パン、チルトの軌道がより滑らかで安定し、30秒の動きが30秒間破綻せずに持続します。
曲線としての表情
目の微かな震えや唇の動きといったマイクロエクスプレッションが、ポーズ間の切り替えではなく、一拍全体を通じた連続的な動きとして表現されます。
肌、髪、そして不気味の谷
肌の質感、髪の光沢、顔の微細な動きがカメラで撮影したものに近づき、生成された顔特有のプラスチック感が抑えられています。
4つの変化、ただし長さだけではありません
2.5は4つの軸で前進します:より長い生成、より豊富な参照、精密な編集、多言語制作。長さが目玉ですが、編集こそが日々の作業で実感できる変化です。
1回の生成で30秒
1回の生成で最大30秒、カメラワーク、連続性、完全なナラティブアークをクリップ全体で維持します。Seedance 2.0の上限は15秒でした。高忠実度時間拡張により、短いクリップを前後に延伸したり、2つのクリップを繋げたりできます。
ショットに必要なすべてを1つのブリーフに
1回の生成で最大30枚の画像、10本の動画クリップ、10本の音声クリップを組み合わせ可能です。キャスト、商品、ロケーション、カメラワーク、音楽、ボイスをまとめて指定できます。2.0では上限が画像9枚、クリップ3本でした。
ディテールを変えて、クリップはそのままに
制御可能な動画編集では、フレーム、カメラ、ペースを維持したまま、指定した要素のみを書き換えます。背景、衣装、商品、俳優の表情、音楽など。30秒の良作に一箇所の欠陥があっても、最初から作り直す必要はありません。
自分の言葉で指示しよう
中国語、英語、スペイン語、インドネシア語、マレー語、タイ語、アラビア語、ポルトガル語、ベトナム語、日本語、韓国語など、ネイティブレベルで対応。プロンプトを翻訳してからモデルに渡す必要がなくなりました。指示への追従性も全体的に向上しています。
2.5と2.0を行ごとに並べて比較
Seedance 2.0も引き続きラインナップに残り、4Kでの短いショットには依然として最適なツールです。
| 機能 | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| 1回の最長生成時間 | 15秒 | 30秒 |
| 参照画像 | 9 | 30 |
| 参照用の動画・音声クリップ | 3 | 動画10本 + 音声10本 |
| 参照素材の合計尺 | 15秒 | 動画30秒、音声30秒、別々にカウント |
| 音声のみの参照 | — | 対応 |
| プロンプト内のタイムスタンプ | ショット番号のみ | 整数秒のタイムスタンプ |
| マルチビュー被写体画像 | 非推奨 | 対応 |
| 出力アスペクト比 | 6つの固定比率 | 0.4~2.5の任意の比率を入力値で設定 |
| 編集・拡張用MOV出力 | — | 対応 — 接続部の色と音声の連続性を維持 |
すべてのアセットには役割がある
枚数を揃えるのは簡単なことです。使いやすさの鍵は、すべてのアセットに@マークでタグ付けし、明示的な役割を割り当てることにあります。これにより、モデルはどの画像が役者で、どの画像が照明かを認識できます。
最大4K、各30 MB。JPEG、PNG、WebP、BMP、TIFF、GIF、HEIC、HEIF。同一被写体のマルチビューセットは2.5で対応(2.0では非推奨)。
480pから4K、各200 MB、クリップあたり2〜30秒、MP4またはMOV。クリップ全体で合計30秒までです。
各15 MB、クリップあたり2〜30秒、MP3またはWAV、個別に合計30秒まで。オーディオのみの参照は2.5の新機能です。BGM、ボイス、効果音トラックだけで、ペーシング、ビートマッチ、リップシンクを制御できます。
参照に担わせられる役割
- 被写体
- 人物、動物、製品、小道具、場所、または架空のキャラクターの外見や声。クリップ全体を通じて一貫して保たれる要素です。@image 1の女性を主役にし、夕暮れの街を歩いているシーンにしてください。
- モーション
- クリップから抽出したアクション、カメラワーク、タイミング、エフェクトを別の被写体に適用します。テイクだけでなく、種別やスタイルを超えて転用できます。@video 1のカメラワークと走るリズムに従ってください。被写体は@image 1です。
- ホワイトモデル
- テクスチャなしの簡易3Dブロックアウトでカメラワークとステージングを指示し、完成品のマテリアル、ライティング、雰囲気はスチール画像から取得します。詳細なモデルよりも粗いジオメトリの方が効果的です。@video 1のホワイトモデルのモーションをレンダリングしてください。被写体は@image 1、シーンは@image 2です。
- スタイル
- 画像やクリップからカラーパレット、カラーグレーディング、テクスチャを取得します。キャストはそのまま維持されます。@video 1の冷たいブルーの夜間グレーディングを使用し、@image 1の主演を維持してください。
- オーディオ
- 音楽、メロディ、セリフ、または声のトーン。キャラクターごとに声を割り当てると、映像がその声で語り出します。父親の声:低く、落ち着いた、中年。@audio 1を参照してください。
- 絵コンテ
- プロットの概要として読み取られるマルチパネルのボード。15パネル以下で、レンダリング済みボードより線画が適しており、パネル内にテキストを描き込まないでください。結果は絵コンテのコマごとではなく、ストーリーに沿って生成されます。@image 1の4つのパネルに従ってください。キャラクターは@image 2です。
- キーフレーム
- 1枚の画像を最初のフレームとして使用し、2枚を最初と最後のフレームとして使用するか、独立したキーフレームのセットを使用します。ストーリーボードとは異なり、出力はこれらに厳密に従います。@image 1が最初のフレーム、@image 5が最後のフレームです。彼女を屋内から屋外へ歩かせてください。




リロールだけが唯一の手段ではなくなります
どちらの機能も、完成したクリップを@video 1として受け取り、指定しなかった部分はそのままにします。編集は既存の内容の一部を書き換えます。拡張はその前後に新しい内容を書き加えます。


領域を書き換え、残りは維持
被写体を追加、削除、衣服やシーンをリファレンス画像に合わせて入れ替え、またはオーディオを変更します — 異なる音楽ベッド、追加エフェクト、再音声化したセリフ。タイムスタンプは編集をウィンドウに限定します:0:02–0:05とその外側は何も動きません。
効果的なパターンは3つの部分から成ります:ソースを指し示し、オブジェクトと変更を指定し、それからモデルがフレームの残りの部分をそのままにするための保持条項を追加します。
@video 1の男性の暗い服装を\n@image 2の服装に置き換えてください。\n他のすべては変更しないでください。
前後に続く内容を記述
最終フレームから前方へ、または最初のフレームの直前へ後方へ延長したり、2つのクリップ間の不足部分を生成してシームレスに繋げたりできます。キャラクター、シーン、カメラは継ぎ目を超えて維持され、映像と音声の両方でシームレスなトランジションを指定できます。
延長機能を使えば、すでにうまくいっている部分を再生成することなく、6秒の強力なクリップを30秒の完成品にできます。MOV入力とMOV出力が推奨パスです。継ぎ目全体で色、明るさ、音声の一貫性が保たれます。
@video 1の最終フレームから6秒間延長:\n彼女がフレームから去り、空が暗くなり、\n街灯が次々と点灯する。シームレスに。
入力によって自動決定される項目
2.5は、ソースアセットが出力の形式を決定するかどうかでジョブを分類します。2.0にはそのような区別がないため、移行時に最も驚くポイントとなるでしょう。
| タスク | アスペクト比 | 尺 |
|---|---|---|
| 編集 | ソースクリップに固定 | ソースに準拠、約0.3秒以内 |
| 最初のフレーム、または最初と最後のフレーム | 最初のフレーム画像に固定 | 任意に設定 |
| 延長 | ソースクリップに固定 | 任意に設定 |
| 参照生成 | 開く | 任意に設定 |
| 絵コンテとキーフレーム | 開く | 任意に設定 |
30秒が真価を発揮する領域
このモデルのユースケースは5つのカテゴリに分かれます。そのうち4つは、作業時間を短縮できるものです。5つ目は、この長さの生成が可能になって初めて実現するものです。
展開するシーン
1回の生成で最後まで展開するプロットのビート。参照スチルのキャストによってアンサンブルが一貫性を保ちます。リグの映り込みや不要なオブジェクトなどの連続性の問題は、再撮影ではなく編集で修正できます。
1つのマスターからあらゆるバージョンを
1つのマスターカットから、SKU、モデル、画面表示テキスト、市場を入れ替えた各種バージョンを生成できます。製品の外観とブランドのルックは参照によって固定されます。ナレーションは必要な言語で追加できます。
アイデア全体をワンテイクで
1つのアイデアを30秒で最初から最後まで解説し、プレゼンターを再収録なしで差し替え、同じセットを複数の言語で配信できます。
手順を最初から最後まで
組立と操作の手順を最初から最後まで表示し、ネームプレート、仕様パネル、パッケージのテキストを製品ごとに書き換えつつ、映像はそのまま維持できます。
15秒ではできなかったこと
ゲームのトレーラーやCG、バーチャルプレゼンター、短編のシリーズ化、季節のカットに合わせてキャラクターの加齢やスタイル変更。
ショットリストのように書く
モデルを、構造化されたブリーフを読むプロデューサーだと思ってください。以下の形式は、他の人に渡しても通用するものです。









5つの要素、この順序で
被写体、場所、出来事、ジャンルとスタイル、カメラワーク。次にショットシーケンス——1秒単位のタイムスタンプまたは番号付きショットのいずれかで——セグメントごとに何が見えるか、カメラがどう動くか、何が言われ何が聞こえるかを記述します。最後に定数で締めます:アングル、環境、雰囲気、底に流れるサウンド。
画面1秒につきストーリーも約1秒分に抑えます。ウィンドウに対して少なすぎるとモデルが即興で補い、多すぎると慌ただしくカットするか半分を省略します。
テキスト内で各アセットをマッピング
アップロード順にアセットに番号を付け、プロンプト内でそれぞれを紐付けます。どれが被写体で、どれが音声で、どれがアクションで、どれがシーンかを指定します。画像に名前を書き込み、それをプロンプトで使用することが、同じキャラクターを2体生成する確実な方法です。
参照がすでに正確な場合は、それに従うように指示して終了します。含まれる動きを再記述すると、モデルが2つの指示を調整しなければならなくなります。
img1〜2はキャラクター1で、@audio 1が声を担当。\nimg3〜4はキャラクター2で、@audio 2が声を担当。\n@video 1の魔法を唱えるアクションと、\n@video 2の軌道移動に従ってください。
- カメラ言語
- 標準的な用語はそのまま使用します。ショットサイズ、プッシュイン、プルアウト、パン、トラック、オービット、ローアングル、ワンテイク、ドリーズーム、ハンドヘルド、スピードランプなどです。ニッチな用語にはその後に平易な説明を付け、トランジションにはトリガーポイントと方法の両方を指定します。
- アクションと表情
- ほとんどのアクションは広く概括的に記述し、詳細は確実に決めるべき2、3のビートのために取っておきます。表情は慣用句で名前を付けるよりも、具体的に書き出した方がうまく伝わります。
- 否定より肯定
- 何を配置すべきかを記述します。否定指定が有効なのは字幕や音声に関する場合、つまり字幕なし、BGMなしなどです。これらはモデルが指示なしに追加しがちな2つの要素でもあります。
- サウンド
- アンビエンス、効果音、セリフ、スコアはそれぞれ音声参照から割り当て、ブリーフ内で記述できます。誰かが話すときにどれを下げるべきかも含めて指定します。
2.5の1秒あたりのコスト
Seedance 2.5は、選択した解像度で出力の秒数ごとに課金されます。プランのティア料金が自動的に適用されます。割引はプランに属し、すべての生成に適用されます。
標準課金でのSeedance 2.5の720p生成コスト。480pは1秒あたり24クレジットで実行されます。最終パス前の反復作業に最適な低コスト方法です。
月額プランから20%割引。この割引はSeedanceのすべての生成に適用され、1回限りではありません。
月額プランから40%割引。最もお得な料金で、30秒の生成を2回実行する価値がある理由です。
よくある質問
はい。Seedance 2.5はPopcraftの動画モデル選択画面でご利用いただけます。Seedance 2.0と並べて選択し、最大30秒の長さを設定して生成してください。
いいえ。Seedance 2.0とSeedance 2.0 4Kは引き続きモデルリストに残ります。6秒の製品ショットに30秒の上限は不要であり、4K出力が必要な場合は2.0を選ぶ理由になります。2.5で追加されたのは、長さ、参照数、そして既存のクリップを編集する機能です。
上限は50ですが、ガイドラインではそれを大幅に下回ることを推奨しています。画像の被写体は8つ以下、主な参照が音声や動画の場合は5つ以下、クリップは5〜10秒、ストーリーボードは15パネル以下に抑えてください。これらを超えると安定性が低下し、生成のやり直しが必要になり始めます。
気に入っている既存のクリップを拡張してみてください。拡張は最もコストのかからない検証方法です。すでに自分で評価済みの映像から始まるためです。継ぎ目が自然であれば——顔、色調、カメラ速度——モデルのその他の強みも、より長い生成に費やす価値があります。そうでなければ、数秒分のコストでそれが学べたことになります。
さらに探索
関連モデル
MiniMax H3は、24fpsの2K動画と同期したステレオ音源(効果音、環境音、台詞)を一度に生成。1つのプロンプトからマルチショット生成、5〜15秒、最初と最後のフレーム制御に対応。Popcraftで公開中。
Popcraft で Seedance 2.0 を使い、テキスト・画像・クリップから映画品質の 4K 動画を生成。ネイティブ同期音声、マルチショットシーケンス、最大 4K (2160p) の極めて精細なディテール。

Seedance 2.0 MiniはByteDanceの最も軽量な動画生成ティアです。標準のSeedance 2.0より最大50%安く、Fastより約2倍高速で、テキスト、画像、動画、音声のプロンプトに対応。Popcraftで公開中。

PopcraftのSeedance 2.0で、画像とプロンプトからシネマティック動画を生成。参照から動画生成、最初/最後のフレーム指定、最大4Kのマルチアスペクト出力に対応。
