Seedance 2.5 · ByteDance
三十秒,一次生成
一整支廣告、產品展示或場景節奏,都能以一次三十秒生成完成,不必分成五段影片再拼接——最多可搭配五十個參考素材,事後還能直接編輯,無需重新生成。
現已於 Popcraft 上線,與 Seedance 2.0 並列。
三十秒,兩次
兩部由字節跳動自製的示範影片,長度正是此模型所設計的最佳時長。每部皆為一次生成——畫面、鏡頭切換與音效同步呈現,無需任何後製剪輯。
該留意哪些細節
這四大提升正是決定一段畫面究竟像真實影片還是 AI 生成物的關鍵細節。
服從空間的光線
眼中的眼神光呈現出帶有深度的玻璃質感,而光線方向、衰減與反射皆遵循場景的物理規則,而非生硬地塗抹上去。
穩定流暢的運鏡
推、拉、橫搖與俯仰的運鏡軌跡變得更滑順穩定,這正是讓三十秒長鏡頭能真正撐起三十秒的關鍵。
曲線般的表情變化
微表情——眼角的顫動、嘴唇的輕抿——以連貫的動態貫穿整個節拍,而非在姿勢間生硬切換。
肌膚、毛髮與恐怖谷效應
肌膚紋理、毛髮光澤與細微面部動作更貼近攝影機實際拍攝的效果,大幅減少讓生成臉孔露餡的塑膠感。
四項改變,其中一項才是長度
在四個面向上邁進 2.5 步:更長的生成時長、更豐富的參考素材、精準編輯,以及多語言創作。長度是最大亮點,而編輯則是讓日常工作真正有感的改變。
單次生成即可達三十秒
單次生成最長可達三十秒,在整段影片中維持運鏡、連貫性與完整的敘事弧線。Seedance 2.0 的上限為十五秒。高保真時序延伸可將短片向前、向後延展,或串接兩段影片。
一個鏡頭所需的一切,盡在一份提示中
單次生成可容納 30 張圖片、10 段影片與 10 段音訊——演員、產品、場景、攝影機行為、音樂與配音一次到位。在 2.0 版本中,上限僅有 9 張圖片與 3 段影片。
修改細節,保留片段
可控影片編輯能維持畫面、攝影機與節奏不變,僅重寫你指定的部分:背景、服裝、產品、演員表情或音樂。一段 30 秒的好影片不再因為小瑕疵就得重新生成。
用自己的話下指令
原生支援中文、英文、西班牙文、印尼文、馬來文、泰文、阿拉伯文、葡萄牙文、越南文、日文與韓文等多種語言——提示詞不再需要先翻譯才能讓模型讀取。整體的指令遵循能力也更為提升。
2.5 與 2.0 逐項比較
Seedance 2.0 仍保留在產品陣容中,在 4K 畫質下依然是短鏡頭的合適工具。
| 功能 | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| 單次最長生成 | 15秒 | 30 秒 |
| 參考圖片 | 9 | 30 |
| 參考影片與音訊片段 | 3 | 10 段影片 + 10 段音訊 |
| 參考素材總時長 | 15秒 | 影片 30 秒、音訊 30 秒,分開計算 |
| 僅音訊參考 | — | 支援 |
| 提示詞中的時間戳記 | 僅限鏡頭編號 | 整秒時間戳記 |
| 多視角主體圖片 | 不建議 | 支援 |
| 輸出長寬比 | 六種固定比例 | 0.4 至 2.5 之間的任意比例,由輸入設定 |
| MOV 輸出,便於剪輯與延伸 | — | 支援 — 接合處的色彩與音訊連貫 |
每個素材都帶有指定任務
數量只是基本。真正讓它好用的關鍵在於,每個素材都會加上 @ 標記並賦予明確角色,讓模型知道哪張圖片是演員、哪張是燈光。
最高 4K,每張 30 MB。支援 JPEG、PNG、WebP、BMP、TIFF、GIF、HEIC、HEIF。2.5 版本支援同一主體的多視角組合,而 2.0 版本不建議使用。
480p 至 4K,每個 200 MB,每段影片 2–30 秒,格式為 MP4 或 MOV。所有影片片段總計不超過 30 秒。
每個 15 MB,每段片段 2–30 秒,MP3 或 WAV 格式,另有獨立的 30 秒總時長限制。純音訊參考素材是 2.5 版的新功能——背景音樂、人聲或音效軌皆可單獨驅動節奏、節拍對齊與唇形同步。
參考素材可承擔的角色
- 主體
- 人物、動物、產品、道具、場景或虛構角色的外觀或聲音——也就是在整段影片中必須保持一致的主體。以 @image 1 中的女性為主角,在黃昏時分漫步於城市街頭。
- 動態
- 從一段影片中提取動作、鏡頭運動、節奏與特效,並套用到不同的主體上。可跨物種與跨風格轉移,不限於同一拍攝鏡次。沿用 @video 1 的鏡頭運動與跑步節奏;主體為 @image 1。
- 白模
- 以粗略無貼圖的 3D 白模驅動運鏡與場面調度;最終的材質、光影與氛圍則來自靜態圖片。此處使用粗略幾何模型的效果優於精細模型。渲染白模 @video 1 中的動態;主體為 @image 1,場景為 @image 2。
- 風格
- 從圖片或影片中擷取色調、調色與質感,同時保留你自己的角色陣容。使用 @video 1 的冷藍夜景調色,並保留 @image 1 中的主角。
- 音訊
- 音樂、旋律、對白或人聲音色。為每個角色指定一種聲音,生成的影片就會以該聲音說話。父親的聲音:低沉、從容、中年。參考 @audio 1。
- 分鏡腳本
- 將多格分鏡圖視為劇情大綱。最多 15 格,優先使用線稿而非精繪分鏡,且格內不繪製文字。生成結果會遵循故事情節,而非逐幀複製畫面。沿用 @image 1 中的四格分鏡;角色為 @image 2。
- 關鍵影格
- 一張圖片作為首影格、兩張作為首尾影格,或一組獨立的關鍵影格。與分鏡腳本不同,輸出會緊密追蹤這些影格。@image 1 是首影格,@image 5 是末影格;讓她從室內走到室外。




重新生成不再是唯一的選擇
這兩項功能都以完成的影片作為 @video 1,並保留你未指定的所有內容。編輯會改寫現有內容的一部分。延伸則會產生其之前或之後的內容。


改寫局部,保留其餘
新增主體、移除主體、根據參考圖片替換服裝或場景,或變更音訊——換一段背景音樂、加上音效、重新配音。時間戳記可將編輯範圍縮小到特定區間:例如 0:02–0:05,此區間外的內容都不會變動。
有效的提示詞模式分為三個部分:指向來源、指定物件與變更內容,然後加上保留條款,讓模型維持畫面其餘部分不變。
將 @video 1 中男子的深色服裝\n替換為 @image 2 中的服裝。\n其餘部分保持不變。
撰寫前後發生的內容
從最後一個影格向前延伸、向第一個影格之前的時刻回溯,或是產生兩個片段之間缺少的橋接,讓它們無縫銜接。角色、場景與鏡頭會跨越接縫延續,並可要求轉場在畫面與聲音上都保持無縫流暢。
延伸功能能讓精彩的 6 秒片段變成完整的 30 秒作品,而不必重新產生已經完美的部分。建議使用 MOV in 與 MOV out 路徑——它能在接合處維持色彩、亮度與音訊的一致性。
從 @video 1 的最後一個影格開始延伸\n6 秒:她走出畫面,天空變暗,\n路燈一盞接一盞亮起。保持無縫銜接。
輸入內容為你決定的事項
2.5 會依據來源素材是否決定輸出形式來劃分任務。2.0 則不做此區分,這也是轉換過來時最容易讓人感到意外的地方。
| 任務 | 長寬比 | 時長 |
|---|---|---|
| 編輯 | 鎖定至來源片段 | 跟隨來源,誤差約在三分之一秒內 |
| 第一個影格,或第一個與最後一個 | 鎖定至首影格影像 | 由你設定 |
| 延伸 | 鎖定至來源片段 | 由你設定 |
| 參考生成 | 開啟 | 由你設定 |
| 分鏡腳本與關鍵影格 | 開啟 | 由你設定 |
三十秒發揮所長
此模型的應用場景可分為五大類。其中四類是能縮短工時的任務,第五類則只有在生成時間達到這麼長時才得以實現。
一鏡到底的場景
一個情節節拍在單次生成中完整呈現,並由一組參考靜態畫面維繫整體演員陣容的連貫性。連續性修正——例如外露的支架或亂入的物件——只需後製剪輯,不必重新拍攝。
一支主版本,衍生所有版本
先完成一支主版本,再衍生其他版本:替換 SKU、模特兒、畫面文案或目標市場,同時以參考畫面鎖定產品外觀與品牌視覺風格。旁白則可依需求配上各種語言。
一個概念,一鏡講完
在三十秒內從頭到尾講解一個概念,無需重新錄製即可替換講者,同一組場景還能以多種語言發行。
從頭到尾的完整流程
從頭到尾展示組裝與操作步驟,並依產品替換銘牌、規格面板及包裝文字,同時保留原始鏡頭畫面。
十五秒無法勝任的任務
遊戲預告片與 CG、虛擬主播、短片擴展為影集、角色為季節性片段老化或重新設計造型。
像寫分鏡表一樣撰寫
把模型當作一位正在閱讀結構化簡報的製作人。以下的格式是能經得起轉交給他人閱讀的那一種。









五個部分,依此順序
主體、地點、事件、類型與風格、攝影機運動。接著是鏡頭序列——整秒的時間戳記或編號鏡頭,兩者皆可——描述每個段落看到的畫面、攝影機如何移動、說了什麼以及聽到什麼。最後以常數作結:角度、環境、氛圍,以及貫穿其中的背景音效。
每秒畫面大約對應一秒的故事內容。時間窗內內容太少,模型會自行即興發揮;太多則會瘋狂剪輯或直接丟棄一半。
在文字中逐一對應
依照上傳順序為素材編號,並在提示詞中綁定每個素材:哪個是主體、哪個是聲音、哪個是動作、哪個是場景。在圖片上寫下名稱並在提示詞中使用該名稱,是確保生成兩個相同角色的可靠方法。
若參考素材已經準確,就指示模型遵循它並停止。重新描述其中包含的動作會讓模型收到兩份需要協調的簡報。
img1–2 是角色 1,由 @audio 1 配音;\nimg3–4 是角色 2,由 @audio 2 配音。\n遵循 @video 1 中的施法動作以及\n@video 2 中的環繞運鏡。
- 鏡頭語言
- 標準術語可直接使用——景別、推進、拉遠、橫搖、跟拍、環繞、低角度、一鏡到底、滑動變焦、手持、速度變化。冷門術語需要在後面加上白話說明,而轉場則需要同時標明觸發點和方式。
- 動作與表情
- 大部分動作以概括方式描述即可,將細節保留給必須精準呈現的兩三個節拍。表情用具體描寫比用成語命名效果更好。
- 正面描述優先
- 描述應該出現的內容。負面提示詞僅在涉及字幕和音訊時才會生效——例如不要字幕、不要背景音樂——而這兩項也正是模型最容易自行添加的元素。
- 音效
- 環境音、音效、對白和配樂都可以分別從音訊參考素材生成並在提示詞中描述,包括當有人說話時哪些音訊應該降低音量。
2.5 每秒費用
Seedance 2.5 依輸出秒數計費,解析度由您選擇。方案等級費率會自動套用——折扣歸屬於方案,並適用於每次生成。
Seedance 2.5 在標準計費下以 720p 生成的費用。480p 每秒消耗 24 點數——是在最終輸出前進行反覆測試的更經濟方式。
月繳方案享 8 折優惠。此折扣適用於每一次 Seedance 生成,而非僅限一次。
月繳方案享 6 折優惠。這是最深的折扣,也是讓 30 秒生成值得跑兩次的原因。
常見問題
可以——Seedance 2.5 已在 Popcraft 影片模型選擇器中上線。在 Seedance 2.0 旁邊選擇它,將時長設定為最多 30 秒,然後進行生成。
不會。Seedance 2.0 和 Seedance 2.0 4K 仍保留在模型清單中。6 秒的產品鏡頭不需要 30 秒的上限,而 4K 輸出正是選擇 2.0 的理由。2.5 新增的是時長、參考素材數量,以及編輯現有影片片段的能力。
50 是上限,建議保持在遠低於此的數量:圖像主體 8 個以內,主要參考為音訊或影片時 5 個以內,片段長度 5 到 10 秒,分鏡腳本 15 格以內。超過這些數量,穩定性會下降,生成結果也會開始需要重複嘗試。
拿一段你已經喜歡的影片片段來延長。延長是驗證這項宣稱最便宜的方式,因為它從你已經認可的素材開始。如果接縫處經得起考驗——臉部、色調、鏡頭速度——那麼模型的其他承諾就值得花更長的生成時間來嘗試。如果不行,你也只花了幾秒鐘的成本就學到了。
繼續探索
相關模型
MiniMax H3 可生成 24fps 的 2K 影片並同步立體聲配樂,一次搞定特效、氛圍與對白。支援單一提示詞多鏡頭、5 至 15 秒、首末幀控制。現已在 Popcraft 上線。
在 Popcraft 上使用 Seedance 2.0,從文字、圖片或片段生成電影級 4K 影片。原生同步音訊、多鏡頭序列,以及最高 4K (2160p) 的極致清晰細節。

Seedance 2.0 Mini 是字節跳動最輕量的影片方案——比標準版 Seedance 2.0 便宜最多 50%,速度約為 Fast 的 2 倍,支援文字、影像、影片及音訊提示詞。現已在 Popcraft 上線。

在 Popcraft 上使用 Seedance 2.0 將影像與提示詞轉化為電影級影片。支援參考素材轉影片、首末影格控制及多比例輸出,解析度最高可達 4K。
