Seedance 2.5 · 字节跳动
单次生成,即得 30 秒视频
完整广告、产品演示或场景片段无需拆分 5 段再拼接,单次生成即可输出 30 秒成品;支持最多 50 个参考素材校准,后续可直接编辑无需重新生成。
现已在 Popcraft 上线,与 Seedance 2.0 并行可用。
两段 30 秒演示
字节跳动官方演示视频共两段,均为模型原生支持时长。每段均为单次生成——画面、镜头运镜与音频同步输出,无需后期拼接。
需要关注的核心要点
这四项提升是决定镜头看起来是实拍素材还是生成内容的细节。
符合空间物理逻辑的光线
眼部反光呈现出具有通透深度的真实质感,光线方向、衰减与漫反射均遵循场景物理规律,而非生硬绘制效果。
连贯稳定的镜头运动
推、拉、摇、移镜头轨迹更加平滑稳定,确保30秒时长的镜头运动全程保持流畅自然。
曲线化自然表情过渡
眼部微颤、唇肌收紧这类微表情,会以连续动态贯穿整个节拍,而非在不同姿态间生硬跳转。
皮肤、毛发与真实感鸿沟
皮肤纹理、发丝光泽与面部细微动态更接近实拍效果,大幅减少AI生成人脸标志性的塑料感。
四项核心升级,时长只是其中之一
在四个维度实现了2.5代跨越:更长生成时长、更丰富参考支持、精准编辑能力、多语言创作。时长是最直观的升级,而编辑能力才是日常生产中感知最强的改进。
单次生成可达30秒
单次生成最长支持30秒,全程保持镜头运动连贯、画面一致性与完整叙事逻辑。Seedance 2.0版本最高仅支持15秒。高保真时序延展可对短片段进行前后延展,或拼接两个独立片段。
单次提交即可配齐镜头所需全部素材
单次生成可导入30张图片、10段视频与10段音频素材,同时配置人物、商品、场景、镜头运镜、配乐及配音。2.0版本仅支持最多9张图片与3段素材。
修改细节,保留原片
可控视频编辑将完整保留画面帧、镜头逻辑与节奏,仅重写你指定修改的内容:背景、服饰、商品、演员表情、配乐均可单独调整。再也不用因为30秒成片里的一处瑕疵就全部重新生成。
用你自己的话描述需求
原生支持中文、英文、西班牙文、印尼文、马来文、泰文、阿拉伯文、葡萄牙文、越南文、日文、韩文等多种语言,无需预先翻译提示词即可直接输入模型。全语言下的指令遵循能力均有大幅提升。
2.5 版本与 2.0 版本逐项对比
Seedance 2.0 版本仍将保留可用,对于短时长素材的4K生成,它依然是合适的选择。
| 功能特性 | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| 单次最长生成时长 | 15秒 | 30 秒 |
| 参考图片 | 9 | 30 |
| 参考音视频片段 | 3 | 10 段视频 + 10 段音频 |
| 参考素材总时长 | 15秒 | 视频最长30秒,音频最长30秒,分别统计 |
| 纯音频参考 | — | 支持 |
| 提示词中的时间戳 | 仅镜头编号 | 整秒时间戳 |
| 多视角主体图像 | 不建议使用 | 支持 |
| 输出宽高比 | 6 种固定比例 | 支持输入设置 0.4 至 2.5 之间任意比例 |
| 输出 MOV 格式,便于编辑与续接 | — | 支持:拼接处色彩与音频连贯过渡 |
每个素材均关联对应任务
统计数量只是基础。真正实用的是:每个素材都会标注 @ 标记并分配明确角色,因此模型可以准确识别哪张是主体、哪张用于光照参考。
单文件最高支持 4K 分辨率、30 MB 大小。支持格式:JPEG、PNG、WebP、BMP、TIFF、GIF、HEIC、HEIF。2.5 版本已支持同一主体的多视角素材组,2.0 版本不建议使用该类素材。
分辨率 480p 至 4K,单文件 200 MB,单片段时长 2–30 秒,支持 MP4、MOV 格式。所有片段总时长合计为 30 秒。
单文件 15 MB,单片段时长 2–30 秒,支持 MP3、WAV 格式,单独统计总时长上限 30 秒。纯音频参考为 2.5 版本新增功能:背景音乐、人声或音效轨可独立控制画面节奏、节拍对齐与口型同步。
参考素材可承载的作用
- 主体
- 人物、动物、产品、道具、场景或虚构角色的外观与声音——该对象在整条片段中需保持设定一致。以 @image 1 中的女性作为主角,在黄昏时分的城市街道上行走。
- 动效
- 可从片段中提取动作、镜头运动、时序与特效,应用至其他主体。支持跨物种、跨风格迁移,不仅限于同素材镜头复用。沿用 @video 1 中的镜头运镜与奔跑节奏;主体采用 @image 1。
- 白模
- 使用无材质的粗糙 3D 白模确定镜头调度与场景布局,最终材质、光照与氛围由静态参考图提供。此场景下低精度几何体效果优于精细模型。渲染白模 @video 1 中的动效;主体采用 @image 1,场景采用 @image 2。
- 风格
- 提取图片或片段的调色、影调与质感,保留原有出场角色设定。沿用 @video 1 的冷蓝色夜景调色,保留 @image 1 中的主角。
- 音频
- 音乐、旋律、对白或人声音色。为每个角色指定对应音色后,生成影片将自动使用该语音输出。父亲音色:低沉、平缓、中年感。参考素材:@audio 1。
- 故事板
- 多格分镜板用作剧情大纲。要求不超过 15 格,优先使用线稿分镜,分镜内不要绘制文字。最终将遵循剧情逻辑生成,而非逐帧还原分镜画面。遵循 @image 1 中的 4 格分镜;角色采用 @image 2。
- 关键帧
- 可使用单张图片作为起始帧、两张图片分别作为首尾帧,或是一组独立关键帧。与分镜不同,生成结果会严格遵循这些关键帧设定。@image 1 为起始帧,@image 5 为结束帧;让她从室内走到室外。




不再只有重新生成这一种选择
两项功能均以 @video 1 作为已完成的基础片段,未指定修改的内容将全部保留原样。编辑功能:重写已有片段的指定部分。延展功能:在片段前后补充生成新内容。


重写指定区域,保留其余内容
支持添加主体、移除主体、参考图片替换服装或场景、修改音频——更换背景音乐、添加音效、重新配音。可通过时间戳限定编辑范围:例如仅修改 0:02–0:05 区间,区间外内容完全不动。
规范有效指令格式 分为三步:指明源素材、说明修改对象与修改内容、最后添加保留条款,让模型不对画面其余部分进行改动。
将 @video 1 中男子的深色服装\n替换为 @image 2 中的服装。\n其余所有内容保持不变。
填写前后衔接内容
可从最后一帧向前延伸、从首帧之前的时刻向后补全,也可生成两段片段间的缺失过渡,让剪辑衔接自然。角色、场景与镜头将在接缝处连贯延续,还可要求实现画面与声音的无缝过渡。
通过延伸功能,无需重制已有合格片段,即可将原本仅6秒的优质内容扩展为完整的30秒成品。推荐使用MOV导入导出方式,可保证拼接处的色彩、亮度与音频一致性。
从视频 @video 1 的最后一帧开始延伸\n6 秒:她走出画面,天色变暗,\n路灯逐一点亮。保持过渡自然。
输入源已自动设定项
2.5 版本会根据源素材是否固定输出形态来划分任务类型。2.0 版本无此区分,这也是从旧版本迁移的用户最容易感到差异的地方。
| 任务 | 宽高比 | 时长 |
|---|---|---|
| 编辑 | 与源片段锁定一致 | 跟随源素材,误差约在 0.3 秒以内 |
| 首帧,或首尾双帧 | 与首帧画面锁定一致 | 可自定义设置 |
| 延伸扩展 | 与源片段锁定一致 | 可自定义设置 |
| 参考生成 | 不限 | 可自定义设置 |
| 分镜与关键帧 | 不限 | 可自定义设置 |
30秒时长的价值所在
本模型适用场景分为五大类。其中四类可大幅缩短工作耗时,第五类则是仅当生成长度达到此时长后才能够实现的全新场景。
完整演绎单场剧情
单次生成即可完整呈现一段剧情节点,通过参考静帧保持出场角色一致性。穿模、穿帮等连贯性问题仅需简单编辑即可修正,无需重新生成全部内容。
一份母版,衍生所有版本
先制作一份主剪辑,即可快速衍生不同版本:替换商品SKU、出镜模特、画面文案或投放市场,同时通过参考锁定产品外观与品牌视觉风格。还可按需生成多语言配音。
一条成片讲清完整概念
30秒内从头到尾完整讲解一个观点,无需重新录制即可更换讲解人,同一份内容还可快速分发为多语言版本。
完整演示操作流程
从头到尾展示装配与操作步骤,可针对不同产品自动替换铭牌、参数面板与包装文字,原镜头画面保持完好。
15秒短片无法承载的创作
游戏预告片与CG、虚拟主播、短片扩展为系列、为季节过场调整角色年龄或重制造型。
按照分镜表格式撰写
请将模型视为正在阅读结构化简报的制片人。下述格式是可顺畅交接给他人的标准规范。









共5个部分,按此顺序排列
主体、地点、事件、类型风格、镜头运动。 随后是镜头序列——可使用整秒时间戳或编号镜头,两种格式均可识别——逐段描述画面内容、镜头运镜、台词与音效。最后标注恒定参数:拍摄角度、环境、氛围、背景持续音效。
请保持每秒画面对应约一秒的叙事内容。窗口内信息量过少时模型会自行补全;信息量过多时模型要么疯狂跳剪,要么直接丢弃半数内容。
在文本中标注每一项素材
按上传顺序为素材编号,在提示词中分别标注对应主体、配音、动作、场景。在图片上标注名称并在提示词中使用该名称,是生成两个相同角色的可靠方法。
若参考素材已经准确,直接沿用即可,无需额外重写。重新描述其中的动作会导致模型需要协调两份冲突指令。
img1–2 为角色1,配音使用 @audio 1;\nimg3–4 为角色2,配音使用 @audio 2。\n遵循 @video 1 中的施法动作以及 @video 2 中的环绕运镜。
- 镜头语言
- 直接使用标准术语即可:景别、推镜、拉镜、摇镜、跟拍、环绕、低角度、一镜到底、滑动变焦、手持拍摄、变速。小众术语需附加通俗说明,转场效果需同时标注触发时机与转场方式。
- 动作与表情
- 大部分动作只需概括描述,仅对 2 至 3 个关键节点补充细节。表情请用文字具体描述,不要使用成语代称。
- 优先正向描述
- 请描述应当存在的内容。仅在涉及字幕、背景音乐时可使用否定描述(如:无字幕、无背景音乐)——这两类也是模型最容易自行额外添加的内容。
- 音效
- 环境音、特效音、对白、配乐均可通过音频参考指定,也可在提示中描述,包括有人说话时哪类音效应当降低音量。
Seedance 2.5 每秒生成费用
Seedance 2.5 按输出时长秒数计费,费用与您选择的分辨率挂钩。套餐档位费率将自动生效——折扣归属对应套餐,每次生成都可享受。
Seedance 2.5 标准计费下 720p 分辨率的生成费用。480p 分辨率每秒消耗 24 点数——在最终生成前用于调试迭代成本更低。
月付立减20%。 该折扣适用于每一次 Seedance 生成,并非仅单次有效。
月付立减40%。 这是最优费率,哪怕生成30秒内容跑两次也划算。
常见问题
可以。Seedance 2.5 已在 Popcraft 视频模型选择器上线。您可在 Seedance 2.0 旁找到该模型,设置最长 30 秒时长后即可生成内容。
不会。Seedance 2.0 以及 Seedance 2.0 4K 版本仍会保留在模型列表中。仅需 6 秒的商品展示无需 30 秒的时长上限,且 4K 输出也是选择 2.0 版本的理由。2.5 版本新增了更长时长、参考素材数量支持,以及编辑已有片段的能力。
上限为 50 份,建议远低于该数值:图片参考不超过 8 张;若主要参考为音频或视频,则不超过 5 份;视频片段建议 5-10 秒;分镜脚本不超过 15 帧。超出上述数值后,生成稳定性会下降,往往需要重复生成才能得到合格结果。
拿一段您已经满意的片段进行延长。延长测试是成本最低的验证方式,因为它基于您已经认可的素材。如果拼接处过渡自然(人脸、色调、镜头速度均无破绽),那么该模型的其他特性也值得花时间生成体验。如果效果不佳,您也仅损失了几秒钟的生成成本。
继续探索
相关模型
MiniMax H3 生成 24fps 的 2K 视频,并同步配有立体声声纹——音效、环境音和对话一次完成。单提示词多镜头切换,5 至 15 秒,支持首尾帧控制。Popcraft 现已上线。
在 Popcraft 上使用 Seedance 2.0,从文本、图片或片段生成电影级 4K 视频。原生同步音频、多镜头序列,以及最高 4K (2160p) 的极致清晰细节。

Seedance 2.0 Mini 是字节跳动推出的轻量版视频生成模型,相比标准版 Seedance 2.0 成本最高降低 50%,生成速度约为快速模式的 2 倍,支持文本、图像、视频、音频提示词输入。现已在 Popcraft 上线。

在 Popcraft 使用 Seedance 2.0,将图像与提示词转换为电影级视频。支持参考图转视频、首尾帧锁定、多比例输出,最高可达 4K 分辨率。
