# 字节发布 Seedance 2.5：单次生成 30 秒视频，支持多模态参考与精准编辑

- 来源：字节 Seed：Research Feed（网页内嵌数据）
- 发布时间：2026-07-31 00:00
- AIHOT 分数：80
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cms8f7n9q0bezrot06im88lqu
- 原文链接：https://seed.bytedance.com/zh/blog/%E4%B8%80%E9%95%9C%E6%88%90%E7%89%87-%E9%9A%8F%E5%BF%83%E5%8F%82%E8%80%83-seedance-2-5-%E6%AD%A3%E5%BC%8F%E5%8F%91%E5%B8%83

## 精选理由

Seedance 2.5 把单次生成拉到 30 秒，加上多模态参考和精准编辑，让视频创作从片段拼凑变成完整叙事。对国内创作者来说，这是即梦和豆包里能马上用到的最强视频模型。

## AI 摘要

字节跳动今日正式发布新一代视频创作模型 Seedance 2.5，单次视频生成时长从 15 秒提升至 30 秒，并支持多轮延长，可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材，并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台，API 服务近期将上线火山方舟。

## 正文

今天，我们正式发布新一代视频创作模型 Seedance 2.5。Seedance 2.0 发布后，我们观察到，用户对视频创作模型的期待正在从“生成一个片段”走向“完成一段创作”。Seedance 2.5 延续了 Seedance 2.0 统一的多模态音视频联合生成架构，重点突破长叙事能力、多模态参考能力和编辑能力。围绕真实的产业场景，让创作拥有更大的想象空间，并进一步释放生产力。

其核心亮点如下：

单次生成时长达 30 秒，支持多轮延长：Seedance 2.5 可单次生成 30 秒高质量视频片段，并支持多轮延长。同时，模型优化了镜头衔接和场景过渡，让长视频保持更好的连贯性。模型还大幅优化了画质、音质以及运动质量，并有效弱化了视频生成中常见的“油腻感”。用户可以生产数分钟具有统一视听语言、高质量的连贯内容，精彩故事一次呈现。

多模态参考能力全面升级：Seedance 2.5 支持用户单次输入最多 30 张图片、10 段视频、10 段音频作为参考素材。模型还提升了白模参考、运动参考、创意参考等各类参考能力，使模型能更好地理解创作意图，实现多主体、多场景、多镜头变化的复杂创意。

更精准、稳定的编辑能力：Seedance 2.5 支持精准的时间戳控制，可定向编辑视频内容，提升创作的效率和可控性。同时，模型强化了绿幕编辑、视角编辑、参考编辑等多种编辑能力，满足影视、广告等更多专业、复杂场景的创作需求。

凭借长叙事、多模态参考、编辑能力的提升，模型不只能单次生成更长的视频，也能更好地理解创作意图、更可控地完成从想法到视频落地的全过程。接下来，我们想邀请你一起观看一段创意短片，全片由 Seedance 2.5 独立生成。

视频 · 前往原文观看

今天，Seedance 2.5 正在陆续上线即梦 AI、豆包专业版等平台，API 服务也将在近期上线火山方舟，欢迎体验和反馈。

项目主页：

https://seed.bytedance.com/seedance2_5

体验入口：

1）即梦网页端-视频生成-选择 Seedance 2.5

2）豆包专业版-视频生成-选择 Seedance 2.5

30 秒长叙事、支持多轮延长，精彩故事一次呈现

Seedance 2.5 将单次视频生成时长从 15 秒提升至 30 秒，同时进一步提升长视频中的叙事能力。模型可以在 30 秒内组织多个有逻辑关联的镜头，让故事从铺垫、推进、转折到收尾逐步展开，而不是简单延续一个画面。比如创作一段歌手一镜到底上台演出的片段，模型演绎了歌手在化妆间与工作人员互动后，穿过后台走廊与伴舞相遇并一起登台演出的完整故事，而非仅歌手上台的画面。

视频 · 前往原文观看

T2V prompt：一镜到底手持稳定器跟拍，镜头从红色厚重幕布缝隙缓缓推进，进入暖色后台化妆间。年轻女歌手背对镜头整理耳机，工作人员提醒她准备登台。她回头看向镜头，开始唱起 City Pop。镜头后退跟拍，歌手穿过幕布进后台通道，与舞伴自然互动，一位工作人员把麦克风递给她。随后歌手与舞伴登上舞台，镜头绕至背面，红黑舞美、LED 屏、追光、烟雾与反光地板逐渐展开。镜头最终拉远至体育馆全景，呈现满场观众、灯牌、荧光棒与欢呼声，营造年轻自由的演唱会高潮氛围。

凭借模型的多轮延长能力， 用户能在已有的视频结果上自然衔接后续镜头，并在延长过程中保持主体特征、场景环境和叙事节奏的连贯，最终生成数分钟具有统一视听语言的连贯内容，减少拆分镜头、反复拼接和处理衔接的成本。

视频 · 前往原文观看

R2V prompt：延长视频，衔接 @视频 1 画面内容和主体继续生成一个 30 秒的视频，保持人物主体、场景、画面风格、声音音效一致。小男孩抱着足球沿车厢跑，地铁停稳后侧边门打开，他立刻冲出，男主紧追。两人一路穿过站台跑到街上，惊动街边路人，男主最终追上并抓住他，小男孩委屈抬头，男主慢慢消气，摸摸他的头，露出无奈笑容。

在画面呈现上，模型能更好地做到自然的运镜衔接，主体在多次切镜中仍保持稳定，音画始终对齐，使长视频生成结果更连贯。比如在一段京剧表演中，镜头伴随主角旋转水袖甩动完成一次优雅的环绕运镜，主体和背景的呈现始终保持一致。水袖在空中的摆动形成自然的弧线，更遵循物理规律。

视频 · 前往原文观看

R2V prompt：16:9 宽幅电影级质感，一镜到底，丝滑运镜，无剪辑。场景参考 @图片 4。 0-5 秒：@图片 2 霸王近景开场，镜头缓慢环绕上半身并过渡至中景；霸王旋身翻转，随后身体与靠旗从镜头前快速掠过，形成自然遮挡，镜头顺势绕至 @图片 1 虞姬身侧。6-10 秒：镜头稳定环绕 @图片 1 虞姬中景，跟随水袖动作完成环绕运镜虞姬抬臂、挑腕、展袖、半转身。最后收袖定格，侧身看向霸王。11-20 秒：@图片 3 武生出场完成后空翻腾动作，随后霸王居中，武生在对侧进退攻防。虞姬位于霸王侧后方以水袖配合，形成刚柔对比。镜头从武生中近景缓慢后拉至舞台大景，结尾三人面向观众同步京剧落幕亮相。

此外，针对视频生成中常见的“油腻感”问题，Seedance 2.5 对物体材质、人物肤质与眼神、光影、画面饱和度等细节进行系统优化。模型还减少了字幕与背景音乐不受控的情况，使成片更接近实拍的影视质感。

多模态参考能力全面升级，复杂创作任务更可控

Seedance 2.5 进一步强化多模态参考能力，支持用户单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材。更多数量、不同类型的参考素材，能更好的还原用户脑海中的创意，生成主体更多、场景更丰富、镜头变化更灵活的复杂视频内容。

模型能综合理解不同素材中的画面构图、场景、风格、人物、道具等元素，并按指令将这些参考素材用于视频生成。在多人同框、群像叙事等复杂场景中，也能同时还原多个人物的形象与声音，保持各主体特征稳定。

视频 · 前往原文观看

R2V prompt：30 秒音乐会片段，16:9 横屏，电影感写实，真实音乐厅光影，暖金色舞台灯，正式古典音乐会氛围。场景@图一，钢琴家参考@图二，大提琴参考@图三，小提琴参考@图四，主唱参考@图五，管弦等其他乐队参考@图六到图十，合唱团参考图十一到图十四，观众席参考@图十五到图十八。主唱舞台中央走向前沿，钢琴家在钢琴旁，乐队分布两侧与后方，合唱团在舞台后方。开场高位俯拍音乐厅全景，钢琴家落键，主唱进入追光演唱，镜头自然带过小提琴、大提琴与管弦乐队，小提琴明亮，大提琴温暖。后段合唱团加入，主唱与第一排观众短暂眼神交流，观众微笑点头。结尾镜头后移，演唱结束，观众跟随鼓掌。

此外，模型还提升了白模参考、运动参考、创意参考等各类参考能力，让画面中的主体、动作、运镜更可控。比如，在白模参考中，用户可以用无纹理 3D 模型搭出画面的空间结构、主体姿态、运动轨迹和镜头机位，再让模型参考这套结构生成视频，使复杂镜头的构图和调度更接近预期。同时，模型还增强了光照控制能力，通过白模的空间信息，生成符合真实物理规律的光照效果，包括光源方向、色温、强度、阴影投射等，让最终生成的画面光影更自然。

视频 · 前往原文观看

R2V prompt：参考 @白模 1 的运镜、镜头节奏、景别变化、主体轨迹和镜头调度。参考 @图片 2 的角色外形、场景、材质、光照、色彩和童话氛围，将白模渲染为梦幻温暖、儿童幻想感、3D 动画短片。剧情依次为：幻想天空飞行→云海神兽伴飞→俯冲入海→鳐鱼海底穿梭→镜面时空裂缝→宇宙摘星→幻化回房间→爸爸盖被→合上绘本定格。

更精准、稳定的编辑能力，有效提升创作效率

在视频生成创作中，用户通常需要控制生成时的节奏，并在生成后持续打磨细节。某个动作在第几秒出现、镜头在什么时间切换，或某片段里的角色、动作是否需要调整，都关系到最终成片的效果。更精准、稳定的编辑能力，可以让用户准确还原创意，提高创作效率，减少反复生成的成本。

Seedance 2.5 支持通过时间戳精准编辑音视频内容，在生成时，用户通过 prompt 控制某个时间段发生的故事、画面视角、运镜和整体节奏，使其更贴近创作意图。在生成后，用户还能针对指定片段里的角色、动作、声音或剧情进行定向修改，同时保持修改前后的连贯性和真实感。

模型还进一步提升了绿幕编辑、视角与运镜编辑、参考编辑等多种编辑能力，以满足影视、广告等更多专业、复杂的创作场景。比如，在绿幕编辑方面，模型不仅能在保持主体不变的情况下，替换不同场景、讲述不同故事，还能更好地基于不同场景的物理规则渲染人物身上的物理效果，包括衣服飘动方向、头发状态、步态节奏、光影等，使主体和场景更加和谐。

视频 · 前往原文观看

R2V prompt：把 @视频 1 绿幕背景渲染场景、障碍、服装和配角：0-4 秒：户外训练，障碍换石头、砖块、轮胎、木箱；4-10 秒：休息室，朋友鼓励；10-15 秒：国际赛场，训练杆换原创防守球员和门将，主角进球。整体写实电影级。

视频 · 前往原文观看

R2V prompt：编辑 @视频 1，保持人物、动作及画风不变，仅调整运镜。15 秒分段运镜设计：0–4 秒，微型 FPV 贴锅穿行，跟随弹起的吐司后横甩至咖啡；4–7 秒，推近并沿锅边横移，跟随煎蛋翻起落回；7–11 秒，急速升至顶视角，匀速下压扫过餐盘和钥匙；11–15 秒，手持近镜跟随双手快速横甩，最后推近早餐，再拉回双人中景。全程连贯稳定。

深入更广泛的产业场景，持续探索应用价值

随着模型能力的提升，Seedance 2.5 也在深入教育、工业等更广泛的产业场景。在教育领域，模型已开始进入真实学习场景。比如，Seedance 2.5 可以将课文背后的历史背景、人物和情节转化为视频内容，把学习内容从静态讲解转化成更生动、更沉浸感的画面。同时，模型可以帮助老师更高效地制作教学视频，将科学原理、历史事件、实验过程等抽象内容转化为动态演示，不仅降低教学物料的制作门槛，还支持灵活的内容定制。

视频 · 前往原文观看

豆包爱学 App「豆包课堂」场景示例

R2V prompt：东方写意风格。 南宋临安街景，热闹的街上几个孩子边跑边闹，孩子们嘴里张嘴念着“蓦然回首，那人却在，灯火阑珊处”。镜头始终跟随孩子们奔跑，带过热闹的街景。镜头上摇，此人正是 @图片 1 辛弃疾。辛弃疾回头，远处是在灯火阑珊中的男子，镜头连贯。

在工业制造、具身智能和自动驾驶等产业中，Seedance 2.5 也开始进入更具体的生产环节。模型可以生成高质量合成视频数据，帮助训练机器人的感知和操作能力；也可以用于工业仿真、流程培训和设备演示。在自动驾驶场景中，模型还可以模拟极端天气、复杂路况等低频场景，为系统测试和训练提供更多样本。

视频 · 前往原文观看

R2V prompt：参考 @白模 1 的运镜、构图、景别、空间关系、零件位置、模型结构、装配顺序和运动轨迹。参考 @图片 1 的材质、光照、色彩、反射和氛围，将白模渲染为高端真实汽车拼装片段。

总结与展望

Seedance 2.5 进一步增强了对真实世界的理解和呈现能力，让视频生成从片段级输出，走向更完整的创作流程。我们也看到，在复杂运动的物理合理性、极多主体交互场景的稳定性上，模型仍有提升空间。

未来，Seedance 团队将继续探索更长的连贯叙事、更懂用户的生成与编辑体验，并进一步增强模型对物理世界规律的理解。我们希望 Seedance 系列模型能更生动、更可控、更懂创作者，帮助更多用户表达创意的同时，持续探索并服务更广泛的产业需求。
