字节跳动 Seed 研究团队在 2026 年 7 月 31 日正式发布新一代 AI 视频生成模型 Seedance 2.5。相比上一代 Seedance 2.0,这次升级集中在三个方向:单次连续生成最长 30 秒、最多 50 项参考输入、时间戳级区域编辑。但一个关键落差需要先说明——6 月 23 日预览时承诺的原生 4K 输出没有落地,量产版分辨率只有 480p 和 720p。

模型已于 7 月 31 日首发上线字节跳动自家的即梦(Dreamina)和豆包 Pro,8 月第一周通过 BytePlus ModelArk 和火山引擎开放 API 接入。

版本号跳过 2.1 到 2.4

Seedance 2.5 直接越过 2.1–2.4 四个版本号,用来标明这是一次代际升级,而非小版本迭代。它在 6 月 23 日的火山引擎 FORCE 大会上首次预览,7 月 31 日正式量产。

单次生成 30 秒,比上一代翻倍

Seedance 2.0 的原生单次生成上限是 15 秒,Seedance 2.5 把它拉到了 30 秒。意义在于:以往要生成一段长视频,得把多段短生成拼接起来;现在可以一次连续跑满 30 秒,再通过多轮延长继续加长。

字节跳动把这项能力称为"长镜头一致性"(Long-Form Shot Consistency),指角色和复杂镜头在整段片段内保持一致,不靠拼接。

参考输入从 12 项增加到 50 项

新一代最多能在一轮生成里放进 50 项参考输入——30 张图片、10 段视频、10 段音频。相比之下,Seedance 2.0 的参考预算只有 12 项(9 图 + 3 视频 + 3 音频),新增容量约是原来的四倍。

50 项的余量意味着可以在同一次请求里放下完整的品牌风格指南、角色三视图和参考音频,用于约束角色的外观、场景和声音。

时间戳级区域编辑

新模型支持时间戳级区域编辑:只调整片段中某一时刻或某一区域,不必重新生成整段视频。对需要反复修改的镜头,这能把整段重渲染变成定点修复,节省时间和生成配额。

物理与多主体稳定性

字节跳动明确点名了两项相对 2.0 的提升:复杂运动的物理合理性,以及多主体交互场景的稳定性。配合导演式镜头控制,具体的镜头调度指令在成片里能更稳定地落实。

原生音频覆盖 10 种以上语言

Seedance 2.5 在生成视频的同一轮里同步生成音频,支持 10 种以上语言的对白,不需要单独走一条配音流水线。这对广告、电商和多语言本地化场景比较实用。

一个需要核实的落差:4K 没来

这是本次发布最值得注意的更正点。6 月 23 日预览时,官方曾宣称支持原生 4K 输出;但 7 月 31 日正式量产版的分辨率只有 480p 和 720p,上限反而低于 Seedance 2.0 最高 1080p 的水平。

也就是说,时长和参考量上去了,分辨率没有兑现。在向客户承诺 4K 出片之前,需要以实际规格为准再做承诺。

与竞品的对比

  • Kling 3.0:多镜头分镜方向,原生 4K,单镜头上限 15 秒,60fps。
  • Veo 3.1:原生音频带口型同步,支持场景延长到约 148 秒。
  • Runway 4.5:物理精度领先,适合复杂多步运动与电影感宽幅画面。

Seedance 2.5 的差异化长板,在于单镜头的连续时长、参考输入的体量,以及定点区域编辑;短板则落在分辨率上。

怎么用上

普通用户可在即梦和豆包 Pro 里直接使用;开发者通过 BytePlus ModelArk 与火山引擎的 API 接入(2026 年 8 月第一周开放)。


对于需要一次生成更长、更一致的成片,又要控制反复修改成本的视频团队,Seedance 2.5 是有针对性的升级;但它不是全维度领先——分辨率这块明确落后于上一代,也落后于主打原生 4K 的竞品。是否采用,取决于你对"一次生成多长"和"输出多清晰"这两个指标的取舍。