实时视频编辑进入 12.66 FPS:清华港科大 LiveEdit 的技术路径
8 月 26 日,清华大学与香港科技大学研究团队开源的 LiveEdit,提出了一条面向通用文本指令的实时流式视频编辑路线:以 4 步去噪、12.66 FPS 的速度边接收视频边编辑,同时保持未编辑区域的画面一致。该工作已被计算机视觉顶级会议 ECCV 2026 接收,论文、训练与测试代码、模型权重全部公开。
此前,基于扩散模型的视频编辑大多走离线后期路线:模型需要等整段视频到齐,再用双向时空注意力逐帧联合处理,编辑质量有保证,但延迟高,难以支撑直播特效、视频会议、增强现实这类持续输入、即时输出的场景。LiveEdit 要解决的问题,就是把这个过程压进实时区间。
流式视频编辑的两道门槛
第一道门槛是注意力机制的分布偏移。高质量视频扩散模型依赖双向注意力——同时查看过去与未来帧,靠邻近帧的双向信息维持结构稳定。流式场景下未来帧尚未到来,模型只能用当前帧和历史帧。论文发现,直接截断未来帧,会让原本集中于邻近帧的注意力摊薄到更长的历史范围,破坏预训练阶段形成的局部时序先验,长时间编辑时出现画面闪烁与结构漂移。
第二道门槛是未编辑区域的重复计算。大多数编辑任务里,真正发生语义变化的只占画面一部分,背景、结构、静态纹理在相邻视频块之间高度相似。但标准扩散模型仍让所有空间 Token 反复经过 Self-Attention、Cross-Attention 与 FFN 层,既浪费算力,也可能让本应保持不变的内容被反复重画。
三阶段蒸馏:把双向编辑能力迁移给因果模型
LiveEdit 的基础模型是 Wan2.1-T2V-1.3B,训练数据来自视频编辑数据集 Ditto-1M 筛选出的 2 万组高质量数据对。整个流程分三步:
- 第一阶段 Foundation Tuning:保留完整的双向 DiT 结构,先让模型学会从原视频、编辑指令到编辑结果的准确映射。输入端把原始视频潜变量与噪声潜变量沿通道维度注入,而不是在时空序列上追加 Token,避免序列长度增长带来的开销。这一阶段不追求速度,只求编辑能力稳定准确。
- 第二阶段 Teacher Forcing:引入块状因果注意力,每个视频块只能访问当前块和历史块,时间块大小设为 3 个潜空间帧。通过教师强制,让模型在明确的因果约束下复现第一阶段的编辑分布,把双向模型的局部结构先验逐步迁移到单向、分块的因果扩散模型上。
- 第三阶段 DMD 蒸馏:用分布匹配蒸馏压缩采样过程,推理步数从 100 次降到 4 次,同时移除需要额外前向计算的 Classifier-Free Guidance。
掩码缓存:跳过未编辑区域的重复计算
减少扩散步数还不够。LiveEdit 进一步提出面向自回归的掩码缓存:比较前一个视频块中原始视频与编辑结果的差异,按动态阈值预测当前视频块可能发生编辑的空间区域,把 Token 划分为活跃编辑区域与未编辑区域——前者执行完整计算,后者直接复用先前缓存的中间特征。论文采用的推理配置下,70% 的冗余空间 Token 被裁剪,且无需额外运行计算开销较大的分割模块。
缓存位置也经过消融实验验证:Self-Attention 特征在相邻时刻之间重复性更强,适合跨时间复用;FFN 保留更多纹理与局部结构等高频空间信息,直接复用容易造成画面模糊甚至结构不稳定。因此缓存只应用在 Self-Attention 层,而不是整个 DiT 块。
12.66 FPS 的效果与评估
效率上,LiveEdit 处理 81 帧视频的总延迟为 7.89 秒,折算 12.66 FPS。为评估通用流式编辑能力,团队建立了包含 120 组样本的测试集,从文本对齐度、背景一致性、运动平滑度、动态程度、美学质量、视频质量六个维度比较。定性结果显示,LiveEdit 能准确完成局部颜色、材质与属性替换,并减少向非编辑区域漂移;缓存机制在保持背景一致性的同时,没有削弱文本指令对齐和运动连续性。
用户研究邀请了 20 名志愿者,对各个方法的结果在指令一致性、背景保留、整体质量三方面排序,LiveEdit 的 Top-3 偏好率分别为 100.0%、87.5%、95.8%。
局限与下一步
LiveEdit 当前依赖一个假设:编辑区域在相邻视频块之间不会突变。当目标快速移动、编辑区域剧烈变化或需要大范围全局修改时,掩码估计与缓存复用策略仍有优化空间。更长的视频、更高的分辨率、更复杂的交互指令下如何保持稳定,是后续要回答的问题。
对做视频工具、直播特效与交互式内容产品的人来说,LiveEdit 的意义在于:它把训练与推理代码全部开源,将实时视频编辑从研究概念变成了可复现、可继续改进的工程起点。实时视频编辑的技术路径已经跑通,下一阶段的竞争点在更长视频、更高分辨率与更复杂编辑场景下的稳定性。