文本指令驱动的视频编辑技术正在从离线内容生产走向直播特效、视频会议和增强现实等在线交互场景。
然而,高质量的视频扩散模型的通常依赖于对完整视频进行双向时空注意力处理,即模型需要等待未来帧到齐,再对整段视频进行联合处理。这种范式能够获得较好的编辑结果,却难以满足低延迟、持续输入与即时输出的要求。
近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步 / 视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。

目前,该工作已被计算机视觉顶级会议 ECCV 2026 接收,其训练、测试代码和模型均已开源。

迈向实时视频编辑的两道门槛
流式视频编辑与常规视频生成任务存在差异:视频生成可以从高斯噪声中自由地合成新的内容,而编辑任务需要在改变目标区域的同时,尽可能保持原始视频中的人物结构、背景纹理、光照和运动轨迹。
因此,直接复用面向生成的流式框架,往往会带来背景闪烁、结构漂移或编辑范围失控。
1. 从双向注意力到因果注意力,会发生分布偏移
双向视频扩散模型通常能够同时访问过去帧和未来帧,并利用邻近帧的双向信息维持结构稳定。进入流式场景后,未来帧尚未到来,模型只能查看当前与历史内容。论文观察到,如果直接截断未来帧,原本集中于邻近帧的注意力会被摊薄到更长的历史范围,破坏预训练阶段形成的局部时序先验。最终表现为模型对原始视频结构的「遗忘」,并在长时间编辑中出现闪烁或漂移。
2. 未编辑区域的重复计算,成为实时推理的主要负担
在多数编辑任务中,真正发生语义变化的区域只占画面的一部分。背景、结构和大量静态纹理在相邻视频块之间高度相似,但标准视频扩散模型仍会让所有空间 Token 反复通过 Self-Attention、Cross-Attention 和 FFN。对这些未编辑区域进行密集重计算,不仅浪费算力,也可能让本应保持不变的内容被模型反复「重画」。

LiveEdit:先迁移编辑能力,再压缩为 4 步因果推理
LiveEdit 设计了渐进式的三阶段蒸馏流程。其基础模型建立在 Wan2.1-T2V-1.3B 之上,训练数据由从现有的视频编辑数据集 Ditto-1M 筛选得到的两万组高质量数据对。
阶段一:Foundation Tuning,建立高质量双向编辑先验
第一阶段保留完整的双向 DiT 结构,让模型充分学习从原始视频、编辑指令到编辑结果的复杂映射。为了避免序列长度进一步增长带来的计算开销,在输入端将原始视频潜变量与噪声潜变量沿通道维度注入,而不是在时空序列维度追加 Token。该阶段的目标不是追求流式推理,而是先获得稳定、准确的编辑能力。
阶段二:Teacher Forcing,对齐分块因果注意力
第二阶段引入块状因果注意力(chunk-wise causal attention)。每个视频块只能访问当前块和历史块,时间块大小设置为 3 个潜空间帧。通过教师强制(Teacher Forcing),模型在明确的因果约束下学习复现第一阶段的编辑分布,使双向模型的局部结构先验逐步迁移到单向、分块的因果扩散模型中。
阶段三:DMD,分布匹配蒸馏把 100 次推理压缩到 4 次
完成因果初始化后,LiveEdit 使用分布匹配蒸馏(Distribution Matching Distillation)继续压缩采样过程。不同于依赖高成本 ODE 初始化的常见自回归蒸馏路线,生成器直接由第二阶段的因果扩散模型权重初始化,并通过分布匹配进行训练。最终,推理步数从 100 次降至 4 次,同时移除需要额外前向计算的 Classifier-Free Guidance。

面向自回归的掩码缓存:让未编辑区域不再反复计算
仅减少扩散步数仍不足以实现稳定高效的实时视频编辑。LiveEdit 进一步提出面向自回归的掩码缓存(AR-oriented Mask Cache),比较前一个视频块中原始视频潜变量与编辑结果的差异,按照一定阈值预测当前视频块中可能发生编辑的空间区域掩码。掩码将 Token 划分为活跃编辑区域与未编辑区域:需要被编辑 Token 继续执行完整计算,未编辑 Token 则优先复用先前缓存的中间特征。
这里使用的阈值并非固定设置,而是根据当前 Token 的冗余程度动态调整。在论文采用的推理配置下,70% 的冗余空间 Token 被裁剪。
这一设计利用了视频编辑区域在相邻视频块之间通常不会发生突变的特点。由于当前块的掩码可以由前一块的编辑差异推断得到,模型无需再额外运行计算开销较大的分割模块。
缓存位置同样经过专门设计。消融实验发现,Self-Attention 特征在相邻时刻之间具有较强的重复性,因而更适合进行跨时间复用;相比之下,FFN 保留了更多纹理和局部结构等高频空间信息,直接复用容易造成画面模糊,甚至引起结构不稳定。因此,最终方案将缓存应用在 Self-Attention 层,而不是简单缓存整个 DiT 块。

12.66 FPS:流式速度与编辑质量如何兼顾?
在效率测试中,LiveEdit 处理 81 帧视频的总延迟为 7.89 秒,达到 12.66 FPS;LiveEdit 通过三阶段蒸馏和缓存机制共同将流式视频编辑系统推入实时化的速度区间。
为了评估通用流式编辑能力,研究团队建立了包含 120 组样本的测试集,并从文本对齐度、背景一致性、运动平滑度、动态程度、美学质量和视频质量等六个维度进行比较。
定性结果显示:LiveEdit 能够准确完成局部颜色、材质和属性替换,并减少向非编辑区域漂移的情况。并且,缓存机制在保持背景一致性的同时,没有削弱文本指令对齐和运动连续性。
同时,用户研究邀请 20 名志愿者对各个方法的结果在指令一致性、背景保留和整体质量三方面进行排序:LiveEdit 在三项指标上的 Top-3 偏好率分别达到 100.0%、87.5% 和 95.8%。

从离线后期处理走向持续在线编辑
LiveEdit 的目标并不只是一个更高的 FPS 数字,而是针对「流式视频编辑」设计实时化路径。这一路线为直播特效、视频会议、实时内容创作与交互提供了更直接的技术基础。
不过,当前方法仍依赖相邻视频块编辑区域较稳定的假设;当目标快速移动、编辑区域剧烈变化或出现大范围全局修改时,掩码估计与缓存复用策略仍有进一步优化空间。
如何在更长视频、更高分辨率和复杂交互指令下保持稳定,也将是后续值得关注的问题。
文章来自于微信公众号 “机器之心”,作者 “机器之心”
【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。
项目地址:https://github.com/Henry-23/VideoChat
在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat
【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。
项目地址:https://github.com/PeterH0323/Streamer-Sales