ECCV 2026 | 一段视频,重建一个可仿真的动态世界

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
ECCV 2026 | 一段视频,重建一个可仿真的动态世界
6100点击    2026-08-18 10:50

机器人走出实验室后,训练数据不再只是 “多不多” 的问题:环境能否覆盖真实世界的尺度、遮挡、接触和运动,直接决定策略能否落地。Real2Sim 因此重新受到关注 —— 如果普通视频也能变成可交互的仿真场景,采集成本会比人工建模或专用设备低得多。


难点在于,视频里看见的世界并不等于物理引擎可用的世界。现有 4D 重建常以隐式场、Gaussian primitives 或点云为结果,适合新视角渲染,却很难直接拆出独立对象,也缺少封闭 Mesh、真实尺度和稳定的时序运动。


OVOW(One Video, One World)给出的答案很直接:从一段普通单目视频出发,把场景拆成实例,补全几何,恢复尺度与运动,再按照重力、接触和支撑关系重新组装,最终得到可以进入物理引擎的 4D Mesh 世界。该工作由清华大学、中国科学技术大学、SparcAI 等团队完成,已被 ECCV 2026 接收。


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

OVOW:从单目视频出发,恢复实例级 4D Mesh 世界,并将其送入物理仿真


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

  • 论文标题:One Video, One World: Turning Monocular Video into Physical 4D Scenes
  • 项目主页:https://onevideooneworld.github.io/
  • 论文:https://arxiv.org/abs/2606.31388
  • 代码:https://github.com/SparcAI-Inc/OVOW


从 “能渲染” 到 “能仿真”


OVOW 的突破不只是 “重建得像”,而是输出可编辑、可碰撞的实例级 Mesh:刚体记录真实尺度与逐帧 6-DoF 位姿,非刚体保留拓扑一致的时序形变。对象因此能被单独移动、删除或替换。


系统还会估计地面和重力,修正悬浮、穿透与错误支撑;单张图片也可作为一帧视频处理。


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

Image-to-3D Reconstruction:每组左侧为输入图像,右侧为 OVOW 恢复的实例级 3D Mesh 场景。系统能够在单图条件下恢复独立对象、完整几何与空间布局。图片来源:OVOW 论文 Figure 5 / 项目主页。


一条从视频到物理世界的流水线


整条流水线不另训专用大模型,而是串联视觉基础模型,依次完成场景理解、几何与运动恢复、物理组装。


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

OVOW 方法总览(阶段 1–3):从视频中的对象发现与运动分类出发,分别恢复静态/刚体 Mesh、可变形 Mesh 序列、真实尺度与逐帧运动


系统先识别实例与运动类型并生成跨帧掩码,再补全遮挡区域,恢复静态、刚体及可变形对象的 Mesh;随后估计真实尺度与逐帧运动,最后校正地面、重力、悬浮、穿透和支撑关系。


关键设计|不依赖预定义骨架或类别模板,直接用顶点形变统一描述静态、刚体与非刚性运动。


一套表示,覆盖静态、刚体与非刚性运动


OVOW 以实例 Mesh 为底座,将整体轨迹与局部形变分开,因而能同时处理车辆、飞机等刚体,以及飞鹰、北极熊等非刚体。


案例一|桌面刚体


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

动态 GIF:左侧为黑色越野车、哑铃与花盆组成的输入视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示


案例二|室内多对象


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

动态 GIF:左侧为黑色越野车、哑铃与花盆组成的输入视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示


案例三|飞鹰形变


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

动态 GIF:左侧为野外飞鹰视频,右侧为 OVOW 恢复的拓扑一致非刚性 4D Mesh。画面来自 OVOW 项目主页官方演示


案例四|机场多刚体


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

动态 GIF:左侧为机场多对象视频,右侧为 OVOW 恢复的实例级刚体 Mesh 场景。飞机、摆渡车与航站楼被分别重建。画面来自 OVOW 项目主页官方演示


案例五|北极熊形变


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

动态 GIF:左侧为包含北极熊及多个物体的视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示


从重建结果到物理仿真的最后一公里


可仿真的关键,是改变初始条件后,场景仍能产生新结果。


仿真与编辑


OVOW 可重新摆放对象或施加外力,由物理引擎计算新的碰撞、倾倒和位移。


案例一|原始布局


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

动态 GIF:OVOW 项目主页“Simulation and Editing”中的 Toy-Car Tabletop I。重建得到的黑色越野车、哑铃、花盆与桌面资产在新的初始状态下发生碰撞、倾倒与位移


案例二|改变布局


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

动态 GIF:Toy-Car Tabletop II。花盆位于车辆前方,哑铃与书本采用新的初始位置;在重力与接触作用下,各实例产生与案例一不同的碰撞和位移


案例三|重新组合


ECCV 2026 | 一段视频,重建一个可仿真的动态世界

动态 GIF:Toy-Car Tabletop III。哑铃、花盆、书本与黑色越野车被重新组合,由同一组重建资产生成第三套倾倒、滑动与碰撞过程


三段动画复用同一组资产,仅改变初始布局便产生不同轨迹;这不是视频重放,而是物理引擎重新计算的结果。


重建质量与流水线可靠性


团队构建了各含 120 个场景的静态与动态基准,每个场景含 3–5 个对象,并提供 Mesh、轨迹、相机、深度和分割真值。


动态基准上,Scene-IoU-OBB 为 0.440、Object-IoU 为 0.210,速度为 3.35 秒 / 帧。运动类型识别、位姿恢复、有效场景与重力仿真稳定率分别为 95.4%、92.4%、86.8% 和 82.7%,速度较逐帧方法提升一至两个数量级。


当普通视频成为 Physical AI 的数据入口


对 Physical AI 而言,RGB 像素只是入口。策略训练真正需要的是对象边界、几何、尺度、轨迹,以及接触和支撑等能够被执行的状态。OVOW 把视频变成实例级 4D Mesh,再由仿真器改变布局、目标和外力,从同一段观测扩展出多组反事实交互轨迹。


这也使 OVOW 可以成为 D4RT 类数据管线的上游。D4RT 用统一的时空查询接口学习深度、相机和 3D 点轨迹,训练时从带真值轨迹的数据中采样时空查询;OVOW 则能提供对象级 Mesh、相机、深度和运动,并在仿真中生成更长、可控、带真值的 tracking 序列。两者并非同一种方法,但在数据生产上可以衔接:OVOW 负责把真实或生成视频变成可仿真的世界,再输出 D4RT 式重建与跟踪任务所需的训练样本。


数据链|普通视频到实例级 4D Mesh,再到物理仿真、可控长时轨迹,以及 4D 重建、跟踪模型与机器人策略。


因此,OVOW 的价值不只是复现一段视频,而是把一次观测变成可以反复干预的数据源:重新摆放对象,制造碰撞、遮挡和长尾状态,再把这些原本很难采集的过程交给世界模型与机器人策略学习。


ONE VIDEO, ONE WORLD|一段视频,记录的不应只是世界的外观;它也可以成为一个能够被理解、编辑和仿真的物理世界。


作者介绍


作者团队来自清华大学、中国科学技术大学、SparcAI、香港理工大学、电子科技大学、南洋理工大学,关注三维视觉、动态场景理解与具身智能。Junhao Chen 与 Boran Zhang 为共同一作,Yufei Wang 为通讯作者。


文章来自于"机器之心",作者 "Junhao Chen 与 Boran Zhang"。

AI转型,免费服务,就找AITNT