拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件
9886点击    2026-08-10 09:50

世界模型是物理原生智能(Physics-native Intelligence,Phi)重要的组成环节。


面对图像、视频和传感器数据等多模态高维观测,世界模型通常先将其编码为紧凑的低维隐状态,再在隐空间中学习状态随时间和动作变化的规律,从而预测未来并辅助决策。


然而,较低的预测误差是否意味着模型真正捕捉到了物理世界的运行规律?它学到的隐状态是否对应真实状态,又能否准确反映动作对未来状态的影响?


2026年5月份,图灵奖得主杨立昆(Yann LeCun)提出的联合嵌入预测架构(JEPA)从理论上证明:满足特定条件时,世界模型是能够从高维观测中恢复真实的状态表征的。不过,这一理论主要关注自治世界模型的表征恢复,尚未拓展至一般受控系统,因此尚无法回答模型能否进一步辨识动作对状态转移的影响。


近期,清华大学李升波教授课题组(iDLab)与滴滴深穹远航实验室(Voyager Lab)组成的联合研究团队,将JEPA的训练架构与受控世界模型(Controlled World Model,CWM)进行了结合,对世界模型表征及转移的可辨识性问题给出了他们的认知与理解。


与自治世界模型不同,受控世界模型同时接收当前的隐状态和当前的动作,并在隐空间中预测下一状态,进而输出该状态对应的观测。研究表明:满足一定约束条件下,由JEPA架构训练的受控世界模型能够在“正交变换”意义下,同时恢复真实的状态表征和动作支配的转移规律。


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


进一步地,该研究发展了受控世界模型的可辨识性理论,提出了“表征裕度”“转移裕度”两个关键指标,分别刻画状态表征与受控转移实现可靠辨识所需的条件。其中,表征裕度衡量了环境中的可预测信息是否足以支撑真实状态的恢复,转移裕度衡量了训练数据在同一状态下是否包含足够的动作变化。


论文的主要结果是,受控世界模型的可辨识性依赖于两个条件,即表征裕度和转移裕度同时为正值,同时满足:


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


表征裕度不足将会影响真实状态的恢复能力,而转移裕度不足则可能导致模型难以预测较少出现的动作。


受控世界模型与可识别性理论


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件

受控世界模型的可辨识性:表征辨识性与转移辨识性


理论分析与证明


对于受控世界模型的可辨识性,论文证明了JEPA架构下的联合预测能够同时正确恢复表征和转移两类信息,同时分析了学习的误差界,以及有限动作覆盖对行为分布之外的预测误差的放大作用。


定理1:状态与受控转移的联合可识别性


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


定理2:行为策略下的定量可识别性


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


定理3:反事实预测误差的可达放大


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


实验验证


非线性观测的表征可识别性


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件

四种非线性观测及其学习表征。颜色与极坐标校准线用于追踪对应的潜在位置;恢复结果允许保留正交旋转。


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件

随表征裕度增大,表征误差和受控转移误差整体下降;虚线标出理论充分条件表征裕度=0的边界。


当表征裕度增加时,编码器更稳定地逆转非线性观测,并在正交变换意义下恢复隐状态;受控转移误差也同步下降。


行为策略覆盖与反事实可靠性


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件

条件动作覆盖从确定性策略逐步增强时,行为误差、反事实误差放大以及A、B两部分的估计误差变化。


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件


从转移识别到目标条件规划


规划器需要比较可能偏离行为策略的动作序列,因此弱激励方向上的误差会直接影响候选动作排序。论文使用同一组有界动作序列进行目标条件规划:模型在潜在空间中预测各序列终点,选择最接近目标的序列,再在真实条件均值动力学中执行。


拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件

不同条件动作覆盖下的预测可达终点与真实可达终点。覆盖增强后,两者逐步对齐,模型所选序列的执行偏差明显减小。


这些实验表明,当条件动作覆盖不足时,即使模型在训练数据上的预测误差较小,对覆盖较弱的动作方向仍可能预测不准,导致预测可达终点与真实可达终点存在偏差。


规划器基于模型预测选择最接近目标的动作序列,但该序列在真实动力学中执行后可能无法到达预期位置。随着条件动作覆盖增强,预测可达集逐渐与真实可达集对齐,模型预测结果与实际执行结果之间的偏差也相应减小。


总结


综上所述,这一研究把预测式表征学习与受控系统辨识联系起来,在同一学习目标下区分了“状态坐标是否恢复”和“动作响应是否识别”两个问题。表征裕度描述预测信号能否排除非线性替代表征,转移裕度描述行为数据能否分离状态演化与动作效应。


由此可以解释,为什么动作条件建模、较低训练误差和可靠反事实规划之间并不自动等价。对模型设计与评估而言,该研究提示后续的研究者不能只检查行为分布上的一步预测误差,还应关注给定状态后的动作覆盖、行为分布外的动作响应,以及状态项与动作项能否被分别恢复。对离线数据采集而言,适量探索噪声不仅扩大动作支持,还直接改善近似转移识别的条件性。


参考文献:
[1]  Zhang, XT.; Guan, Y.; Zhang, B.; Li, HY.; Zhang Y-Q; and Li, S. E.  (2026) On the Identifiability of Controlled World Models.  arXiv:2607.22430
[2] Li, S. E. (2023) Reinforcement Learning for Sequential Decision and Optimal Control. Springer.
[3] Klindt, D.; LeCun, Y.; and Balestriero, R. (2026) When Does LeJEPA Learn a World Model? arXiv:2605.26379.
[4]  Maes, L.; Lidec, Q. L.; Scieur, D.; LeCun, Y.; and Balestriero, R.  (2026) LeWorldModel: Stable End-to-End Joint-Embedding Predictive  Architecture from Pixels. arXiv:2603.19312.
[5] Zhan, G.; Wang, L.;  Zhang, X.; Gao, J.; Tomizuka, M.; and Li, S. E. 2025. Bootstrap  Off-policy with World Model. NeurIPS, volume 38, 134093-134121.
论文链接:https://arxiv.org/abs/2607.22430


文章来自于"量子位",作者 "iDLab"。

AI转型,免费服务,就找AITNT