世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制
5531点击    2026-07-28 10:33

人类可以轻松想象一个还没做出的动作会带来什么:手一松,杯子会掉;往前一推,抽屉会合上。动作尚未发生,大脑已经预演了可能的结果。对机器人来说,具身世界模型(Embodied World Model)会根据当前观察和未来的动作,预测动作执行后的未来画面。有了它,机器人可以先在「脑子里」预演,再决定实际怎么做。机器人规划、策略评估和数据生成等任务,都需要建立在这类预测能力之上。


为了能够利用更多的无标注数据对世界模型进行大规模训练,隐动作模型(Latent Action Model,LAM)被设计用于从画面变化里提取「隐动作(Latent Action)」充当伪标签,让世界模型在海量人类视频上预训练(Pre-training),学会「大概怎么动」。之后,仅需要少量带真实动作标注的视频进行后训练(Post-training),即可更快更好地适应真实动作控制。


Aether AI(aetherlabs.ai)与加州大学圣地亚哥分校联合开展的一项新研究发现,这条路线训练出的世界模型有一个重要问题:其画面足够流畅,但给定的动作控制信号却常被无视。通过因果分析,团队发现,问题的根源在于隐动作模型受到了视觉混杂因素的污染。世界模型应该学习「动作导致未来」,动作是因,画面是果。但当隐动作夹带背景和场景信息时,模型可能只靠画面连续性预测下一帧,而忽略真正的控制指令。


团队据此提出 CD-LAM(Causally Debiased Latent Action Model,因果去偏隐动作模型)。它不改动世界模型的主体架构、隐动作维度和动作接口,而是从模型上游净化 LAM 输出的隐动作表征,减少其中夹带的场景与背景信息进行去偏。实验显示,经过 CD-LAM 去偏后,模型的动作误差下降 30% 以上,画面质量也得到显著提升。且后训练仅需 3k-6k 步微调,仅需基线模型约 10% 的训练开销。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

▲ 左三图分别比较动作误差、画面质量和机器人动作微调所需的更新步数;右图说明,普通 LAM 会把背景和场景信息混进隐动作,世界模型因此可能混淆真实动作和视觉因素。通过 CD-LAM 去偏减少这类信息后,模型性能大幅提升,且后训练所需微调更新显著降低。


该研究由 Aether AI 与加州大学圣地亚哥分校合作完成。第一作者 Yufan Wei 是 UC San Diego 博士一年级学生,该工作主要完成于其在 Aether AI 实习期间;项目负责人兼通讯作者是 Kun Zhou。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制


  • 论文标题:Causally Debiased Latent Action Model for Embodied Action Conditioned World Models
  • 论文链接:https://arxiv.org/abs/2607.09185 
  • 代码链接:https://github.com/yufanwei/CD-LAM 
  • 项目主页:https://yufanwei.github.io/CD-LAM-project-page/ 


一、因果分析:从干预测试追溯到 LAM 的视觉混杂


现有 LAM 大多以视频重建为训练目标,不会区分画面变化究竟由机器人动作、镜头移动还是光照变化造成。为了把下一帧重建得更像,模型可能把场景上下文、背景连续性和物体外观等信息一并编码进 “隐动作”。而在预训练阶段,世界模型对动作的理解主要来自 LAM 的输出,因此也可能继承这条捷径:依靠场景线索猜测下一帧,而不是真正学习控制指令会带来什么变化。


干预是检验因果关系最直接的方式:改变「因」,看「果」变不变。也就是改变动作,看生成结果是否随之变化。因此团队设计了两类干预测试。


  • 静止指令测试:固定初始画面,并把后续机器人动作全部设为零。理想情况下,机械臂应当保持静止,但基线模型生成的机械臂仍然明显运动。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

基线模型 


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

CD-LAM


  • 目标动作测试:保持初始画面不变,将动作输入替换为另一段视频中的动作序列。理想情况下,生成轨迹应当跟随新的动作变化,但基线模型的结果几乎没有随之改变。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

目标动作


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

基线模型


因换了,果没变。


为了追溯问题来源,团队进一步检查了上游的 LAM 编码器。结果显示,基线 LAM 会对相同画面、镜头移动和视频上下文等与动作无关的信息产生明显响应,说明这些视觉因素也被编码进了隐动作。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

▲ LAM 是否把与动作无关的信息编码进隐动作。三项测试分别检查:输入两张相同画面时,模型是否仍会产生非零隐动作;单纯移动镜头是否会明显改变隐动作;以及隐空间是否更多按场景、而不是按动作组织。“场景捷径泄漏” 衡量同一段视频中的不同动作是否会因为共享场景信息,而被错误地编码得更接近。所有测试只评估 LAM 编码器,不涉及世界模型生成;数值越低越好。


二、画面像,不等于动作对


PSNR 等通用指标衡量的,是生成画面与参考画面在像素层面的相似度。但论文分析显示,PSNR 对动作误差的解释力很弱,难以反映模型是否真的遵循了给定动作。为此,团队借鉴视频生成领域基于点跟踪的运动评测方法,提出了面向具身操作的 FDCE,即前景动作偏差距离:先分离机械臂和被操作物体等前景区域,跟踪前景点的运动轨迹,再计算生成轨迹与参考轨迹之间的距离,以衡量动作误差。画面质量则仍通过 PSNR 等通用指标进行评估。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

▲图丨左:FDCE 的计算示意;右:PSNR 与动作误差的分布,表现出画面质量与动作控制的准确性之间存在极弱关联。


三、CD-LAM:先清理隐动作,再接入真实控制


CD-LAM 不改世界模型的主体架构,而是先从上游清理 LAM 输出的隐动作。整个训练分为三步:去偏 LAM → 训练世界模型 → 接入真实机器人动作


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

▲ 图丨 CD-LAM 的三阶段训练流程。 第一阶段通过三项训练目标清理 LAM 输出;第二阶段用清理后的隐动作训练世界模型;第三阶段接入真实机器人控制指令。世界模型主体、隐动作维度和输入格式保持不变。


CD-LAM 通过增加三个训练目标达到了对 LAM 的去偏:


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制


1. 具身中心重建 


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制


其中 ô_{t+1} 与 o_{t+1} 分别是重建下一帧和真实下一帧,W_t 是逐像素权重:SAM3 标出的前景取大权重、背景取小权重。整项将重建错误惩罚的权重偏向于前景部分。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制


2. 动作中心对比学习 


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制


其中 v_i 是隐动作投影归一化后的表征,y_ij 标记两段视频是否属于同一动作原语。这一项奖励同动作原语对的高相似度、惩罚异类对的高相似度,即同类拉近、异类推远。


 的作用是先通过从视频文本标注文本中提取出动词,归成抓取放置、倾倒、打开等动作原语,再利用 SigLip Loss 把同类动作表征拉近、异类动作表征推远,从而让潜动作空间的聚类更依赖于动作而非场景。


3. 隐空间校准 


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制


其中 z_t^0 是输入两张相同帧得到的「零动作」隐向量,分母是普通动作模长的滑动参照。该项只在零动作的模长超过参照的一小截时施加惩罚,把静止压向原点,不碰正常动作。搭配的 L_KL-fb 给每个维度留免罚额度,只约束超出的容量。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制


完成 LAM 去偏后,训练继续分两步推进。先以去偏后的隐动作为条件预训练世界模型,使其学习动作如何改变未来画面。再用带真实控制指令的机器人数据进行后训练,并通过轻量适配层将控制指令接入同一隐动作空间。


四、动作误差下降,后训练步数减少


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

▲ 去偏微调后、以隐动作为条件的生成结果。左半区:以从视频变化中提取的隐动作为条件正常生成;右半区:目标动作干预,即固定初始画面、把条件替换为目标隐动作。右半区是目标动作测试正,CD-LAM 在两种规模下的动作误差都显著降低。


在只使用隐动作、尚未接入真实机器人控制指令时,2B 和 14B 模型的动作误差分别下降 42% 和 26%,PSNR 分别提升 3.41 dB 和 2.14 dB。在目标动作测试中,两种规模模型相较基线的动作误差分别下降 21% 和 34%。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

▲ 接入真实机器人动作、完成后训练后的结果。


接入真实机器人动作数据进行后训练后,相较于基线 2B 和 14B 模型的动作误差分别下降 34.8% 和 30.4%,PSNR 提升约 0.75 至 1.0 dB。在静止指令测试中,2B 模型的残余运动幅度减半,14B 模型则减少 76.7%。在目标动作测试中,两种规模模型的误差又分别下降 7% 和 15%,说明生成轨迹更能随输入动作变化。


视频示例|CD-LAM 重建的动作轨迹更接近参考运动。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

参考视频  


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

 基线模型


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

CD-LAM


视频示例|固定同一初始画面并将控制动作换成目标动作后,DreamDojo 的机械臂逐渐偏离目标轨迹,CD-LAM 的生成轨迹更接近目标运动。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

目标动作


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

基线模型 


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

CD-LAM 


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

▲ 图丨机器人动作适配效率。橙色虚线为 DreamDojo 训练 5 万步的参考水平;CD-LAM 的 PSNR 与 FDCE 均在 3000~4000 步内越过基线模型(相当于 10 倍以上的加速), 6000 步的已明显反超。


CD-LAM 同时提升了机器人动作的适配效率,仅用约 3,000 步更新就达到了 DreamDojo 训练 50,000 步的表现,相当于 10 倍多的加速。在训练至约 6,000 步时,主要指标已全面超过基线。


世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

▲ 表|去偏视频数据量的影响。 各组使用不同时长的视频对 LAM 进行去偏,随后在同一 2B 模型上采用相同的机器人动作后训练设置。第一阶段均固定训练 1,000 步,以排除训练预算差异,单独考察数据量的影响。


值得注意的是,CD-LAM 的去偏本身也不依赖大规模的视频数据。仅使用 1 小时视频数据进行去偏训练,就能获得使用 1,000 小时数据时约 80% 的收益。说明更干净的隐动作本身可以显著减轻后续迁移负担,使世界模型在适配真实机器人动作时,不必再同时纠正预训练阶段对视觉混杂形成的错误依赖。


更多细节见原论文,模型、评测协议与训练代码均已开源。


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

2
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner