李飞飞的世界模型,终于开始训练机器人了

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
李飞飞的世界模型,终于开始训练机器人了
7335点击    2026-07-29 14:22

李飞飞老师的World Labs,补了块关键拼图。


刚刚,借助新收购机器人公司SceniX之力,World Labs发布了全新的机器人策略训练与评估引擎——


Real-to-sim-to-real (R2S2R) 


这套引擎将World Labs空间智能的版图从生成可交互的虚拟世界,进一步延伸到了真实机器人的训练、评估与部署,并首次打通了从仿真训练到真实运行的闭环


李飞飞的世界模型,终于开始训练机器人了


拆开来看,R2S2R包含Real-to-Sim和Sim-to-Real两个部分。


其中,Real-to-Sim负责把现实中的机器人、传感器、物体以及交互过程搬进仿真,构建与真实任务对齐的虚拟环境。


李飞飞的世界模型,终于开始训练机器人了


Sim-to-Real则让机器人在这些虚拟环境中完成训练和评估,再将策略直接部署回真实世界。


李飞飞的世界模型,终于开始训练机器人了


李飞飞老师在X上表示,基于这套方法训练出来的策略,即使完全没用过真实世界数据,也已经能够连续自主运行1小时,无需人工干预。


不仅如此,R2S2R还让机器人策略的评估变得更容易规模化。


李飞飞的世界模型,终于开始训练机器人了


通过对齐策略在仿真与现实中的运行过程,真实世界里的成功、失败及其触发条件,都可以在虚拟世界中被复现和分析。


可以说,R2S2R不仅打通了世界模型从生成世界,到训练、评估和部署真实机器人的闭环,也推进了李飞飞此前提出的世界模型三分法中,最关键的一块——


仿真器


在她的经典划分中,世界模型可以承担三种功能:渲染器负责生成观察,仿真器负责模拟世界状态,规划器则负责输出行动。


李飞飞的世界模型,终于开始训练机器人了


而R2S2R所做的,正是让World Labs生成的世界从“看起来真实”,进一步变成机器人真正能够进入、交互和学习的训练场。


想scale具身智能,先得scale机器人学习的世界


那么,为什么要扩展机器人的学习环境,而且还非得在仿真里?


在博客中,World Labs表示:


当前机器人发展的主要瓶颈,已经不只是模型架构,而是缺少能够规模化获取的经验和评估。


李飞飞的世界模型,终于开始训练机器人了


一方面,真实世界中的物体位置、光照、物理属性和交互过程都在不断变化。


要让机器人真正走出实验室,就必须提前覆盖足够丰富的场景,并反复测试它在什么情况下会成功、又会在哪里失败。


另一方面,与训练大模型的互联网数据不同,机器人的每一条经验都需要真实发生。


每轮实验都要占用硬件,人工重置物体、恢复失败并维护系统。即便拥有海量人类视频,也很难系统覆盖不同环境、物体属性、机器人状态和失败条件。


因此,仿真最大的价值,并不只是“省下采集数据的钱”,而是可以主动制造现实中昂贵、危险或难以重复的情况,让机器人反复经历成功与失败。


但过去的仿真技术也存在着明显短板。


它不仅需要为每项真实任务单独搭建环境,成本高、速度慢,而且仿真与现实之间往往存在视觉、几何和物理动态上的差距。


更重要的是,机器人在仿真中学会的策略,到了真实世界未必依然有效;仿真中的测试结果,也未必能反映真实表现。


基于上述背景,World Labs推出了从现实到仿真再到现实训练(R2S2R)的仿真引擎,用于训练和评估机器人策略。


李飞飞的世界模型,终于开始训练机器人了


其中,Real-to-Sim负责把现实中的机器人、传感器、物体和交互过程重建成与任务对齐的虚拟世界。不仅要还原世界的外观,还要尽可能保留机器人与物体交互时的运动和物理反馈。


Sim-to-Real则利用这些世界完成策略训练与评估,找到模型容易失败的状态,并判断仿真中的表现能否迁移到真实硬件。


两者连接起来,便形成了一套闭环:


从现实中提取任务,在仿真中规模化生成经验、训练和寻找失败,再把策略部署回现实;现实中的新结果,又会继续修正世界模型、训练数据和机器人策略。


也就是说,R2S2R不是简单地用仿真替代真实数据,而是把一个真实任务扩展成大量可控制、可复用的学习世界,让机器人能够以更低的成本反复训练、评估和迭代。


Real-to-sim-to-real


具体来说,这套方法首先从Real-to-Sim开始。


团队先采集机器人、传感器、环境、物体和任务演示等信息,再通过生成式世界建模系统,将其重建为一个可交互的虚拟世界。


这个世界不仅要还原外观和几何结构,还要尽可能复现物体的物理和动力学特性。


比如,在下面的双机械臂装箱任务中,仿真和现实环境会执行相同的动作序列,从而产生高度一致的观察结果、物体运动情况以及最终效果。


李飞飞的世界模型,终于开始训练机器人了


这里的难点在于,真实环境并不会提供一套准确参数。


物体的重量、摩擦力可能难以测量,机器人和摄像头也可能与标称规格存在偏差,电缆、包装等柔性物体的形变更难用简单模型描述。


因此,R2S2R会根据不同任务的需要,组合使用不同的表示和建模方法。


完成重建后,团队会让机器人在现实与仿真中执行相同动作,直接比较视觉观测、物体反应和最终结果,从而验证两边是否真正对齐。


李飞飞的世界模型,终于开始训练机器人了


而在Sim-to-Real阶段,对齐后的仿真世界会进一步变成一套可扩展的训练与评估引擎。


具体的,机器人先在仿真中学习新策略,评估系统再主动寻找它容易失败的状态,并围绕这些弱点生成新的交互经验,形成“发现问题—补充数据—改进策略”的闭环,最后再部署回真实硬件。


李飞飞的世界模型,终于开始训练机器人了


此外,相比现实数据采集,仿真可以系统调整物体位置、机器人状态、视角、外观、物理属性和任务难度,让策略反复经历现实中成本高、难复现甚至不安全的情况,并获得物体状态、接触、受力等硬件上难以采集的监督信号。


而且,一个重建好的任务并不只服务于某个模型或某款机器人。同一套仿真环境可以继续适配不同策略、传感器和机器人平台,从一次性实验变成可复用的训练基础设施。


报告中显示,在没有真实世界数据参与,只在仿真里训练的策略可以直接迁移到ALOHA、RB-Y1、YAM、Flexiv和xArm等机器人平台,完成装箱、绕线、试管转移和杂乱环境中的单件抓取等任务。


其中,电源线绕行、线缆插拔、试管转移,以及马克笔和铅笔抓取等任务,均连续自主运行1小时,期间没有失败,也没有人工接管。


李飞飞的世界模型,终于开始训练机器人了


这说明,对齐后的仿真未来可能不只是现实数据的补充,而会成为机器人训练经验的重要来源。


最后,在评估方面。


由于机器人受制于物理世界的运行速度,每测试一个checkpoint,都要重新布置场景、运行机器人并处理失败,成本高,能够覆盖的情况也十分有限。


相比之下,R2S2R则可以先在数千种受控条件下主动寻找失败,提前筛掉表现不佳的checkpoint,只把最有希望的策略留给真实硬件测试。


这里的关键,并不是要求仿真与现实的成功率完全一致,而是两边能够得出相同的判断:


哪些策略更好、它们在哪里成功或失败,以及训练中的提升能否真正迁移到硬件。


在ALOHA双臂方块交接任务中,团队测试了GR00T N1.6和π₀.₅两种策略架构,以及不同训练配置、ID和OOD场景。每个checkpoint分别进行了2000次仿真试验和100次真机试验。


结果显示,仿真中表现更好的checkpoint,在真机上通常也表现更好。仿真不仅保持了不同策略之间的相对排名,也呈现出与现实相似的成功和失败分布。


李飞飞的世界模型,终于开始训练机器人了


更重要的是,这种对齐不只是让仿真画面看起来像现实。


团队会让机器人在仿真和现实中执行完全相同的动作,再比较两边看到的画面、物体的反应和最终结果是否一致。


即使是在线缆、关节物体等很难模拟的任务,也要尽可能复现真实的物理变化。


以方块交接为例,当方块放在机器人不太熟悉的位置时,机械臂会抓得更靠近边缘,差一点就失手。这种“险些失败”的过程,不仅出现在真机上,也在仿真中被复现了出来。


也就是说,仿真还原的不只是机器人最后成功了还是失败了,还能还原它为什么会走向成功或失败。


这也意味着,R2S2R可以成为机器人开发中的高通量评估层,用来筛选checkpoint、发现性能退化,并决定下一轮应该补充什么数据。


World labs收购SceniX


事实上,在正式发布R2S2R的前一周,World Labs就已经宣布收购SceniX


李飞飞的世界模型,终于开始训练机器人了


SceniX是一家专注机器人仿真、训练与评估的初创公司,他们的技术方向聚焦于把真实机器人任务搬进数字世界,让原本昂贵、缓慢甚至危险的数据采集和模型评估,可以在仿真中规模化完成。


SceniX联合创始人李昀烛目前是哥伦比亚大学助理教授,曾在MIT获得博士学位,随后在斯坦福跟随李飞飞从事博士后研究。


有意思的是,这两家公司的合作并不是从这段师生关系开始的。


最早,SceniX只是World Labs生成式世界模型Marble的客户。直到李飞飞发现这家公司由李昀烛创办,双方才进一步意识到彼此技术上的互补,并展开了收购计划。


World Labs擅长生成模型、计算机视觉和3D重建,可以从稀疏输入中快速生成具有空间一致性的世界;


SceniX则更熟悉机器人、仿真、学习算法和硬件系统,知道怎样让这些世界真正用于策略训练、评估和部署。


换句话说,就是前者解决“世界怎么生成”,后者解决“机器人怎么在里面学习”。


在a16z访谈中,李昀烛表示,这次收购并不意味着World Labs要亲自造机器人。


它们真正想建设的,是一套与机器人形态和模型架构解耦的基础设施:


无论客户使用单臂、双臂还是移动机器人,VLA还是World Action Model,都可以进入同一个数字世界训练和测试。


在未来,双方将围绕仿真、基础模型和动作条件模型逐步整合,并希望先在仓库、实验室和电子装配等半结构化场景中,与客户完成真实部署验证。


参考链接

[1]https://www.worldlabs.ai/blog/real-to-sim-to-real

[2]https://www.worldlabs.ai/blog/taxonomy-of-world-models?utm_source=chatgpt.com

[3]https://x.com/drfeifei/status/2082137342824075357


文章来自于"量子位",作者 "henry"。

AI转型,免费服务,就找AITNT