
去哪训练、拿什么学、怎么考?这是物理AI从实验室走向现实世界的三个核心问题,现在有了系统性答案。
物理人工智能(Physical AI)与具身智能正在经历一场深刻的范式转移。
从早期局限于单一任务的特定控制算法,到如今依托多模态大模型实现对三维物理世界的感知、推理与决策,AI Agent 正在逐步突破数字世界的边界。
然而,当智能试图走出虚拟空间、迈入现实世界时,底层基础设施的匮乏成为了最大掣肘。
要支撑物理 AI 的持续进化,行业必须回答三个核心问题:去哪里高效训练?高质量数据从何而来?如何科学评估空间智能?
群核科技集结了英伟达、英特尔、Adobe等产业巨头,携手浙江大学、帝国理工学院、苏黎世联邦理工学院等全球顶尖学术机构,共同交出了一份系统性答卷。

三个问题,分别对应三篇入选 ECCV 2026的论文。下面,我们分别看这三篇论文,给出了怎样的参考答案。
智能体要进行大规模感知与动作训练,离不开高保真仿真器的支撑。然而,传统仿真器往往面临“画质”与“速度”无法兼得的尴尬局面。
针对这一行业瓶颈,群核科技携手 NVIDIA、Adobe Research 等顶级团队,推出了高保真具身仿真器SPEAR,尝试从底层同时兼顾“高保真”、“可编程”与“极速运行”。

论文链接:https://arxiv.org/pdf/2607.06701
作为一个轻量且模块化的 Python 库,SPEAR 重新设计了 Python 与游戏引擎之间的通信机制。

SPEAR 直接对接了 Unreal Engine (UE) 的 C++ 运行时反射系统。它不需要人为编写海量的封装代码,而是在运行时以字符串为键,动态查找类、调用函数并修改变量。
这种设计让 SPEAR 一举向 Python 开放了 14485 个 UE 原生函数 与 53537 个属性,可编程能力比传统仿真器提升了一个数量级,而自身代码量却精简至约 2.7 万行。开发者甚至只需在 C++ 中加一行标记,就能立刻在 Python 端调用全新的自定义逻辑。

各种UE仿真器可编程功能的比较
针对数据传输这一最大痛点,SPEAR 引入了进程间共享内存机制。渲染出的图像无需经过任何多余的复制流程,即可直接从 GPU 传输至 Python 端的 NumPy 数组中,实现了真正的 Zero-Copy 传输。
同时,SPEAR 提出了以“事务”为核心的异步编程模型。
研究人员通过 <begin_frame> 和< end_frame> 上下文定义每一帧的 UE 工作图。凭借异步调用机制,SPEAR 在独立的服务器线程中排队处理任务,完全不阻塞 UE 的游戏主线程,让仿真程序得以按原生帧率高效运转。

SPEAR 编程模型
在性能表现上,SPEAR 搭载的相机传感器能在 1080P 分辨率下达到 73 FPS(渲染吞吐超 1.5 亿像素/秒),端到端渲染速度比 UnrealCV+ 快 15 倍,比 AirSim 快 12 倍。除了常规视觉图像,它还能直接导出深度图、法线图、语义分割、材质 ID 以及基于物理的渲染(PBR)参数等丰富模态。
强大的图形学底座与极高的灵活性,让 SPEAR 在多个复杂场景中展现出惊人的应用潜力:
SPEAR 提供了可编程、高吞吐的 UE 仿真接口,适合作为具身智能的训练与数据生成环境之一。
解决了“去哪里训练”的环境难题后,物理 AI 的下一个核心痛点,在于后训练阶段的强化学习效率。
虽然强化学习(如基于 GRPO 的策略优化)已在多模态大模型的视觉感知与推理任务中展现出巨大潜力,但当前的训练机制正面临严重的“数据质量陷阱”。群核科技与浙江大学合作的发表的 Syn-GRPO 框架,尝试通过在线自进化合成数据来给出解法。

论文链接:https://arxiv.org/pdf/2511.19343
在 GRPO 等强化学习算法训练过程中,研究人员发现 MLLM 的输出熵和多样性呈现出急剧下降的趋势,这一现象被称为 “熵崩溃(Entropy Collapse)” 和 “多样性崩溃”。
造成崩溃的本质原因,在于现有的视觉感知数据集(如传统的目标检测、视觉定位数据)样本格式与背景过于单一。模型在训练初期很快就能学会“套路”,输出分布迅速收缩,导致算法探索空间极度受限。
先前针对大模型 RL 的改进尝试(如 CLIP-Higher、Clip-Cov、Entropy Adv.)大多试图从 GRPO 算法本身通过正则化或熵惩罚来缓解问题,但这些方法治标不治本,始终无法突破低质量数据带来的固有上限。
为了从根本上打破数据质量天花板,团队抛弃了静态数据集的传统思维,转而在强化学习训练的循环中,让模型在线“自进化”地生成高质量、高响应多样性的训练样本。

Syn-GRPO 框架
不同于纯文本大模型可以通过提示词直接合成新文本,视觉感知任务(如 Bounding Box 定位)对图像内容与物理标注的精准性有着苛刻的要求。如果直接用生成模型重绘整张图像,原有目标的坐标就会失效。
为解决这一难题,Syn-GRPO 的数据服务器巧妙地设计了前景一致性生成机制。
系统首先利用 BEN2 分割模型精准抠出视觉感知任务的目标主体(如车辆、小动物),随后保留原目标的物理坐标,仅将背景替换并通过基于 SDXL ControlNet 的重绘模型合成全新的复杂场景。这种做法不仅百分之百保证了原感知标注的准确性,还极大地扩充了环境背景的多样性。
更关键的是,数据服务器与 GRPO 训练流采用了完全解耦的异步通信架构。数据合成分布式地在后台静默执行,使得 Syn-GRPO 的训练耗时仅比原始 GRPO 增加约 5%,完美避免了同步合成方案导致的耗时翻倍问题。
为了确保新生成的图像能精准击中模型的“认知盲区”,GRPO 工作流对 MLLM 的输出结构进行了重构。
模型在输出推理逻辑与答案的同时,还被要求预测当前样本的响应多样性得分以及用于制造新图像的文本描述。
通过将模型预测的多样性与当前 Batch 实际采样产生的真实方差进行对比,算法计算出专属的多样性奖励,借此引导 MLLM 学会识别并描述那些能够激发更高探索活力的复杂场景。
针对强化学习后期模型整体多样性下滑引起的“多样性漂移”现象,Syn-GRPO 引入了指数移动平均(EMA)校准机制进行动态平滑,显著提升了策略优化的稳定性。每轮采样中多样性奖励最高的那组描述,将被自动推送到数据服务器,作为制造下一代训练样本的“配方”。
在 REC(指称表达理解)、OVD(开放词汇目标检测)以及 ISR(室内场景精细化)三大视觉感知任务的实测中,Syn-GRPO 展现出了压倒性的优势。以 Qwen2.5-VL-3B 为基座,Syn-GRPO 在 Out-of-Domain 评价集 LISA-Grounding 上取得了 68.28% 的准确率,大幅领先 VLM-R1(63.14%)和标准 GRPO(62.24%);在 RefCOCO 数据集上更是达到了 92.15%。

Qwen2.5-VL-3B 在 REC 任务上的实验结果

OVD 任务上的实验结果
比单纯的指标提升更具启发性的,是实验中观察到的“自进化 Scaling 现象”。随着训练 Epoch 的不断推进,Syn-GRPO 驱动生成的图像呈现出背景越来越杂乱、遮挡关系越来越复杂的趋势。
这表明 Syn-GRPO 真正构建了一个动态演化的训练系统:随着大模型感知能力的增强,系统能够自动为自己生成难度更高、更具挑战性的“新试卷”,从而源源不断地为强化学习注入探索活力,展现出长程训练的优秀可扩展性。
在搭建了高保真的仿真演练场并实现了数据的在线自进化之后,最后一个问题浮出水面:如何科学衡量智能体在三维物理世界中的真实空间智能?
当前主流的视觉语言模型评测基准普遍采用“旁观者视角”,即向模型提供一张静态图片或一段预录视频,让其回答几何关系或物体位置。然而,真正的空间智能并非静态的观照,而是在主动移动与交互中通过消除几何歧义、建立拓扑认知来解决复杂任务。
针对这一痛点,群核科技联合浙江大学等团队推出了WalkerBench,尝试重新定义物理 AI 的空间感知评测标准。

GitHub链接:https://github.com/lalayang123456-ctrl/WalkerBench
作为首个建立在真实街景与地图数据之上的全球尺度交互式空间智能评测基准,WalkerBench 彻底剥离了 GPS 信号与街名等先验地图信息,要求 Agent 仅凭机载第一视角 RGB 视觉输入完成自主探索。
WalkerBench 覆盖了全球 6 大洲 160 多座城市,并在采样中特意选用了大量非英语城市(如达卡、罗安达、卡拉奇等),以此抑制大模型的地理常识记忆偏见,确保评测精准聚焦于实时的视觉空间推理能力。其任务体系被划分为两大层次:

WalkerBench 概览
在 WalkerBench 的长程测试中,研究人员发现主流 VLM 在面对 3D 拓扑任务时存在致命缺陷:模型的线性上下文机制难以处理高维度的空间轨迹,随着探索步数增加,很容易陷入“走着走着就忘了”的记忆崩塌与方向迷失。
为此,WalkerBench 提出了专门的 Spatial-IDE 破局框架。该框架通过两大机制彻底解耦了空间感知与高层推理:
1.状态外化与显式拓扑记忆(ETM):将隐式的视觉观测转化为一个动态的显式拓扑记忆图(ETM)。该图实时记录节点的坐标、朝向、遍历历史以及语义注释,并以固定 Token 预算进行序列化传输,为大模型提供了精准的“空间地图外挂”。
2.认知解耦与目标导向感知(GDP):将任务拆解为高层空间推理引擎与目标导向感知(GDP)。推理引擎只关注全局路径规划与决策,而感知模块则专职回答具体的局部问题(如“前方招牌是否可见,相对角度是多少”),防止过长的上下文历史压垮大模型的推理能力。

Spatial-IDE 框架
WalkerBench 在学术界与产业界引发了强烈反响,其公布的一系列实验数据深刻揭示了当前多模态大模型的真实短板。
在零样本交互导航评测中,人类受试者的任务完成率达到了 69.43%,而未配备辅助框架的顶尖 VLM Agent(如 Claude-Opus-4.6)最高却仅有 24.49%。这一巨大差距表明,单纯依靠 2D 静态图像预训练的大模型在三维空间交互智能上远未饱和。
在引入 Spatial-IDE 框架后,被测的 9 个主流 VLM Agents 均取得了巨大的性能突破,平均得分提升了 104.97%。例如,Claude-Opus-4.6 的完成率跃升至 43.17%(绝对提升 18.68%);GLM-4.6V 从 13.31% 飙升至 31.77%;而原始得分垫底的 GPT-5-chat-latest 在状态外化帮助下性能暴涨 119.98%。

消融实验进一步证实,ETM 记忆图与 GDP 目标感知的结合产生了极强的协同效应,证明了“记住什么”和“看什么”在空间推理中的核心价值。

为了进一步验证算法在真实物理世界中的落地能力,除了虚拟仿真评测之外,研究团队还通过真机部署检验了系统的泛化表现。
实验将 Spatial-IDE 框架直接部署于宇树 G1 人形机器人。在未经任何特定物理环境微调的前提下,机器人仅依靠机载单目 RGB 摄像头和自然语言指令,在真实的开放城市街道中完成了连续多街区的千米级自主导航。这一实测结果表明,该系统具备从数字仿真向复杂真实世界直接迁移(Sim-to-Real)的可行性。
拆解这三项入选 ECCV 2026 的工作,每一项都切中了具身智能当前的关键瓶颈:SPEAR 尝试平衡仿真器的渲染画质与吞吐效率,Syn-GRPO 致力于解决多模态强化学习中的数据崩溃问题,而 WalkerBench 则为空间智能提供了一套可交互的物理评测标准。
但这三项研究更值得关注的价值,在于它们并非零散的单点试验,而是构成了一套相互咬合的具身数据循环机制:
从“虚拟仿真”到“在线自进化”再到“真机实测”,数据、算法与评测三者形成了一个动态演进的闭环。
这同时印证了一个趋势:物理 AI 的竞争,正逐渐从单一的模型参数比拼,转向基础设施层的建设。
正如大语言模型的发展依赖于海量文本的沉淀,具身智能要跨越虚拟与现实的界限,同样需要能够支撑大规模训练与持续进化的底层基础设施。
群核科技结合自身在 3D 数字孪生与图形学渲染领域的积累,通过与全球学术及产业团队合作推出的这三项成果,尝试为物理 AI 搭建一套涵盖“仿真-训练-评测”的技术底座。
随着多模态模型与物理环境的持续融合,这种基础设施维度的技术积累,或将为具身智能从代码走向物理世界的落地过程提供切实的参考。
文章来自于"AI科技评论",作者 "张璐"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0