PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128
5724点击    2026-09-02 14:33

模型竞争的下一站,是让智能体在真实世界里可执行、可验证、可进化。


从 OpenAI 开源 Codex Harness,到 DeepSeek 提出“一切皆插件”,再到 Anthropic 发布模型硬件标准 MHS,头部实验室的动作指向同一个判断:模型竞争的下一站,是让智能体在真实世界里可执行、可验证、可进化。而 RSI(Recursive Self-Improvement,递归自进化)的核心,正是让经过验证的改进进入下一轮。


无独有偶,两个月前悄然开源的 PhyAgentOS,如今交出了它的正式版答卷。8 月 31 日,面向物理世界的 RSI 基础设施 PhyAgentOS v1.0.0 正式发布。它为物理智能模型补上了最关键的一块拼图,每一次动作的执行有据可查,每一次任务的成败有据可验,只有经过验证的经验才能沉淀下来、反哺下一轮进化,从模型决策、物理执行到经验回流,递归自进化的完整闭环就此形成。


该框架由 X-Era Lab(拓元智慧)、中山大学 HCP 实验室与鹏城国家实验室具身智能研究所联合研发,2026 年 7 月开源后即持续迭代,Star 数已超过 2000。


Github: https://github.com/PhyAgentOS/PhyAgentOS-core


项目网站:https://phy-agent-os.x-era.com/


技术报告:https://arxiv.org/pdf/2607.16636


01

从动作结束到任务验收:

一条物理执行主线,两条可信闭环


在物理世界里,动作做完和事情做成,是两回事。机械臂走完了轨迹,夹爪也合上了,但目标物抓没抓稳、放没放对位置,传统框架往往无从回答。PhyAgentOS v1.0.0 将执行过程纳入同一条链路,让每一步都能被追问到底。


PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

图 1|PhyAgentOS 新版总体架构:一条物理执行主线,两条可信闭环。


在这条链路中,Agent 规划目标,动作经 Forge Tool API 进入 ToolEndpoint 与 Dora 数据流直达机器人,AgentTask 全程留痕,Evidence 与 Verifier 依据现场证据验收结果。其中 Forge Gateway 只做“守门人”,负责能力发现、路由与执行状态管理,不替用户定义什么叫成功。而得益于统一的 Tool 契约,更换模型、仿真器乃至机器人本体时,上层应用一行代码都不用改。


执行可信了,接下来的问题自然浮现:如何把这份"可信"沉淀为可复用的工程秩序?PhyAgentOS的选择,是从给物理动作"立规矩"开始。


02

核心演进与模块升级,

从给物理动作“立规矩”开始


物理世界不像代码,点错了可以撤销重跑。所以 v1.0.0 立的第一条规矩,就是把“看”和“动”彻底分开。Forge Query 负责看,只读取状态、只做不改变环境的计算。Forge Action 负责动,每一次真实的物理动作都必须从它这里发起。而且 Gateway 收下动作,只代表任务排上了队,不代表事情办成了。一旦遇到超时、取消或结果未知,系统不会盲目继续,而是先回头核实现场,再决定下一步。


第二条规矩,是让每种信息规范在对应的文件中。人和 Agent 要读的长期知识,继续留在 AGENTS.md、SKILL.md 这类 Markdown 文件里。真正跑起来的执行,一律走 Forge Tool API。执行中产生的事实,则交给 AgentTask、PlanRevision 与 Evidence Bundle 这些结构化记录来保管。旧版那套靠轮询 Markdown 文件来驱动执行的做法,就此退出历史舞台。


PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

图 2|协议精简不是放弃 Markdown,而是让知识、执行与事实分别进入合适的载体。


第三条规矩,是任何结论都要拿证据说话。Query 和 Action 记下执行了什么,图像和机器人状态记下现场什么样,Verifier 则拿着目标和成功标准独立验收。证据本身也不是拿来就用,格式、大小、来源、时序,四道关一道都不能少。如果验收没通过,系统不会推倒重来,而是在原任务上追加一次 PlanRevision,带着此前的动作、证据和判断,换个计划接着干。


PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

图 3|执行事实、现场证据与任务结论彼此独立,Verifier 负责把它们组织成可检查的验收结果。


PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

PhyAgentOS 任务验证与重新规划能力演示


立完规矩,能力本身也被纳入工程化管理。Skill 沉淀任务方法,Tool 代表当前可调用的能力,Skill Runtime 则像一位尽职尽责的“管家”,包揽安装、启动、健康检查与生命周期管理。每个 Skill 都打包完整分发,经过校验之后才会上线,安装前还会自动确认 Gateway 和所需 Tool 是否就位。内置的 move-arm-by-ee Skill、benchmark skill 开箱即用,一行命令启动对应的 Dora profile,状态查询、末端运动和夹爪动作即刻就绪。


PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

图 4|Skill 指导 Agent,Tool 进入 Forge 执行;经过验证的任务经验再通过门槛形成新 Skill 或 Scoped Lesson。


PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

PhyAgentOS 通过安装 Skill Runtime 实现特定技


03

具身 RSI:

拒绝过拟合的受控进化闭环


让系统自我进化,最难的从来不是“进化”本身,而是分得清什么是真经验。一次偶然的抓取成功,可能是目标物恰好停在了顺手的位置,可能是摩擦力帮了忙。如果照单全收,系统学到的就不是方法,而是运气。PhyAgentOS 的回答很克制,只有经过验证的 AgentTask,才有资格进入经验的提炼流程。


系统会把每个任务的目标、计划修订、工具轨迹、验证结果和证据指纹,整理成一份完整的 TaskEpisode,然后按成色分流。稳定可复现的流程,晋升为 SkillCandidate 候选技能。反复出现的工作流问题,记为 FailureObservation,等待修复。至于设备掉线、网络抖动、证据不足这类“环境噪音”,只留下一份诊断记录,绝不混进经验库。该学的一课不落,不该学的一点不沾。


门槛还不止于此。一个 Skill 想正式晋升,一条 Lesson 想被激活,都必须有多个相互独立的任务共同背书,再通过结构与安全两道检查。具体坐标、凭据、Endpoint、可执行 ID,以及任何试图绕过 Forge 或 Verifier 的指令,一律不得写入 Skill。内置 Skill 同样动不得,新版本只以 workspace override 的形式叠加,历史版本完整保留。就算写入或演进中途失败,也不会殃及原任务的执行结果。


所以,v1.0.0 所谓的“自进化”,走的是一条刻意求慢的路。先执行,后验证。先积累独立证据,再抽象成经验。先通过边界检查,才允许影响下一次任务。让每一步进化都踩在证据上,这才是物理世界里可持续的 RSI。


PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

PhyAgentOS 技能进化与经验沉淀功能演示


04

严谨基准:三大具身 Benchmark 

验证真实泛化增益


自进化是否真实有效,最终要拿数据说话。PhyAgentOS 将任务分发、环境重置、策略执行、证据采集、失败分析和报告生成纳入 AgentTask 与 Forge 流程。评测分为两个口径:First attempt 记录策略首次运行成绩,Final outcome 记录有界恢复后的最终结果;两者分开统计,重试不计作新 episode。


PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128


在 LIBERO 上,X-VLA 首次失败的 54 个 episode 中有 26 个经分析和恢复后完成,最终失败数降至 28,过程中未修改策略模型代码。Benchmark Skills 还支持用自然语言选择基准、策略和任务范围,并输出包含任务来源、失败证据和复现配置的结构化报告。


PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

Video: Automated evaluation of OpenVLA implemented on the Libero benchmark


05

生态扩展与升级收益:

从 43 种构型到 1.0.0 产品周期


能力闭环之外,v1.0.0 的生态版图也在快速扩张。截至 v1.0.0,PhyAgentOS 支持的机器人构型由 19 种增至 43 种,覆盖机械臂、四足、人形、移动操作平台和灵巧手;其中 9 种支持真机运行,包括 PIPER、GO2、G1、SO-101、GR-3、Astra-Pro、H1-Pro、Lekiwi 与 Stella 灵巧手。


算法节点由约 4 个增至 9 个,覆盖 Pi0.5、SmolVLA、VLA-JEPA、LingBot-VA、FastWAM、SAM3、YOLO、ACT 与 Diffusion Policy,另有 11 个节点列入路线图。新机器人通过 ToolSpec、Query / Action ToolEndpoint 和 manifest v2 Skill Bundle 接入,无需改动 Agent 调度层。


项目采用 dev 日常更新、main 版本发布的双轨机制。核心仓库已迁至 PhyAgentOS 组织并更名为 PhyAgentOS-core,相关文档同步更新。截至发稿,GitHub Star 数接近 2000;9 月将启动机械臂 Agent、跨构型迁移和仿真到真机等技术直播。


PhyAgentOS 采用 MIT 协议开源。X-Era Lab 是主要工程贡献者和首批真实场景部署方,XLeRobot、松灵、睿尔曼和零次方参与官方维护。统一 Tool 契约减少模型对单一机器人接口的绑定,也为机器人、仿真和教学场景提供一致的任务记录与验证链路。


06

快速上手:五行命令开启

递归自进化物理智能探索


运行以下命令即可开始:


git clone https://github.com/PhyAgentOS/PhyAgentOS-core.git

cd PhyAgentOS-core

python -m pip install -e .

paos onboard

paos agent


加载机器人 Skill:


paos skill install move-arm-by-ee

paos skill start move-arm-by-ee --profile mujoco

paos skill status move-arm-by-ee


Forge Gateway 需根据 Skill Runtime 与环境单独启动。PhyAgentOS 也支持 LIBERO、CALVIN、RoboCasa365、Isaac Sim 和真实机器人。


07

结语:让物理行动可核对、

让进化经验可复用


模型能力不断提升,但真实环境还要求系统说明:动作经过什么边界、结果由哪些证据支持,失败后如何继续。


PhyAgentOS v1.0.0 将这些环节放进同一条链路:Agent 负责目标与策略,Forge 负责执行,AgentTask 记录过程,Evidence 保存现场,Verifier 判断结果,Skill Runtime 管理能力,Evolution 只沉淀经过验证的经验。


这套分工让任务结果可检查,失败过程可复盘,验证过的经验可继续使用。物理智能体的递归自进化,由此变成可落地的基础设施。


文章来自于"AI科技评论",作者 "PhyAgentOS team"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales