不再止步于自然语言!PhiZero让世界模型学会「物理语言」

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
6685点击    2026-08-18 15:28

从物理视频生成到运动迁移,再到可控世界建模。


如果说自然语言帮助 AI 读取人类记录的知识,那么 PhiZero 所探索的 “物理语言”,则试图让 AI 读懂真实世界中的运动、交互与变化。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」


不再止步于自然语言!PhiZero让世界模型学会「物理语言」


  • 论文名称:PhiZero: A World Model Built Around Physical Language 
  • 项目网站:https://Phi-Zero.github.io/
  • 研究团队:Shuyao Shang、Yuqi Wang、Ruopeng Gao、Xu Chen、Tieniu Tan、Lue Fan、Zhaoxiang Zhang  
  • 所属机构:中国科学院自动化研究所(NLPR, CASIA)


语言让经验得以保存,也让知识能够跨越时间与个体持续传播。人类借助语言描述日常生活、总结科学规律、书写历史与程序;大语言模型则通过学习这些内容,逐步掌握概念表达、知识组织,以及面向数字信息的理解与推理。


当 AI 开始进入现实环境,仅靠自然语言是否足以支撑它认识世界?进一步说,除了描述事物的文字,机器能不能学习一套直接表征物理世界细粒度变化的符号系统?


PhiZero 从这个问题出发,希望为世界的状态演化建立一种可学习、可预测的新表示。


从结果开始:PhiZero 展示了哪些能力?


1. 生成具有连贯物理过程的视频


无论是海水冲击岩石、液体灌入容器,还是物体坠入热油、金属罐发生爆炸,PhiZero 都可以对后续过程进行建模。它追求的不仅是每一帧足够逼真,也要求动作产生的影响能够延续,整段事件在时间上保持完整。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」


不再止步于自然语言!PhiZero让世界模型学会「物理语言」

场景虽然跨越海浪、流体、燃烧与爆炸,模型面对的核心任务却相同:预测当前状态将如何继续发展。


2. Motion Transfer:让同一种变化发生在不同载体上


在物理语言中,重点是变化本身,而非执行变化的具体对象。基于这一特点,一段运动所对应的状态转移可以离开原始视频,被赋予新的外观、身体结构或视觉风格。


Human Body → G1 Humanoid


对于真人运动,PhiZero 可以先抽取其中的状态变化,再让 Unitree G1 人形机器人呈现相应过程。这项迁移不以成对的人类 — 机器人训练视频为前提。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」

图中包含四组跨身体形态的迁移结果;各组由左侧真人输入与右侧 G1 输出组成。


Human Hand → Sharpa Dexterous Hand


相似的迁移也能发生在手部操作上:人手与物体接触、完成抓握及转动手腕的过程,可以在 Sharpa 灵巧手上重新呈现。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」


Simulation → Reality


这种机制同样能够连接仿真域与真实域。模型保留仿真片段所包含的动作和交互,再以真实场景的初始外观为基础,生成对应的后续视频。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」

每行展示同一个交互过程:仿真输入位于左侧,真实视觉域中的重建结果位于右侧。


3. 从单张图像出发,连续探索可交互世界


PhiZero 能够接收持续输入、随时更新的控制信号。每当移动方向或观察视角发生改变,模型都会据此向前生成世界,同时努力维持环境布局、关键地标及空间关系的一致。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」

四段演示分别从异星地表、月下湖景、滨海村庄和落日原野展开。


4. 由驾驶动作决定未来画面


面对相同的道路起始帧,不同控制轨迹应当导向不同结果。PhiZero 会结合转向的方向与幅度生成相应未来;在下方四个案例中,多条备选控制信号及其生成视频被并列展示。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」


5. 预测机器人动作带来的视觉后果


在机器人任务中,抓取、舀取和双臂配合等动作轨迹可以先被编码为物理语言,再被还原为细致的交互视频。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」


视频看起来真实,为什么还不够?


近年来,视频世界模型的生成能力不断提升。输入一幅图像或一条文本指令,模型已经可以合成视觉效果出色的未来片段。但是,画面具有真实感,并不能保证其中发生的事情符合物理规律。


网球碰到玩具鸭之后,后者应当怎样移动?物体坠入滚烫的油中,会引发什么样的液体响应?金属容器爆炸时,火光、碎片和投影又该如何随时间共同改变?要回答这些问题,模型需要超越表面的像素质量,理解状态之间的转移、动作造成的影响,以及事件向后展开的因果关系


传统方法往往直接在维度极高的像素空间里生成未来,物理世界的状态转移也因此被包裹在巨大的视觉预测网络之中。这样的模型擅长合成下一段画面,却缺少一个专门用于表达 “世界接下来怎样变化” 的中间层。PhiZero 正是针对这一缺口提出。


“物理语言” 究竟是什么?


通过在大规模真实视频上进行自监督学习,PhiZero 获得了一组容量紧凑的离散表示,并将其称为物理语言(Physical Language)。这套表示不会重复记录颜色、纹理等静态视觉细节,也无意覆盖画面里的全部像素;它专门编码另一类信息:


对象怎样移动、彼此如何作用,以及整个场景从一个时刻过渡到下一个时刻的方式。


以倾倒液体为例,容器的形状与材质已经包含在首帧中;倾斜、流出、扩散等动态过程,则交由物理语言承载。如此一来,描述外观的信息与描述演化的信息被明确分工。


这种分工使状态变化具备复用的可能。即便更换场景、材质或对象形态,原有的运动和交互规律仍可被保存,并进一步参与组合与迁移。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」

画面中的对象与环境已经改变,贯穿事件的状态转移仍然保持一致。


PhiZero 的方法:推演在前,渲染在后


以物理语言为中间层,PhiZero 构建了 Reason-then-Render(先推理、后渲染)的世界模型框架。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」


这套框架由两个主要阶段构成:


阶段一:将视频转写为物理语言。Physical Language Tokenizer 识别连续世界状态之间的差异,并把这些差异编码成离散符号序列。场景和对象的静态外观由第一帧提供,视觉细节则可以借助预训练扩散解码器恢复,因此,数量有限的符号能够集中记录真正发生的动态变化。


阶段二:在物理语言中预测后续事件。Physical Language Reasoner 接收当前图像与动作意图,按照自回归方式生成未来的符号序列;扩散解码器随后读取这些符号,将推理出的演化过程转换为视频。


因此,模型对未来的生成可以理解为一条三段式链路:


识别此刻的世界 → 推算后续的状态变化 → 绘制变化对应的视觉结果


物理语言对视频动态进行了高度压缩。一段 4 秒长、8 FPS、分辨率为 512×896 的视频,在首帧之后仅需 256 个离散符号表示其状态演化;相比之下,标准视频 VAE 会使用 44,800 个连续视觉 token。重建实验表明,即使符号数量大幅减少,模型依然获得领先质量。这说明被压缩表示优先保留了与世界演化相关的信息,而不是反复存储静态外观。


物理语言从哪里来?


与人类语言一样,物理语言也需要从大量经验中形成。


不再止步于自然语言!PhiZero让世界模型学会「物理语言」


训练数据经历了逐层筛选。研究团队先对约 5 万小时真实世界视频进行去重、画质过滤和镜头级筛选,从中保留约 1 万小时未标注内容,用于训练 Physical Language Tokenizer。接下来,真实视频与仿真视频共同构成约 500 万个时长 4 秒的片段,帮助模型覆盖更多状态转移。最终,约 100 万个运动充分、物理事件明确的样本被进一步选出,用来提升 Physical Language Reasoner 对世界演化的预测能力。


整个学习过程不需要人为规定某个符号必须表示 “碰撞”“重力” 或 “流体”。通过不断压缩视频、还原画面并预测未来,模型自行发现哪些变化值得记录,又该如何将它们组织成连续事件;物理语言由此从数据中逐渐形成。


用实验检验:它是否真的更理解物理世界?


不再止步于自然语言!PhiZero让世界模型学会「物理语言」

这里给出四组 Physics-IQ 实例,橙色框对应 PhiZero 生成的视频。


研究团队分别从物理视频生成与物理事件理解两个方向对 PhiZero 进行了评估。


在生成侧,PhiZero 在Physics-IQ Verified、PhyGround、WorldModelBench三项基准中取得领先成绩,相关指标覆盖结果是否一致、过程是否遵循物理规律,以及整体世界建模水平。相较于直接在像素空间生成视频的模型,它更准确地表现出碰撞引起的移动、重力造成的形变、连续触发的反应,以及随对象位置改变的阴影。


在理解侧,PhiZero 在 IntPhys2、LikePhys、YoCausal三项测试中也达到领先或具有竞争力的表现。模型可以把两段视频映射到物理语言空间并比较其合理程度,进而找出不符合直觉物理或因果逻辑的事件。


由此可见,物理语言不仅是一种服务于生成的高效编码,也提供了评判现实中哪些事件更有可能发生的表示基础。


为 AI 打开一条通往物理世界的新通道


自然语言之所以强大,并不只是因为它能给事物命名,还因为知识可以借助语言被抽象、重组、推导和传递。PhiZero 希望把类似的能力带到对物理变化的表达之中。PhiZero 则把连续的世界演化压缩成可传递、可推断的符号,使视频生成、物理理解、动作控制与运动迁移能够围绕同一个表示体系建立联系。


面向未来,规模更大的训练数据、更强的模型以及跨度更长的预测,有望继续拓展物理语言的表达范围。它还可能支持多模态模型理解时空关系、帮助具身智能体制定计划,并推动技能在不同机器人形态之间迁移。


文字让 AI 接触到了人类书写的数字知识;PhiZero 所做的尝试,则是让机器进一步读取运动与交互中蕴含的世界规律。


让 AI 不只看见世界,也学会物理世界自己的语言。


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md