用3D几何先验驱动视频扩散,实现更一致的世界生成
用3D几何先验驱动视频扩散,实现更一致的世界生成随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。
搜索
随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。
机器人撬开啤酒瓶盖,白色泡沫顺着瓶口涌出来。
机器人撬开啤酒瓶盖,啤酒泡沫涌起,酒液从画面右下角流入杯中。
2026 年上半年,美国风险投资市场呈现极端的两极分化。每 100 美元风投中,有 86 美元流向 AI 公司,其中 OpenAI 与 Anthropic 两家企业占据全球四成以上份额;与此同时,非 AI 创业公司经通胀调整后的融资金额已跌至新冠疫情水平之下。
过去三年,AI 内容生成行业经历了几轮密集的技术迭代。从文生图到文生视频,从几秒的短片到分钟级的长视频,每一轮升级都让生成内容的质量和时长向前推进一步。
太卷了!过去两年,视频生成模型把画面参数几乎卷了个遍。
近日,清华大学智能产业研究院(AIR)与加州大学伯克利分校(BAIR)团队合作提出了一种全新的预测范式 ODEWorld,其建立在连续的“物理时间流”(Physical-Time Flow, PT-Flow)之上。与传统方法直接预测下一帧是什么不同,ODEWorld 试图学习的是:世界究竟怎样从当前状态连续地变化到未来状态。
8 月 10 日,戴盟机器人正式发布全球首个触觉锚定世界模型 Daimon-TWM(Tactile-grounded World Model),以原生触觉贯穿物理认知、推演决策和瞬时反应全阶段。这个 “物理交互脑” 不仅能理解正在发生的物理接触,还能预测下一步交互会发生什么,并根据瞬息万变的反馈及时修正动作。
过去两年,self-reflection、self-correction、self-play、agentic RL、skill learning、test-time adaptation、open-ended evolution、self-evolving agent等概念不断涌现。
世界模型是物理原生智能(Physics-native Intelligence,Phi)重要的组成环节。