世界模型迎来「真考场」:WorldArena 2.0 Challenge正式启动
世界模型迎来「真考场」:WorldArena 2.0 Challenge正式启动WorldArena 1.0 的核心意义,在于将世界模型评测从 “好不好看” 推进到 “是否真的有用”。它不再只关注视频观感,而是把物理一致性、可控性、3D 准确性和具身任务功能性纳入统一评测框架,使许多看似流畅的生成结果第一次在机器人具身任务中接受检验。
搜索
WorldArena 1.0 的核心意义,在于将世界模型评测从 “好不好看” 推进到 “是否真的有用”。它不再只关注视频观感,而是把物理一致性、可控性、3D 准确性和具身任务功能性纳入统一评测框架,使许多看似流畅的生成结果第一次在机器人具身任务中接受检验。
Raft是一个很神奇的AI产品。当它还叫Slock的时候,我认为这主要是一个投资人自嗨产物。除了极少数自己充了Claude、Codex会员,同时本地电脑还有Opencode、Pi等一系列Agent的极致变态电子佬用户,没人需要一个AI群聊。
机器之心编辑部 由 OpenAI 前首席技术官 Mira Murati 创立的 AI 初创公司 Thinking Machines Lab,刚刚发布了自研 AI 模型 Inkling。与 OpenAI、Anthropic 或 Google 的旗舰模型不同,Inkling 是一款开放权重模型,外部开发者和企业可以直接下载,并根据自身需求进行修改。
ChatGPT的第一个物理身体被爆出来了:一款音箱。
最新消息终于来了——Gemini 3.5 Pro或将于7月17日正式上线。更有意思的是,这个日期恰好与国产大模型DeepSeek V4正式版的发布窗口正面重合。那么这一次,谷歌拿出的究竟是“真金”还是“虚火”?不妨从三个维度拆解一下。
80年前,阿根廷作家博尔赫斯写过一个寓言,叫《博闻强记的富内斯》。博尔赫斯笔下的富内斯,拥有过目不忘、堪称完美的记忆,却无法思考,因为思考依赖于遗忘和抽象。
你半夜失眠问Claude该不该辞职,它体贴得像个认识了十年的老朋友。
最近一段时间,越来越多人开始讨论一个词:Loop。刚开始看到这个说法,我也觉得有点抽象。Agent 本身不就会反复思考、调用工具、修改代码吗?为什么还要专门设计一个 Loop?周末两天看完 Claude Code 团队写的一篇文章,我才发现,这件事其实没有那么玄乎。
不知道你有没有发现一个现象。
几乎所有 AI 设计工具都卡在同一个地方:它们很会生成,但不太会交付。