Claude满分、GPT 99分!何恺明团队把AGI考试打穿了
Claude满分、GPT 99分!何恺明团队把AGI考试打穿了何恺明团队提出VISTA方法,将ARC-AGI-3的数字表换回图像并配备可随时翻看的视觉记忆相册,使Claude Opus 5拿下满分100分、GPT-5.6 Sol获得99分,证明卡住大模型的是眼睛和记性而非模型能力本身。
搜索
何恺明团队提出VISTA方法,将ARC-AGI-3的数字表换回图像并配备可随时翻看的视觉记忆相册,使Claude Opus 5拿下满分100分、GPT-5.6 Sol获得99分,证明卡住大模型的是眼睛和记性而非模型能力本身。
Meta个人智能体Muse爆火后,沈俊潇创办的Memories.ai押注视觉记忆赛道,其视觉模型栈已在高通骁龙平台实现手机、PC与智能眼镜的端侧持续感知,并与英伟达达成合作,成为芯片厂商卡位生态的重要伙伴。
Einsia AI旗下Navers Lab发布视觉编程基准PPTBench,包含500个科学流程图任务并测试10个模型36种配置,GPT-6 Astra High以77.34分居首,但64.03%的结果因流程语义错误被拒,表明视觉理解仍是当前主要瓶颈。
上海人工智能实验室开源的多模态决策SOTA模型Intern-Decision采用自回归式掩码语言任务框架,在推理速度上比Jev提升2至3倍,并在游戏画面决策、验证码识别和网页操作等任务中展现出将视觉理解与结构化决策结合的能力,目前已在Hugging Face、GitHub开源0.8B、2B和4B三个版本。
奥比中光向香港联交所提交上市申请,拟发行H股并在港交所主板上市,蚂蚁集团旗下上海云鑫持股8.92%,2025年营收9.41亿元、净利润1.28亿元,全球机器人3D视觉感知市场份额以29.0%排名第一。
Anthropic发布Claude Sonnet 5.5,运行速度较前代提升30%、单任务成本最高降低30%,以一半的标价在多项基准测试中接近或反超大杯Opus 5.5,凭借代码、视觉理解和办公等能力成为新一代性价比之王。
埃默里大学提出的Decompose–Look–Reason(DLR)框架被EMNLP 2026接收,该方法通过分解问题、按premise提取视觉latent再推理,在Qwen3-VL-8B-Thinking上于V*、MathVista等基准取得显著提升。
新加坡国立大学 Show Lab 发布的 Show-Harness 通过一套可被 VLM 理解的语义动作接口,使前沿视觉语言模型和轻量微调的 Qwen3.5-2B 能够跨模型、跨机器人本体直接操控真实机器人,并在跨任务、跨环境、跨本体实验中取得显著高于基线的成功率。
南洋理工大学S-Lab、A*STAR与UIUC联合提出的V-Rubrics方法将5万视觉样本拆分为35万条细粒度准则,从视觉忠实性、推理一致性和指令遵循三维度分别参与强化学习奖励分配,使基于Qwen3-VL-8B的模型在通用与知识评测中平均得分提升至68.04。
AI 正从看懂画面,走向理解空间、预测变化、执行动作。