AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
Claude满分、GPT 99分!何恺明团队把AGI考试打穿了

Claude满分、GPT 99分!何恺明团队把AGI考试打穿了

Claude满分、GPT 99分!何恺明团队把AGI考试打穿了

何恺明团队提出VISTA方法,将ARC-AGI-3的数字表换回图像并配备可随时翻看的视觉记忆相册,使Claude Opus 5拿下满分100分、GPT-5.6 Sol获得99分,证明卡住大模型的是眼睛和记性而非模型能力本身。

来自主题: AI资讯
7442 点击    2026-10-04 22:03
Muse爆火,个人Agent如何获得“持久记忆”

Muse爆火,个人Agent如何获得“持久记忆”

Muse爆火,个人Agent如何获得“持久记忆”

Meta个人智能体Muse爆火后,沈俊潇创办的Memories.ai押注视觉记忆赛道,其视觉模型栈已在高通骁龙平台实现手机、PC与智能眼镜的端侧持续感知,并与英伟达达成合作,成为芯片厂商卡位生态的重要伙伴。

来自主题: AI资讯
8415 点击    2026-10-04 22:01
GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?

GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?

GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?

Einsia AI旗下Navers Lab发布视觉编程基准PPTBench,包含500个科学流程图任务并测试10个模型36种配置,GPT-6 Astra High以77.34分居首,但64.03%的结果因流程语义错误被拒,表明视觉理解仍是当前主要瓶颈。

来自主题: AI资讯
7179 点击    2026-09-30 15:42
比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA

比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA

比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA

上海人工智能实验室开源的多模态决策SOTA模型Intern-Decision采用自回归式掩码语言任务框架,在推理速度上比Jev提升2至3倍,并在游戏画面决策、验证码识别和网页操作等任务中展现出将视觉理解与结构化决策结合的能力,目前已在Hugging Face、GitHub开源0.8B、2B和4B三个版本。

来自主题: AI资讯
9021 点击    2026-09-29 11:14
350亿机器人3D视觉一哥,冲刺港交所!蚂蚁是股东

350亿机器人3D视觉一哥,冲刺港交所!蚂蚁是股东

350亿机器人3D视觉一哥,冲刺港交所!蚂蚁是股东

奥比中光向香港联交所提交上市申请,拟发行H股并在港交所主板上市,蚂蚁集团旗下上海云鑫持股8.92%,2025年营收9.41亿元、净利润1.28亿元,全球机器人3D视觉感知市场份额以29.0%排名第一。

来自主题: AI资讯
7014 点击    2026-09-29 11:12
刚刚,性价比之王Sonnet 5.5发布!

刚刚,性价比之王Sonnet 5.5发布!

刚刚,性价比之王Sonnet 5.5发布!

Anthropic发布Claude Sonnet 5.5,运行速度较前代提升30%、单任务成本最高降低30%,以一半的标价在多项基准测试中接近或反超大杯Opus 5.5,凭借代码、视觉理解和办公等能力成为新一代性价比之王。

来自主题: AI资讯
9089 点击    2026-09-29 10:12
面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

埃默里大学提出的Decompose–Look–Reason(DLR)框架被EMNLP 2026接收,该方法通过分解问题、按premise提取视觉latent再推理,在Qwen3-VL-8B-Thinking上于V*、MathVista等基准取得显著提升。

来自主题: AI技术研报
8400 点击    2026-09-28 16:22
从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

新加坡国立大学 Show Lab 发布的 Show-Harness 通过一套可被 VLM 理解的语义动作接口,使前沿视觉语言模型和轻量微调的 Qwen3.5-2B 能够跨模型、跨机器人本体直接操控真实机器人,并在跨任务、跨环境、跨本体实验中取得显著高于基线的成功率。

来自主题: AI技术研报
7682 点击    2026-09-28 09:50
答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

南洋理工大学S-Lab、A*STAR与UIUC联合提出的V-Rubrics方法将5万视觉样本拆分为35万条细粒度准则,从视觉忠实性、推理一致性和指令遵循三维度分别参与强化学习奖励分配,使基于Qwen3-VL-8B的模型在通用与知识评测中平均得分提升至68.04。

来自主题: AI技术研报
7661 点击    2026-09-28 09:48