AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA

比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA

比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA

上海人工智能实验室开源的多模态决策SOTA模型Intern-Decision采用自回归式掩码语言任务框架,在推理速度上比Jev提升2至3倍,并在游戏画面决策、验证码识别和网页操作等任务中展现出将视觉理解与结构化决策结合的能力,目前已在Hugging Face、GitHub开源0.8B、2B和4B三个版本。

来自主题: AI资讯
8731 点击    2026-09-29 11:14
350亿机器人3D视觉一哥,冲刺港交所!蚂蚁是股东

350亿机器人3D视觉一哥,冲刺港交所!蚂蚁是股东

350亿机器人3D视觉一哥,冲刺港交所!蚂蚁是股东

奥比中光向香港联交所提交上市申请,拟发行H股并在港交所主板上市,蚂蚁集团旗下上海云鑫持股8.92%,2025年营收9.41亿元、净利润1.28亿元,全球机器人3D视觉感知市场份额以29.0%排名第一。

来自主题: AI资讯
6795 点击    2026-09-29 11:12
刚刚,性价比之王Sonnet 5.5发布!

刚刚,性价比之王Sonnet 5.5发布!

刚刚,性价比之王Sonnet 5.5发布!

Anthropic发布Claude Sonnet 5.5,运行速度较前代提升30%、单任务成本最高降低30%,以一半的标价在多项基准测试中接近或反超大杯Opus 5.5,凭借代码、视觉理解和办公等能力成为新一代性价比之王。

来自主题: AI资讯
8856 点击    2026-09-29 10:12
面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26

埃默里大学提出的Decompose–Look–Reason(DLR)框架被EMNLP 2026接收,该方法通过分解问题、按premise提取视觉latent再推理,在Qwen3-VL-8B-Thinking上于V*、MathVista等基准取得显著提升。

来自主题: AI技术研报
8156 点击    2026-09-28 16:22
从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

新加坡国立大学 Show Lab 发布的 Show-Harness 通过一套可被 VLM 理解的语义动作接口,使前沿视觉语言模型和轻量微调的 Qwen3.5-2B 能够跨模型、跨机器人本体直接操控真实机器人,并在跨任务、跨环境、跨本体实验中取得显著高于基线的成功率。

来自主题: AI技术研报
7398 点击    2026-09-28 09:50
答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

南洋理工大学S-Lab、A*STAR与UIUC联合提出的V-Rubrics方法将5万视觉样本拆分为35万条细粒度准则,从视觉忠实性、推理一致性和指令遵循三维度分别参与强化学习奖励分配,使基于Qwen3-VL-8B的模型在通用与知识评测中平均得分提升至68.04。

来自主题: AI技术研报
7406 点击    2026-09-28 09:48
Ming-Image-0.1-Design 系列开源,专做UI海报,走进真实设计工作流

Ming-Image-0.1-Design 系列开源,专做UI海报,走进真实设计工作流

Ming-Image-0.1-Design 系列开源,专做UI海报,走进真实设计工作流

过去,在灵光闪应用中,用户需要等到应用生成完成,才能看到完整的页面设计和视觉效果。 在画眉的专业设计场景中,设计师拿到成图后,还要经过拆层处理,通常需要 5 分钟以上才能继续编辑。 一个需要更早看见设

来自主题: AI资讯
10531 点击    2026-09-23 22:37
ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

随着编辑工具与生成模型的快速普及,「改图」正在变得越来越容易,篡改者可以在几乎不改变画面观感的前提下完成内容伪造,给内容真实性核验、平台治理与数字媒体信任带来新的风险。因此,图像取证与可信鉴伪证据,成为了内容安全中尤为重要的一环。

来自主题: AI技术研报
9643 点击    2026-09-22 09:51
迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

让 AI 生成一张海报已经不难。更难的是,让它围绕同一个设计目标持续工作:理解品牌与产品要求,生成初稿;发现标题、产品位置或整体风格存在问题后,知道应该修改哪里、怎样修改;同时保留已经确认的内容。等到下一次活动,它还能延续此前确定的设计偏好和有效经验。

来自主题: AI技术研报
10558 点击    2026-09-22 09:50