AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

Doc-V* 由小米大模型 Plus 团队和华中科技大学 VLRLab 团队合作提出,一种从「静态阅读」到「主动探索」的多页文档理解新范式,通过交互式视觉推理让模型像人一样有策略地阅读长文档。

来自主题: AI技术研报
9317 点击    2026-04-30 09:00
英伟达全模态大模型 Nemotron 3 Nano Omni 来了,几秒搞定老黄3分钟演讲,吞吐量同类9倍

英伟达全模态大模型 Nemotron 3 Nano Omni 来了,几秒搞定老黄3分钟演讲,吞吐量同类9倍

英伟达全模态大模型 Nemotron 3 Nano Omni 来了,几秒搞定老黄3分钟演讲,吞吐量同类9倍

英伟达于昨日正式推出全新多模态推理模型Nemotron 3 Nano Omni,将文本、视觉、语音三大模态能力深度融合至单一模型体系,目前可免费使用。

来自主题: AI资讯
9981 点击    2026-04-29 19:52
重磅!Claude一口气打通Adobe、Blender等8大设计建模创意软件,3所顶级艺术院校同步试点

重磅!Claude一口气打通Adobe、Blender等8大设计建模创意软件,3所顶级艺术院校同步试点

重磅!Claude一口气打通Adobe、Blender等8大设计建模创意软件,3所顶级艺术院校同步试点

Anthropic今天宣布与Blender、Autodesk、Adobe、Ableton、Splice等多家合作伙伴联合推出一批连接器,涵盖了3D建模、平面设计、音乐制作和现场视觉等多个领域的创意工具,让Claude能够直接在创意专业人士日常使用的软件中运行。

来自主题: AI资讯
10048 点击    2026-04-29 10:12
AI智力天花板崩了!GPT-5.5 Pro视觉智商145,撞倒门萨俱乐部门槛

AI智力天花板崩了!GPT-5.5 Pro视觉智商145,撞倒门萨俱乐部门槛

AI智力天花板崩了!GPT-5.5 Pro视觉智商145,撞倒门萨俱乐部门槛

1946年至今,「人类最高智商俱乐部」门萨将迎来第一位非人类成员。根据LisanBench最新跑分,GPT-5.5 Pro文本IQ 130踩上门萨会员线,视觉IQ直接飙到145,杀进天才区。一年前「LLM过不了130」还是技术圈共识,今天,这堵墙彻底被砸碎!

来自主题: AI资讯
10127 点击    2026-04-26 23:48
斯坦福系视觉AI公司Collov,完成2300万美元A轮,押注摄像头是AI新入口

斯坦福系视觉AI公司Collov,完成2300万美元A轮,押注摄像头是AI新入口

斯坦福系视觉AI公司Collov,完成2300万美元A轮,押注摄像头是AI新入口

创始人张霄昨天,2026年4月23日,宣布融资2300万美元,也成立了Collov Labs Research,资金用于扩充研究团队和加速视觉AI系统研发,而非单纯的商业扩张。

来自主题: AI资讯
6630 点击    2026-04-26 12:11
前馈式3D的终极路线图来了!五大核心战线,一文看清未来三维重建该往哪走

前馈式3D的终极路线图来了!五大核心战线,一文看清未来三维重建该往哪走

前馈式3D的终极路线图来了!五大核心战线,一文看清未来三维重建该往哪走

从单幅图像恢复三维结构,到多视图场景建模、动态 4D 重建,再到机器人、自动驾驶、SLAM 与视频生成,如何让模型在不依赖逐场景优化的前提下,直接、高效地理解并重建三维世界,正在成为 3D 视觉领域的

来自主题: AI技术研报
9940 点击    2026-04-26 12:09
谷歌再发「香蕉」!何恺明等引爆视觉Transformer时刻

谷歌再发「香蕉」!何恺明等引爆视觉Transformer时刻

谷歌再发「香蕉」!何恺明等引爆视觉Transformer时刻

最近,谷歌联合ResNet作者何恺明、谢赛宁、NeRF先驱Jonathan T. Barron、 3D图形学名家Thomas Funkhouser,正式发布了Vision Banana。它向世界宣告:视觉AI终于不再需要那些臃肿的任务头了,理解,本质上只是生成过程中的一次「对齐」。

来自主题: AI技术研报
10191 点击    2026-04-24 16:13
前OpenAI工程师团队推出 AI 原生无限视觉浏览器原型Flipbook,颠覆HTML!

前OpenAI工程师团队推出 AI 原生无限视觉浏览器原型Flipbook,颠覆HTML!

前OpenAI工程师团队推出 AI 原生无限视觉浏览器原型Flipbook,颠覆HTML!

想象一下:你打开浏览器,没有代码、没有 HTML、没有 CSS 布局引擎。屏幕上每一帧画面,都是 AI 模型实时生成的像素视频流。满满的科幻降临既视感!这就是 Zain Shah(前 OpenAI、YC 校友)和团队刚刚发布的 Flipbook 原型。

来自主题: AI资讯
12080 点击    2026-04-24 10:46
视觉大模型迎来“o1时刻”:腾讯混元提出SOAR,让AI在生成中学会自我纠偏

视觉大模型迎来“o1时刻”:腾讯混元提出SOAR,让AI在生成中学会自我纠偏

视觉大模型迎来“o1时刻”:腾讯混元提出SOAR,让AI在生成中学会自我纠偏

近日,腾讯混元团队提出HY-SOAR (Self-Correction for Optimal Alignment and Refinement),一种面向扩散模型和流匹配模型的数据驱动后训练方法。

来自主题: AI技术研报
8595 点击    2026-04-23 14:44