AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

何恺明参与!DeepMind把文生视频模型做成通用视觉基座,训练数据量仅1/500

当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。

来自主题: AI技术研报
8139 点击    2026-08-07 09:10
快手可灵AI核心技术骨干王鑫涛离职

快手可灵AI核心技术骨干王鑫涛离职

快手可灵AI核心技术骨干王鑫涛离职

根据雷锋网报道,快手可灵AI核心技术骨干王鑫涛已确认离职。有知情人士透露,其下一站大概率将前往另一家头部互联网大厂。公开资料显示,王鑫涛本科毕业于浙江大学,博士阶段进入香港中文大学多媒体实验室深造,师从汤晓鸥教授,长期深耕计算机视觉与生成式AI方向。

来自主题: AI资讯
7776 点击    2026-08-07 00:26
别再吹AI生图了,不能图层编辑的AI都是“画饼”

别再吹AI生图了,不能图层编辑的AI都是“画饼”

别再吹AI生图了,不能图层编辑的AI都是“画饼”

面向设计生产场景,兔展智能研发了UniWorld-Design,进一步强化了视觉生成与编辑能力的结合,并基于此打造了产模一体战略的重要产品——RabbitVis。AI正在从通用能力竞争,进入场景能力竞争

来自主题: AI资讯
8035 点击    2026-08-06 10:47
视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

随着 AI 生图能力不断提升,如何让 AI 真正进入创作流程成为新的行业问题。兔展智能基于 UniWorld-Design 视觉 AI 大模型推出 RabbitVis,尝试推动视觉 AI 从图片生成走向可编辑、可交付的创作流程。

来自主题: AI技术研报
8279 点击    2026-08-06 09:36
Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。

来自主题: AI技术研报
8269 点击    2026-08-05 15:50
VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

视觉问答模型的准确率不断提高,但高分未必来自视觉理解 —— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。

来自主题: AI技术研报
8205 点击    2026-08-04 10:33
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出:模型越来越大、语义能力越来越强,动作更新却未必足够快。

来自主题: AI技术研报
9986 点击    2026-08-03 15:30
这家中国公司站上国际顶会SIGGRAPH的C位

这家中国公司站上国际顶会SIGGRAPH的C位

这家中国公司站上国际顶会SIGGRAPH的C位

7 月 19 日至 23 日,美国洛杉矶,SIGGRAPH 2026 如期而至。这场汇聚全球计算机图形学与视觉计算领域顶尖学者、艺术家与工程师的年度盛会,吸引了来自 69 个国家的近万名参会者。渲染、几何建模、动画仿真、与生成式 AI,几乎所有关于如何用计算机创造视觉世界的最前沿探索,都在这五天里集中呈现。

来自主题: AI资讯
7800 点击    2026-07-30 16:38
深度|10人团队登顶视觉推理榜,Chance AI 超过GPT、Gemini和人类专家

深度|10人团队登顶视觉推理榜,Chance AI 超过GPT、Gemini和人类专家

深度|10人团队登顶视觉推理榜,Chance AI 超过GPT、Gemini和人类专家

过去两年,多模态模型的竞争看起来像一场“造眼睛”的竞赛:更高的图像分辨率、更多的视觉 token、更大的模型,以及更昂贵的训练。行业似乎默认,只要第一次看得足够清楚,AI 就能从“看见”抵达“洞见”。

来自主题: AI资讯
10264 点击    2026-07-30 11:34