AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
高德联合南大、清华、北大发布WorldRoamBench,定义交互式世界模型长时漫游评测新范式

高德联合南大、清华、北大发布WorldRoamBench,定义交互式世界模型长时漫游评测新范式

高德联合南大、清华、北大发布WorldRoamBench,定义交互式世界模型长时漫游评测新范式

随着 Genie 3 的发布,可交互世界模型真正走到台前:用户不再只是观看生成视频,而是可以输入动作实时改变一个持续演化的世界。世界模型开始从「生成一段视频」走向「模拟一个可交互世界」,但能走进去,不等于经得起探索。模型能否持续响应控制、维持视觉与空间一致、遵守物理规律并记住来路,仍缺少系统评测。

来自主题: AI技术研报
8918 点击    2026-09-16 10:35
OpenAI 计划3亿美金收购AI影像公司 Glass Imaging

OpenAI 计划3亿美金收购AI影像公司 Glass Imaging

OpenAI 计划3亿美金收购AI影像公司 Glass Imaging

OpenAI计划以3亿美金收购由前苹果工程师创立的AI影像公司Glass Imaging,以补充端侧视觉能力,布局多模态AI硬件。

来自主题: AI资讯
8426 点击    2026-09-15 14:16
视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

视觉理解和生成究竟能否相互促进?从视觉表征、任务到系统重新审视UMM

理解生成统一模型(Unified Multimodal Models, UMMs)正在成为多模态模型的重要发展方向。相比传统的理解模型 + 生成模型,UMM 希望在同一个模型中同时完成视觉理解和图像生成,让文本和图像能够在统一上下文中被理解、推理和生成。

来自主题: AI技术研报
6685 点击    2026-09-14 15:03
字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!

字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!

字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!

字节Seed团队推出Seed-Evolving第五版更新,通过统一Model ID实现周级自动迭代,在Coding Agent长程任务完成度和VLM视觉理解能力上均有显著提升,用户一次接入即可享受模型持续进化。

来自主题: AI资讯
8710 点击    2026-09-12 10:03
刚刚,ECCV最佳论文出炉,李飞飞获时间检验奖

刚刚,ECCV最佳论文出炉,李飞飞获时间检验奖

刚刚,ECCV最佳论文出炉,李飞飞获时间检验奖

机器之心编辑部 几个小时前,ECCV 公布了今年度的最佳论文奖等奖项。 ECCV(European Conference on Computer Vision,欧洲计算机视觉国际会议)是计算机视觉(C

来自主题: AI资讯
9576 点击    2026-09-11 16:04
DeepSeek V4.1 Flash 开源:全新架构

DeepSeek V4.1 Flash 开源:全新架构

DeepSeek V4.1 Flash 开源:全新架构

刚刚,DeepSeek 开源了 V4.1 Flash,原生支持视觉理解,也是全新架构系列中最小的一款模型,550B 总参数,输入时激活 8B,输出时激活 16B(你没看错,输入输出激活不同)

来自主题: AI技术研报
7212 点击    2026-09-10 16:58
ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。

来自主题: AI技术研报
6428 点击    2026-09-10 15:18
大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。

来自主题: AI技术研报
9440 点击    2026-09-09 14:49
全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。

来自主题: AI技术研报
6309 点击    2026-09-08 11:02