AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

一段人坐上椅子的视频,对人类而言再普通不过。我们不仅能看见 “人坐了下来”,还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定,这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,“看见动作” 与 “重建真实交互” 仍是两回事。一个视觉上准确坐在椅子上的人体,进入物理仿真后,椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。视觉上成立,并不意味着物理交互上成立。

来自主题: AI技术研报
5423 点击    2026-09-21 10:10
给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

NTU、CMU、Berkeley等高校联合推出VBVR-Pro视觉推理系统,构建300项任务与100项可验证打分器的训练评测平台,测试30余个多模态模型,并验证其打分器可直接作为强化学习奖励。

来自主题: AI技术研报
6947 点击    2026-09-20 15:08
肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中

来自主题: AI技术研报
8855 点击    2026-09-20 15:07
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

PhAI Labs联合牛津、斯坦福等高校推出跨领域预测框架JEPA-Anything,通过正交预测分解(OPF)机制将预测容量分配到多个互补子空间,并在视觉、生物、临床、控制、分子、物理场和天气七类系统中验证,同时在肝癌研究中从内部因子筛选出可实验验证的候选干预方案,在行星轨道模拟中提取出与开普勒第三定律高度吻合的尺度规律。

来自主题: AI技术研报
5403 点击    2026-09-20 11:07
对话Memories.ai沈俊潇:用视觉记忆驱动物理AI自进化

对话Memories.ai沈俊潇:用视觉记忆驱动物理AI自进化

对话Memories.ai沈俊潇:用视觉记忆驱动物理AI自进化

Memories.ai创始人沈俊潇在对话中阐述,记忆只是基础,公司真正聚焦于通过自建视频数据湖驱动物理AI实现"递归自我进化"(Physical RSI),其LVMM大型视觉记忆模型已与高通、英伟达达成合作,种子轮融资追加至1600万美元。

来自主题: AI资讯
8028 点击    2026-09-20 11:05
开源Editable-Design,让AI生图终于能改字、拖图层

开源Editable-Design,让AI生图终于能改字、拖图层

开源Editable-Design,让AI生图终于能改字、拖图层

开源项目 Editable Design 结合视觉模型、HTML 代码与持续工作的 Agent,将 AI 生图重构为可编辑的设计文件,使文字可直接修改、图层可独立拖动,仓库展示了 14 组覆盖营销海报、信息设计等 6 类视觉任务的案例。

来自主题: AI技术研报
8124 点击    2026-09-19 14:55
构建你的完整角色世界,ArcLoop做了个全栈AI故事引擎

构建你的完整角色世界,ArcLoop做了个全栈AI故事引擎

构建你的完整角色世界,ArcLoop做了个全栈AI故事引擎

ArcLoop推出全栈AI故事引擎,围绕IP World统一管理角色、场景与视觉资产,解决AI漫剧长线连载中的角色一致性与世界观延续难题,创始人秦路此前在字节工作七年,公司已完成天使轮融资。

来自主题: AI资讯
8898 点击    2026-09-18 15:50
豆包大模型再更新,发力多模态编程,一手实测来了

豆包大模型再更新,发力多模态编程,一手实测来了

豆包大模型再更新,发力多模态编程,一手实测来了

字节跳动发布新版豆包2.1 Pro(0915版本),重点升级多模态编程与视觉理解能力,可依据设计图、图纸和操作录屏生成代码,编辑团队通过山西3D旅行导览、小王子微缩星球等场景实测,验证其在Agent任务交付与Token效率方面的提升。

来自主题: AI资讯
7750 点击    2026-09-18 15:48
流式推理优化,让机器人决策延迟低至0.68秒

流式推理优化,让机器人决策延迟低至0.68秒

流式推理优化,让机器人决策延迟低至0.68秒

SimpleMemVLA由面壁智能联合华中科技大学等机构提出,将带时间戳的原生视觉历史直接作为机器人记忆上下文,在四项记忆基准取得SOTA并涌现视觉上下文学习能力,同时通过流式推理优化将60秒历史决策延迟从1.02秒降至0.68秒。

来自主题: AI技术研报
9287 点击    2026-09-18 15:47
TPAMI26 | 全面升级PolaFormer++:极性感知计算流 +通道级尖峰,实现线性注意力的新天花板

TPAMI26 | 全面升级PolaFormer++:极性感知计算流 +通道级尖峰,实现线性注意力的新天花板

TPAMI26 | 全面升级PolaFormer++:极性感知计算流 +通道级尖峰,实现线性注意力的新天花板

继 ICLR 2025 的 PolaFormer 之后,哈工大(深圳)与鹏城实验室合作的扩展版本 PolaFormer++ 近日被 IEEE TPAMI 正式接收。新版本在理论框架、特征映射设计和实验覆盖面上全面升级:首次给出判定特征映射是否具备「降熵尖锐性」的理论判据,并提出极性感知的通道级尖锐(PaCS)特征映射,在六大类视觉核心任务上全面验证了线性注意力的潜力。

来自主题: AI技术研报
8432 点击    2026-09-18 09:35