AI资讯新闻榜单内容搜索-视觉

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视觉
全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。

来自主题: AI技术研报
5978 点击    2026-09-08 11:02
机器人基础模型的「协作时代」来了!芝诺机器人发布全球首个协作具身智能基础模型

机器人基础模型的「协作时代」来了!芝诺机器人发布全球首个协作具身智能基础模型

机器人基础模型的「协作时代」来了!芝诺机器人发布全球首个协作具身智能基础模型

芝诺机器人发布全球首个协作具身智能基础模型Zeno-1,该3B参数模型专为去中心化多机器人协作设计,能在本地以30Hz频率进行闭环视觉—运动推理,通过四阶段递进训练让机器人从同一策略副本中自发涌现协作行为,实现1+1>2的效果。

来自主题: AI资讯
7898 点击    2026-09-07 16:45
Meta全开源HumanCLAW:基础模型正进入具身智能的决策层

Meta全开源HumanCLAW:基础模型正进入具身智能的决策层

Meta全开源HumanCLAW:基础模型正进入具身智能的决策层

Meta联合南洋理工大学等多所高校全开源HumanCLAW基准,将高层行动决策与低层运动控制分离以单独测量视觉语言模型的行动智能,九个前沿模型完整交互成功率仅16.8%,揭示出当前基础模型缺乏持续维护自身身体状态估计的具身自我感知缺口。

来自主题: AI技术研报
8618 点击    2026-09-05 10:45
让代码接管世界演化,西湖大学发布Code视频世界模型

让代码接管世界演化,西湖大学发布Code视频世界模型

让代码接管世界演化,西湖大学发布Code视频世界模型

西湖大学AGI实验室发布Code World Model视频世界模型,将世界演化与视觉生成分离,由Coding Agent和代码负责因果规则执行、视频模型负责高保真视觉渲染,并提出Proxy作为可编译视觉条件通道,用约5.6小时游戏视频完成原型验证。

来自主题: AI资讯
8367 点击    2026-09-04 15:49
苹果新作:内化视觉思考,推理提速 5 倍

苹果新作:内化视觉思考,推理提速 5 倍

苹果新作:内化视觉思考,推理提速 5 倍

苹果研究团队提出 Internalized Visual Thinking(IVT)后训练框架,通过在训练阶段联合学习文本答案与未来帧隐空间表征、在推理阶段完全移除未来视觉预测过程,使模型在主动视频推理任务上相比 Visual CoT 获得超过 5 倍的推理加速,且在六项评测设置中均优于 Answer-Only SFT。

来自主题: AI技术研报
7678 点击    2026-09-04 10:36
刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路

刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路

刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路

Anthropic发布Fable 5.1完整提示词与工程落地指南,涵盖思考档位选择、工具调用进度汇报、历史对话管理、上下文压缩、写作密度控制、检索引用规范、安全策略调优、多智能体并行及视觉任务处理等多方面的使用技巧与避坑要点。

来自主题: AI资讯
10073 点击    2026-09-04 00:02
答对了却没看图?EASE给多模态RLVR装上「视线校正器」

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。

来自主题: AI技术研报
6915 点击    2026-09-03 14:17
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。

来自主题: AI技术研报
5662 点击    2026-09-03 09:50
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。

来自主题: AI技术研报
9019 点击    2026-09-02 14:32
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。

来自主题: AI技术研报
9991 点击    2026-09-02 09:27