AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。

来自主题: AI技术研报
5619 点击    2026-09-03 09:50
33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。

来自主题: AI技术研报
8174 点击    2026-09-02 14:33
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。

来自主题: AI技术研报
8983 点击    2026-09-02 14:32
李飞飞发布:全球首个多模态世界模型

李飞飞发布:全球首个多模态世界模型

李飞飞发布:全球首个多模态世界模型

「全球首个」多模态世界模型,来了!

来自主题: AI技术研报
7453 点击    2026-09-02 10:07
AI到底能不能自己造AI?别吵了,有人做出来了

AI到底能不能自己造AI?别吵了,有人做出来了

AI到底能不能自己造AI?别吵了,有人做出来了

RSI,可能是 AI 世界里最像科幻的一个词。

来自主题: AI技术研报
6714 点击    2026-09-02 09:28
AI能挖漏洞吗?北航等机构把真实漏洞炼进了模型参数

AI能挖漏洞吗?北航等机构把真实漏洞炼进了模型参数

AI能挖漏洞吗?北航等机构把真实漏洞炼进了模型参数

给一个大模型漏洞描述和代码仓库,它能否像安全研究人员一样,读代码、找入口、调用工具、构造输入,并反复验证自己的判断?

来自主题: AI技术研报
9107 点击    2026-09-02 09:27
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。

来自主题: AI技术研报
9956 点击    2026-09-02 09:27
AIVC只是前菜!复旦提出生命算子,统一生命建模

AIVC只是前菜!复旦提出生命算子,统一生命建模

AIVC只是前菜!复旦提出生命算子,统一生命建模

虚拟细胞,已经成为AI与生物交叉领域最火热的方向之一。

来自主题: AI技术研报
10311 点击    2026-09-01 14:43
当AI从工具到认知主体,我们需要警惕哪些新风险?

当AI从工具到认知主体,我们需要警惕哪些新风险?

当AI从工具到认知主体,我们需要警惕哪些新风险?

导读:随着智能体系统(Agentic AI System)处理任务能力的持续提升,AI 正在逐渐从传统意义上的工具,演变为能够自主决策、独立执行任务,并与人类及社会群体进行持续交互的智能主体。但是一个越来越值得关注的问题是:当 AI 的认知能力不断扩展,其潜在风险不再局限于单一任务中的幻觉、偏见或决策错误,而是进一步影响人类用户的能动性、自主性,乃至人类对 AI 系统的控制权。

来自主题: AI技术研报
10320 点击    2026-09-01 14:21
少数Full Attention层如何重塑内部计算?混合线性注意力大模型中的「尖峰」与「平台」之谜首次揭开

少数Full Attention层如何重塑内部计算?混合线性注意力大模型中的「尖峰」与「平台」之谜首次揭开

少数Full Attention层如何重塑内部计算?混合线性注意力大模型中的「尖峰」与「平台」之谜首次揭开

Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。

来自主题: AI技术研报
8015 点击    2026-09-01 14:21
谷歌重磅发布WikiSkill,技能可以自己进化了!

谷歌重磅发布WikiSkill,技能可以自己进化了!

谷歌重磅发布WikiSkill,技能可以自己进化了!

一个 Agent 到底凭什么越来越强?有人靠更大的模型,有人靠更多数据。就在前天,Google Research 最新发布的 WikiSkill 给出了另一条答案:给 Agent 搭一套三层知识架构,让技能自己进化。

来自主题: AI技术研报
7192 点击    2026-09-01 10:27
万兴偷偷做的TVC神器,茶颜悦色已经用上了!

万兴偷偷做的TVC神器,茶颜悦色已经用上了!

万兴偷偷做的TVC神器,茶颜悦色已经用上了!

今年发了这么多期短剧Agent创作平台,我发现市面上专门针对TVC制作的,超级少。

来自主题: AI技术研报
10259 点击    2026-09-01 10:27
Co-Scientist升级:AI走出屏幕,首次在真实实验室「造出」半导体

Co-Scientist升级:AI走出屏幕,首次在真实实验室「造出」半导体

Co-Scientist升级:AI走出屏幕,首次在真实实验室「造出」半导体

Google DeepMind与杜克大学联合发布了AI科研系统Co-Scientist的重大升级版本,Co-Scientist是Google基于Gemini构建的多智能体科研系统。

来自主题: AI技术研报
10467 点击    2026-09-01 09:55
中国大模型已经世界一流,为什么开发者生态还在别人手里?

中国大模型已经世界一流,为什么开发者生态还在别人手里?

中国大模型已经世界一流,为什么开发者生态还在别人手里?

模型是中国做的,为什么后面的数千次创新发生在海外开发者平台?从模型分发、开发者工具到算力路由,中国缺的不是技术,是默认路径。如果只看结论,读完下面五条摘要即可;后文是证据、机制和行动方案。

来自主题: AI技术研报
7806 点击    2026-08-31 16:48
当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

Salesforce AI与UIUC研究人员提出Strong-to-Weak Scaffolding方法,让强模型(Builder AI)为弱模型GPT-5.4-mini自动设计外部Harness工作框架,无需修改参数即可将其在心智理论任务上的平均准确率从0.488提升至最佳0.912,揭示AI4AI的核心机制是将认知结构而非知识从强模型迁移至弱模型。

来自主题: AI技术研报
8094 点击    2026-08-31 15:26
「AI 味」不是在一句话里,而是渗透了所有的文字

「AI 味」不是在一句话里,而是渗透了所有的文字

「AI 味」不是在一句话里,而是渗透了所有的文字

相信很多人现在见到「不是……而是」,已经会下意识 PTSD 了:这是不是 AI 写的?还有各种破折号,冒号,以及经典版本「稳稳地接住你」「我用最直白的话,不绕弯子地告诉你」…… 当然,这些不断被总结出

来自主题: AI技术研报
8300 点击    2026-08-31 12:03
MIT最新研究显示:AI文明可能根本不需要语言。

MIT最新研究显示:AI文明可能根本不需要语言。

MIT最新研究显示:AI文明可能根本不需要语言。

最近 MIT 出了一篇研究,我看完有点不知道说什么好。

来自主题: AI技术研报
8444 点击    2026-08-31 10:44
Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破,无需训练即成功实现了从 3B 小模型到 Claude Opus 5 的全面提升。

来自主题: AI技术研报
9571 点击    2026-08-30 11:55
「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。

来自主题: AI技术研报
6346 点击    2026-08-28 12:01