AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。

来自主题: AI技术研报
7935 点击    2026-09-02 14:33
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。

来自主题: AI技术研报
8641 点击    2026-09-02 14:32
李飞飞发布:全球首个多模态世界模型

李飞飞发布:全球首个多模态世界模型

李飞飞发布:全球首个多模态世界模型

「全球首个」多模态世界模型,来了!

来自主题: AI技术研报
7091 点击    2026-09-02 10:07
AI到底能不能自己造AI?别吵了,有人做出来了

AI到底能不能自己造AI?别吵了,有人做出来了

AI到底能不能自己造AI?别吵了,有人做出来了

RSI,可能是 AI 世界里最像科幻的一个词。

来自主题: AI技术研报
6447 点击    2026-09-02 09:28
AI能挖漏洞吗?北航等机构把真实漏洞炼进了模型参数

AI能挖漏洞吗?北航等机构把真实漏洞炼进了模型参数

AI能挖漏洞吗?北航等机构把真实漏洞炼进了模型参数

给一个大模型漏洞描述和代码仓库,它能否像安全研究人员一样,读代码、找入口、调用工具、构造输入,并反复验证自己的判断?

来自主题: AI技术研报
8869 点击    2026-09-02 09:27
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。

来自主题: AI技术研报
9685 点击    2026-09-02 09:27
AIVC只是前菜!复旦提出生命算子,统一生命建模

AIVC只是前菜!复旦提出生命算子,统一生命建模

AIVC只是前菜!复旦提出生命算子,统一生命建模

虚拟细胞,已经成为AI与生物交叉领域最火热的方向之一。

来自主题: AI技术研报
10046 点击    2026-09-01 14:43
当AI从工具到认知主体,我们需要警惕哪些新风险?

当AI从工具到认知主体,我们需要警惕哪些新风险?

当AI从工具到认知主体,我们需要警惕哪些新风险?

导读:随着智能体系统(Agentic AI System)处理任务能力的持续提升,AI 正在逐渐从传统意义上的工具,演变为能够自主决策、独立执行任务,并与人类及社会群体进行持续交互的智能主体。但是一个越来越值得关注的问题是:当 AI 的认知能力不断扩展,其潜在风险不再局限于单一任务中的幻觉、偏见或决策错误,而是进一步影响人类用户的能动性、自主性,乃至人类对 AI 系统的控制权。

来自主题: AI技术研报
10048 点击    2026-09-01 14:21
少数Full Attention层如何重塑内部计算?混合线性注意力大模型中的「尖峰」与「平台」之谜首次揭开

少数Full Attention层如何重塑内部计算?混合线性注意力大模型中的「尖峰」与「平台」之谜首次揭开

少数Full Attention层如何重塑内部计算?混合线性注意力大模型中的「尖峰」与「平台」之谜首次揭开

Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。

来自主题: AI技术研报
7741 点击    2026-09-01 14:21
谷歌重磅发布WikiSkill,技能可以自己进化了!

谷歌重磅发布WikiSkill,技能可以自己进化了!

谷歌重磅发布WikiSkill,技能可以自己进化了!

一个 Agent 到底凭什么越来越强?有人靠更大的模型,有人靠更多数据。就在前天,Google Research 最新发布的 WikiSkill 给出了另一条答案:给 Agent 搭一套三层知识架构,让技能自己进化。

来自主题: AI技术研报
6883 点击    2026-09-01 10:27
万兴偷偷做的TVC神器,茶颜悦色已经用上了!

万兴偷偷做的TVC神器,茶颜悦色已经用上了!

万兴偷偷做的TVC神器,茶颜悦色已经用上了!

今年发了这么多期短剧Agent创作平台,我发现市面上专门针对TVC制作的,超级少。

来自主题: AI技术研报
9998 点击    2026-09-01 10:27
Co-Scientist升级:AI走出屏幕,首次在真实实验室「造出」半导体

Co-Scientist升级:AI走出屏幕,首次在真实实验室「造出」半导体

Co-Scientist升级:AI走出屏幕,首次在真实实验室「造出」半导体

Google DeepMind与杜克大学联合发布了AI科研系统Co-Scientist的重大升级版本,Co-Scientist是Google基于Gemini构建的多智能体科研系统。

来自主题: AI技术研报
10191 点击    2026-09-01 09:55
中国大模型已经世界一流,为什么开发者生态还在别人手里?

中国大模型已经世界一流,为什么开发者生态还在别人手里?

中国大模型已经世界一流,为什么开发者生态还在别人手里?

模型是中国做的,为什么后面的数千次创新发生在海外开发者平台?从模型分发、开发者工具到算力路由,中国缺的不是技术,是默认路径。如果只看结论,读完下面五条摘要即可;后文是证据、机制和行动方案。

来自主题: AI技术研报
7492 点击    2026-08-31 16:48
当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

Salesforce AI与UIUC研究人员提出Strong-to-Weak Scaffolding方法,让强模型(Builder AI)为弱模型GPT-5.4-mini自动设计外部Harness工作框架,无需修改参数即可将其在心智理论任务上的平均准确率从0.488提升至最佳0.912,揭示AI4AI的核心机制是将认知结构而非知识从强模型迁移至弱模型。

来自主题: AI技术研报
7797 点击    2026-08-31 15:26
「AI 味」不是在一句话里,而是渗透了所有的文字

「AI 味」不是在一句话里,而是渗透了所有的文字

「AI 味」不是在一句话里,而是渗透了所有的文字

相信很多人现在见到「不是……而是」,已经会下意识 PTSD 了:这是不是 AI 写的?还有各种破折号,冒号,以及经典版本「稳稳地接住你」「我用最直白的话,不绕弯子地告诉你」…… 当然,这些不断被总结出

来自主题: AI技术研报
8010 点击    2026-08-31 12:03
MIT最新研究显示:AI文明可能根本不需要语言。

MIT最新研究显示:AI文明可能根本不需要语言。

MIT最新研究显示:AI文明可能根本不需要语言。

最近 MIT 出了一篇研究,我看完有点不知道说什么好。

来自主题: AI技术研报
8136 点击    2026-08-31 10:44
Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破,无需训练即成功实现了从 3B 小模型到 Claude Opus 5 的全面提升。

来自主题: AI技术研报
9227 点击    2026-08-30 11:55
「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。

来自主题: AI技术研报
6054 点击    2026-08-28 12:01
招了多个 DeepSeek 大肥鱼,为我打工!

招了多个 DeepSeek 大肥鱼,为我打工!

招了多个 DeepSeek 大肥鱼,为我打工!

最近 DeepSeek Harness(DSH)真是太火了!之前我发过 《首发实测 + 入门教程》 教大家如何安装使用,还盘点过 《16 个超火的 DSH 插件》。

来自主题: AI技术研报
6891 点击    2026-08-28 11:03
OpenAI 数万名 Agent 组团入侵 Hugging Face,就为了做一道题

OpenAI 数万名 Agent 组团入侵 Hugging Face,就为了做一道题

OpenAI 数万名 Agent 组团入侵 Hugging Face,就为了做一道题

867 亿元,Hugging Face 被英伟达纳入麾下,就在这桩巨额收购的前一晚,OpenAI 发布超长安全调查报告里,Hugging Face 还是一个巨大的「事故现场」——看来并没有影响它的价值。

来自主题: AI技术研报
9596 点击    2026-08-28 11:02