AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA

分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA

分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA

刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。

来自主题: AI技术研报
8078 点击    2026-07-26 15:38
Vibe Coding撞墙了?换个思路治好AI编程的「局部失忆」

Vibe Coding撞墙了?换个思路治好AI编程的「局部失忆」

Vibe Coding撞墙了?换个思路治好AI编程的「局部失忆」

现在的 Agent 将所有的工程线索和垃圾噪音都一股脑扔进 Chat Context 里,缺乏一层独立、结构化的 Engineering State 来做隔离与控制。为了打破这个瓶颈,Valkor 联合浙江大学智能计算与软件研究中心、伦敦大学学院(UCL)软件工程团队正式推出并开源了 loom。

来自主题: AI技术研报
8422 点击    2026-07-26 14:21
迈向长程智能体,人大高瓴发布149页全景综述

迈向长程智能体,人大高瓴发布149页全景综述

迈向长程智能体,人大高瓴发布149页全景综述

我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。

来自主题: AI技术研报
8271 点击    2026-07-26 11:28
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。

来自主题: AI技术研报
8057 点击    2026-07-26 11:25
千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

以往的空间音频模型,要么受限于实验室的苛刻采集条件,要么被高昂的人工标注成本卡住脖子。而团队的核心洞察是:相机的自运动本身就是一种免费的监督信号。当相机转动时,声源在声场中的相对位置随之改变——这种变化无需人工标注,模型即可从中学习空间对应关系。这项工作入选CVPR 2025 Highlight,投稿论文前2%。

来自主题: AI技术研报
7813 点击    2026-07-26 11:25
给835页文档,还你一个数据库!Cursor重塑「大模型经济学」:AI蜂群化身终极廉价编译器

给835页文档,还你一个数据库!Cursor重塑「大模型经济学」:AI蜂群化身终极廉价编译器

给835页文档,还你一个数据库!Cursor重塑「大模型经济学」:AI蜂群化身终极廉价编译器

多模型Agent系统显然是未来的趋势。cursor 的一篇很不错的文章。他们的最新研究表明,将前沿模型作为规划者和协调者,与一个更廉价的“主力”模型搭配,可以大幅降低项目中总token的成本,从而实现 15 倍的成本改进。

来自主题: AI技术研报
7812 点击    2026-07-25 11:37
Kimi K3设计榜登顶焚诀公开:就藏在思维链里

Kimi K3设计榜登顶焚诀公开:就藏在思维链里

Kimi K3设计榜登顶焚诀公开:就藏在思维链里

停停停!Kimi K3的最佳打开方式可能不在Coding——用它做前端设计,才是真·Interesting。在Design Arena最新公布的单次生成前端榜单中,Kimi K3以1414分位列第一,力压Fable 5和GPT-5.6 Sol。

来自主题: AI技术研报
9144 点击    2026-07-25 11:37
告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。

来自主题: AI技术研报
8204 点击    2026-07-25 11:37
AI老大哥夯爆了,“商汤系”离职创业者这半年狂揽400亿元!

AI老大哥夯爆了,“商汤系”离职创业者这半年狂揽400亿元!

AI老大哥夯爆了,“商汤系”离职创业者这半年狂揽400亿元!

根据IT桔子数据,截至2026年7月17日, 32家“商汤系”公司在上半年共完成28笔融资,累计融资额超过470亿元人民币,在中国AI融资市场取得了耀眼的成绩。其中,既有商汤科技自身通过“1+X”战略拆分出的子公司——曦望Sunrise、大晓机器人、商汤医疗等;也有大批从商汤离职创业的前高管所创立的公司

来自主题: AI技术研报
7945 点击    2026-07-24 15:57
一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

腾讯微信在论文 SkillHone 中,将这个问题归结为优化历史丢失,进而提出了面向持续 Skill 进化的开发框架。 SkillHone 把每轮诊断、候选修改、评估证据和最终决定组织成持久决策历史。同时,持续优化的对象也从单一的 SKILL.md 文件扩展到了整个 Skill 文件夹及其修改过程。

来自主题: AI技术研报
8397 点击    2026-07-24 15:56
多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

BigMac 是原生多模场景下的流水并行训练新范式。它针对多模态大模型训练中计算效率与显存占用难以兼顾的问题,提出了依赖安全的嵌套流水线:以成熟的 LLM 流水线为主干,在不打乱 LLM 执行顺序的前提下,有序嵌入编码器和生成器计算,从而在不增加 LLM 流水线空泡、保持激活显存有界的同时,高效实现多模态流水训练。

来自主题: AI技术研报
8101 点击    2026-07-24 15:55
把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Sca

来自主题: AI技术研报
8203 点击    2026-07-24 15:54
真实工作流,正在成为下一代训练数据

真实工作流,正在成为下一代训练数据

真实工作流,正在成为下一代训练数据

数据市场的故事,正在进入新一轮周期。来自企业真实工作流的 Real-world Data,成为越来越多 AI Labs 争夺的新资源。比如 GitHub 就是典型的 Real-world Data,它几乎完整保留了一个问题从出现到解决的全过程。相比之下,今天绝大多数 Human Data 公司提供的,仍是人为构造的数据。

来自主题: AI技术研报
8570 点击    2026-07-24 11:00
让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

当大模型 Agent 被部署到工具调用、长程任务和开放环境中,一个关键问题会随之出现:能否在不更新模型参数的情况下,将执行经验沉淀下来,并在下一次做得更好?

来自主题: AI技术研报
5749 点击    2026-07-24 10:45
Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。

来自主题: AI技术研报
6678 点击    2026-07-24 10:45
139.6倍加速、100%安全约束:影眸科技提名具身顶会RSS最佳论文

139.6倍加速、100%安全约束:影眸科技提名具身顶会RSS最佳论文

139.6倍加速、100%安全约束:影眸科技提名具身顶会RSS最佳论文

在近日的具身智能顶会 RSS(Robotics: Science and Systems)2026 上,最高奖项 Outstanding Paper Award 提名名单里,出现了一个不太 “机器人” 的名字 —— 影眸科技,一家头部 3D 生成大模型公司。

来自主题: AI技术研报
9253 点击    2026-07-23 16:01
AI幻觉最可怕的人类副作用出现了

AI幻觉最可怕的人类副作用出现了

AI幻觉最可怕的人类副作用出现了

最新研究发现,AI幻觉不只会骗你了,还能喂大你的自信心、削弱你的判断力。

来自主题: AI技术研报
6278 点击    2026-07-23 16:01
ECCV 2026|把全球3D地图变成无人机训练场,国防科大AirZoo构建航拍几何3D视觉统一基准

ECCV 2026|把全球3D地图变成无人机训练场,国防科大AirZoo构建航拍几何3D视觉统一基准

ECCV 2026|把全球3D地图变成无人机训练场,国防科大AirZoo构建航拍几何3D视觉统一基准

国防科技大学虚拟现实与视觉计算团队(SAW Lab)联合先进制导与控制技术国家级重点实验室等推出面向航拍几何 3D 视觉的统一大规模数据集与评测基准 「AirZoo」。

来自主题: AI技术研报
6058 点击    2026-07-23 15:36
分享一个Skill,帮你把电影画面拆成可复用的视觉系统。

分享一个Skill,帮你把电影画面拆成可复用的视觉系统。

分享一个Skill,帮你把电影画面拆成可复用的视觉系统。

嗨大家好!我是阿真! 刷短视频就是这点不好,上次看到一个 AI 视频拆解分析的教程,感觉很有意思,刷完了过两天忘记在哪里刷的了。

来自主题: AI技术研报
6719 点击    2026-07-23 15:23
视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。

来自主题: AI技术研报
9624 点击    2026-07-23 10:39
纠偏率98.15%!方向感觉醒,第一视角认路的国产AI开挂了

纠偏率98.15%!方向感觉醒,第一视角认路的国产AI开挂了

纠偏率98.15%!方向感觉醒,第一视角认路的国产AI开挂了

商业地图可以告诉机器人「前方右转」,却无法直接告诉它眼前应该从哪里转、沿哪一侧通过;即使已经生成路线,控制误差、地面变化和动态障碍,也可能让机器人在行进过程中逐渐偏离。

来自主题: AI技术研报
7213 点击    2026-07-23 10:38