近30家高校机构联合发起,国内首个 Agent 记忆榜单 AML 出炉,谁的 Agent 最不健忘

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
近30家高校机构联合发起,国内首个 Agent 记忆榜单 AML 出炉,谁的 Agent 最不健忘
7687点击    2026-08-13 00:21

当大模型的热潮逐渐回归理性,AI 行业关注的问题也在发生变化。


人们不再只看模型能不能回答某个问题,而是开始关心:


它能否在长期交互中记住关键信息,理解持续变化的上下文,并在之后的任务里正确调用这些记忆。


对 Agent 来说,这种长期记忆能力,正逐渐成为影响实际可用性的一项基础能力。


今天,Agent Memory Leaderboard(AML,记忆之巅排行榜)正式发布首期结果。


近30家高校机构联合发起,国内首个 Agent 记忆榜单 AML 出炉,谁的 Agent 最不健忘


来自官网:http://agentmemories.ai/


先交代一下这个榜单的来路。


AML 由国内外数十所高校与研究机构联合主办,名单里有清华、北大、人大、上海交大、浙大、复旦、中科大、南大、上海人工智能实验室、中科院自动化所,海外机构包括牛津大学、南洋理工、新南威尔士大学等,开源社区 Datawhale 也参与其中。


作为业内首个关注 Agent 记忆系统的机制级榜单,AML 上线仅十天内就吸引了 136 个团队注册参评,官方站点点击量迅速突破了 20 万次,在海内外技术社区与产业界引发广泛关注。


近30家高校机构联合发起,国内首个 Agent 记忆榜单 AML 出炉,谁的 Agent 最不健忘


评测按两个独立维度组合:类型分文本记忆代码记忆两条赛道,组别分学术方法榜商业产品榜


文本赛道考察事实召回、多跳整合、时序理解、记忆治理、个性化、规则执行、安全与隐私;代码赛道则看系统能否从历史工程任务中检索并复用调试经验与项目上下文。


评测机制:聚焦"记忆"本身


在各类 AI 榜单不断涌现的当下,AML 受到关注,很大程度上源于它对评测变量的控制。


以往的记忆评测中,最终效果往往同时受到生成模型与记忆系统的影响。仅凭一段流畅的演示,很难判断系统表现究竟来自底层模型本身,还是记忆模块确实检索并召回了关键信息。


针对这一问题,AML 统一提供生成模型和评分模型,将参评方案的主要发挥空间集中在检索与召回环节,从而尽可能单独评估记忆系统本身的能力。


在防止针对性刷分方面,AML 采用公开子集与私有盲测集相结合的方式,并将评测分数与代码 Commit 或镜像版本绑定,以降低硬编码和针对测试集过拟合的可能性。


通过这套相对统一的评测流程,不同记忆系统得以在规则执行、记忆管理和代码库历史追溯等任务中进行更具可比性的测试。


榜单结果正式发布


在这套相对统一的评测体系下,多种 Agent 记忆方案完成了完整测试:


在商业产品榜的文本赛道中,MemoraX 以 58.0 分位列第一,MemOS 和 NTES-MEMORY-SMART 分列其后。


从各项细分结果来看,MemoraX 在系统稳定性、信息检索与召回等方面表现较为突出,也体现出一定的工程落地能力。


近30家高校机构联合发起,国内首个 Agent 记忆榜单 AML 出炉,谁的 Agent 最不健忘


开源方法榜的文本赛道中,InvMem 以 45.1 分位列第一,Refind 和 ActiveMemoryIndex 紧随其后。此外,Hybrid Search、ChronoHybridMem 等方案也取得了较为靠前的成绩。


近30家高校机构联合发起,国内首个 Agent 记忆榜单 AML 出炉,谁的 Agent 最不健忘


从整体结果来看,Agent 记忆系统目前尚未形成单一的主流路线。动态记忆索引、混合检索等方向仍在持续演进,学术界与开源社区也在加快相关方法的探索与迭代。


结语


AML 官方表示,首期榜单只是一个开始。接下来,榜单将保持常态化更新,并陆续推出深度解读与技术复盘,进一步分析本次评测中出现的典型技术架构,以及不同方案在各项能力维度上的具体表现。


对于整个 AI 产业而言,AML 不仅提供了一张权威成绩单,更为技术选型与研究迭代指明了方向。


文章来自于微信公众号 “夕小瑶科技说”,作者 “夕小瑶科技说”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI