Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案
6953点击    2026-07-29 09:50

一个Agent可以完整读过任务要求,亲手执行过失败命令,也能在十分钟前准确定位错误根因,但到了下一轮决策,它仍可能像第一次遇到问题一样重走旧路:再次写入已经确认不可写的目录,重新尝试已经被证伪的参数,或者修好局部测试后忘掉最初的验收条件。Meta研究者在《Remember When It Matters》中把这种现象定义为行为状态衰减,英文是behavioral state decay:信息未必从上下文或记忆库中消失,只是逐渐失去了约束下一步行动的能力;因此,论文真正讨论的不是怎样保存更多历史,而是要不要在主Agent旁边单独放一个记忆模型,让它维护执行状态,并在关键工具调用发生前决定是否提醒主Agent。


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


问题定义:信息还在,为什么行动已经不受它约束


长上下文主要改善信息的可访问性,却不能保证某条信息在正确时间拥有足够高的决策权重。真实Agent轨迹会迅速堆积终端日志、依赖安装输出、测试栈、工具返回、重复文件内容和临时分析,关键要求即使没有被截断,也可能从“必须持续遵守的约束”退化成“模型曾经看过的一句话”;因此,判断一个Agent有没有记忆,不能只看历史是否仍在上下文中,还要看这段历史能否在相关动作发生前重新影响决策。


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


Meta:给主Agent再配一个副Agent来管记忆


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


主Agent继续负责规划、调用工具和推进任务,记忆Agent只负责观察近期轨迹、维护结构化记忆库,并判断某条历史状态是否应该临时进入下一次主Agent调用;这种分工把“做事”和“记住做事过程中发生了什么”拆成两个相对独立的系统职责。


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


近期轨迹与持久记忆共同输入


记忆Agent读取的近期轨迹窗口被表示为:


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


第一阶段:更新记忆库


记忆管理阶段被形式化为:


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


第二阶段:决定提醒还是沉默


完成记忆更新后,系统再执行干预策略:


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


干预动作只有两类:


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


记忆库被拆成三层


研究者把记忆库定义为:


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


这个三元组分别保存记忆Agent的私有状态、稳定知识和程序性经验,使任务进度、环境事实与失败记录不会被压缩成一段难以更新的混合摘要。


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


这套设计与普通RAG的差异不只在检索算法:RAG通常根据当前查询返回语义相似的记录,而记忆Agent还要判断哪条状态会影响下一步行动,以及是否值得在此刻介入。它也不同于自由发挥的Advisor模型,后者可以重新规划任务或提出新策略,而论文中的记忆Agent被限制为基于已有执行状态提供提醒,避免两个Agent同时争夺规划权。


核心实验:这套方法确实有用,但随便放个小模型会变差


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


消融实验进一步说明,有记忆库并不等于会使用记忆:每一步把完整记忆库暴露给主Agent,整体优于无记忆基线,却在领域等权宏平均上落后完整方案2.8个百分点;强制每一步都生成提醒,在任务加权平均上与选择性方案接近,甚至略高0.3个百分点,但宏平均略差,因此论文只能支持“允许沉默带来更均衡表现”,不能断言它在所有指标上都更优。只保留干预模型、不维护持久记忆时,电信任务有所提升,航空任务却从68%下降到62%;使用Mem0的向量与BM25检索也能提高平均分,却没有改善航空任务,说明“找到历史记录”和“判断哪条记录此刻必须影响行动”仍是两个不同的问题。


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


定性分析显示记忆干预主要在五类时刻起作用:主Agent即将违反任务要求或服务政策、忽略已经验证的环境事实、重复此前失败的命令、丢失已经建立的错误诊断,以及混淆当前用户、订单、线路、代码分支或开放子目标。一个有效提醒通常非常具体,例如指出当前正则仍遗漏单数字节IPv4边界,或者提醒主Agent后台工具已经确认用户并非金卡会员;它恢复的是历史状态对下一步动作的约束,而不是重新生成一份宽泛策略。


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


论文还训练Qwen3.5-27B充当开放权重记忆Agent,说白了就是放个小模型看看行不行,并冻结Qwen3.5-122B-A10B主Agent,以测试这项能力能否从前沿闭源模型中蒸馏出来。结果给出了一个非常重要的工程结论:未经训练的27B记忆模型把SETA验证奖励从0.709降到0.693,SFT后提高到0.720,继续使用GRPO校准介入时机后达到0.734;训练后的模型迁移到Terminal-Bench,又把主Agent的pass@1从37.6%提高到41.1%,增加3.5个百分点。


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


SFT主要让模型学会结构化记忆工具、紧凑写法、过时状态更新以及“提醒或沉默”的接口规范,GRPO则根据最终验证器奖励调整干预决策。一个长任务包含多次记忆调用,而结果往往只有成功或失败,研究者因此通过离线轨迹识别可能影响最终结果的关键转折步骤,把强化学习集中在这些pivot turns上;这说明记忆模型的难点并非能否生成摘要,而是能否判断哪次介入真正值得付出成本并承担影响主Agent的风险。


哪种类型的Agent值得单独配一个记忆模型


从这篇论文的结果看,独立记忆模型最适合长轨迹、强状态依赖和高错误复发率的任务,例如持续数十轮的编码调试、需要跨多轮遵守政策的客服工具Agent、存在多个用户或订单实体的业务流程,以及局部修复容易覆盖全局要求的自动化任务。对于这些系统,您需要单独维护稳定事实、尝试与结果、开放目标和风险,再在不可逆操作、重复失败或任务阶段切换前决定是否注入提醒,单纯扩展上下文或统一做向量检索很难稳定承担这项职责。


反过来,如果任务通常在少数几轮内结束、历史状态很少、错误重试成本低,或者产品对延迟和推理成本极为敏感,额外运行一个记忆模型未必划算。论文证明的是特定长程基准中“执行与记忆解耦”能够提高成功率,并没有证明所有Agent都应增加第二个模型;工程上真正需要判断的是,您的失败是否主要来自行为状态衰减,以及这些失败带来的成本是否高于额外模型调用、状态存储和校准训练的成本。


这套方案的代码,研究团队开源在:https://github.com/yifannnwu/proactive-memory-agent


Agent该不该单独配一个记忆模型?怎么搭建?Meta最新研究给出了答案


结语


这篇论文给出的答案并不是“所有Agent都应该再配一个模型”,而是把一个长期被混在上下文管理里的问题单独拆了出来:主Agent即使看过某条信息,也不代表这条信息会在正确时刻继续控制行动。独立记忆模型的价值,在于维护一份可更新的执行状态,并在主Agent即将违反要求、重复失败或丢失诊断时,把最小必要信息重新送回决策回路。


所以,Agent该不该单独配一个记忆模型,最终取决于您的系统是否经常出现一种特殊故障:信息没有消失,主Agent却已经不再按它行动。若这类失败持续发生,增加一个受约束、能保持沉默、经过专门校准的记忆Agent,可能比继续扩大上下文或叠加通用检索更接近问题本身;若任务足够短、状态足够简单,第二个模型很可能只是额外成本。


文章来自于"AI修猫Prompt",作者 "AI修猫Prompt"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0