个性化智能体强化学习框架上线,8B模型盲测第一

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
个性化智能体强化学习框架上线,8B模型盲测第一
8885点击    2026-09-14 09:22

个性化Agentic RL遇上现实用户平台场景时,一直存在一个常见难点:面对同样的query,不同用户往往偏好不同的规划策略、工具调用和最终表达。


如果只优化通用的任务完成度,模型容易学成“平均用户最喜欢的样子”;直接把历史行为塞进prompt,又可能把从众、流行度和上下文噪声误当成真实偏好。


针对这些挑战,来自中国科学技术大学与阿里巴巴集团的研究团队提出PARPO(Personalized Anchor Reward-Decoupled Policy Optimization),把个性化正式放进Agentic RL的训练期优化目标。


问题:正确答案为什么还不够


在代码生成、搜索等有明确答案的任务里,奖励相对容易定义;但在电商助手、旅行规划和日程安排中,多条轨迹都能“完成任务”,用户真正在意的却是是否符合自己的习惯、约束与偏好。


论文将挑战归纳为三点:


  • C1:个性化奖励含义不清——通用奖励无法表达同一条轨迹对不同用户的不同价值;
  • C2:偏好信号被行为混合——真实兴趣、流行度影响和群体从众交织在一起;
  • C3:记忆仍然太扁平——难以显式表达用户、技能、工具、场景与历史轨迹之间的关系。


个性化智能体强化学习框架上线,8B模型盲测第一

相同query面对不同用户时,最优轨迹可能完全不同。


PARPO的闭环:记忆、奖励与优化各司其职


PARPO不是单独替换GRPO的一个公式,而是三个相互衔接的部分:PSGM在rollout之前提供用户相关的技能和经验;两阶段偏好解耦奖励模型在rollout之后产生个性化奖励;PARPO优化器将通用任务质量和个性化偏好分成两条advantage轨道,再进行策略更新。高质量轨迹随后被总结为新技能写回PSGM,形成“检索—交互—评价—优化—积累”的闭环。


PSGM(偏好对齐技能演化图记忆)把历史经验组织为包含User、Skill、Tool、Scenario、Trajectory五类节点的异构图:检索时先按query找到语义种子技能,再沿“技能—用户—同源技能”扩展候选,综合用户相关性、互补加成与冲突惩罚排序——找回来的经验未必在文本上最相似,却处在同一个有效行为邻域里。


奖励模型分两阶段:第一阶段用多视角用户画像缓解冷启动;第二阶段在用户—物品交互图上用LightGCN建立兴趣与从众两个正交分支,兴趣分支提高低流行度项目的权重、从众分支相反,从而从混合行为中提取更干净的偏好信号。


优化器侧,个性化分支通过指数移动平均维护用户级历史锚点,让当前奖励与该用户自己的历史中心比较,而不是与所有用户混合后的均值比较,缓解异质偏好下的reward-center与reward-scale失配。直觉是:通用质量负责让agent把事情做对,个性化质量负责让它用这个用户愿意接受的方式做好。


个性化智能体强化学习框架上线,8B模型盲测第一

PARPO完整训练闭环。PSGM改变rollout输入,偏好奖励模型提供个性化监督,PARPO将两类奖励转成两条advantage轨道。


主结果:更像这个用户想要的完成方式


论文在ETAPP、更困难的ETAPP-Hard和面向商家决策的SJAgent上评估(Qwen3-4B/8B),与ReAct、GRPO、DAPO、GSPO、GiGPO、MemRL、SkillRL等方法比较。ETAPP上,8B模型的Judge分数达到0.8333,Personal、Proactive、Procedure等维度全面领先;SJAgent上Reward达到0.8270。在15位人类专家与4组LLM judge的盲测中,PARPO均排名第一,最大优势出现在User Relevance——说明提升主要来自更强的用户对齐,而不只是更顺滑的文字表达。


消融实验显示:去掉技能记忆后Judge从0.7708降至0.7006,是所有消融中最大的降幅;去掉用户锚点或兴趣、从众任一分支也都明显掉点——记忆、解耦和用户锚点缺一不可。


个性化智能体强化学习框架上线,8B模型盲测第一

Qwen3-8B在ETAPP上的奖励维度对比,PARPO在四个维度上均取得最高的最终EMA分数。


当然,方法也有边界:人工盲测规模仍然有限;兴趣—从众解耦是操作层面的,并不构成严格的因果分离。但PARPO指出的方向很清晰:同一个任务不再只有一种“正确完成”的方式——真正好的策略,还必须是这个用户愿意接受、愿意持续使用的完成方式。


论文标题:From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning
作者:Ranxu Zhang、Zeyang Li、Jiacheng Huang、Rui Zhang、Xiaozhou Xu、Zhe Sun、Yanyong Zhang、Chao Wang
论文链接:https://arxiv.org/abs/2605.23382


文章来自于"量子位",作者 "PARPO 团队"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0