PARPO 团队 投稿
量子位 | 公众号 QbitAI
当个性化Agentic RL遇上现实用户平台场景时,一直存在一个常见难点:面对同样的query,不同用户往往偏好不同的规划策略、工具调用和最终表达。
如果只优化通用的任务完成度,模型容易学成“平均用户最喜欢的样子”;直接把历史行为塞进prompt,又可能把从众、流行度和上下文噪声误当成真实偏好。
针对这些挑战,来自中国科学技术大学与阿里巴巴集团的研究团队提出PARPO(Personalized Anchor Reward-Decoupled Policy Optimization),把个性化正式放进Agentic RL的训练期优化目标。
问题:正确答案为什么还不够
在代码生成、搜索等有明确答案的任务里,奖励相对容易定义;但在电商助手、旅行规划和日程安排中,多条轨迹都能“完成任务”,用户真正在意的却是是否符合自己的习惯、约束与偏好。
论文将挑战归纳为三点:
C1:个性化奖励含义不清——通用奖励无法表达同一条轨迹对不同用户的不同价值;
C2:偏好信号被行为混合——真实兴趣、流行度影响和群体从众交织在一起;
C3:记忆仍然太扁平——难以显式表达用户、技能、工具、场景与历史轨迹之间的关系。

△相同query面对不同用户时,最优轨迹可能完全不同。
PARPO的闭环:记忆、奖励与优化各司其职
PARPO不是单独替换GRPO的一个公式,而是三个相互衔接的部分:PSGM在rollout之前提供用户相关的技能和经验;两阶段偏好解耦奖励模型在rollout之后产生个性化奖励;PARPO优化器将通用任务质量和个性化偏好分成两条advantage轨道,再进行策略更新。高质量轨迹随后被总结为新技能写回PSGM,形成“检索—交互—评价—优化—积累”的闭环。
PSGM(偏好对齐技能演化图记忆)把历史经验组织为包含User、Skill、Tool、Scenario、Trajectory五类节点的异构图:检索时先按query找到语义种子技能,再沿“技能—用户—同源技能”扩展候选,综合用户相关性、互补加成与冲突惩罚排序——找回来的经验未必在文本上最相似,却处在同一个有效行为邻域里。
奖励模型分两阶段:第一阶段用多视角用户画像缓解冷启动;第二阶段在用户—物品交互图上用LightGCN建立兴趣与从众两个正交分支,兴趣分支提高低流行度项目的权重、从众分支相反,从而从混合行为中提取更干净的偏好信号。
优化器侧,个性化分支通过指数移动平均维护用户级历史锚点,让当前奖励与该用户自己的历史中心比较,而不是与所有用户混合后的均值比较,缓解异质偏好下的reward-center与reward-scale失配。直觉是:通用质量负责让agent把事情做对,个性化质量负责让它用这个用户愿意接受的方式做好。

△PARPO完整训练闭环。PSGM改变rollout输入,偏好奖励模型提供个性化监督,PARPO将两类奖励转成两条advantage轨道。
主结果:更像这个用户想要的完成方式
论文在ETAPP、更困难的ETAPP-Hard和面向商家决策的SJAgent上评估(Qwen3-4B/8B),与ReAct、GRPO、DAPO、GSPO、GiGPO、MemRL、SkillRL等方法比较。ETAPP上,8B模型的Judge分数达到0.8333,Personal、Proactive、Procedure等维度全面领先;SJAgent上Reward达到0.8270。在15位人类专家与4组LLM judge的盲测中,PARPO均排名第一,最大优势出现在User Relevance——说明提升主要来自更强的用户对齐,而不只是更顺滑的文字表达。
消融实验显示:去掉技能记忆后Judge从0.7708降至0.7006,是所有消融中最大的降幅;去掉用户锚点或兴趣、从众任一分支也都明显掉点——记忆、解耦和用户锚点缺一不可。

△Qwen3-8B在ETAPP上的奖励维度对比,PARPO在四个维度上均取得最高的最终EMA分数。
当然,方法也有边界:人工盲测规模仍然有限;兴趣—从众解耦是操作层面的,并不构成严格的因果分离。但PARPO指出的方向很清晰:同一个任务不再只有一种“正确完成”的方式——真正好的策略,还必须是这个用户愿意接受、愿意持续使用的完成方式。
论文标题:From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning
作者:Ranxu Zhang、Zeyang Li、Jiacheng Huang、Rui Zhang、Xiaozhou Xu、Zhe Sun、Yanyong Zhang、Chao Wang
论文链接:https://arxiv.org/abs/2605.23382
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🎓 我们会 (尽量) 及时回复你 :)
🌟 点亮星标 🌟
科技前沿进展每日见


