本文研究了大型语言模型(LLM)智能体在长时间、多会话交互中处理事实变化(如用户位置、价格更新、计划修订)的能力。通过真实对话数据,发现记忆维护是导致失败的关键瓶颈:将完整上下文替换为有限的自维护记忆后,准确率从92%降至77%,且该差距随对话长度增加而扩大,而非压缩率。作者发布了Supersede,一个基于强化学习(verifiers/prime-rl堆栈)的开放环境,将测量转化为训练信号,通过奖励当前值回答、惩罚过时值来训练智能体。实验表明,使用GRPO对小型开放模型(Qwen2.5-3B)进行微调,在未见过的真实对话中,其超期准确率从9.0%提升至16.7%,且沿检查点单调递增,证明该差距是可训练的。这是首个以时间事实货币性为奖励目标的可训练环境,并首次证明超期差距可以被训练缩小而不仅是被测量。
核心观点
- LLM智能体在长时间交互中处理事实更新的能力存在显著且独特的失败模式
- 使用有限记忆替代完整上下文后,准确率从92%显著下降至77%(McNemar检验p<0.005)
- 准确率下降与对话长度(增长24倍)相关,而非记忆压缩率;增加记忆容量无法恢复性能
- 发布了开源的强化学习环境Supersede,基于verifiers/prime-rl堆栈,用于训练智能体记忆更新能力
- GRPO微调Qwen2.5-3B模型在真实未见对话上,超期准确率从9.0%提升至16.7%,且训练曲线单调递增
技术要点
技术要点包括:在LongMemEval知识更新子集上评估,对比完整上下文与有限自维护记忆;使用配对McNemar检验证明统计显著性;分析准确率随对话长度(24倍)和记忆容量(n=25)的变化;开发Supersede环境,基于verifiers/prime-rl堆栈,提供奖励信号(当前值回答得正奖励,过时值得负奖励);采用GRPO(组相对策略优化)对Qwen2.5-3B进行微调,使用单调递增的检查点曲线验证学习效果。
应用场景
适用于需要长期记忆和事实更新的对话智能体,如个人助理、客服系统、计划管理应用,以及任何涉及多轮交互中信息变化的场景。