本文研究LLM智能体在长时间多轮交互中处理事实更新的能力。发现即使使用前沿模型(如gpt-5.4),当替换完整上下文为有限的自维护记忆时,准确率从92%降至77%。这种差距不是由于模型大小或记忆容量不足,而是随着对话长度增加而加剧。作者发布了Supersede环境,通过强化学习奖励基于当前事实的回答,惩罚过时信息。使用GRPO微调小模型(Qwen2.5-3B)使个体准确率从9.0%提升至16.7%,证明该差距可训练。

核心观点

技术要点

使用LongMemEval的知识更新子集;对比完整上下文与自维护记忆;统计显著性检验(McNemar p<0.005);随对话长度24x增长准确率从68%降至28%;环境基于verifyers/prime-rl栈;GRPO微调Qwen2.5-3B;通过单调检查点曲线确认策略学习而非工具效应。

应用场景

聊天机器人、虚拟助手、计划更新、动态信息处理等需要追踪事实变化的长期交互场景。