本文研究LLM智能体在长时间多轮交互中处理事实更新的能力。发现即使使用前沿模型(如gpt-5.4),当替换完整上下文为有限的自维护记忆时,准确率从92%降至77%。这种差距不是由于模型大小或记忆容量不足,而是随着对话长度增加而加剧。作者发布了Supersede环境,通过强化学习奖励基于当前事实的回答,惩罚过时信息。使用GRPO微调小模型(Qwen2.5-3B)使个体准确率从9.0%提升至16.7%,证明该差距可训练。
核心观点
- LLM智能体在事实更新场景中存在独特的记忆更新失败,即使使用前沿模型也是如此
- 有限自维护记忆导致准确率显著下降(92%→77%),且模型扩展无法解决
- 失败与对话长度相关,而非压缩比;对话增长24倍时准确率从68%降至28%
- 发布Supersede强化学习环境,以时间事实货币性为奖励信号
- GRPO微调小模型(Qwen2.5-3B)使超车准确率从9.0%提升至16.7%,证明差距可训练
技术要点
使用LongMemEval的知识更新子集;对比完整上下文与自维护记忆;统计显著性检验(McNemar p<0.005);随对话长度24x增长准确率从68%降至28%;环境基于verifyers/prime-rl栈;GRPO微调Qwen2.5-3B;通过单调检查点曲线确认策略学习而非工具效应。
应用场景
聊天机器人、虚拟助手、计划更新、动态信息处理等需要追踪事实变化的长期交互场景。