该研究关注大型语言模型(LLM)智能体在长时间、多会话交互中更新事实信息的能力。通过真实对话数据发现,即使使用前沿模型(如gpt-5.4),从完整上下文切换到有限的自维护记忆也会导致准确率显著下降(从92%降至77%),且该差距不随模型规模扩大而消失。进一步实验表明,问题并非记忆容量不足,而是对话长度增加导致准确率持续下降(68%至28%),且增加记忆容量无改善。研究者发布了基于强化学习的环境Supersede,通过奖励当前值回答、惩罚过时值来训练智能体。使用GRPO对Qwen2.5-3B模型进行微调后,在未见过对话上的准确率从9.0%提升至16.7%,证明该缺口可通过训练弥补。
核心观点
- LLM智能体在长对话中更新事实的能力存在显著缺陷,即使前沿模型也会因记忆维护不当而性能大幅下降。
- 该缺陷并非由记忆容量不足导致,而是对话长度增加带来的核心挑战。
- 以完整上下文为基准,记忆维护的瓶颈是独立于理解能力的核心问题。
- 使用强化学习环境Supersede和GRPO微调,可有效提升模型在事实更新任务上的准确率。
技术要点
研究者构建了基于verifiers/prime-rl栈的强化学习环境Supersede,设计奖励函数奖励从当前值回答并惩罚过时值。通过GRPO(一种在线策略优化方法)对Qwen2.5-3B小模型进行微调,在真实未见过对话上进行评估,准确率从9.0%升至16.7%,且模型检查点呈单调递增,表明策略学习而非辅助机制主导了提升。
应用场景
['长时间对话的智能助手(如用户信息变化时的个人助理)', '动态数据更新场景(如价格、计划修订的问答系统)', '需要维护事实时效性的知识密集型交互应用']