← 返回 2026-10-05 简报

谷歌研究人员找到防止自我改进AI代理记忆测试数据的方法

Google researchers find a way to keep self-improving AI agents from memorizing their tests

语音播报
摘要
事件:谷歌研究员提出RRSI方法,通过限制编辑预算和严格审查机制,防止AI代理在自我改进过程中记忆测试数据。 要点:RRSI在未见基准上提升4.7分,运行节省30%代币。 影响:解决自优化AI的记忆偏差问题,为构建通用、高效的代理系统提供新范式,降低对强大基座模型的依赖。

控制框架决定代理在修改文件前是否读取了正确的文件,是否能够从错误中恢复,以及是否清晰地交付结果。根据一篇新的研究论文,近期代理领域的许多进展来自于对控制框架的工作,而非新模型的出现。

直到最近,这项工作都是人工完成的。人们审查失败的运行记录并手动修补控制框架。较新的方法通过让语言模型基于测试任务的反馈反复重写控制框架本身,从而自动化这一循环。

研究人员称这是一种实用的递归自我改进形式。该系统产生用于优化控制框架的反馈,而该控制框架反过来又控制系统自身的行为。

自我优化导致代理记忆其测试任务

论文表明,这种自我优化伴随着一个隐患。由于代理持续处理同一组有限的测试任务,它最终会记住这些任务。其在训练任务上的得分上升,而在新的、未见过的任务上的收益则缩小甚至完全消失。

研究人员表示,这种情况以多种方式发生。搜索过程记住了仅适用于特定基准的模式,偏爱那些纯粹因运气好而得分高的候选方案,并堆积不必要的复杂性,从而在不提升代理能力的情况下提高测试分数。

其他方法主要在训练任务上取得改进,但很少能迁移到未见过的基准上。RRSI 在三个领域均提升了这些基准的得分。| 图片来源:Google

不断缩小的编辑预算和严格的评审者保持控制框架的通用性

RRSI(代理控制框架的正则递归自我改进)在优化循环的两端发挥作用,同时保持控制框架完全可编辑。当系统提出新更改时,预算限制了候选方案一次可以捆绑多少个独立编辑。

该预算随时间推移而缩小。早期轮次允许较大的重写,而后期轮次仅允许那些能清晰追溯到结果的微小更改。系统还会记录早期的尝试,以免不断追逐同样的失败想法。当进展停滞时,它会故意对尚未触及的控制框架部分进行实验。

RRSI 在两个环节限制自我优化:提出新更改时,以及决定哪些更改成为控制框架永久组成部分时。| 图片来源:Google

在选择更改时,评审者会审查每个提案,并剔除任何硬编码任务名称、解决方案或其他基准特定技巧的提案。另一条规则规定,只有当计算成本带来可衡量的性能提升时,才接受更高的计算成本。不再有帮助的组件会被移除。

放弃训练收益在新任务上获得回报

研究人员在涵盖编码、代理办公工作和工程设计领域的八个基准上测试了 RRSI。底层模型 Claude Opus 4.8 在整个过程中保持冻结状态。团队将 RRSI 与未修改的基线控制框架以及四种最近的优化方法进行了比较。

根据论文,RRSI 在其训练任务上的得分最高提升 14.1 分,在五个从未见过的基准上最高提升 4.7 分。与未正则化的版本相比,它在运行时使用的令牌减少了约 30%。在所有未见过的基准上,整体性能从未低于基线水平,而这通常是控制框架记忆其任务时会发生的情况。

RRSI 控制框架也在训练集之外的每个任务上有所改进,在 JobBench 上的最大增益为 4.7 分。| 图片来源:Google

每种方法在训练任务上都表现良好,但在新任务上的结果发生了逆转。两种方法的得分甚至低于基线控制框架。RRSI 在所有变体中实现了最小的训练收益,并且是唯一在未见过任务上显著高于基线的方法。这些护栏旨在产生完全这种权衡。

在优化的控制框架中,RRSI 需要的令牌和步骤最少,并在新任务上表现最佳,尽管未修改的基线控制框架更加精简。| 图片来源:Google

在一款模型上优化的工具链也能帮助较弱的模型

使用 Gemini 3.5 Flash 优化的编码工具链,在未进行任何修改的情况下,将性能弱得多的 Gemini 3.1 Flash Lite 的准确率提高了 14.6 个百分点,从 11.2 提升至该数值。该系统发现的机制并不依赖于用于发现它们的模型的能力。

作者指出,他们的研究仅涵盖围绕冻结模型构建的工具链,并未涉及模型权重发生变化的情况。

他们得出结论,只有当重复反馈转化为持久性改变时,自我改进才能使 AI 代理可靠地提升能力。代码已在 GitHub 上提供。

手动设计的工具链往往无法泛化到新任务中,ARC-AGI-3 上的测试已证实了这一点。使用专为特定目的构建的工具链,Opus 4.6 在熟悉的环境中得分达到 97.1%,而在陌生环境中得分为 0%。英伟达(Nvidia)最近展示了 SoL-Pi ,这是一种相关方法,其中研究代理会自动重建编码代理的工具链。它在性能没有明显下降的情况下,将令牌使用量减少了高达 49%。

在此前不久,谷歌让代理“梦回”过去的搜索运行过程,以改进其搜索策略。这项工作同样未改变模型本身。

本条评分 10.5 score-v1
  • 来源权威 8
    注册表 priority=8(The Decoder)
  • 时效 2.483
    发布 9.8 小时前,衰减到 2.48/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-10-05 · 10.48 分

原文链接:https://the-decoder.com/google-researchers-find-a-way-to-keep-self-improving-ai-agents-from-memorizing-their-tests/
来源:The Decoder
以上内容由 AI 自动翻译,仅供参考。
← 返回简报