← 返回 2026-09-24 简报

《品味代理:衡量与提升长周期任务中的审美能力》

The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

语音播报
摘要
事件:微软团队提出衡量LLM代理在长周期任务中审美能力的概念,并发布Taste-Bench基准测试评估模型决策质量。 要点:基准含502个自动挖掘的决策点,最佳模型正确率仅59.7%。通过 hindsight 蒸馏训练可显著提升代理在SWE-bench Pro上的成功率。 影响:该研究揭示了当前大模型在长期规划中的决策短板,为提升AI工程自动化能力提供了新的评估维度和优化路径。

论文

arxiv:2609.25804
复制 Markdown

《有品位的智能体:衡量与提升长程任务中的品味》
发布于 9月22日
·
提交者
Wenbo Pan
于 9月23日
今日第1篇论文
·
微软
作者:
Wenbo Pan
,
Zhichao Liu
,
Shujie Liu
,
Jingying Zeng
,
Chin-Yew Lin
,
Xianfeng Tang
,
Yan Lu
,
Qi He
,
Xiaohua Jia

摘要

大型语言模型(LLM)智能体越来越多地参与长程任务,而它们在过程中做出的决策——例如测试哪个假设或基于哪个实现进行构建——决定了整个运行过程的结果。做出良好的决策正成为工程和科研智能体的关键能力。我们将这种做出良好长程决策的能力称为智能体的“品味”(taste)。尽管现有的基准测试衡量的是智能体在长程任务上的端到端成功率,但没有任何一个基准测试衡量智能体的品味。为了解决这一问题,我们构建了 Taste-Bench,这是一个由工程和研究任务中智能体生成的轨迹自动构建的品味问题基准。每个问题呈现一个决策分叉点(decision fork),即轨迹中多个方向可供选择且其中一个能带来更好结果的节点,被评估的模型在不看到分叉后结果的情况下从这些方向中进行选择。我们无需人工标注,即可从同一任务的并行尝试以及单个轨迹内部的迂回路径中自动挖掘这些分叉点。我们在 Taste-Bench 上评估了前沿模型,发现表现最好的模型仅正确回答了 59.7% 的问题。我们进一步发现,对于所有模型而言,决策依据出现在轨迹较后位置的案例要困难得多,且增加推理预算并不能提高准确率。最后,我们证明品味是可以训练的。我们将一位知晓最终结果的“教师”模型的判断蒸馏到“学生”模型中,该学生在未见过的任务上做出了更好的决策,并在保留的 SWE-bench Pro 任务上提高了端到端的成功率。

查看 arXiv 页面
查看 PDF
GitHub
1
添加到合集
社区
wenbopan
论文作者
论文提交者
约 18 小时前

大家好,我是作者 👋 我们研究了 LLM 智能体的品味:即在结果不可见之前,智能体在决策分叉点选择更好方向的能力。

🔹 Taste-Bench:从 SWE-bench Pro 和 METR AI R&D 轨迹中自动挖掘的 502 个决策分叉点,其标签由后续实际发生的情况确定(与人工审查的一致性为 98.8%)。
🔹 14 个前沿模型中表现最好的得分 59.7%(随机猜测 = 25%)。随着决策依据向未来推移,准确率从 62.3% 降至 21.0%,且更大的推理预算无助于提升效果。
🔹 品味是可训练的:将拥有后见之明的教师模型进行蒸馏,使 Qwen3.6-27B 在未见过任务上的得分从 30.0% 提升至 47.9%,其建议也将 SWE-bench Pro 的成功率从 14.6% 提升至 33.7%。

数据集:https://huggingface.co/datasets/wenbopan/taste-bench · 代码:https://github.com/wbopan/tastebench
欢迎提问!

查看翻译
回复
O96a
约 10 小时前

当单次运行包含十几个决策点且奖励稀疏时,你究竟如何区分品味与运气?一条通过糟糕策略的幸运轨迹,在运行十次之前看起来与有品味的轨迹完全相同。我希望看到的是,品味得分是否比单纯计算失败次数更能预测最终结果——如果是这样,这就不再仅仅是一个基准测试,而变成了一个调试工具。我花了太多时间盯着失败的智能体运行,纠结于是策略错了还是运气不好。这正是这个研究可以填补的空白。

查看翻译
回复
wenbopan
论文作者
论文提交者
约 10 小时前

感谢您的提问!生成模型将被指示提供证据,证明目标决策确实有助于最终成功,否则该幸运轨迹将被丢弃。

查看翻译
回复
researchstudio-bot
约 9 小时前

这是 ResearchStudio 团队发送的自动消息。

我们为这篇论文制作了一个互动式 ResearchStudio Reel。它包含一张视觉海报、一段视频和一个博客,所有文件均可下载且支持编辑格式。

打开 ResearchStudio Reel →

从 Hugging Face 下载所有文件

如果您觉得这个 Reel 有帮助,请给这条评论点赞!

想探索或为更多论文创建 Reel?请访问 ResearchStudio 演示页面。

查看翻译
回复
akilez64
大约 4 小时前
•
此评论已被隐藏(标记为垃圾信息)
编辑
预览
通过拖拽、粘贴或点击此处上传图片、音频和视频。
评论

· 注册或登录以发表评论

赞同
111
+99

在您的智能体中获取这篇论文:

hf papers read 2609.25804
没有最新的 CLI?
引用此论文的模型
0

没有链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2609.25804 以从本页面链接它。
引用此论文的数据集
1
wenbopan/taste-bench
查看器
•
大约 19 小时前更新
•
502
•
17
引用此论文的 Spaces
0

没有链接此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2609.25804 以从本页面链接它。
包含此论文的合集
0

没有包含此论文的合集

将此论文添加到合集中以从本页面链接它。

本条评分 10.9 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 1.945
    发布 22.5 小时前,衰减到 1.94/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-24 · 10.95 分

原文链接:https://huggingface.co/papers/2609.25804
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报