← 返回 2026-10-03 简报

在线策略与离线策略学习?蒸馏动力学的系统研究

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

语音播报
摘要
事件:剑桥大学团队系统研究强到弱蒸馏中策略选择的影响,控制变量分析 rollout 策略。 要点:发现 rollout 策略非核心因素,token 级 KL 方向主导性能,前向 KL 稳健而反向 KL 敏感。 影响:挑战在线策略必然更优的观点,表明其价值取决于目标与超参。

论文

arxiv:2609.35259
复制 Markdown
在线策略与离线策略学习?蒸馏动力学的系统研究
发布于 9月28日
·
提交者
Julianna Piskorz
于10月2日提交

今日第3篇论文

·
剑桥大学
作者:
Julianna Piskorz
,
Antonin Berthon
,
Mihaela van der Schaar
摘要

在线策略学习被认为可以减少灾难性遗忘,产生更稀疏的参数更新,并提高泛化能力。然而,现有的监督微调与强化学习之间的比较同时变化了多个因素,使得 rollout 策略的贡献难以隔离。我们通过独立地改变 rollout 策略、词元级别的 KL 散度方向以及学习率,在 Llama3 和 Qwen2.5 模型系列以及涵盖科学、医学和算术领域的推理任务中,研究了受控的强到弱蒸馏设置下 rollout 策略的影响。我们的分析揭示了一个复杂的蒸馏动力学图景,其中 rollout 策略并不一定起核心作用。相反,词元级别的 KL 散度方向更清晰地塑造了任务表现和输出覆盖范围,而学习率则控制着遗忘和更新稀疏性。对 KL 梯度的分析以及沿连续的学生-教师 rollout 策略谱系的实验解释了这一模式:前向 KL 对 rollout 策略具有显著的鲁棒性,尽管 rollout 策略发生变化,其表现依然稳定且强劲;而后向 KL 则敏感得多,并偏好由学生生成的 rollout。尽管如此,在线策略数据在两种 KL 散度方向下均能改善对 Countdown 算术任务更困难变体的泛化能力,尽管这种优势在随后的 RLVR(强化学习价值回归)后并不总能持续存在。我们的更广泛结论在移除梯度裁剪、使用采样 KL 估计器以及训练需要更长推理链的任务时依然稳健。总体而言,我们的结果挑战了在线策略 rollout 本质上更优越的观点,并表明其价值关键取决于目标函数、评估设置和优化超参数。

查看 arXiv 页面
查看 PDF
添加到合集
社区
jpiskorz
论文提交者
大约7小时前

好奇听听你们对于在强到弱蒸馏背景下,在线与离线策略学习之间差异的看法和评论!

查看翻译
回复
编辑
预览
通过拖拽、粘贴或点击此处上传图片、音频和视频。
评论

· 注册或登录以发表评论

赞成
114
+102

在你的智能体中获取此论文:

hf papers read 2609.35259
没有最新的 CLI?
引用此论文的模型
0

无链接此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2609.35259 以从本页链接它。
引用此论文的数据集
0

无链接此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2609.35259 以从本页链接它。
引用此论文的 Spaces
0

无链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2609.35259 以从本页链接它。
包含此论文的合集
0

无包含此论文的合集

将此论文添加到合集中以从本页链接它。

本条评分 10.9 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 1.945
    发布 22.5 小时前,衰减到 1.94/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-10-03 · 10.95 分

原文链接:https://huggingface.co/papers/2609.35259
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报