← 返回 2026-09-30 简报

超越教师分配:领域归一化的多教师在线策略蒸馏

Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation

语音播报
摘要
事件:南洋理工大学团队提出域归一化多教师策略蒸馏方法,解决多专家模型合并时反馈分布不均导致数学能力受损问题。 要点:通过测量并重缩放各领域反馈方差,平衡指令遵循与数学任务的更新强度。在六个公开基准测试中,该方法显著提升了平均得分,并恢复了大部分丢失的数学优势。 影响:为构建全能大模型提供关键参数调节思路,开发者可直接利用其代码复现效果,优化多技能融合时的性能平衡。

论文

arxiv:2609.35347
复制 Markdown

超越教师分配:领域归一化的多教师在线策略蒸馏

发布于 9月28日
·
提交者
XinLi
于 9月29日

今日第3篇论文

·
南洋理工大学
作者:
Xin Li
,
Hao Jiang
,
Xin Gao
,
Annan Wang
,
Yuchen Xie
,
Jinghao Guo
,
Xingwei Qu
,
Yichi Zhang
,
Chau Yuen

摘要

强化学习可以将一个语言模型转化为多个专家,每个专家都精通于一项特定技能,如数学、编程或遵循指令,但用户需要一个具备所有这些技能的模型。多教师在线策略蒸馏(MOPD)通过让专家指导一名学生来合并这些能力:学生回答每个提示,而该提示所属领域的专家会对每一个token提供反馈。这种路由机制决定了哪位专家进行教学,但未决定其反馈对共享学生的影响强度。在三个不同规模的 Qwen3.5 模型中,我们发现 MOPD 的学生并未超越由最佳单一专家指导的学生,且几乎未获得数学专家的优势。反馈是不平衡的:遵循指令的反馈分布范围是数学反馈的数倍,并主导了学生的更新过程。我们提出了领域归一化的 MOPD(DN-MOPD),它保留了路由机制,并根据测量到的分布范围对每个领域的反馈进行重新缩放。在六个公开基准测试中,DN-MOPD 在所有规模、三种随机种子以及两种答案长度限制下,均提升了平均分数,并恢复了大部分丢失的数学能力增益。使用固定领域权重的对照实验表明,这种增益主要来自于降低遵循指令反馈的影响,而非单纯提高数学反馈;且接近 DN-MOPD 测量值的固定权重表现相当。因此,结合专家不仅需要决定由谁进行教学,还需要决定其反馈的重要性程度。

查看 arXiv 页面
查看 PDF
项目主页
GitHub
10
添加到合集
社区
XINLI1997
论文作者
论文提交者
约 17 小时前

项目主页:https://lixin.ai/DN-MOPD/ 。代码:https://github.com/LiXin97/DN-MOPD

查看翻译
回复
编辑
预览
通过拖拽、粘贴到文本输入框或点击此处来上传图片、音频和视频。
评论

· 注册或登录以发表评论

赞同
138
+126

在您的智能体中获取此论文:

hf papers read 2609.35347
没有最新的 CLI?
引用此论文的模型
0

无链接此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2609.35347 以从此页面链接它。
引用此论文的数据集
1
XINLI1997/DN-MOPD-Data
查看器
•
更新于约 17 小时前
•
26.7k
•
56
引用此论文的 Spaces
0

无链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2609.35347 以从此页面链接它。
包含此论文的合集
1
DN-MOPD
合集
超越教师分配:领域归一化的多教师在线策略蒸馏。数据和模型。
•
2 项内容
•
更新于约 17 小时前

本条评分 10.9 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 1.945
    发布 22.5 小时前,衰减到 1.94/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-30 · 10.95 分

原文链接:https://huggingface.co/papers/2609.35347
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报