← 返回 2026-09-30 简报

后训练阶段在无关决策中留下行为痕迹

Post-Training Leaves Behavioral Shadows on Unrelated Decisions

语音播报
摘要
事件:北大团队提出无任务蒸馏方法,利用教师模型在无关决策中的微小偏好偏移,仅用单字回答实现能力迁移。 要点:通过5664个单字样本,Qwen2.5-1.5B学生在HumanEval+上提升5.34pp,无需代码示例或 logits。 影响:揭示后训练痕迹可跨任务泄露,证明微小行为偏差能传递复杂技能,为高效模型蒸馏提供新范式。

论文

arxiv:2609.29233
复制 Markdown
训练后行为在无关决策中留下“行为阴影”
发布于 9月24日
·
提交者
曾元浩
于 9月29日

1 今日论文

·
北京大学
作者:
张子阳
,
景宇斌
,
曾元浩
,
李裕瑶
,
王浩然
,
龚一辰
摘要

我们发现,语言模型可以通过与任务无关的文本转移能力。后训练通常使用特定任务数据来改进语言模型。关于潜意识学习的前期研究表明,有关这些更新的信息可以通过无关生成传递,但主要侧重于使用大量教师输出得出的特征或偏好。我们引入了无任务主动蒸馏(Active Taskless Distillation, ATD),该方法仅通过每个提示中来自教师的单个词即可实现能力转移。ATD 通过后训练留下的“行为阴影”探测能力:选择那些教师和学生模型共享的公共祖先对两个普通词语几乎无偏好的提示。从该祖先初始化的学生仅从生成的提示-词对中学习,无需目标任务示例、教师 logits 或教师参数。在 Qwen2.5-1.5B 的主要编码实验中,5,664 个样本使得 HumanEval+ 上的准确率比精确干扰匹配的控制组提高了 5.34 个百分点。其他实验表明,科学常识、常识推理和阅读理解等能力在不同模型代际、尺寸和家族中也存在转移。功能分析表明,所学能力是可组合的,且其强度与教师的更新强度呈正相关。

查看 arXiv 页面
查看 PDF
GitHub
13
添加到收藏
社区
评论
论文提交者
大约 17 小时前

一个模型能否在不展示任何代码的情况下教另一个模型编程?

令人惊讶的是,可以。一个经过编码训练的教师仅用单个词回答数千个无关提示。一个仅基于这些答案进行训练的学生在编程方面变得更强——尽管它从未见过代码、任务示例或教师 logits。仅通过 5,664 个单字答案,该学生在 HumanEval+ 上比干扰匹配的控制组提高了 +5.34 个百分点。

为什么?后训练留下了分布式的“行为阴影”:即使在无关语境中,普通词语之间也存在微小的偏好偏移。我们的方法——无任务主动蒸馏(ATD)——针对基础模型几乎未决的决策点,即微小偏移揭示更新方向的位置。前期研究表明偏好可以通过这种方式传递;据我们所知,这是首次证明一种能力可以如此转移。

该效应在科学、常识、阅读理解、模型尺寸和家族中均成立。结论是:所学能力会溢出到其训练任务之外——数千个看似无意义的行为变化共同携带了后训练的丰富痕迹。

查看翻译
👍
2
+
回复
编辑
预览
通过拖拽、粘贴或点击此处上传图片、音频和视频。
评论

· 注册或登录以发表评论

赞同
249
+237

将此论文获取到你的代理中:

hf papers read 2609.29233
没有最新的 CLI?
引用此论文的模型
0

无链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2609.29233 以从此页链接它。
引用此论文的数据集
0

无链接此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2609.29233 以从此页链接它。
引用此论文的 Spaces
0

无链接此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2609.29233 以从此页链接它。
包含此论文的集合
1
微调
集合
43 项
•
更新于大约 6 小时前
•
4

本条评分 10.9 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 1.945
    发布 22.5 小时前,衰减到 1.94/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-30 · 10.95 分

原文链接:https://huggingface.co/papers/2609.29233
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报