← 返回 2026-10-04 简报

Transformer模型过早停止思考,而一个微小的LoRA即可修复此问题

Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

语音播报
摘要
事件:研究发现大模型推理链过早中断,研究者通过在早期层添加微小LoRA,使冻结模型能显著延长有效推理步数并修复此缺陷。 要点:基础模型仅跟进1.4至3.6行;在Qwen3-8B第14层加入秩为8的LoRA后,24行任务准确率从15.5%跃升至99%,且无需解冻基座权重。 影响:证明计算能力存在但被过早截断,开发者可用极低参数成本修复长链推理缺陷,提升多跳问答性能,无需重新训练庞大模型。

TL;DR:在被要求直接回答(不使用思维链)时,大语言模型仅能跟随如 K = apple; B = K; D = B; print(D) 这样的引用链短短几行。在早期层中引入一个微小的 rank-8 LoRA,可使冻结的中间层将链条延续得更远。计算能力确实存在;只是它过早停止了。

主要发现

13个基础模型(0.6B–32B)仅能可靠地跟随1.4–3.6行。将深度加倍(OLMo-3 7B → 32B)后,链条长度仍保持在约2.6行。

Qwen3-8B + 在第14层训练的 rank-8 LoRA(65,537个参数,所有基础权重冻结):在24行链条上的精确准确率从15.5%提升至99%。经过更长训练的版本可在单次前向传播中处理长达50行的链条。

机制:LoRA 对每个 token 独立作用,且不传递任何跨 token 的信息。它启动了一个接力过程:程序行通过冻结的第16–22层将链条身份传递下去。在第14–22层切断每行对其父节点的注意力会导致准确率降至随机水平;而在第23–29层进行相同切断则影响甚微。

放置悬崖:使用相同的配方,LoRA 位于第20层时可达20.5行;位于第21层时仅达5.2行。对冻结模型的测量在4个预留模型中的3个中,将该界限定位在预注册容差范围内。

循环模型:在 Ouro-1.4B 中,每轮循环应用 LoRA,经过4次循环后可达60行,经过8次循环后≥160行(双链选择准确率)。

多跳问答:在 MuSiQue(黄金段落)上,分别训练的早期层 LoRA 在三个标准模型上使 EM(精确匹配)分数提升9.4–17.9。

🎬 网站:https://lunamos.github.io/stop-thinking-too-early/
💻 代码:https://github.com/Lunamos/stop-thinking-too-early

欢迎提问!

本条评分 10.2 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 1.225
    发布 46.5 小时前,衰减到 1.23/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-10-04 · 10.22 分

原文链接:https://huggingface.co/papers/2609.36585
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报