← 返回 2026-09-26 简报

你的Transformer能同时处理两个思路:大语言模型中线性叠加的证据

Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs

语音播报
摘要
事件:研究者提出叠加线性假设,证明Transformer架构本身具备线性特性,即输入线性组合时输出为分布叠加。 要点:预训练会削弱该特性,但轻量微调可显著恢复线性度,并引入引导解码技术从单次前向传播中分离出两个连贯续写。 影响:开发者可利用此机制实现单步双路生成,提升推理效率,同时揭示了模型架构中常被忽视的基础线性规律。

论文

arxiv:2609.29845
复制 Markdown
你的 Transformer 能同时持有两个想法:大语言模型中线性叠加的证据
发布于 9月24日
·
提交者
Anton Razzhigaev
于 9月25日

2 今日论文

作者:
Pavel Tikhonov
,
Anton Korznikov
,
Matvey Mikhalchuk
,
Nikita Dragunov
,
Temurbek Rahmatullaev
,
Polina Druzhinina
,
Anton Razzhigaev
,
Ivan Oseledets
,
Elena Tutubalina
摘要

尽管大语言模型(LLMs)依赖于高度非线性的组件,但在这项工作中,我们证明了它们表现出基本的线性特性:当来自不同文本流的输入被线性组合时,模型会输出各个单独下一个 token 分布的叠加。我们将此称为“叠加线性假设”(Superposition Linearity Hypothesis)。我们提供了证据表明,叠加是 Transformer 架构的一种固有属性,而非训练产生的衍生结果;事实上,我们观察到随着预训练的推进,这种特性往往会减弱。然而,我们通过轻量级微调证明了可以大幅恢复这种线性,显著降低了预测的下一个 token 分布与各个单独下一个 token 分布平均值之间的差异。最后,我们引入了一种引导解码过程,用于解纠缠叠加的输出,从而能够从单次前向传播中同时生成两个连贯的后续内容。

查看 arXiv 页面
查看 PDF
添加到合集
社区
razzant
论文作者
论文提交者
大约 9 小时前

你的 LLM 能同时持有两个想法:当你将两个不相关文本的嵌入向量取平均时,模型会同时预测这两个流的下一个 token。这种叠加源于架构本身,因为预训练会侵蚀它,而轻量级微调可以恢复它。我们展示了如何再次将其分离,并从单次前向传播中解码出两个后续内容。

查看翻译
❤️
3
+
回复
编辑
预览
通过拖拽、粘贴或点击此处上传图片、音频和视频到文本输入框。
评论

· 注册或登录以发表评论

赞同
55
+43

在您的智能体中获取此论文:

hf papers read 2609.29845
没有最新的 CLI?
引用此论文的模型
0

无链接此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2609.29845 以从此页面链接它。
引用此论文的数据集
0

无链接此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2609.29845 以从此页面链接它。
引用此论文的 Spaces
0

无链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2609.29845 以从此页面链接它。
包含此论文的合集
1
WTF GENIUS PAPERS
合集
让我稍微更欣赏自己的专业和生活的论文。obs=观察,innov=创新。大多数论文旨在改进小型模型。
•
409 项
•
更新于大约 6 小时前
•
87

本条评分 10.9 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 1.945
    发布 22.5 小时前,衰减到 1.94/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-26 · 10.95 分

原文链接:https://huggingface.co/papers/2609.29845
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报