我们报告了 Anthropic 可解释性团队正在开发的一些想法,这些可能对在此领域积极工作的研究人员感兴趣。其中一些是我们预计在未来几个月内发表更多内容的新兴研究分支。另一些则是我们希望分享的小观点,因为我们不太可能就此撰写论文。
请大家将这些结果视为同事在实验室会议上分享的一些想法或初步实验,而非成熟的论文。
Kevin Der、Harish Kamath、Ben Thompson;Nick Turner 编辑
稀疏自编码器(SAEs)已成为表征模型中重要安全行为的宝贵工具。通常,我们会发现表现出令人担忧行为的模型转录文本,并识别这些转录文本中的关键活跃特征以进行调查。这些特征往往描述了我们需要关注的更一般的模型倾向,例如痛苦情绪或评估意识。在识别出这些特征后,我们可以将其用于下游应用,例如作为探针来监控其他转录文本,或构建归因图以更完整地描绘任何给定的模型行为。
然而,识别重要特征存在两个实际问题:
SAE 作用于单个标记位置的激活值。即使是较短的转录文本也可能产生数千到数百万个特征激活值供解释。
许多 SAE 特征是“无聊”的——它们专注于模型计算中与安全性无关的部分,如语法或用于阐述决策的具体标记。
我们尝试过各种程度的变通方法,例如在 Opus 4.6 系统卡中,我们使用对比提示来隔离相关特征组,但使用 SAE 特征激活值研究转录文本仍然显得笨拙。
作为 Anthropic 研究员计划的一部分,我们实验了平均轮次 SAE(Turn-Averaged SAEs)。概念很简单:我们对单个人类或助手轮次中的所有标记的残差流进行平均,并训练一个 SAE 来重构该表示。对于给定的轮次,平均轮次 SAE 将呈现 L0 个活跃特征,而每个标记的 SAE 将呈现 n_tokens × L0 个特征。由于轮次可能延伸数百到数千个标记,平均轮次 SAE 大幅减少了需要解释的特征激活值数量。这一想法受到先前工作的启发,该工作表明平均残差流对于识别抽象模型表示(如人格向量)很有用。
我们发现,与每个标记的特征相比,平均轮次特征捕捉到了转录文本更多的高层特征。例如,考虑以下轮次,其中助手错误地回答了一个简单的数字谜题:
用户:100 以下不包含 9 的最高数字是多少?
助手:100 以下不包含数字 9 的最高数字是 95。
我们在 Qwen-2.5-7B-Instruct 的中间层上,针对 LMSYS-Chat-1M 数据集训练了每个标记的 SAE 和平均轮次 SAE,并使用它们的激活值研究了该提示。来自每个标记 SAE 的最高激活特征集中在数值推理上(例如算术语句、数字、编号系统),而最高激活的平均轮次 SAE 特征直接识别与数字谜题中错误答案相关的特征。这种特征质量的改进外推到比训练期间看到的平均轮次长度长 150 倍的轮次。
为了验证这种方法,我们将平均轮次 SAE 与每个标记的 SAE 进行头对头比较。我们要求 Sonnet 4.6 根据两个标准评判一组轮次:
每套特征在从 10 个随机轮次中唯一识别给定轮次方面的表现如何。(判别力)
评审员完全描述给定轮次时,偏好平均轮次特征而非每个标记特征的频率如何。(覆盖率)
在判别指标上,轮次平均特征的表现尚可(74%),但低于逐词元特征(95%),后者通常包含原始对话轮次中存在的特定短语或词元。然而,在覆盖度指标方面,人们更倾向于使用轮次平均特征而非逐词元特征,占比达 77%。
我们的完整论文包含了更多细节和实验,包括:
一种嵌套 SAE 架构,该架构将轮次平均特征与逐词元特征结合在一个模型中;
将轮次平均 SAE 应用于归因图:
一项案例研究,追踪了来自 LMSYS 数据集的 14 轮对话中的一个可解释电路;
完整性/替换指标及干预实验,验证了由嵌套 SAE 生成的归因图在衡量因果影响方面等于或优于使用逐词元 SAE 构建的图。
一个对比提示管道,用于识别对应于安全相关人格及其他行为特征的轮次平均特征。
我们通常对使用轮次平均 SAE 以及其他使模型行为审计对人类和自动化分析都更简单的技术感到兴奋。