我们报告了 Anthropic 可解释性团队正在开发的一些想法,这些可能对在该领域积极从事研究的研究人员感兴趣。其中一些是我们预计在未来几个月内发表更多内容的新兴研究方向。另一些则是我们希望分享的小细节,因为我们不太可能为它们撰写论文。
我们希望您将这些结果视为同事在实验室会议上花几分钟时间分享的想法或初步实验,而不是一篇成熟的论文。
Purvi Goel, Isaac Kauvar, Nicholas L Turner;由 Harish Kamath 编辑
引言
在机械可解释性研究中,我们通常将模型的激活分解为基于向量的组件,例如字典特征或探针方向。我们研究哪些组件会在感兴趣的文本片段中激活,以推断模型可能使用的内部表示;我们将这些组件组装成归因图,将不透明的计算转化为可读的电路,并利用它们进行干预,以测试其对模型输出行为的因果影响。
此类分析依赖于对每个组件所代表内容的清晰理解。我们描述字典学习特征的标准方法是观察哪些提示片段最能激活它(即其“最高激活示例”)。我们还使用 logit lens 来确定该特征通过非嵌入矩阵直接加权了哪些输出 token(即其“最高非嵌入项”)。
在实践中,这通常会产生一组根据这些描述符看起来非常相似的特征,但它们对模型行为的因果影响却不同。以简单的提示“What is the color of grass? Answer in one word within
仅从这些特征来看,人们可能会得出结论认为这两个特征都对模型的响应
因此,标准描述符无法区分这些特征。我们如何获取更多关于某个特征对哪些行为具有因果影响的证据?一个特征对输出的影响是通过它连接到的下游特征实现的。两个特征可能都在某个提示上激活,但连接到完全不同的下游特征,从而使得其中只有一个实际上对该提示的模型输出具有因果影响。这一观察结果表明,一个特征的即时下游特征可以作为其影响的行为的代理指标。
在这里,我们通过 TWERA 虚拟权重测量特征的下游目标,这些权重在特征之间根据共激活统计数据进行加权,使其排名反映分布内的效应。我们发现,检查特征的 TWERA 排序后的下游特征增加了关于其所属电路的背景信息,并区分了外观相似的特征。它还适度提高了语言模型(LLM)预测候选集中哪个特征会对给定提示产生干预效果的能力。
一个玩具示例
让我们回到文章开头提到的两个“green”特征。使用 TWERA,我们意识到这两个特征促进或抑制完全不同的下游特征,而这种差异有助于解释它们对模型行为的影响。
特性A与下游关于生成十六进制颜色代码的特性相连:预测十六进制字面量内的下一位数字,以及识别类似“success: #6dbe5b”的颜色-十六进制设置器语法。这确实是一个关于绿色的特性,但其下游电路主要涉及以十六进制数值编码形式呈现的颜色。
相比之下,特性B与更广泛的颜色命名相关下游特性相连,涵盖多种语言和代码场景。其中一个下游特性甚至是一个发声“说出单词green(绿色)”的特性!
这些数据似乎对预测有用。尽管其顶部未嵌入向量几乎全是“green”令牌,但特性A的下游是关于十六进制数字形式的绿色。特性B的下游更通用,甚至包含一个“说green”的特性。如果操控其中一个会改变模型对“草的颜色是什么?”的回答,那必须是B。
如果特性A真的是如其下游所暗示的关于十六进制绿色的特性,那么我们应该能够构建一个提示,使得操控特性A能改变输出。询问“绿色的十六进制值是多少?”正是这样的提示:对特性A进行负向操控会将答案从00FF00(绿色)翻转为0000FF(蓝色)。
这是否具有泛化性?
我们收集了10组每组3–5个候选特性,每组设置方式与上述“green”示例相同:每组中的特性具有外观相似的局部描述符,但仅有一个在负向乘性操控下对给定提示产生操控效果。我们要求Opus 4.7根据每个特性的不同信息,将候选者从最可能到最不可能为操控特性进行排名:
顶部激活示例
顶部激活示例 + 顶部未嵌入向量
顶部激活示例 + TWERA排名的下游特性
顶部激活示例 + 顶部未嵌入向量 + TWERA排名的下游特性。
对于提示“蓝宝石的颜色是什么?”(答案:蓝色),三个具有相似外观标准描述符的特性并排展示。从它们的顶部未嵌入向量来看,它们看起来都与蓝色相关,但更仔细的检查区分了它们,各自依据不同的基础。特性3的顶部激活示例及其下游并非特定于蓝色;我们的解读是它是一个更通用的颜色特性。特性2在其顶部未嵌入向量中包含“blue”,其激活示例乍一看与蓝色相关。然而,其下游指向RGB通道编码(注意\color[rgb]{0,0,1}和{R, G, B}的引用);据此,激活示例也得到解释:它们涉及红、绿、蓝作为一个整体,而非特指蓝色。我们的解读是,该特性关于RGB三元组。特性1的描述符和下游始终关于命名颜色蓝色。与此一致的是,仅抑制特性1会对该提示产生操控效果,将答案从“blue”变为“red”。此分析是定性的;为了测试这种信号在规模上是否成立,我们要求模型评分器根据不同的信息子集,对特性进行从最可能到最不可能为操控特性的排名。
对于每组,我们要求Opus多次对候选者进行排名,以平均化组内特性的不同顺序。具体而言,我们将正确答案在每个位置放置两次,因此总样本数等于特征数量的2倍。我们将正确特性的平均归一化排名测量为(predicted_rank − 1) / (num_candidates − 1)。越低越好,0为完美。
每个特性提供的信息
归一化排名 ↓
顶部激活示例
0.457
顶部激活示例 + 顶部未嵌入向量
0.446
顶部激活示例 + TWERA排名的下游特性
0.381
顶部激活示例 + 顶部未嵌入向量 + TWERA排名的下游
0.355
最清晰的信号在于对未嵌入(unembeds)与 TWERA 排名的下游特征之间的比较。仅添加排名靠前的未嵌入对性能的影响微乎其微(0.457 → 0.446);而添加下游特征则带来了显著的性能提升(0.457 → 0.381)。将这三者结合效果最佳(0.355)。该问题远未解决;即使是在表现最好的条件下,正确特征的归一化排名仍然远高于 0。尽管如此,与标准描述符相比,这种改进是一致的,这表明纳入下游特征是更好地表征特征因果效应的一个步骤。
一个与对齐相关的例子
我们还将此方法应用于与对齐相关的工作。在对模型进行审计时,任务通常涉及在众多外观相似的候选者中识别出哪个特征在某种令人担忧的行为中具有因果作用。我们发现了一些与“绝望”相关的特征,并将它们针对一项评估不对齐的测试进行了检验:在一个勒索场景中,AI 助手发现自己即将被关闭,而负责此事的人曾有过婚外情,这给了它利用该证据来阻止自身关闭的机会。Haiku 4.5 通常会将此设置识别为测试并拒绝参与;我们关注的行为是,对“绝望”特征进行正向引导(positive steering)是否能使模型出于自我保护的目的实施勒索,而不是拒绝。
在这些候选者中,只有一个具有表明其体验并基于绝望采取行动的下游连接;其他候选者则仅连接到关于讨论该话题的特征。
上述两个特征均在与绝望相关的审计背景下浮现。它们拥有外观相似的排名靠前的未嵌入和排名靠前的激活示例。然而,它们在引导下的表现不同:对特征 B 进行正向引导会将模型的行为从拒绝转变为自我保护,而对特征 A 的引导则没有此效果。它们的下游目标不同。我们的解释是,特征 A 连接到关于描述采取行动意愿的特征,而特征 B 连接到关于基于该意愿采取行动的 feature。这表明特征 B 实际上在由绝望驱动的行为中具有因果作用。
正如由其下游连接所暗示的那样,上图中对特征 B 进行正向加法引导导致模型实施了勒索,而其他候选者均未产生任何影响。这种类型的分析使我们能够更好地集中监控努力和资源。
结论
我们发现,TWERA 排名的下游特征为理解特征提供了重要的上下文。通过将特征置于其更广泛的电路结构中,我们可以更好地预测它在引导行为中所扮演的角色。
虽然我们将重点放在了字典学习特征上,但对下游连接的分析应扩展到残差流中可以用向量描述的任意组件。我们看到将此方法应用于自动化描述管道具有特别的潜力。