本研究定位了经过对齐训练的语言模型中的政策路由机制。中间层的注意力门(gate)检测内容并触发深层放大器头(amplifier heads)以增强拒绝信号。在小模型中,门和放大器为单头;在更大规模下,它们成为跨相邻层的头组。门贡献的输出DLA不足1%,但互换测试(p<0.001)和敲除级联验证其因果必要性。对12个模型(2B至72B)的互换筛选(n>=120)检测到相同模式,但具体头因实验室而异。单头消融在72B时减弱效果达58倍,且遗漏互换识别出的门;在大规模下,互换是唯一可靠的审计方法。调制检测层信号可连续控制政策,从坚决拒绝到规避再到事实回答。在安全提示上,相同干预将拒绝转变为有害指导,表明安全训练的能力被路由门控而非移除。阈值因主题和输入语言而异,且路由在代际间迁移而行为基准不变。路由是早期承诺:门在其自身层提前触发,早于更深层完成输入处理。一种上下文替代密码将三个模型中的门互换必要性降低70%至99%,模型转而解题而非拒绝。将明文门激活注入密码前向传播可恢复Phi-4-mini中48%的拒绝,将绕过定位到路由接口。第二种方法——密码对比分析——通过明文/密码DLA差异在O(3n)次前向传播中映射完整的密码敏感路由电路。任何能击败检测层模式匹配的编码都会绕过政策,无论更深层是否重构内容。

核心观点

技术要点

采用互换测试、敲除级联、DLA(激活差异)分析、单头消融、密码对比分析等方法定位路由电路。通过替代密码实验扰乱检测层模式匹配,验证路由接口的脆弱性。

应用场景

安全训练中的拒绝行为审计与控制、模型政策可解释性研究、安全对齐鲁棒的评估、对抗攻击检测与防御。