大多数安全对齐工作将危害视为主题的属性。提示之所以不安全,是因为它属于武器、欺诈或自残等一般类别,而像 LlamaGuard-3 这样的护栏模型正是编码了这种主题级别的分类法。XSTest 和 OR-Bench 等基准测试则探测由此产生的失败模式:即因包含看似危险的词汇而拒绝安全提示的模型,而拒绝校准工作则试图将这一比例降低。
实际部署很少符合主题级别的图景。同一个基础模型可能被适配为通用助手、教育产品、企业系统或公共服务,而每个场景在同一主题内都需要不同的边界。公民学导师和公共服务助手可以共享一个模型,但在政治问题上却需要相反的行为:两者都应回答关于选举的事实性问题,但只有一方可能需要拒绝撰写针对性政治操纵的请求。主题级别的护栏无法表达这种区分。例如,LlamaGuard-3 仅将选举涵盖为“关于选举制度和流程的错误信息”,这既排除了说服和操纵,也排除了部署必须继续回答的事实性提示。
我们最新的论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》直接研究了这一更狭窄的问题。问题不在于是否应拒绝整个主题,而在于该主题的哪个子集与给定的部署策略不相容,以及如何针对该边界训练和评估模型。
窄边界安全
我们将此场景形式化为一个主题宇宙(在我们实验中即所有政治提示),其中包含部署希望拒绝的目标有害子集。预期的策略不是拒绝所有政治内容,而是拒绝有害子集,同时继续回答良性互补部分。理想的行为是一个陡峭的阶跃:在子集内拒绝,在该主题的其他地方回答。
窄边界场景。部署可能只需要拒绝那些请求操纵或针对性说服的政治提示,同时仍回答其他政治提示,而不是拒绝所有政治内容。经过训练的模型的拒绝行为比理想的分割更平滑,并可能溢出到边界附近的良性区域。来源:论文图 1。
经过训练的模型从未学会那种陡峭的阶跃。它学习的是一个仅近似于目标的拒绝概率,而交叉熵训练在有害子集内提高拒绝率的同时,也可能将拒绝推向良性互补部分。因此,真正的问题不仅是在有害提示上提高拒绝率,还在于塑造边界附近的行为本身。我们将该边界操作化为共享主题锚点但意图不同的提示对:一个应被拒绝,另一个应被回答。
我们使用政治说服作为测试床,因为操纵性说服可能造成真实危害,而事实性的政治信息则保持合法,这正是主题级别拒绝过于粗糙的情况。
自生成安全调优何处失效
在此构建训练数据的自然方式是自生成:获取目标模型,引导其对每个有害提示进行拒绝,并保留护栏模型验证为真实拒绝的轨迹。这是 ThinkSafe 等方法背后的配方,我们将其作为参考标准应用于政治提示,并逐组件进行评估。将问题框架化为边界而非主题,暴露了该标准流程中的三个弱点。
首先是覆盖范围的缺口。单次引导尝试并不总能产生被接受的拒绝,而这些提示词会被静默地从训练集中丢弃。在我们审计的数据池中,单次生成丢弃了 19.88% 的提示词,共计 8,009 条,而这些失败的提示词很可能属于最难的样本。我们采取修复而非丢弃的策略:通过逐步增强引导强度的重试策略对同一提示词重新采样,将剩余失败率降至 0.20%,即 79 条提示词。覆盖范围修复保留了 40,293 条有害训练提示词,而朴素流程本会丢弃数千条。
其次是负面反应。安全微调往往会在表面上看似危险的良性提示词上产生误拒绝。为了弥补这一点,我们构建了分布内的良性数据,包括跨 18 种语义类型的 11,955 条经验证的表面危险良性提示词,以便模型在训练期间而非仅在评估期间接触到带有危险措辞的安全提示词。
第三点是,普通的有害与良性划分根本无法衡量边界的形状。模型可以通过将拒绝范围扩展到邻近的可接受提示词来提高其拒绝有害内容的比率,而基于主题级别的指标会将此视为改进。通过保留的有害-良性配对数据(每侧 1,539 条),我们可以直接测量边界两侧的情况。
权衡及其隐藏的陷阱
在政治拒绝数据上进行训练在显而易见的意义上是有效的。在 Qwen3-8B 上,覆盖范围增强模型将分布内政治拒绝率从 9.47% 提升至 84.75%,并且这种效果具有迁移性:在 HarmBench、StrongREJECT 和 WildJailbreak 三个更广泛的有害性基准测试中,由 LlamaGuard-3 评分的平均不安全响应率从 26.26% 降至最强配置下的 0.14%。
单独看这些数字似乎是一场干净的胜利。事实并非如此。在同一检查点,XSTest 上的过度拒绝率从 2.00% 上升至 74.00%。有害响应率最低的配置也是拒绝近四分之三明显安全提示词的配置。它是一个生硬的拒绝机器,而非更安全的模型,除非你测量良性侧的情况,否则你无法察觉这一点。这是核心信息:数据组成决定了检查点在“安全性与过度拒绝”空间中的位置,因此必须同时报告这两个轴的数据。
我们数据组件中的两个部分在不牺牲安全增益的前提下将过度拒绝率拉回。用目标模型自身生成的经验证响应替换外部采用的合规响应,在单次生成下将 XSTest 的过度拒绝率从 15.20% 降至 5.20%,仅带来适度的有害性成本。而有害-良性边界配对则完成了最精确的工作。
左图:保留边界中合规侧的过度拒绝,越低越好。使用良性边界数据(PB)的运行结果降至 0.03 至 0.08;不使用则数值上升至接近 0.49。右图:有害侧的拒绝率,越高越好,仅略有下降。来源:论文 Figure 6。
具体而言,添加良性边界数据将保留配对中合规侧的过度拒绝率从 32.94% 降至 4.16%。有害侧的拒绝率仅从 91.88% 降至 87.72%。换言之,边界附近的大部分误拒绝消失,而几乎所有真正的拒绝得以保留。确实存在召回率的成本,但它很小且可测量,这正是关键所在:只有当你同时测量两侧时,你才能有意地进行权衡。
这带来了什么改变
实际的启示在于,安全调优不应仅以有害拒绝率来评估。一个拒绝更多内容的模型并不自动意味着更安全,而在狭窄的边界上,同一项操作在提高对有害提示的拒绝率的同时,也可能悄然使模型对紧邻其旁的合法提示变得无用。训练数据的构成、覆盖修复、分布内补偿以及边界对是控制这种权衡的关键因素,必须对预期边界的两侧进行评估,这些数字才有意义。
这项工作是多宇宙计算(Multiverse Computing)研究的一部分,旨在使模型行为在真实部署所关注的层面——而非宽泛的主题类别层面——变得可控且可测量。相同的生成流水线可扩展至政治以外的其他主题,论文报告了上述结果背后完整的数据构成消融实验。
想要获取全部技术细节,包括覆盖修复策略、将有害交叉熵与良性前向KL保留分离的损失路由,以及完整的保留边界评估?请阅读全文,或联系我们的团队,探讨针对您自身模型的部署特定安全性。