摘要:arXiv:2606.27683v1 类型:交叉。边缘设备越来越多地通过API服务调用大型语言模型(LLM)以实现上下文感知的边缘智能,而边缘生成的数据可能被收集用于改进LLM,并可能将敏感、受版权保护、有害或过时的信息引入模型行为。机器遗忘提供了一种无需重新训练LLM即可消除不良数据影响的方法。然而,现有方法仍面临两个差距:一是仅API的黑盒访问,目标模型参数和内部logits不可用;二是当遗忘目标和保留数据共享高度相似的提示结构或语义模式时,如何保持保留数据的效用。为解决这些挑战,我们提出了受控行为差异(CBD),一个仅API的黑盒遗忘框架。CBD使用两个辅助模型在保留输入和遗忘目标输入之间创建受控行为差异,将该差异转化为遗忘相关分数,并将与遗忘相关的提示从目标LLM路由出去。为了提高在目标和保留数据高度相似时的区分准确性,CBD通过估计经验Fisher矩阵并求解正则化广义特征值问题,构建基于梯度统计的判别基础,将遗忘信号引导到目标特定信息而非共享提示结构。与11个白盒和灰盒遗忘基线相比,CBD实现了更好的遗忘-效用权衡,且其性能在不同设置下变化很小。在ToFU forget10上,CBD在遗忘集上接近重新训练的参考值,同时将模型效用提高到74.90,比第二好的基线高出约15%。在WMDP上,它将有害知识准确率降低到25.68,接近随机猜测,同时保持MMLU准确率为52.67。代码位于https://github.com/DGL-codes/CBD。
核心观点
- 提出仅API的黑盒遗忘框架CBD,解决目标模型参数不可访问的问题。
- 利用两个辅助模型创建受控行为差异,将差异转化为遗忘相关分数,路由无关提示。
- 通过梯度统计构建判别基础,区分高度相似的目标和保留数据,提升遗忘精度。
- 在ToFU和WMDP基准上优于11种基线,实现更好的遗忘-效用权衡。
技术要点
CBD框架使用两个辅助模型分别处理保留数据和目标数据,通过对比输出创建受控行为差异。差异通过遗忘相关分数量化,并用于路由决策。为了提高区分能力,CBD估计经验Fisher矩阵,并通过求解正则化广义特征值问题获得梯度统计判别基础,从而将遗忘信号聚焦于目标数据的特有信息,而非共享的语义结构。
应用场景
边缘设备上的LLM服务,需要移除敏感、有害、版权或过时数据的影响,而无需重新训练模型;适用于仅提供API访问的黑盒场景。