本文提出了一种名为受控行为分歧(CBD)的仅API黑盒遗忘框架,用于解决边缘设备上大型语言模型(LLM)在API调用中移除不良数据影响的问题。CBD通过两个辅助模型在保留输入和遗忘目标输入之间创建受控行为分歧,转化为遗忘相关性分数,并将相关提示路由远离目标LLM。为了在高相似性数据下提高区分精度,CBD通过估计经验Fisher矩阵和求解正则化广义特征值问题构建基于梯度统计的判别基,引导遗忘信号针对目标特定信息。实验表明,CBD在遗忘效用权衡上优于11种白盒和灰盒基线,性能稳定。
核心观点
- 解决仅API黑盒访问下的LLM遗忘问题
- 提出受控行为分歧(CBD)框架
- 使用两个辅助模型创建行为分歧
- 通过梯度统计和Fisher矩阵构建判别基
- 在ToFU和WMDP数据集上表现优异
- 代码已开源
技术要点
仅API黑盒访问:无法获取模型参数和内部logits。受控行为分歧:在保留和遗忘输入之间创建可控差异。基于梯度统计的判别基:估计经验Fisher矩阵,求解正则化广义特征值问题。路由机制:将遗忘相关提示远离目标LLM。遗忘效用权衡:优于11种基线,性能稳定。
应用场景
边缘设备上的LLM服务(通过API);移除敏感、版权、有害或过时的信息;保护用户隐私和数据安全;提升模型在保留任务上的性能