首页 > AI前沿 > Does On-Policy Distillation for Safety Pose Backdoor Risks?

Does On-Policy Distillation for Safety Pose Backdoor Risks?

arXiv机器学习 2026-10-06 10:50 5 阅读 查看原文

On-policy distillation (OPD) 简介

On-policy distillation (OPD) 已逐渐成为将能力从教师模型转移到学生模型的有效方式之一。近期研究进一步探索 OPD 作为提高大型语言模型安全性的工具,并取得了有前景的结果。

安全风险揭露

然而,这些方法通常假设教师和训练数据是可信赖的。在本论文中,我们揭露了 OPD 安全性中的一个被忽视的威胁:一个与安全一致但被后门攻击的教师可以向最初干净的学生传播其隐藏的恶意行为。

威胁模型分析

在我们的威胁模型下,低至 3% 的中毒率会导致攻击成功率 (ASR) 高达 70% 的攻击。

风险放大因素

  • 首先,增加训练轮数可以在低中毒率下导致高 ASR。仅用 10 个中毒样本,在 16 个轮次后 ASR 达到 67%。
  • 其次,常用的 top-k KL 可以加速后门转移,导致触发条件下的有害行为在大多数设置中比样本-token KL 更早出现。

Lazy Defense 方法

除了这些发现之外,我们还探索了一种简单的缓解方法,称为 Lazy Defense,它通过剪辑 KL 奖励来使学生更新不那么激进,限制激进更新并减缓后门学习。

实验结果

实验表明,Lazy Defense 在低中毒率设置中延迟了后门转移。

结论

总之,我们的发现揭示了 OPD 可以传播后门,突出了解决 OPD 安全风险的必要性。