HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分44
蒸馏防御在强化学习后轻易失效
Distillation Defenses Easily Break After Reinforcement Learning
AI 导读
论文指出,现有蒸馏攻击防御通常只在蒸馏后立即评估,隐含假设攻击者不再继续训练,但更现实的威胁模型包含蒸馏后的强化学习。结果显示,强化学习会降低蒸馏攻击门槛,仅用当前 API 易得数据即可窃取闭源模型推理能力,效果相当于提取完整隐藏推理轨迹的复杂攻击。任何泄露足够信息以重建近似推理轨迹的蒸馏防御都可能失效。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org