[论文解读] What Doesn't Kill You Makes You Robust(er): How to Adversarially Train against Data Poisoning
本文提出了一种新颖的对抗性训练框架,通过在训练过程中注入对抗性构造的投毒样本,从而降低模型对恶意数据篡改的敏感性,以抵御数据投毒攻击。该方法在鲁棒性-准确率权衡上表现优越,能泛化至多种威胁模型(包括自适应攻击),并优于先前的防御方法如DP-SGD和标准对抗性训练。
Data poisoning is a threat model in which a malicious actor tampers with training data to manipulate outcomes at inference time. A variety of defenses against this threat model have been proposed, but each suffers from at least one of the following flaws: they are easily overcome by adaptive attacks, they severely reduce testing performance, or they cannot generalize to diverse data poisoning threat models. Adversarial training, and its variants, are currently considered the only empirically strong defense against (inference-time) adversarial attacks. In this work, we extend the adversarial training framework to defend against (training-time) data poisoning, including targeted and backdoor attacks. Our method desensitizes networks to the effects of such attacks by creating poisons during training and injecting them into training batches. We show that this defense withstands adaptive attacks, generalizes to diverse threat models, and incurs a better performance trade-off than previous defenses such as DP-SGD or (evasion) adversarial training.
研究动机与目标
- 为应对机器学习中日益增长的数据投毒威胁,即恶意行为者篡改训练数据以操纵模型行为。
- 克服现有防御方法存在的缺陷,如测试准确率低下、易受自适应攻击影响,或仅适用于特定威胁模型的局限性。
- 开发一种可泛化的鲁棒防御框架,能够抵御多样化的数据投毒攻击,包括目标投毒攻击和后门攻击。
- 将已被证明对测试时间对抗性样本有效的对抗性训练方法,扩展至训练时间数据投毒防御,通过在模型训练过程中生成并注入对抗性投毒样本。
提出的方法
- 通过优化最坏情况扰动,在训练过程中生成对抗性投毒样本,以模拟真实的数据投毒攻击。
- 将这些对抗性构造的投毒样本注入训练批次中,从而在模型优化过程中模拟现实的数据投毒场景。
- 该框架使用修改后的损失函数,最小化模型对这些注入投毒样本的敏感性,从而有效训练出对投毒攻击具有鲁棒性的模型。
- 动态生成投毒样本,无需事先识别被污染的数据点,从而实现对未知威胁的实时适应。
- 该方法评估了多种投毒生成策略,包括随机噪声补丁、优化后的最坏情况补丁,以及通过CutMix生成的分布内图像补丁。
- 它采用与标准对抗性训练相同的优化原则,但将其应用于数据投毒威胁模型,将被污染的数据视为训练分布中的对抗性样本。
实验结果
研究问题
- RQ1对抗性训练能否有效适应防御训练时间的数据投毒攻击,而不仅限于防御测试时间的对抗性样本?
- RQ2所提出的方法在面对专门设计以绕过已知防御机制的自适应数据投毒攻击时表现如何?
- RQ3与DP-SGD和标准对抗性训练等现有防御方法相比,该防御方法的鲁棒性-准确率权衡如何?
- RQ4该防御方法能否在包括目标投毒攻击和具有不同触发模式的后门攻击在内的多种数据投毒威胁模型中实现泛化?
- RQ5在训练过程中使用动态生成的投毒样本,是否能带来比静态或预先识别的投毒数据更好的泛化能力和鲁棒性?
主要发现
- 所提出的投毒免疫防御方法在抵御4×4语义Firefox标志补丁时,平均投毒攻击成功率仅为25.80%,而未受保护的模型则达到79.68%。
- 对于噪声棋盘补丁,该方法将投毒成功率降低至29.77%,同时保持92.00%的自然准确率,显著优于基线防御方法。
- 该方法在不同触发类型间表现出良好的泛化能力:对分布外的噪声补丁和分布内的语义补丁均保持强鲁棒性。
- 使用基于图像的补丁(如CutMix风格)进行训练,相比随机噪声或优化补丁,能带来更好的鲁棒性,尤其在语义有意义的触发条件下表现更优。
- 该防御方法优于DP-SGD,后者尽管将自然准确率降至69.33%,但对语义触发仍表现出极高脆弱性(投毒准确率达94.40%)。
- 特征空间的可视化显示,受保护的模型学习到更具鲁棒性的表征,对投毒引起的特征偏移敏感性显著降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。