Skip to main content
QUICK REVIEW

[论文解读] Provable Defense Against Delusive Poisoning

Lue Tao, Lei Feng|arXiv (Cornell University)|Feb 9, 2021
Adversarial Robustness in Machine Learning参考文献 52被引用 6
一句话总结

本文提出对抗训练作为一种可证明有效的防御方法,以应对误导性投毒攻击,即对正确标记样本施加最小扰动会降低模型性能。通过将攻击形式化为在 ∞-Wasserstein 球内的最坏情况分布偏移,作者证明了最小化对抗风险可约束自然风险,表明对抗训练可防止对非鲁棒特征的过度依赖,并能抵抗在基准数据集上的六种实际攻击。

ABSTRACT

Delusive poisoning is a special kind of attack to obstruct learning, where the learning performance could be significantly deteriorated by only manipulating (even slightly) the features of correctly labeled training examples. By formalizing this malicious attack as finding the worst-case distribution shift at training time within a specific $\infty$-Wasserstein ball, we show that minimizing adversarial risk on the poison data is equivalent to optimizing an upper bound of natural risk on the original data. This implies that adversarial training can be a principled defense method against delusive poisoning. To further understand the internal mechanism of the defense, we disclose that adversarial training can resist the training distribution shift by preventing the learner from overly relying on non-robust features in a natural setting. Finally, we complement our theoretical findings with a set of experiments on popular benchmark datasets, which shows that the defense withstands six different practical attacks. Both theoretical and empirical results vote for adversarial training when confronted with delusive poisoning.

研究动机与目标

  • 将误导性投毒攻击形式化为在 ∞-Wasserstein 球内的分布偏移。
  • 建立对抗风险最小化与自然风险泛化之间的理论联系。
  • 解释为何对抗训练通过减少对非鲁棒特征的依赖,能够抵抗误导性投毒攻击。
  • 在标准基准数据集上,通过实证验证该防御方法对六种实际误导性投毒攻击的有效性。

提出的方法

  • 将误导性投毒攻击建模为在原始数据分布周围以 ∞-Wasserstein 球为约束的最坏情况分布偏移。
  • 证明在投毒数据上最小化对抗风险可为原始数据分布上的自然风险提供上界。
  • 利用此等价关系,证明对抗训练是一种有理论依据的防御机制。
  • 分析对抗训练在存在细微数据扰动时,如何通过减少对非鲁棒特征的过拟合来发挥作用的内在机制。
  • 应用标准的对抗训练流程(例如基于 PGD 的优化)来防御误导性投毒攻击。
  • 在六种不同实际攻击设置下的标准基准数据集上评估该防御方法。

实验结果

研究问题

  • RQ1对抗训练能否在理论上被证明是应对误导性投毒攻击的有效防御?
  • RQ2在投毒数据上最小化对抗风险是否等价于对干净数据上的自然风险进行上界约束?
  • RQ3对抗训练如何缓解由误导性投毒引发的分布偏移影响?
  • RQ4非鲁棒特征在误导性投毒攻击的脆弱性中扮演何种角色?
  • RQ5该防御方法在多种实际攻击场景下是否依然有效?

主要发现

  • 对抗训练最小化了自然风险的可证明上界,为该方法在应对误导性投毒攻击中的有效性提供了理论依据。
  • 该防御方法通过减少模型对易受细微输入扰动影响的非鲁棒特征的依赖而起作用。
  • 理论分析证实,对抗训练在 ∞-Wasserstein 约束下可有效抵消误导性投毒引发的分布偏移。
  • 实证结果表明,该方法在标准基准数据集上对六种不同实际误导性投毒攻击均表现出鲁棒性。
  • 该防御方法在多种数据分布和攻击类型下均保持强大性能,验证了其泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。