Skip to main content
QUICK REVIEW

[论文解读] Randomization matters. How to defend against strong adversarial attacks

Rafaël Pinot, Raphael Ettedgui|arXiv (Cornell University)|Feb 26, 2020
Adversarial Robustness in Machine Learning参考文献 38被引用 12
一句话总结

本文提出了一种基于对抗性训练分类器集成提升的随机化防御方法,理论上和实证上均表明随机化能显著提升对强自适应攻击的鲁棒性。通过构建一个混合分类器,该方法在自适应PGD攻击下于CIFAR-10上实现了0.55的准确率——比对抗性训练高出13%,其优于任何单一确定性模型的性能源于博弈论的鲁棒性保障。

ABSTRACT

Is there a classifier that ensures optimal robustness against all adversarial attacks? This paper answers this question by adopting a game-theoretic point of view. We show that adversarial attacks and defenses form an infinite zero-sum game where classical results (e.g. Sion theorem) do not apply. We demonstrate the non-existence of a Nash equilibrium in our game when the classifier and the Adversary are both deterministic, hence giving a negative answer to the above question in the deterministic regime. Nonetheless, the question remains open in the randomized regime. We tackle this problem by showing that, undermild conditions on the dataset distribution, any deterministic classifier can be outperformed by a randomized one. This gives arguments for using randomization, and leads us to a new algorithm for building randomized classifiers that are robust to strong adversarial attacks. Empirical results validate our theoretical analysis, and show that our defense method considerably outperforms Adversarial Training against state-of-the-art attacks.

研究动机与目标

  • 探究确定性分类器是否能对所有对抗性攻击实现最优鲁棒性。
  • 探索随机化防御策略是否能克服确定性方法在对抗鲁棒性方面的局限性。
  • 开发一种实用且具有理论基础的随机化分类器构建方法,使其对强自适应攻击具有鲁棒性。
  • 在CIFAR-10和CIFAR-100上,通过实证验证该方法对最先进攻击的鲁棒性。

提出的方法

  • 将对抗性攻击-防御问题形式化为防御者(分类器)与攻击者之间的无限零和博弈。
  • 证明在确定性设定下纳什均衡不存在,意味着不存在任何确定性分类器能实现普遍最优。
  • 提出一种基于提升的方法,通过在当前混合模型上生成的对抗性样本迭代训练新模型,构建随机化分类器。
  • 在训练过程中使用期望logits和期望损失优化,以最大化混合模型在自适应攻击下的鲁棒性。
  • 采用自适应攻击(如Adaptive-ℓ∞-PGD)并结合多次随机重启与基于梯度的优化,以评估鲁棒性。
  • 基于攻击下的表现(bestAUA)而非自然准确率选择初始分类器,以提升最终混合模型的鲁棒性。

实验结果

研究问题

  • RQ1是否存在一种确定性分类器,能确保对所有对抗性攻击实现最优鲁棒性?
  • RQ2在面对强自适应攻击时,随机化防御策略是否能优于确定性方法?
  • RQ3通过提升构建的分类器混合是否能提供优于单个模型的最坏情况鲁棒性保障?
  • RQ4博弈论框架是否能为对抗防御中随机化的使用提供理论依据?

主要发现

  • 本文证明,由于对应无限零和博弈中纳什均衡不存在,任何确定性分类器都无法对所有对抗性攻击实现最优鲁棒性。
  • 任何确定性防御均可被随机化分类器混合所超越,证明了随机化的理论优势。
  • 所提出的提升型随机化分类器在自适应ℓ∞-PGD攻击下于CIFAR-10上实现0.55的准确率,较对抗性训练(0.42)提升0.13。
  • 在CIFAR-100上,该方法在ℓ∞-PGD攻击下实现0.53的准确率,在ℓ2-C&W攻击下实现0.52的准确率,均优于对抗性训练。
  • 基于攻击下鲁棒性(bestAUA)选择混合中的首个分类器,相比基于自然准确率选择,准确率提升3%。
  • 消融实验确认不存在梯度掩蔽现象,因为在ℓ∞-PGD攻击下ε=0.250时准确率降至0.000,验证了鲁棒性评估的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。