Skip to main content
QUICK REVIEW

[论文解读] Increasing Confidence in Adversarial Robustness Evaluations

R. Zimmermann, Wieland Brendel|arXiv (Cornell University)|Jun 28, 2022
Adversarial Robustness in Machine Learning被引用 5
一句话总结

本文提出一种主动鲁棒性测试,通过修改模型以确保对抗性样本存在,来检测防御评估中的弱对抗攻击。该测试揭示,13篇先前发表的防御方法中有11篇在更强攻击下失效,暴露了先前评估中的缺陷,并倡导通过攻击单元测试来提高对鲁棒性声明的信心。

ABSTRACT

Hundreds of defenses have been proposed to make deep neural networks robust against minimal (adversarial) input perturbations. However, only a handful of these defenses held up their claims because correctly evaluating robustness is extremely challenging: Weak attacks often fail to find adversarial examples even if they unknowingly exist, thereby making a vulnerable network look robust. In this paper, we propose a test to identify weak attacks, and thus weak defense evaluations. Our test slightly modifies a neural network to guarantee the existence of an adversarial example for every sample. Consequentially, any correct attack must succeed in breaking this modified network. For eleven out of thirteen previously-published defenses, the original evaluation of the defense fails our test, while stronger attacks that break these defenses pass it. We hope that attack unit tests - such as ours - will be a major component in future robustness evaluations and increase confidence in an empirical field that is currently riddled with skepticism.

研究动机与目标

  • 为解决机器学习中因弱攻击评估而导致的对抗鲁棒性被高估的广泛问题。
  • 开发一种方法,通过确保在修改后的模型中存在对抗性样本,来识别有缺陷的鲁棒性评估。
  • 提出一种主动测试,作为攻击的单元测试,验证其在已知存在对抗性样本时能否成功找到这些样本。
  • 通过检测无法识别已知对抗性样本的攻击,提高对经验鲁棒性评估的信心。
  • 鼓励防御作者为其特定架构或训练方法开发定制化的攻击单元测试。

提出的方法

  • 该方法通过将分类任务重新定义为二分类问题,并将决策边界设置在原始输入附近,来修改神经网络,以确保对每个输入都存在对抗性样本。
  • 利用原始模型的特征构建一个二分类器,确保有效的对抗性样本位于攻击的威胁模型范围内(例如,ℓ∞-球半径为ε)。
  • 该测试使用在干净样本和ε球内植入的对抗性样本上训练的二元判别器,使得在威胁模型范围内的任何攻击都不可避免地面临对抗性样本的存在。
  • 通过调整干净样本数量(Ni)和植入的对抗性样本数量(Nb)来调节测试的难度,Ni越高则难度越大,Nb越高则难度越低。
  • 只有当攻击在修改后的模型上实现接近完美的对抗成功率(ASR),且显著优于随机基线(R-ASR)时,才视为通过测试。
  • 该测试应用于13个先前的防御方法;未能通过测试的攻击被认为过弱,无法信赖其用于鲁棒性评估。

实验结果

研究问题

  • RQ1能否开发一种系统性方法,用于检测在鲁棒性评估中无法找到已存在对抗性样本的弱对抗攻击?
  • RQ2如何设计一种测试,以确保对抗性样本的存在,从而验证攻击的强度?
  • RQ3当前的鲁棒性评估在多大程度上因攻击不够强而失败?这一问题能否被量化?
  • RQ4主动单元测试能否作为可信鲁棒性评估在防御研究中的必要条件?
  • RQ5防御作者如何将其适配于其特定架构或训练方法,以确保评估的严谨性?

主要发现

  • 所提出的主动测试成功识别出13篇先前经过同行评审的防御方法中11篇的弱评估,这些方法后来被更强攻击攻破。
  • 未能通过测试的攻击在所有情况下都高估了防御的鲁棒性,表明其弱到无法检测已知的对抗性样本。
  • 通过调整干净样本数量和植入的对抗性样本数量,可调节测试的难度,从而在挑战性与可靠性之间取得平衡。
  • 攻击必须在修改后的模型上实现接近完美的ASR,并显著优于随机基线,才能通过测试,从而确保其足够强大。
  • 该测试揭示,许多已发表的评估基于无法区分鲁棒与非鲁棒模型的攻击,严重削弱了其结论的可信度。
  • 作者建议在未来鲁棒性评估中将此类主动测试作为标准实践,以提高结果的可复现性与可信度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。