Skip to main content
QUICK REVIEW

[论文解读] Defending Against Physically Realizable Attacks on Image Classification

Tong Wu, Liang Tong|arXiv (Cornell University)|Sep 20, 2019
Adversarial Robustness in Machine Learning参考文献 33被引用 12
一句话总结

本文提出了一种新颖的防御方法,以应对可物理实现的对抗性攻击,通过引入矩形遮挡攻击(DOA)这一新型抽象模型,模拟现实世界中的物理攻击(如贴纸或眼镜框)。该方法利用DOA生成的对抗性样本进行对抗性训练,使模型对这类攻击具备更强的鲁棒性,在人脸识别和交通标志分类任务中,其鲁棒性显著优于标准对抗性训练或随机平滑方法。

ABSTRACT

We study the problem of defending deep neural network approaches for image classification from physically realizable attacks. First, we demonstrate that the two most scalable and effective methods for learning robust models, adversarial training with PGD attacks and randomized smoothing, exhibit very limited effectiveness against three of the highest profile physical attacks. Next, we propose a new abstract adversarial model, rectangular occlusion attacks, in which an adversary places a small adversarially crafted rectangle in an image, and develop two approaches for efficiently computing the resulting adversarial examples. Finally, we demonstrate that adversarial training using our new attack yields image classification models that exhibit high robustness against the physically realizable attacks we study, offering the first effective generic defense against such attacks.

研究动机与目标

  • 解决现有防御方法在应对可物理实现的对抗性攻击(如停车标志上的贴纸或对抗性眼镜框)方面的不足。
  • 评估现有鲁棒学习方法(基于PGD的对抗性训练与随机平滑)在真实世界物理攻击下的局限性。
  • 提出一种新的攻击模型——矩形遮挡攻击(DOA),更准确地捕捉物理对抗性扰动的约束与特征。
  • 证明基于DOA的对抗性训练可显著提升模型对真实世界物理攻击的鲁棒性,优于传统防御方法。

提出的方法

  • 提出一种新型抽象对抗性模型——矩形遮挡攻击(DOA),其中攻击者在图像上放置一个小型、经对抗性设计的矩形(贴纸)。
  • 设计高效算法,通过同时优化矩形的位置与内容,以最大化分类错误,从而计算对抗性遮挡。
  • 使用DOA模型生成的对抗性样本,通过标准对抗性训练流程训练深度神经网络。
  • 采用穷举搜索与基于梯度的搜索策略生成DOA样本用于训练,实现可扩展且高效的防御学习。
  • 在两个真实世界的物理攻击场景中评估该防御方法:使用对抗性眼镜框进行人脸识别,以及使用贴纸攻击进行交通标志分类。
  • 在相同物理攻击设置下,将DOA训练模型的性能与基于$l_p$-范数的攻击(PGD、$l_{ u}$)和随机平滑训练的模型进行比较。

实验结果

研究问题

  • RQ1标准鲁棒训练方法(基于PGD的对抗性训练与随机平滑)在应对如眼镜框和贴纸等可物理实现的攻击时效果如何?
  • RQ2能否通过一种更符合物理约束(特别是矩形遮挡)的新对抗性攻击模型,提升图像分类器的鲁棒性?
  • RQ3与现有防御方法相比,使用所提出的DOA模型进行对抗性训练是否能显著提升模型对真实世界物理攻击的鲁棒性?
  • RQ4DOA防御在其他非矩形的物理攻击模式(如三角形或心形遮罩)下是否具备良好的泛化能力?
  • RQ5当在数字域中测试$l_p$-范数有界的攻击(如PGD)时,DOA防御的鲁棒性在多大程度上仍然有效?

主要发现

  • 基于PGD的对抗性训练与随机平滑方法在物理攻击下效果有限,鲁棒性显著下降(例如,干净准确率从约98%降至物理贴纸攻击下的<5%)。
  • 基于DOA的防御在对抗性眼镜框攻击下,人脸识别任务的鲁棒性达到100%,显著优于PGD训练模型(ε=2时鲁棒性为44.04%)和随机平滑模型(ε=2时鲁棒性为39.79%)。
  • 在交通标志分类任务中,DOA训练模型在物理贴纸攻击下保持95.59%的准确率,而PGD训练模型为91.20%,原始模型为89.54%。
  • DOA训练模型对其他遮挡模式(如大号三角形和心形遮罩)也表现出良好的泛化能力,即使这些形状占据图像的8%时仍保持高鲁棒性。
  • DOA对$l_{ u}$-有界PGD攻击(如ε=8时鲁棒性为33.40%)无效,证实其专门针对物理、局部化且稀疏的扰动设计。
  • DOA防御在$l_0$-约束攻击(如JSMA)下仍有效,且相比原始模型鲁棒性有所提升,表明其对稀疏性约束攻击具有更广泛的应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。