Skip to main content
QUICK REVIEW

[论文解读] Detecting Adversarial Perturbations with Saliency

Chiliang Zhang, Zhimou Yang|arXiv (Cornell University)|Mar 23, 2018
Adversarial Robustness in Machine Learning参考文献 28被引用 3
一句话总结

本文提出一种基于显著性的二分类器,通过利用真实样本与对抗样本显著图之间的差异来检测对抗样本。该方法使用基于梯度的显著图,在干净图像和扰动图像上进行训练,在MNIST上实现100%检测准确率,在CIFAR-10和ImageNet子集上超过90%的准确率,涵盖多种攻击类型,展现出从强对抗攻击到弱对抗攻击的强泛化能力。

ABSTRACT

In this paper we propose a novel method for detecting adversarial examples by training a binary classifier with both origin data and saliency data. In the case of image classification model, saliency simply explain how the model make decisions by identifying significant pixels for prediction. A model shows wrong classification output always learns wrong features and shows wrong saliency as well. Our approach shows good performance on detecting adversarial perturbations. We quantitatively evaluate generalization ability of the detector, showing that detectors trained with strong adversaries perform well on weak adversaries.

研究动机与目标

  • 解决深度神经网络对肉眼难以察觉但导致误分类的对抗样本的脆弱性。
  • 通过利用干净输入与对抗输入在显著图中内在模型行为的差异,提升检测鲁棒性。
  • 开发一种在不同攻击强度和类型间具有良好泛化能力的检测器,尤其在从强对抗攻击到弱对抗攻击之间。
  • 评估检测器对能够绕过现有检测方法的自适应第二轮攻击的抗性。

提出的方法

  • 该方法使用原始图像及其对抗样本作为训练数据,输入特征源自基于梯度的显著图。
  • 显著图通过模型输出对输入图像的梯度计算得到,突出显示对分类最具影响力的像素。
  • 检测器被训练以区分干净样本(具有正确显著图)与对抗样本(具有扭曲显著图),利用对抗样本会引发错误特征关注的特性。
  • 该方法在MNIST、CIFAR-10和ImageNet子集上使用标准深度学习训练流程,配合Adam优化器,超参数根据数据集分别调优。
  • 在多种攻击类型下评估检测器:FGSM、迭代FGSM(l∞和l2)、JSMA和C&W,使用不同的扰动边界(ε)。
  • 通过在强对抗样本(如高ε)上训练并在弱对抗样本(如低ε)上评估,以及反向测试,来验证泛化能力。

实验结果

研究问题

  • RQ1显著图能否通过揭示深度神经网络中错误的特征关注,有效暴露对抗扰动?
  • RQ2在强对抗样本上训练的检测器是否能良好泛化到弱对抗样本,表明其鲁棒性和可迁移性?
  • RQ3所提出的方法能否抵抗针对现有检测机制设计的第二轮攻击?
  • RQ4检测器在不同数据集(MNIST、CIFAR-10、ImageNet)和攻击类型下的表现如何?

主要发现

  • 在MNIST数据集上,检测器在所有测试的对抗攻击中均实现了100%的检测准确率。
  • 在CIFAR-10上,检测器在FGSM、迭代(l∞和l2)、JSMA和C&W攻击中均保持超过90%的准确率。
  • 在ImageNet子集上,检测器达到89.83%的测试准确率,并在所有攻击类型和扰动水平下保持超过80%的检测性能。
  • 在强对抗样本(如高ε)上训练的检测器能良好泛化到弱对抗样本,但反之则不然,证实了其强大的泛化能力。
  • 检测器对第二轮攻击依然有效,因为现有自适应攻击无法生成能绕过该检测器的有效对抗样本。
  • 基于显著图的检测方法在泛化能力和鲁棒性方面优于标准的N+1检测方法,尤其在可迁移性和自适应攻击场景下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。