Skip to main content
QUICK REVIEW

[论文解读] Attribution-driven Causal Analysis for Detection of Adversarial Examples

Susmit Jha, Sunny Raj|arXiv (Cornell University)|Mar 14, 2019
Adversarial Robustness in Machine Learning参考文献 34被引用 8
一句话总结

本文提出了一种新颖的、无需训练的对抗样本防御方法,通过基于归因的因果分析实现:它通过集成梯度法逐步遮蔽模型解释中高归因特征,以检测对抗性输入。关键发现是,对抗性样本——尤其是可物理实现的对抗性样本——对这种遮蔽极为敏感,而良性输入则保持鲁棒,从而在多种攻击类型(包括FGSM、PGD、CW和对抗性补丁)下实现超过98%的检测准确率。

ABSTRACT

Attribution methods have been developed to explain the decision of a machine learning model on a given input. We use the Integrated Gradient method for finding attributions to define the causal neighborhood of an input by incrementally masking high attribution features. We study the robustness of machine learning models on benign and adversarial inputs in this neighborhood. Our study indicates that benign inputs are robust to the masking of high attribution features but adversarial inputs generated by the state-of-the-art adversarial attack methods such as DeepFool, FGSM, CW and PGD, are not robust to such masking. Further, our study demonstrates that this concentration of high-attribution features responsible for the incorrect decision is more pronounced in physically realizable adversarial examples. This difference in attribution of benign and adversarial inputs can be used to detect adversarial examples. Such a defense approach is independent of training data and attack method, and we demonstrate its effectiveness on digital and physically realizable perturbations.

研究动机与目标

  • 为解决检测那些难以察觉却会误导深度学习模型的对抗性样本这一关键空白。
  • 探究对抗性样本在归因空间中的鲁棒性,其中模型决策通过特征重要性进行解释。
  • 开发一种独立于训练数据和攻击特异性知识的防御机制,仅依赖于模型解释。
  • 评估在因果邻域中对高归因特征进行逐步遮蔽时,对抗性样本的鲁棒性。
  • 证明由于归因集中于局部区域,可物理实现的对抗性扰动比数字扰动更具可检测性。

提出的方法

  • 使用集成梯度法计算给定输入的特征归因,为模型决策中的每个输入特征(如像素)分配重要性得分。
  • 通过迭代遮蔽归因值最高的前-k%特征来定义因果邻域,从最高归因值开始。
  • 评估在逐步遮蔽下的模型预测稳定性:良性输入保持原始标签,而对抗性输入则频繁改变标签。
  • 将遮蔽过程应用于数字对抗性样本(如FGSM、PGD、CW、DeepFool)和可物理实现的对抗性补丁(如香蕉、烤土司、棒球补丁)。
  • 将模型预测发生变化的点作为对抗性本质的指示器,早期标签变化表明高度脆弱性。
  • 构建两级认知模型:系统1(原始DNN)和系统2(基于归因的分析),两者均需被欺骗才能构成成功攻击。

实验结果

研究问题

  • RQ1对抗性样本在归因空间中对高归因特征的逐步遮蔽是否具有鲁棒性?
  • RQ2在遮蔽下,对抗性样本的归因分布与良性输入有何不同?
  • RQ3通过归因遮蔽定义的因果邻域能否作为对抗性样本的可靠检测机制?
  • RQ4可物理实现的对抗性补丁中高归因特征的局部集中是否使其比数字扰动更具可检测性?
  • RQ5该防御方法在不掌握攻击类型或训练数据的情况下,对多种攻击类型的适用性如何?

主要发现

  • 仅遮蔽0.4%的最高归因像素即可检测到99.71%的基于香蕉补丁的对抗性样本,98.14%的烤土司补丁样本,以及99.20%的棒球补丁样本。
  • 由FGSM、PGD、CW和DeepFool攻击生成的对抗性样本在极小遮蔽量(如0.2%至4%的最高归因特征)下即表现出显著的标签变化,表明其在归因空间中具有高度敏感性。
  • 良性输入在遮蔽最高归因特征的4%以内时仍保持鲁棒,所有测试情况下均维持原始标签。
  • 由于高归因特征更集中,更小的对抗性补丁尺寸可提升检测率,表明物理可实现性与归因空间鲁棒性之间存在权衡。
  • 即使在小尺寸补丁(图像面积的25%)下,该方法仍能检测到超过98%的对抗性补丁攻击,证明其在真实世界物理威胁模型中的有效性。
  • 该防御方法在多种攻击类型下均有效,且无需访问训练数据或具体攻击方法的知识,具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。