[论文解读] Saliency Methods for Explaining Adversarial Attacks
本文指出,尽管先前有观点认为引导反向传播(GuidedBP)显著性图不具类别区分性,但该文发现其仍包含类别区分信息,并提出一种增强方法,通过在类别间归一化显著性图来增强这种区分信号。所提出的增强型GuidedBP在解释对抗性误分类方面达到当前最优性能,能够突出导致错误预测的特征,在定性和定量评估中均优于现有方法。
The classification decisions of neural networks can be misled by small imperceptible perturbations. This work aims to explain the misled classifications using saliency methods. The idea behind saliency methods is to explain the classification decisions of neural networks by creating so-called saliency maps. Unfortunately, a number of recent publications have shown that many of the proposed saliency methods do not provide insightful explanations. A prominent example is Guided Backpropagation (GuidedBP), which simply performs (partial) image recovery. However, our numerical analysis shows the saliency maps created by GuidedBP do indeed contain class-discriminative information. We propose a simple and efficient way to enhance the saliency maps. The proposed enhanced GuidedBP shows the state-of-the-art performance to explain adversary classifications.
研究动机与目标
- 解决深度神经网络中对抗性误分类缺乏可靠解释方法的问题。
- 通过展示未归一化梯度中隐藏的类别区分性信息,挑战‘GuidedBP产生非区分性显著性图’的既有观点。
- 开发一种简单、高效的GuidedBP增强方法,以提升其解释对抗性预测的能力。
- 评估增强型显著性图在识别导致对抗性误分类特征方面的有效性。
- 证明基于显著性图的扰动可部分恢复对抗样本上的模型性能。
提出的方法
- 该方法指出,GuidedBP图中的类别区分性信息被标准归一化方法掩盖,因为后者使各类别的显著性值范围趋于相等。
- 提出一种新的归一化方案,将显著性值相对于所有类别平均激活值进行计算,从而保留类别间的差异。
- 增强型显著性图定义为 $ \boldsymbol{s}^{m} = \frac{ \text{grad}_{\boldsymbol{x}} f^{m} }{ \text{mean}_{k} ( \text{grad}_{\boldsymbol{x}} f^{k} ) } $,其中梯度通过带ReLU过滤的反向传播计算。
- 通过在归一化前比较不同类别间的显著性值,增强区分性,确保相关性差异得以保留。
- 该方法应用于干净图像和对抗性图像,以分析模型注意力在扰动下的变化。
- 使用C&W攻击生成的对抗性样本,通过定性可视化和定量指标对方法进行评估。
实验结果
研究问题
- RQ1尽管先前有观点认为无关,GuidedBP显著性图是否仍包含类别区分性信息?
- RQ2能否通过保留梯度幅值的类别间差异,增强显著性图以更好地解释对抗性误分类?
- RQ3增强型GuidedBP在解释对抗性预测方面与现有显著性方法相比表现如何?
- RQ4基于显著性图的对抗性输入扰动能否恢复模型性能?
- RQ5在成功与失败的对抗性攻击中,显著性图突出显示了哪些特征?
主要发现
- 所提出的增强型GuidedBP显著提升了解释对抗性误分类的能力,能够突出导致错误预测的特征。
- 增强型GuidedBP的显著性图清晰显示:在干净图像中,模型关注正确物体部分(如头部);而在对抗性误分类图像中,模型则关注无关特征(如翅膀)。
- 该方法在解释对抗性攻击方面达到当前最优性能,在定性和定量评估中均优于现有显著性方法。
- 基于增强型显著性图的对抗性输入扰动,可使C&W攻击样本上的模型性能实现可测量的恢复。
- 过滤效应(正梯度的二值掩码)在各类别间几乎相同,但未归一化的显著性值差异揭示了类别区分性信息。
- 在成功攻击(Adv_s)中,显著性图聚焦于非相关特征(如秃鹰的翅膀);而在失败攻击(Adv_f)中,其正确突出目标物体(如头部),证实了该方法的对抗性区分能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。