Skip to main content
QUICK REVIEW

[论文解读] Interpreting Adversarial Examples with Attributes

Sadaf Gulshad, Jan Hendrik Metzen|arXiv (Cornell University)|Apr 17, 2019
Adversarial Robustness in Machine Learning参考文献 51被引用 6
一句话总结

本文提出一种方法,通过预测并定位类别特定的视觉属性(如颜色、形状和纹理)来解释对抗样本。通过按类别相关性和图像相关性对属性进行排序,模型能够解释误分类现象:对抗样本因网络预测并定位了与错误类别对齐的虚假属性而被误分类,而干净样本则因正确属性而得到合理解释。

ABSTRACT

Deep computer vision systems being vulnerable to imperceptible and carefully crafted noise have raised questions regarding the robustness of their decisions. We take a step back and approach this problem from an orthogonal direction. We propose to enable black-box neural networks to justify their reasoning both for clean and for adversarial examples by leveraging attributes, i.e. visually discriminative properties of objects. We rank attributes based on their class relevance, i.e. how the classification decision changes when the input is visually slightly perturbed, as well as image relevance, i.e. how well the attributes can be localized on both clean and perturbed images. We present comprehensive experiments for attribute prediction, adversarial example generation, adversarially robust learning, and their qualitative and quantitative analysis using predicted attributes on three benchmark datasets.

研究动机与目标

  • 通过分析驱动决策的底层视觉属性,理解深度神经网络为何会误分类对抗样本。
  • 使用视觉区分性属性,为干净样本和对抗样本的预测提供可解释的依据。
  • 通过将预测属性定位在图像区域上,弥合对抗鲁棒性与模型可解释性之间的差距。
  • 在具有不同属性粒度的基准数据集上,对标准模型和经过对抗训练的鲁棒模型进行评估。

提出的方法

  • 训练一个基于排序的属性预测头,将图像特征映射到类别属性空间,优先选择与预测类别最相关的属性。
  • 使用基于Faster R-CNN的物体部件检测器,通过边界框定位视觉证据,实现对预测属性的定位。
  • 将该框架应用于通过无目标攻击和有目标攻击(如FGSM、PGD)生成的干净图像和对抗样本。
  • 在三个基准数据集(CUB、AWA和LAD)上评估模型性能,这些数据集具有不同的属性粒度和类别相似性。
  • 对比标准模型与经过对抗训练的模型在属性预测和定位结果上的差异,以评估鲁棒性。
  • 通过类别相关性(当属性被扰动时预测结果的变化程度)和图像相关性(定位准确率)量化属性的相关性。

实验结果

研究问题

  • RQ1干净样本与对抗样本的预测属性有何不同?它们是否与正确类别或错误类别对齐?
  • RQ2属性定位能否揭示导致对抗样本误分类的视觉证据?
  • RQ3对抗鲁棒模型在多大程度上能恢复与干净样本相似的基于属性的解释?
  • RQ4在具有不同属性粒度(细粒度与粗粒度)的数据集中,属性预测与定位结果如何变化?

主要发现

  • 对抗样本被误分类,是因为模型预测并定位了与错误类别对齐的虚假属性,例如将大比目鱼误认为是白腹和白头,而正确属性应为‘红腹’和‘蓝头’的画眉鸟。
  • 在无目标攻击中,对抗样本在定位属性上与错误类别高度重叠,而干净样本则由其正确类别独有的属性得到支持。
  • 在有目标攻击中,对抗样本上的定位属性主要为目标类别的属性,而正确类别的属性则缺乏视觉证据。
  • 经过对抗训练的模型即使在对抗输入上,其属性预测和定位结果在视觉和语义上也更接近真实类别,表明其与正确推理的对齐性得到改善。
  • 在Awa和LAD等粗粒度数据集中,正确类别与对抗类别之间的属性重叠较少,导致定位属性的视觉区分更清晰。
  • ‘蓝头’和‘黑翼’等属性在对抗训练后的图像中被正确预测并准确定位,而在标准模型中则缺失或定位错误,证实了属性层面一致性的提升带来了更强的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。