Skip to main content
QUICK REVIEW

[论文解读] Robust Feature-Level Adversaries are Interpretability Tools

Stephen Casper, Max Nadeau|arXiv (Cornell University)|Oct 7, 2021
Adversarial Robustness in Machine Learning被引用 9
一句话总结

本文提出了一种鲁棒的、可解释的特征级对抗样本,具有高度通用性,可在 ImageNet 规模下实现目标攻击、通用攻击、伪装攻击、物理可实现攻击以及黑盒攻击。通过操纵图像生成器的潜在表征,该方法生成的对抗性特征具有可感知性和可描述性(例如,彩色圆圈),可用于诊断模型中脆弱的特征-类别关联,并设计有效的复制/粘贴攻击,展示了其在模型可解释性方面的强大诊断能力。

ABSTRACT

The literature on adversarial attacks in computer vision typically focuses on pixel-level perturbations. These tend to be very difficult to interpret. Recent work that manipulates the latent representations of image generators to create "feature-level" adversarial perturbations gives us an opportunity to explore perceptible, interpretable adversarial attacks. We make three contributions. First, we observe that feature-level attacks provide useful classes of inputs for studying representations in models. Second, we show that these adversaries are uniquely versatile and highly robust. We demonstrate that they can be used to produce targeted, universal, disguised, physically-realizable, and black-box attacks at the ImageNet scale. Third, we show how these adversarial images can be used as a practical interpretability tool for identifying bugs in networks. We use these adversaries to make predictions about spurious associations between features and classes which we then test by designing "copy/paste" attacks in which one natural image is pasted into another to cause a targeted misclassification. Our results suggest that feature-level attacks are a promising approach for rigorous interpretability research. They support the design of tools to better understand what a model has learned and diagnose brittle feature associations. Code is available at https://github.com/thestephencasper/feature_level_adv

研究动机与目标

  • 开发对人类可解释的对抗攻击,超越不可察觉的像素级扰动。
  • 创建在多种条件下(包括物理世界部署)均鲁棒且通用的对抗样本。
  • 利用这些对抗样本作为实用的可解释性工具,诊断深度神经网络中虚假的特征-类别关联。
  • 通过利用模型学习到的弱点的针对性复制/粘贴攻击,验证这些攻击的诊断能力。

提出的方法

  • 该方法通过优化预训练图像生成器的潜在码,生成视觉上一致、高层级的特征,从而产生对抗性特征,使目标分类器产生误判。
  • 不仅通过微小扰动,还通过正则化手段确保对抗性特征具有伪装性(例如,外观像交通灯)和感知上的合理性。
  • 通过利用生成器合成多样化、逼真的图像块的能力,支持多种攻击类型:目标攻击、通用攻击、物理可实现攻击和黑盒攻击。
  • 引入一种新颖的评估范式,即‘复制/粘贴’攻击,将对抗性补丁粘贴到自然图像中,以在自然情境下测试模型的误分类表现。
  • 该方法利用预训练的基于 GAN 的生成器(例如,StyleGAN)来合成对抗性特征,同时保持图像质量和语义一致性。
  • 通过结合对抗损失、感知损失和伪装正则化,确保生成的特征既有效又可被人类描述。

实验结果

研究问题

  • RQ1能否使特征级对抗样本足够鲁棒和通用,以在 ImageNet 规模下支持目标攻击、通用攻击和物理可实现攻击?
  • RQ2可解释的、人类可描述的对抗性特征在多大程度上能揭示深度神经网络中脆弱或虚假的特征-类别关联?
  • RQ3通过潜在空间操纵生成的对抗样本能否用于设计有效的复制/粘贴攻击,从而在自然图像情境中利用模型的弱点?
  • RQ4在模型可解释性的诊断效用方面,这些特征级对抗攻击与传统像素级攻击相比如何?
  • RQ5此类对抗样本能否以系统化、可复现的方式用于识别和验证社会有害偏见或模型失败?

主要发现

  • 该方法成功生成了在感知上一致且易于描述的特征级对抗补丁,例如彩色圆圈,使 ResNet50 模型将蜜蜂误分类为苍蝇的置信度达到 97%。
  • 使用生成的对抗性补丁(例如,交通灯)插入蜜蜂图像的复制/粘贴攻击,使模型对错误类别的置信度从 55% 提升至 97%,验证了对抗性特征的实际可利用性。
  • 这些攻击在多种条件下表现出鲁棒性,包括不同的背景、视角和物理部署环境,证实了其物理可实现性和通用性。
  • 对抗性样本揭示了交通灯的存在与将蜜蜂误分类为苍蝇之间存在虚假关联,该发现随后通过针对性的复制/粘贴实验得到确认。
  • 在这些特征级对抗样本上进行对抗训练可提升模型的鲁棒性,表明其在超越像素级攻击的通用对抗鲁棒性方面具有价值。
  • 该方法促进了对社会有害偏见的发现,例如模型对特定视觉模式的过度依赖,这些偏见通过可解释性框架被诊断并验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。