Skip to main content
QUICK REVIEW

[论文解读] Evaluating Robustness to Context-Sensitive Feature Perturbations of Different Granularities

Isaac Dunn, Laura Hanu|arXiv (Cornell University)|Jan 29, 2020
Adversarial Robustness in Machine Learning参考文献 58被引用 9
一句话总结

本文提出一种方法,通过在生成神经网络中对潜在激活进行扰动,生成不同粒度的上下文敏感特征扰动,以评估深度学习模型的鲁棒性。研究发现,针对像素空间扰动的对抗训练不仅未能提升对粗粒度、语义上有意义变化的鲁棒性,反而会显著削弱这种鲁棒性,挑战了‘一种领域内的鲁棒性可泛化到其他领域’的假设。

ABSTRACT

We cannot guarantee that training datasets are representative of the distribution of inputs that will be encountered during deployment. So we must have confidence that our models do not over-rely on this assumption. To this end, we introduce a new method that identifies context-sensitive feature perturbations (e.g. shape, location, texture, colour) to the inputs of image classifiers. We produce these changes by performing small adjustments to the activation values of different layers of a trained generative neural network. Perturbing at layers earlier in the generator causes changes to coarser-grained features; perturbations further on cause finer-grained changes. Unsurprisingly, we find that state-of-the-art classifiers are not robust to any such changes. More surprisingly, when it comes to coarse-grained feature changes, we find that adversarial training against pixel-space perturbations is not just unhelpful: it is counterproductive.

研究动机与目标

  • 评估图像分类器对反映真实分布偏移的、上下文敏感且粒度可变的特征扰动的鲁棒性。
  • 探究对细粒度像素扰动的鲁棒性是否能泛化到图像特征中的高层、语义上有意义的变化。
  • 评估旨在提升对有界像素扰动鲁棒性的对抗训练,是否会无意中损害对粗粒度、上下文敏感变化的鲁棒性。
  • 开发一种通过在不同层操纵预训练生成模型的潜在激活来生成合理且语义一致的扰动的方法。

提出的方法

  • 在预训练的生成神经网络中扰动潜在激活值,以在生成图像中引起上下文敏感的特征变化。
  • 通过选择生成器中修改激活的层来控制扰动的粒度:越早的层产生越粗粒度的变化,越晚的层产生越细粒度的变化。
  • 使用基于梯度的优化过程,寻找能引起目标误分类且保持感知合理性的最小扰动。
  • 通过测量在不断增加的扰动幅度下导致误分类的扰动比例来评估模型鲁棒性。
  • 引入人工判断以过滤掉未实质性改变真实图像标签的扰动,确保仅考虑语义相关的改变。
  • 在不同扰动粒度下对比标准训练和对抗训练的ImageNet与MNIST分类器。

实验结果

研究问题

  • RQ1针对有界像素扰动的对抗训练是否能提升对上下文敏感的高层特征变化的鲁棒性?
  • RQ2最先进图像分类器在不同粒度的上下文敏感特征扰动下的鲁棒性如何变化?
  • RQ3保持语义一致性的上下文敏感扰动是否比标准的像素级扰动更能有效暴露模型的脆弱性?
  • RQ4对细粒度纹理和颜色变化的鲁棒性在多大程度上能泛化到对粗粒度形状和结构变化的鲁棒性?

主要发现

  • 最先进图像分类器对任何粒度的上下文敏感特征扰动均不鲁棒,表明其对分布偏移存在根本性脆弱性。
  • 针对像素空间扰动的对抗训练不仅未能提升对粗粒度、上下文敏感变化的鲁棒性,反而显著降低了这种鲁棒性。
  • 在MNIST上,对抗训练提升了对细粒度扰动(生成器最后四层)的鲁棒性,但对粗粒度变化(前四层)无任何改善,证实了该趋势在更大规模上的存在。
  • 对抗训练无法提升对粗粒度特征的鲁棒性,表明此类模型可能更依赖粗粒度特征,因而对语义层面的分布偏移更加敏感。
  • 通过潜在空间操作生成的扰动能产生语义上合理的改变(如改变物体形状或场景结构),相比标准的ℓp-范数有界扰动,更具现实性和信息量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。