Skip to main content
QUICK REVIEW

[论文解读] On the Benefits of Models with Perceptually-Aligned Gradients

Gunjan Aggarwal, Abhishek Sinha|arXiv (Cornell University)|May 4, 2020
Adversarial Robustness in Machine Learning参考文献 11被引用 5
一句话总结

本文表明,使用低扰动边界(例如 ε = 1.0/255)进行对抗训练的模型,尽管缺乏强对抗鲁棒性,仍会产生与感知对齐的梯度——即梯度在视觉上与目标类别相似。这些模型在零样本迁移和弱监督定位任务上的表现优于标准训练和高ε对抗训练的模型。

ABSTRACT

Adversarial robust models have been shown to learn more robust and interpretable features than standard trained models. As shown in [\cite{tsipras2018robustness}], such robust models inherit useful interpretable properties where the gradient aligns perceptually well with images, and adding a large targeted adversarial perturbation leads to an image resembling the target class. We perform experiments to show that interpretable and perceptually aligned gradients are present even in models that do not show high robustness to adversarial attacks. Specifically, we perform adversarial training with attack for different max-perturbation bound. Adversarial training with low max-perturbation bound results in models that have interpretable features with only slight drop in performance over clean samples. In this paper, we leverage models with interpretable perceptually-aligned features and show that adversarial training with low max-perturbation bound can improve the performance of models for zero-shot and weakly supervised localization tasks.

研究动机与目标

  • 探究在低对抗扰动边界(ε)下训练的模型是否仍表现出与感知对齐的梯度。
  • 评估此类模型在零样本迁移和弱监督定位等下游任务上的性能表现。
  • 确定即使缺乏强鲁棒性,与感知对齐的梯度是否仍能增强泛化能力和可解释性。
  • 将低ε对抗训练模型与标准训练模型及高ε对抗训练模型在下游任务上进行比较。

提出的方法

  • 在CIFAR-10、SVHN、MNIST、USPS和受限ImageNet数据集上,使用FGSM和PGD攻击,对不同ℓ∞范数边界(ε ∈ {1.0, 2.0, 4.0, 8.0}/255)进行对抗训练。
  • 通过梯度可视化评估梯度与输入图像之间的感知对齐程度。
  • 应用大规模无目标PGD攻击(ε = 32.0/255),以检验对抗样本是否仍与目标类别相似。
  • 通过源数据集和目标数据集的验证准确率,评估从SVHN到MNIST以及从MNIST到USPS的零样本迁移性能。
  • 在CUB数据集上使用基于Grad-CAM的边界框估计和IoU指标,进行弱监督目标定位(WSOL)。
  • 通过Top-1准确率、已知真实框的定位准确率以及IoU > 0.5阈值下的Top-1定位准确率,对不同模型进行比较。

实验结果

研究问题

  • RQ1在低对抗扰动边界(ε)下训练的模型是否仍表现出与感知对齐的梯度,即使其鲁棒性不高?
  • RQ2具有与感知对齐梯度的模型是否能提升零样本迁移学习任务的性能?
  • RQ3此类模型在弱监督目标定位任务中是否优于自然训练模型和高ε对抗训练模型?
  • RQ4梯度的感知对齐是否为一种可泛化的特性,能够增强下游任务的泛化能力?

主要发现

  • 使用低ε(如 ε = 1.0/255)对抗训练的模型表现出与感知对齐的梯度,当扰动输入时,梯度在视觉上与目标类别相似。
  • 尽管对抗鲁棒性较低(例如在ε = 4.0/255时PGD准确率为34.33%),这些模型仍保持较高的干净数据集测试准确率(在CIFAR-10上为90.95%)。
  • 在SVHN → MNIST零样本任务中,AT-1模型达到75.99%的目标准确率,超过自然模型的53.98%和高ε模型。
  • 在MNIST → USPS零样本任务中,AT-0.05模型达到81.81%的目标准确率,优于自然模型(75.14%)和高ε模型。
  • 在CUB数据集的弱监督定位任务中,AT-0.5模型达到77.93%的Top-1定位准确率,优于自然ResNet50(50.0%)及其他AT模型。
  • 低ε模型中与感知对齐的梯度,使得即使在大扰动(ε = 32.0/255)下,生成的对抗样本在视觉上仍与目标类别相似,而自然模型则产生随机噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。