Skip to main content
QUICK REVIEW

[论文解读] Jacobian Adversarially Regularized Networks for Robustness

Alvin Chan, Yi Tay|PolyPublie (École Polytechnique de Montréal)|Dec 21, 2019
Adversarial Robustness in Machine Learning参考文献 33被引用 8
一句话总结

该论文提出Jacobian对抗正则化网络(JARN),一种通过对抗正则化使分类器生成的雅可比矩阵显著性与输入图像相似,从而增强对抗鲁棒性的方法。通过判别器强制雅可比矩阵与真实图像相似,JARN在MNIST、SVHN和CIFAR-10上实现了更高的鲁棒准确率,且无需使用对抗训练样本,同时在与对抗训练结合时可提供附加的鲁棒性提升。

ABSTRACT

Adversarial examples are crafted with imperceptible perturbations with the intent to fool neural networks. Against such attacks, adversarial training and its variants stand as the strongest defense to date. Previous studies have pointed out that robust models that have undergone adversarial training tend to produce more salient and interpretable Jacobian matrices than their non-robust counterparts. A natural question is whether a model trained with an objective to produce salient Jacobian can result in better robustness. This paper answers this question with affirmative empirical results. We propose Jacobian Adversarially Regularized Networks (JARN) as a method to optimize the saliency of a classifier's Jacobian by adversarially regularizing the model's Jacobian to resemble natural training images. Image classifiers trained with JARN show improved robust accuracy compared to standard models on the MNIST, SVHN and CIFAR-10 datasets, uncovering a new angle to boost robustness without using adversarial training examples.

研究动机与目标

  • 探究提升分类器输入雅可比矩阵显著性是否能够增强对抗鲁棒性。
  • 开发一种在训练过程中无需对抗样本的防御机制,为鲁棒性提供新途径。
  • 探索雅可比显著性——对抗训练的副产品——是否可作为主要训练目标。
  • 在多个数据集和防御设置下评估所提方法的鲁棒性与效率。

提出的方法

  • JARN引入一种对抗正则化损失,促使分类器的输入雅可比矩阵与原始输入图像相似。
  • 训练一个判别器网络,以区分真实输入图像与分类器对应的雅可比矩阵。
  • 优化分类器以欺骗判别器,使其将雅可比矩阵分类为真实图像,从而促进生成显著且结构化的雅可比输出。
  • 使用标准经验风险最小化方法端到端训练,损失函数包含交叉熵与对抗正则化损失的组合。
  • 正则化项通过超参数λ_adv加权,控制雅可比矩阵与输入图像对齐的强度。
  • 该方法与标准训练和对抗训练兼容,可实现附加的鲁棒性增益。

实验结果

研究问题

  • RQ1提升分类器输入雅可比矩阵的显著性是否能带来更高的对抗鲁棒性?
  • RQ2雅可比显著性是否可作为独立于对抗训练样本的鲁棒性主要训练目标?
  • RQ3所提出的对抗正则化框架是否能稳定训练并在不同数据集上泛化?
  • RQ4与标准对抗训练方法相比,JARN在鲁棒性与效率方面表现如何?
  • RQ5JARN的鲁棒性是否源于梯度遮蔽,而非真正的对抗鲁棒性?

主要发现

  • JARN在MNIST、SVHN和CIFAR-10上实现了比标准模型更高的鲁棒准确率,且训练过程中未使用对抗样本。
  • 当与FGSM对抗训练结合时,JARN-AT1表现出具有竞争力的鲁棒性,某些情况下优于标准的PGD-AT7。
  • JARN将训练时间缩短至7步PGD对抗训练的一半以下,CIFAR-10上每轮仅需217秒,而PGD-AT7需704秒。
  • JARN模型的雅可比矩阵在视觉上更具显著性,且与输入图像的相似度高于标准模型,尤其能覆盖更广泛的图像区域。
  • JARN对黑盒迁移攻击表现出鲁棒性,其准确率高于白盒攻击,表明其不依赖于梯度遮蔽。
  • JARN在一系列超参数范围内表现稳定,表明其训练动态稳健,归因于真实图像与雅可比矩阵配对的训练方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。