Skip to main content
QUICK REVIEW

[论文解读] Learning More Robust Features with Adversarial Training

Shuangtao Li, Yuanke Chen|arXiv (Cornell University)|Apr 20, 2018
Adversarial Robustness in Machine Learning参考文献 8被引用 17
一句话总结

本文提出了一种新颖的对抗训练方法,通过显式最小化神经网络隐藏层中的特征失真,以提升对对抗攻击的鲁棒性。通过在对抗损失中添加失真正则化项,该方法使网络能够学习到更具鲁棒性的特征,在MNIST和CIFAR-10上验证了其对FGSM和PGD攻击的显著抗性,同时增强了特征层面的鲁棒性。

ABSTRACT

In recent years, it has been found that neural networks can be easily fooled by adversarial examples, which is a potential safety hazard in some safety-critical applications. Many researchers have proposed various method to make neural networks more robust to white-box adversarial attacks, but an effective method have not been found so far. In this short paper, we focus on the robustness of the features learned by neural networks. We show that the features learned by neural networks are not robust, and find that the robustness of the learned features is closely related to the resistance against adversarial examples of neural networks. We also find that adversarial training against fast gradients sign method (FGSM) does not make the leaned features very robust, even if it can make the trained networks very resistant to FGSM attack. Then we propose a method, which can be seen as an extension of adversarial training, to train neural networks to learn more robust features. We perform experiments on MNIST and CIFAR-10 to evaluate our method, and the experiment results show that this method greatly improves the robustness of the learned features and the resistance to adversarial attacks.

研究动机与目标

  • 研究神经网络在对抗扰动下所学习特征的鲁棒性。
  • 识别标准对抗训练在提升特征鲁棒性方面的局限性,尽管其显著增强了模型层面的鲁棒性。
  • 开发一种直接增强内部特征表示鲁棒性的方法,以提升整体对抗防御能力。
  • 评估更鲁棒的特征是否能带来对更强攻击者(如PGD)的更强抵抗能力。
  • 提出并验证一种最小化对抗扰动引起的特征失真的训练目标。

提出的方法

  • 通过对比干净输入与对抗扰动输入之间归一化特征值的均方失真来度量特征鲁棒性。
  • 引入一种改进的对抗训练目标,添加失真正则化项:$\tilde{J}_{adv} = \alpha J(x,y) + (1-\alpha)J(x^*,y) + \sum_{i=1}^{L-1} \beta_i \sum_{j=1}^{h_i} d_{ij}$,其中$d_{ij}$为第i层第j个归一化特征的失真度。
  • 在训练期间使用FGSM高效生成对抗样本,尽管评估时使用PGD。
  • 对特征应用批量归一化,以确保失真度量的尺度不变性。
  • 采用逐层加权($\beta_i$),并为深层网络赋予更高的权重,以优先保证高层表示的鲁棒性。
  • 在MNIST和CIFAR-10上使用改进目标训练模型,并在干净数据集、FGSM扰动和PGD扰动测试集上进行评估。

实验结果

研究问题

  • RQ1标准训练和对抗训练的神经网络所学习的特征对输入扰动是否具有鲁棒性?
  • RQ2针对FGSM的对抗训练在多大程度上提升了所学习特征的鲁棒性?
  • RQ3在训练过程中显式最小化特征失真,是否能带来对更强攻击者(如PGD)的更好鲁棒性?
  • RQ4与标准对抗训练相比,所提出的失真正则化训练在特征层面和模型层面的鲁棒性方面表现如何?
  • RQ5特征鲁棒性的提升是否与对多样化对抗攻击的更强抵抗能力相关?

主要发现

  • 标准训练和FGSM对抗训练的网络所学习的特征对PGD攻击不具鲁棒性,表现为高均方失真值。
  • 针对FGSM的对抗训练虽略微提升了特征鲁棒性,但并未使特征变得高度鲁棒,尽管其显著提高了对FGSM攻击的模型准确率。
  • 所提出的方法比标准对抗训练更有效地降低了平均特征失真,尤其是在深层网络中。
  • 在MNIST上,所提方法在FGSM攻击下达到97.13%的准确率,在PGD攻击下达到91.71%,优于标准对抗训练(FGSM 94.92%,PGD 6.12%)。
  • 在CIFAR-10上,该方法在FGSM攻击下达到65.14%的准确率,在PGD攻击下达到34.40%,显著优于标准对抗训练(FGSM 85.26%,PGD 10.43%)。
  • 结果证实,更鲁棒的特征能带来对对抗攻击更强的防御能力,特别是对一阶攻击者(如PGD)具有显著优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。