Skip to main content
QUICK REVIEW

[论文解读] A3T: Adversarially Augmented Adversarial Training

Akram Erraqabi, Aristide Baratin|arXiv (Cornell University)|Jan 12, 2018
Adversarial Robustness in Machine Learning参考文献 15被引用 7
一句话总结

该论文提出A3T,一种新型对抗训练方法,通过训练判别器以区分真实与对抗性特征表示,从而在隐藏层中实现不变性,增强深度神经网络的鲁棒性。该方法在对抗性MNIST样本上实现了96.10%的准确率,优于标准对抗训练,并通过联合优化分类器与判别器实现了更好的泛化性能。

ABSTRACT

Recent research showed that deep neural networks are highly sensitive to so-called adversarial perturbations, which are tiny perturbations of the input data purposely designed to fool a machine learning classifier. Most classification models, including deep learning models, are highly vulnerable to adversarial attacks. In this work, we investigate a procedure to improve adversarial robustness of deep neural networks through enforcing representation invariance. The idea is to train the classifier jointly with a discriminator attached to one of its hidden layer and trained to filter the adversarial noise. We perform preliminary experiments to test the viability of the approach and to compare it to other standard adversarial training methods.

研究动机与目标

  • 解决深度神经网络对不可察觉的对抗扰动的脆弱性,此类扰动虽难以察觉却会导致误分类。
  • 通过在对抗噪声下强制网络隐藏表示的不变性来提升鲁棒性。
  • 引入一种双训练机制,其中判别器学习检测对抗性特征,而分类器则学习即使在对抗性输入下也生成类似真实样本的表示。
  • 证明将对抗训练与通过判别器实现的表示不变性相结合,可在标准基准上实现更好的鲁棒性。

提出的方法

  • 在隐藏层ℓ处附加一个判别器分支训练分类器,该判别器将特征分类为真实(t=1)或对抗性(t=0)。
  • 利用判别器提供损失信号,以促使编码器在真实与对抗性输入下产生不变的表示。
  • 使用混合损失优化分类器:对真实数据分类使用交叉熵损失,对对抗性样本则使用对抗损失以欺骗判别器。
  • 使用二元交叉熵损失训练判别器,以区分真实特征(z = E(x))与对抗性特征(z = E(x^adv))。
  • 通过在分类损失中使用真实与对抗性数据的凸组合(α = 0.5)将该方法与标准对抗训练相结合。
  • 为编码器引入独立损失项:−β log D(E(x^adv)),其中β控制不变性强制的强度。

实验结果

研究问题

  • RQ1通过判别器强制隐藏表示中的不变性是否能提升对抗鲁棒性?
  • RQ2与标准对抗训练相比,所提出的A3T方法在对抗样本上的泛化能力如何?
  • RQ3将对抗训练与表示级不变性相结合,是否能比单独使用任一方法获得更好的鲁棒性?
  • RQ4性能对超参数(如β(不变性强度)和ε(扰动幅度))的敏感性如何?

主要发现

  • 在干净MNIST数据上,A3T实现了98.72%的测试准确率,当仅考虑干净数据时,优于标准对抗训练(98.89%)。
  • 在ε = 0.1的对抗样本上,A3T实现了96.10%的准确率,优于标准对抗训练(94.45%)和A2T(89.74%)。
  • 该方法表明,通过判别器强制实现特征不变性可产生更鲁棒的表示,即使分类器未显式在对抗样本上进行训练亦然。
  • 将基于判别器的不变性损失(β = 1)与标准对抗训练(α = 0.5)结合,取得了最佳整体性能。
  • 判别器成功学习到区分真实与对抗性特征,表明该方法有效捕捉了隐藏表示中的分布差异。
  • 该方法在MNIST上展示了概念验证的可行性,表明经进一步调优后,有望扩展至更大数据集和架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。