Skip to main content
QUICK REVIEW

[论文解读] Towards Rapid and Robust Adversarial Training with One-Step Attacks

Leo Schwinn, René Raab|arXiv (Cornell University)|Feb 24, 2020
Adversarial Robustness in Machine Learning参考文献 32被引用 5
一句话总结

本文提出一种快速且鲁棒的对抗训练方法,通过在输入中注入噪声增强单步FGSM攻击,有效防止梯度混淆,实现与PGD方法相当或更优的鲁棒性,同时显著降低计算成本。

ABSTRACT

Adversarial training is the most successful empirical method for increasing the robustness of neural networks against adversarial attacks. However, the most effective approaches, like training with Projected Gradient Descent (PGD) are accompanied by high computational complexity. In this paper, we present two ideas that, in combination, enable adversarial training with the computationally less expensive Fast Gradient Sign Method (FGSM). First, we add uniform noise to the initial data point of the FGSM attack, which creates a wider variety of adversaries, thus prohibiting overfitting to one particular perturbation bound. Further, we add a learnable regularization step prior to the neural network, which we call Pixelwise Noise Injection Layer (PNIL). Inputs propagated trough the PNIL are resampled from a learned Gaussian distribution. The regularization induced by the PNIL prevents the model form learning to obfuscate its gradients, a factor that hindered prior approaches from successfully applying one-step methods for adversarial training. We show that noise injection in conjunction with FGSM-based adversarial training achieves comparable results to adversarial training with PGD while being considerably faster. Moreover, we outperform PGD-based adversarial training by combining noise injection and PNIL.

研究动机与目标

  • 解决基于PGD的对抗训练计算成本过高的问题,该问题限制了其在实际部署中的应用。
  • 克服标准FGSM训练在面对更强攻击时泛化能力差的问题,其根本原因在于梯度混淆。
  • 通过可学习的噪声注入实现输入级数据增强,提升单步对抗训练的鲁棒性。
  • 实现稳定且高效的基于FGSM的训练,其性能可匹配或超越PGD方法,同时大幅缩短训练时间。

提出的方法

  • 通过在FGSM攻击前向输入添加均匀噪声,提出噪声增强的FGSM(NFGSM),以多样化扰动并减少对单一扰动边界的过拟合。
  • 提出可学习的像素级噪声注入层(PNIL),利用重参数化技巧从学习到的高斯分布中重采样输入特征。
  • 端到端地通过反向传播训练PNIL,使网络能够学习到最优的输入方差分布,从而增强鲁棒性。
  • 将PNIL作为网络的第一层,对输入进行正则化,削弱对抗扰动在传播过程中的影响。
  • 结合NFGSM与PNIL,稳定基于FGSM的训练过程,防止梯度混淆,这是以往单步方法的主要失败模式。
  • 避免使用KL散度损失(与VAE不同),转而依赖网络的分类损失来指导PNIL参数的学习。

实验结果

研究问题

  • RQ1当引入输入级数据增强时,单步FGSM对抗训练能否实现与多步PGD训练相当的鲁棒性?
  • RQ2在输入空间中注入噪声是否能防止梯度混淆,这是FGSM训练失败的主要原因?
  • RQ3可学习的、可微分的噪声层(PNIL)能否在不增加推理复杂度的前提下,提升对抗训练的泛化能力与鲁棒性?
  • RQ4NFGSM与PNIL的结合在鲁棒性与训练效率方面,与标准PGD对抗训练相比表现如何?
  • RQ5PNIL学习到的方差分布是否聚焦于保留关键特征而抑制背景噪声,从而提升对定向攻击的鲁棒性?

主要发现

  • 在不同扰动边界下,使用输入噪声的NFGSM训练方法在鲁棒性上略高于标准RFGSM,尤其在弱攻击下表现更优。
  • PNIL显著提升了对无梯度攻击(如SPSA)的鲁棒性,这类攻击通常会破坏使用标准FGSM训练的模型。
  • 与基于PGD的对抗训练相比,使用PNIL与NFGSM训练的模型在鲁棒性上表现更优,尽管其采用的是单步攻击。
  • PNIL学习到的特征分布会为背景区域分配更高的方差,而对前景物体分配更低的方差,从而有效过滤关键区域的对抗噪声。
  • 与PGD相比,该方法将训练时间降低了数量级,因其仅依赖单步FGSM攻击,计算开销极低。
  • PNIL通过确保网络无法利用梯度掩蔽,有效防止了梯度混淆,从而实现更可靠、更具泛化能力的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。