[论文解读] Understanding Catastrophic Overfitting in Single-step Adversarial Training
本文将单步对抗训练中灾难性过拟合的根本原因归因于决策边界的失真,即模型对FGSM攻击变得鲁棒,但对多步PGD攻击完全失效。作者提出一种简单的、针对图像的扰动幅度搜索方法,可防止过拟合,并在无需多步训练的情况下实现接近100%的PGD鲁棒性,优于快速对抗训练方法,且在计算成本更低的前提下达到与基于PGD的方法相当的鲁棒性。
Although fast adversarial training has demonstrated both robustness and efficiency, the problem of "catastrophic overfitting" has been observed. This is a phenomenon in which, during single-step adversarial training, the robust accuracy against projected gradient descent (PGD) suddenly decreases to 0% after a few epochs, whereas the robust accuracy against fast gradient sign method (FGSM) increases to 100%. In this paper, we demonstrate that catastrophic overfitting is very closely related to the characteristic of single-step adversarial training which uses only adversarial examples with the maximum perturbation, and not all adversarial examples in the adversarial direction, which leads to decision boundary distortion and a highly curved loss surface. Based on this observation, we propose a simple method that not only prevents catastrophic overfitting, but also overrides the belief that it is difficult to prevent multi-step adversarial attacks with single-step adversarial training.
研究动机与目标
- 探究单步对抗训练中灾难性过拟合的根本原因,即对FGSM的鲁棒性提升,但对PGD的鲁棒性下降至0%。
- 分析固定扰动幅度如何导致决策边界失真,并使多步攻击能够欺骗模型。
- 开发一种计算高效的防御方法,可在防止灾难性过拟合的同时,保持对多种对抗攻击的强大鲁棒性。
- 挑战单步训练无法防御多步攻击的假设,证明通过适当的扰动缩放是可行的。
提出的方法
- 提出一种在训练过程中动态为每张输入图像确定最优扰动幅度的方法,而非使用固定的ε。
- 采用基于搜索的方法,寻找仍能欺骗模型的最大扰动,确保在多种攻击幅度下均保持鲁棒性。
- 将自适应扰动步长集成到快速对抗训练框架中,保持计算效率。
- 在干净样本和对抗样本的损失优化过程中均应用该方法,通过对齐梯度来提升泛化能力。
- 使用超参数c控制搜索范围,实验表明c=3时性能最优。
- 使用标准交叉熵损失进行模型训练,对抗样本通过自适应步长生成,避免依赖多步PGD。
实验结果
研究问题
- RQ1为何在单步对抗训练中,对FGSM的鲁棒性提升,而对PGD的鲁棒性却下降至0%?
- RQ2固定扰动幅度如何导致决策边界失真和灾难性过拟合?
- RQ3是否可通过一种简单、图像特定的扰动缩放方法,在不损失鲁棒性的前提下防止灾难性过拟合?
- RQ4能否仅通过单步对抗训练实现对多步攻击的高鲁棒性?
主要发现
- 所提方法在CIFAR-10和Tiny ImageNet上均有效防止了灾难性过拟合,PGD50鲁棒准确率达到7.8%,而快速对抗训练中为0.0%。
- 在CIFAR-10上,该方法实现了49.6%的标准准确率和12.5%的FGSM鲁棒准确率,优于快速对抗训练(26.2%标准准确率,49.0% FGSM鲁棒准确率),且在鲁棒性上与PGD2对抗训练相当。
- 在Tiny ImageNet上,该方法实现了7.8%的PGD50鲁棒准确率,显著优于快速对抗训练(0.0%),并接近PGD2对抗训练的性能。
- 该方法将Tiny ImageNet的训练时间缩短至25.7小时,低于PGD2的27.7小时和快速对抗训练的19.6小时,同时提供了更优的鲁棒性。
- 即使在使用Wide-ResNet-40-10模型生成的黑盒PGD50攻击下,该方法训练的模型在Tiny ImageNet上仍保持7.8%的PGD50鲁棒准确率。
- AutoAttack测试结果证实了模型的鲁棒性:所提方法在性能上与PGD2对抗训练相当,显著优于快速对抗训练(在AA下完全失效)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。