[论文解读] Bag of Tricks for Adversarial Training
本文指出,对抗鲁棒性对权重衰减、批量归一化模式和PGD初始化等基本训练超参数极为敏感,而这些参数在以往的研究中常被忽视。通过在CIFAR-10上进行系统的消融实验,作者发现微小的超参数调整可使鲁棒准确率下降超过7%。通过重新优化训练设置,他们在AutoAttack上取得了新的SOTA结果,表明许多先前的防御方法因训练配置不佳而被低估。
Adversarial training (AT) is one of the most effective strategies for promoting model robustness. However, recent benchmarks show that most of the proposed improvements on AT are less effective than simply early stopping the training procedure. This counter-intuitive fact motivates us to investigate the implementation details of tens of AT methods. Surprisingly, we find that the basic settings (e.g., weight decay, training schedule, etc.) used in these methods are highly inconsistent. In this work, we provide comprehensive evaluations on CIFAR-10, focusing on the effects of mostly overlooked training tricks and hyperparameters for adversarially trained models. Our empirical observations suggest that adversarial robustness is much more sensitive to some basic training settings than we thought. For example, a slightly different value of weight decay can reduce the model robust accuracy by more than 7%, which is probable to override the potential promotion induced by the proposed methods. We conclude a baseline training setting and re-implement previous defenses to achieve new state-of-the-art results. These facts also appeal to more concerns on the overlooked confounders when benchmarking defenses.
研究动机与目标
- 探究为何许多提出的对抗训练改进方法相较于简单早停法仅带来有限的性能提升。
- 识别出对对抗鲁棒性有显著影响但常被忽视的训练超参数和实现细节。
- 为CIFAR-10上的PGD-AT和TRADES-based对抗训练建立标准化且高效的训练方案。
- 证明通过优化超参数重新实现先前的防御方法,可在标准基准上实现新的SOTA性能。
- 强调由于训练设置不一致,基准测试中对抗防御方法可能受到混杂因素的干扰。
提出的方法
- 系统评估10余种训练技巧(如权重衰减、学习率调度、批量大小、BN模式、PGD初始化、早停、预热、优化器选择)对PGD-AT和TRADES的影响。
- 在CIFAR-10上使用标准化且优化的超参数方案重新实现先前的防御方法(如TRADES、PGD-AT)。
- 采用一致的评估协议:在ℓ∞约束下使用AutoAttack、PGD-1000、SPSA和C&W攻击。
- 比较不同权重衰减值(如2×10⁻⁴ vs. 5×10⁻⁴)、BN模式(训练模式 vs. 评估模式)以及初始化策略(均匀分布 vs. 高斯分布)下的鲁棒准确率。
- 在WRN-34-10和ResNet-18上进行消融研究,以隔离每个超参数的影响。
- 报告5个随机种子下的结果,以确保统计可靠性。
实验结果
研究问题
- RQ1像权重衰减和批量归一化模式这样的常见训练超参数如何影响对抗训练模型的鲁棒准确率?
- RQ2为何许多提出的对抗训练改进方法相较于简单早停法仅带来有限的性能提升?
- RQ3通过优化训练设置重新实现先前的防御方法,是否可在标准基准上实现新的SOTA性能?
- RQ4PGD初始化和学习率预热等实现细节在多大程度上影响模型的鲁棒性?
- RQ5在相同设置下,不同优化器(如Adam、AdamW、SGD-GC)在训练鲁棒模型方面的表现如何比较?
主要发现
- 将权重衰减从2×10⁻⁴调整为5×10⁻⁴,使PGD-AT的鲁棒准确率下降超过7%,表明该超参数具有极高的敏感性。
- 在生成对抗样本时使用BN的评估模式,相比使用训练模式,鲁棒准确率提高了约5%。
- 将PGD初始化从均匀分布切换为高斯分布(δ₀ ~ N(0, αI)),在相同模型上使鲁棒准确率提高了约5%。
- 使用权重衰减=5×10⁻⁴、BN评估模式和ReLU激活函数重新训练的TRADES模型,在AutoAttack(ℓ∞, ε=8/255)上实现了54.39%的鲁棒准确率,创下新的SOTA纪录。
- 该模型在ε=0.031的AutoAttack上实现了53.94% ± 0.10%的鲁棒准确率,优于包括Rice等人(2020)和Zhang等人(2019b)在内的先前工作。
- 优化器的选择显著影响性能:AdamW在AutoAttack上取得45.79%的鲁棒准确率,而SGD-GC达到51.65%,凸显了优化策略的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。