[论文解读] Regularizers for Single-step Adversarial Training
本文提出了三种用于单步对抗训练的新型正则化方法,可缓解梯度掩蔽问题,并使模型在计算成本较低的情况下实现与计算昂贵的多步对抗训练相当的鲁棒性。通过强制执行损失单调性和表面平滑性——这些是鲁棒模型的关键特性——正则化方法使得基于FGSM的高效单步训练能够抵御非迭代和迭代攻击。
The progress in the last decade has enabled machine learning models to achieve impressive performance across a wide range of tasks in Computer Vision. However, a plethora of works have demonstrated the susceptibility of these models to adversarial samples. Adversarial training procedure has been proposed to defend against such adversarial attacks. Adversarial training methods augment mini-batches with adversarial samples, and typically single-step (non-iterative) methods are used for generating these adversarial samples. However, models trained using single-step adversarial training converge to degenerative minima where the model merely appears to be robust. The pseudo robustness of these models is due to the gradient masking effect. Although multi-step adversarial training helps to learn robust models, they are hard to scale due to the use of iterative methods for generating adversarial samples. To address these issues, we propose three different types of regularizers that help to learn robust models using single-step adversarial training methods. The proposed regularizers mitigate the effect of gradient masking by harnessing on properties that differentiate a robust model from that of a pseudo robust model. Performance of models trained using the proposed regularizers is on par with models trained using computationally expensive multi-step adversarial training methods.
研究动机与目标
- 解决单步对抗训练的局限性,即由于梯度掩蔽导致收敛于退化极小值。
- 通过使单步方法实现鲁棒性,克服鲁棒性与计算成本之间的权衡。
- 识别并利用鲁棒模型的内在特性(如损失单调性和平滑损失表面)作为正则化信号。
- 开发无需迭代生成对抗样本的高效正则化方法,以保持训练速度。
- 在保持单步方法效率的同时,实现与多步对抗训练(如PGD、TRADES)相当的鲁棒性。
提出的方法
- 提出SAT-R1、SAT-R2和SAT-R3三种不同的正则化方法,将鲁棒性诱导的归纳偏置注入单步对抗训练。
- SAT-R1在每个批次中对单个样本使用迭代FGSM(IFGSM),以增强梯度稳定性并减少掩蔽。
- SAT-R2采用改进的FGSM方法,使用随机扰动方向(R-FGSM),在无需迭代步骤的情况下提升鲁棒性。
- SAT-R3通过在两个不同扰动幅度(ε_low 和 ε_high)下进行训练,利用两者梯度符号相同这一特性以减少计算量。
- 所有正则化方法均集成到标准的FGSM-based对抗训练中,每张对抗样本保持一次前向传播(FBP)的计算成本。
- 正则化方法通过在扰动下鼓励损失行为的一致性,强制实现损失单调性和平滑性,从而对抗梯度掩蔽。
实验结果
研究问题
- RQ1单步对抗训练是否可以在不进行迭代梯度计算的情况下,实现与多步方法相当的鲁棒性?
- RQ2鲁棒模型的哪些特定特性(如损失单调性、表面平滑性)可作为正则化信号加以利用?
- RQ3如何使用高效、非迭代的正则化方法缓解单步对抗训练中的梯度掩蔽?
- RQ4是否可以通过强制实现鲁棒模型结构特性的正则化方法,提升对非迭代和迭代攻击的泛化能力?
- RQ5在不同正则化器设计下,鲁棒性与训练效率之间的权衡如何?
主要发现
- 使用所提正则化方法(SAT-R1、SAT-R2、SAT-R3)训练的模型在鲁棒性上与使用计算成本较高的多步方法(如PGD-AT和TRADES)训练的模型相当。
- SAT-R1和SAT-R2在鲁棒性上优于SAT-R3,尤其在PGD-40和PGD-100攻击下表现更优,因其对梯度掩蔽的正则化更强。
- SAT-R3在三者中计算成本最低,每张对抗样本仅需一次前向传播,适用于大规模训练。
- 对SAT-R3模型进行少量周期的SAT-R1/SAT-R2微调或预训练,可显著提升鲁棒性,证明了正则化信号的可迁移性。
- 损失表面图显示,使用正则化方法训练的模型表现出平滑、无振荡的行为,证实了尖锐度降低和泛化能力提升。
- 所提正则化方法成功缓解了梯度掩蔽,证据显示在MNIST、CIFAR-10和ImageNet-subset上,对FGSM和PGD攻击均表现出一致的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。