Skip to main content
QUICK REVIEW

[论文解读] Improving Fast Adversarial Training with Prior-Guided Knowledge

Xiaojun Jia, Yong Zhang|arXiv (Cornell University)|Apr 1, 2023
Adversarial Robustness in Machine Learning被引用 4
一句话总结

该论文提出FGSM-PGK,一种快速对抗训练方法,通过利用先验引导的知识——特别是来自历史训练的高质量对抗扰动和模型权重——来防止灾难性过拟合。通过先验引导的初始化和正则化提升对抗样本质量,该方法在四个数据集上以极低的额外训练成本实现了最先进水平的鲁棒性。

ABSTRACT

Fast adversarial training (FAT) is an efficient method to improve robustness. However, the original FAT suffers from catastrophic overfitting, which dramatically and suddenly reduces robustness after a few training epochs. Although various FAT variants have been proposed to prevent overfitting, they require high training costs. In this paper, we investigate the relationship between adversarial example quality and catastrophic overfitting by comparing the training processes of standard adversarial training and FAT. We find that catastrophic overfitting occurs when the attack success rate of adversarial examples becomes worse. Based on this observation, we propose a positive prior-guided adversarial initialization to prevent overfitting by improving adversarial example quality without extra training costs. This initialization is generated by using high-quality adversarial perturbations from the historical training process. We provide theoretical analysis for the proposed initialization and propose a prior-guided regularization method that boosts the smoothness of the loss function. Additionally, we design a prior-guided ensemble FAT method that averages the different model weights of historical models using different decay rates. Our proposed method, called FGSM-PGK, assembles the prior-guided knowledge, i.e., the prior-guided initialization and model weights, acquired during the historical training process. Evaluations of four datasets demonstrate the superiority of the proposed method.

研究动机与目标

  • 探究快速对抗训练(FAT)中灾难性过拟合的根本原因,并揭示其与对抗样本质量的关联。
  • 在保持或提升对抗鲁棒性的前提下降低训练成本,尤其与多步攻击的标准对抗训练相比。
  • 开发一种方法,利用历史训练知识(如对抗扰动和模型权重)进行训练,而无需在训练过程中增加额外的前向传播。
  • 确保在不同攻击强度和评估设置下均具备鲁棒性,特别是在强ℓ∞攻击下。
  • 从理论和实证两方面验证,提升对抗样本质量可带来更平滑的损失曲面并改善泛化能力。

提出的方法

  • 提出基于从历史训练步骤中提取的高质量对抗扰动的先验引导初始化方法,以增强快速训练中初始对抗样本的质量。
  • 引入一种先验引导正则化方法,将先验扰动与对抗扰动相结合,以平滑损失函数并提升对两类扰动的鲁棒性。
  • 设计一种先验引导集成方法,通过使用不同的衰减率动态平均来自历史检查点的模型权重,以改善泛化性能。
  • 采用一种极小-极大优化框架,其中内层最大化步骤使用单步FGSM攻击,但通过改进的初始化和正则化防止性能崩溃。
  • 该方法整合了三个组件:先验引导初始化、先验引导正则化和先验引导权重平均,构成FGSM-PGK框架。
  • 理论分析支持所提出初始化方法在训练过程中维持对抗鲁棒性的有效性。

实验结果

研究问题

  • RQ1为什么在快速对抗训练中会发生灾难性过拟合?这是否与对抗样本的质量有关?
  • RQ2是否可以利用历史训练数据在不增加训练成本的前提下提升对抗样本质量?
  • RQ3与标准FGSM-AT相比,先验引导初始化在随时间推移防止鲁棒性退化方面表现如何?
  • RQ4结合先验引导知识(初始化、正则化和模型权重)是否能带来优于单独使用任一组件的鲁棒性?
  • RQ5所提出方法在不同ℓ∞攻击强度和不同数据集下的表现如何?

主要发现

  • FGSM-PGK在CIFAR-10、SVHN、Tiny ImageNet和ImageNet-100上均能防止灾难性过拟合,即使在强ℓ∞攻击(如14/255)下也表现稳定,而先前方法如NuAT则失败。
  • 在使用ResNet-18的CIFAR-10上,该方法实现了最先进水平的PGD-10鲁棒准确率,优于所有快速和标准对抗训练基线。
  • 仅使用先验引导初始化即可防止过拟合并提升鲁棒性,但结合正则化和权重平均后性能最佳,且额外训练时间极少。
  • FGSM-PGK的损失曲面在对抗方向上表现出更高的线性度,表明其损失轮廓更平坦、更具鲁棒性。
  • 先验引导正则化方法提升了损失的平滑度,这与对先验扰动和对抗扰动更强的鲁棒性密切相关。
  • 该方法在训练时间与标准FGSM-AT相当的前提下实现了卓越的鲁棒性,使其在实际部署中高效且实用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。