[论文解读] Attacks Which Do Not Kill Training Make Adversarial Learning Stronger
提出 Friendly Adversarial Training (FAT),它通过 early-stopped PGD 使用友好对抗数据(在被错误分类的样本中最不具对抗性的一组)以在不牺牲自然准确性的前提下提升鲁棒性。提供理论上界及实证证据,表明在不损害标准泛化的情况下可以实现鲁棒性。
Adversarial training based on the minimax formulation is necessary for obtaining adversarial robustness of trained models. However, it is conservative or even pessimistic so that it sometimes hurts the natural generalization. In this paper, we raise a fundamental question---do we have to trade off natural generalization for adversarial robustness? We argue that adversarial training is to employ confident adversarial data for updating the current model. We propose a novel approach of friendly adversarial training (FAT): rather than employing most adversarial data maximizing the loss, we search for least adversarial (i.e., friendly adversarial) data minimizing the loss, among the adversarial data that are confidently misclassified. Our novel formulation is easy to implement by just stopping the most adversarial data searching algorithms such as PGD (projected gradient descent) early, which we call early-stopped PGD. Theoretically, FAT is justified by an upper bound of the adversarial risk. Empirically, early-stopped PGD allows us to answer the earlier question negatively---adversarial robustness can indeed be achieved without compromising the natural generalization.
研究动机与目标
- 质疑在标准对抗训练中将自然泛化与对抗鲁棒性权衡的必要性。
- 提出 friendly adversarial training (FAT),使用最少对抗性、置信度错误分类的数据来更新模型。
- 通过对 FAT 的对抗风险给出上界,从理论上提供依据。
- 表明 early-stopped PGD 能高效实现 FAT,并提升标准和鲁棒精度。
- 表明 FAT 允许在训练期间使用更大的扰动预算(epsilon),同时保持或提升性能。
提出的方法
- 将 FAT 表述为在友好对抗数据上最小化损失,定义为带有边际约束 rho 的被错分的对抗样本。
- 用满足置信边距并最小化损失的对抗样本的约束最小化来替代标准对抗训练中的内部最大化。
- 开发 PGD-K-τ,一种早停的 PGD 算法,通过 τ 控制选择损失较小的错分样本(或损失较大但正确分类的样本),从而推广传统的 PGD-K。
- 证明一个紧致的对抗风险上界,结合标准项与鲁棒项,并使用边距参数 ρ。
- 提供一个可行的 FAT 算法,能够将现有防御方法(如 TRADES、MART)改造成 FAT 变体。
- 在 CIFAR-10 和 SVHN 上,使用 ResNet-18、Small CNN 和 Wide ResNet 架构进行经验验证,比较在各种攻击下的标准和鲁棒准确性。
实验结果
研究问题
- RQ1是否可以在对抗训练中实现对抗鲁棒性而不牺牲自然泛化?
- RQ2在误分类样本内使用友好对抗数据是否能改善训练稳定性和泛化?
- RQ3早停的 PGD (PGD-K-τ) 如何影响模型的训练动力学与鲁棒性?
- RQ4哪些理论保证可以支持 FAT 作为对抗风险上界方法的合理性?
- RQ5FAT 是否能与现有对抗训练方法(TRADES、MART)兼容以获得更好性能?
主要发现
- FAT 提高在标准(自然)测试集上的准确度,同时在多种攻击下维持有竞争力的鲁棒准确性。
- 早停的 PGD (PGD-K-τ) 缓解对抗数据的交叉混合现象,并在训练中逐步增强鲁棒性。
- FAT 使训练时的扰动预算 ε_train 能更大而不损害泛化,与传统对抗训练不同。
- 对抗风险的理论上界显示,FAT 通过将被错分的对抗数据与置信边距结合来降低风险。
- 可以从现有方法导出 FAT 变体(如 TRADES 的 FAT、MART 的 FAT),为实际部署提供可行路径。
- 实证结果表明,通过控制 τ 的取值(如 τ ∈ {0,1,2,3})可以提升鲁棒性,同时在标准与鲁棒性能之间取得平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。