Skip to main content
QUICK REVIEW

[论文解读] Adversarial Training Versus Weight Decay

Angus Galloway, Thomas Tanay|arXiv (Cornell University)|Apr 10, 2018
Adversarial Robustness in Machine Learning参考文献 40被引用 17
一句话总结

本文比较了对抗训练与权重衰减在提升深度学习模型鲁棒性方面的表现,结果表明权重衰减通过减少所有泛化误差,实现了对多种扰动的更好泛化,优于对抗训练。在CIFAR-10上,该方法相较于先前基线模型实现了40%的绝对准确率提升,同时自然准确率损失极小,且对分布外输入保持高熵。

ABSTRACT

Performance-critical machine learning models should be robust to input perturbations not seen during training. Adversarial training is a method for improving a model's robustness to some perturbations by including them in the training process, but this tends to exacerbate other vulnerabilities of the model. The adversarial training framework has the effect of translating the data with respect to the cost function, while weight decay has a scaling effect. Although weight decay could be considered a crude regularization technique, it appears superior to adversarial training as it remains stable over a broader range of regimes and reduces all generalization errors. Equipped with these abstractions, we provide key baseline results and methodology for characterizing robustness. The two approaches can be combined to yield one small model that demonstrates good robustness to several white-box attacks associated with different metrics.

研究动机与目标

  • 评估并比较对抗训练与权重衰减在提升模型对对抗扰动鲁棒性方面的有效性。
  • 理解对抗训练(损失函数的平移)与权重衰减(损失函数的缩放)对模型行为的潜在几何影响。
  • 开发一种更稳定且可泛化的鲁棒性评估基线,使其在多种攻击类型和扰动度量下均表现良好。
  • 证明仅使用简单权重衰减的小型模型即可实现与最先进对抗训练防御相当的鲁棒性,而无需依赖复杂的对抗数据增强。
  • 提供一种更具可解释性与可靠性的防御机制,避免对抗训练引入的漏洞。

提出的方法

  • 作者将对抗训练分析为损失函数上的数据平移操作,而权重衰减则被视为对损失函数的缩放操作。
  • 他们使用标准训练(无对抗样本)在小型、低容量的卷积神经网络(CNN)上应用L2权重衰减进行训练。
  • 该模型经过调优,可在不同扰动条件下实现良好泛化,尤其针对L0(汉明距离)和L∞有界攻击。
  • 通过不同ε值的PGD攻击评估鲁棒性,并与Madry等人提出的基线防御方法进行对比。
  • 作者通过可视化滤波器来评估表征学习效果,对比了使用与不使用权重衰减训练的模型。
  • 他们进行了随机像素交换实验,以测试在L0类型攻击下的鲁棒性,结果表明权重衰减训练的模型表现更优。

实验结果

研究问题

  • RQ1在不同类型的扰动下,权重衰减与对抗训练相比,如何减少泛化误差?
  • RQ2仅使用权重衰减训练的小型模型能否实现与最先进对抗训练防御方法相当的鲁棒性?
  • RQ3对抗训练对损失曲面产生了何种几何影响?其与权重衰减的影响有何不同?
  • RQ4权重衰减训练的模型是否能更好地泛化到分布外输入(如欺骗图像)?
  • RQ5在L0和L∞攻击下,小型权重衰减模型能否超越更大的对抗训练模型?

主要发现

  • 权重衰减训练的模型在鲁棒准确率上相比先前基线实现了40%的绝对提升,自然测试准确率仅下降2.4%。
  • 在以汉明距离为约束的L0攻击下,该模型优于Madry等人提出的防御方法,证明其在无对抗数据增强的情况下仍具备更优的鲁棒性。
  • 该模型对欺骗图像保持了高熵的Softmax输出,表明其不确定性估计可靠;而Madry基线模型则对这些输入表现出高度自信的错误分类。
  • 权重衰减模型的滤波器更平滑且更具可解释性,不重要的滤波器被置零,表明其具有更好的归纳偏置并减少了过拟合。
  • 对抗训练导致滤波器呈现高度纹理化的模式,可能是因为其拟合了表面统计特性,并使数据可分性降低了约ε‖w‖₁。
  • 该模型在不同扰动幅度和攻击类型下表现出更稳定的鲁棒性,表明权重衰减提供了比对抗训练更广泛、更具泛化能力的归纳偏置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。