Skip to main content
QUICK REVIEW

[论文解读] Understanding Adversarial Robustness Through Loss Landscape Geometries

Vinay Uday Prabhu, Dian Ang Yap|arXiv (Cornell University)|Jul 22, 2019
Adversarial Robustness in Machine Learning参考文献 13被引用 11
一句话总结

本文研究了对抗训练与深度神经网络损失景观几何之间的关系,采用滤波器归一化进行可视化。与直觉相反,对抗训练——尤其是使用FGSM和PGD——导致损失景观更尖锐、更混乱,表明鲁棒性并不一定与更平坦的泛化相关。stAdv攻击产生的损失景观最平滑,表明原始图像与对抗样本之间的结构相似性可能促进更平坦的几何结构。

ABSTRACT

The pursuit of explaining and improving generalization in deep learning has elicited efforts both in regularization techniques as well as visualization techniques of the loss surface geometry. The latter is related to the intuition prevalent in the community that flatter local optima leads to lower generalization error. In this paper, we harness the state-of-the-art "filter normalization" technique of loss-surface visualization to qualitatively understand the consequences of using adversarial training data augmentation as the explicit regularization technique of choice. Much to our surprise, we discover that this oft deployed adversarial augmentation technique does not actually result in "flatter" loss-landscapes, which requires rethinking adversarial training generalization, and the relationship between generalization and loss landscapes geometries.

研究动机与目标

  • 研究对抗数据增强对深度学习损失景观几何的影响。
  • 检验对抗训练导致损失曲面更平坦、更具泛化能力的假设。
  • 比较不同对抗攻击方法(FGSM、PGD、stAdv)对损失景观平滑度的影响。
  • 探讨对抗鲁棒性与泛化在损失景观几何层面的脱节现象。
  • 鼓励进一步研究对抗训练对优化动力学与泛化的影响。

提出的方法

  • 使用滤波器归一化,实现不同权重幅度模型之间损失景观几何的直接比较。
  • 在CIFAR-10上训练ResNet-32模型,随后在经过FGSM、PGD和stAdv攻击生成的对抗样本增强的数据集上进行微调。
  • 应用ℓ∞-有界对抗攻击:FGSM用于单步扰动,PGD用于迭代投影梯度下降,stAdv用于几何空间变换扰动。
  • 通过沿归一化滤波器方向的二维和三维投影可视化损失景观,以评估曲率与凸性。
  • 通过原始图像与对抗样本之间的结构相似性(SSIM)度量,关联感知真实度与景观平滑度。
  • 通过在干净和对抗测试集上的top-1准确率比较泛化性能。

实验结果

研究问题

  • RQ1对抗训练是否如普遍假设的那样,导致更平坦、更凸的损失景观?
  • RQ2不同对抗攻击方法(FGSM、PGD、stAdv)如何影响损失景观的几何结构?
  • RQ3对抗样本与原始图像之间的感知相似性与损失景观平滑度之间是否存在相关性?
  • RQ4从预训练模型进行对抗微调是否会产生与从零开始训练不同的景观几何?
  • RQ5结合多种攻击类型是否能产生更平坦的损失景观并提升泛化性能?

主要发现

  • 在原始数据上训练的干净模型表现出最平滑、最凸的损失景观,与对抗训练能改善几何结构的预期相悖。
  • 使用FGSM增强的模型显示出最尖锐、最混乱的损失景观,尽管其在FGSM攻击下鲁棒性有所提升。
  • 使用PGD增强的模型损失景观尖锐度低于FGSM,但仍显著比干净模型更混乱。
  • 使用stAdv增强的模型产生了最平滑的对抗损失景观,且其与原始图像的结构相似性更高(1-SSIM = 0.0028)。
  • 在所有攻击类型中,1-SSIM越低(感知相似性越高),损失景观越平滑,二者存在强烈正相关。
  • 对抗微调可能导致模型记忆扰动,并基于图像结构相似性而非鲁棒特征进行泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。