Skip to main content
QUICK REVIEW

[论文解读] Understanding Adversarial Robustness: The Trade-off between Minimum and Average Margin

Kaiwen Wu, Yaoliang Yu|arXiv (Cornell University)|Jul 26, 2019
Adversarial Robustness in Machine Learning参考文献 40被引用 8
一句话总结

本文揭示了深度学习中的一个根本性权衡:标准训练通过最大化最小边缘(margin)来实现高准确率,但会降低平均边缘,从而增加对对抗攻击的脆弱性。为解决此问题,作者提出一种新型正则化项,显式促进平均边缘,同时保持Fisher一致性,显著提升鲁棒性而不损失准确率,该结论已在多个数据集和模型上得到验证。

ABSTRACT

Deep models, while being extremely versatile and accurate, are vulnerable to adversarial attacks: slight perturbations that are imperceptible to humans can completely flip the prediction of deep models. Many attack and defense mechanisms have been proposed, although a satisfying solution still largely remains elusive. In this work, we give strong evidence that during training, deep models maximize the minimum margin in order to achieve high accuracy, but at the same time decrease the \emph{average} margin hence hurting robustness. Our empirical results highlight an intrinsic trade-off between accuracy and robustness for current deep model training. To further address this issue, we propose a new regularizer to explicitly promote average margin, and we verify through extensive experiments that it does lead to better robustness. Our regularized objective remains Fisher-consistent, hence asymptotically can still recover the Bayes optimal classifier.

研究动机与目标

  • 探究深度神经网络对抗脆弱性的根本原因,特别是边缘分布对模型鲁棒性的影响。
  • 识别标准训练过程中最大化最小边缘(以提升准确率)与最小化平均边缘(以增强鲁棒性)之间的内在权衡。
  • 提出一种新的训练目标,显式促进平均边缘,同时确保与贝叶斯最优分类器的渐近一致性。
  • 通过实证验证,证明所提出的正则化项可在多种架构和数据集上提升对抗鲁棒性。
  • 证明鲁棒性可被增强,而无需依赖计算成本高昂的对抗训练或复杂防御机制。

提出的方法

  • 提出一种新型正则化项,在训练过程中显式最大化平均边缘,其定义为所有训练样本边缘的均值。
  • 将平均边缘正则化项整合到标准交叉熵损失函数中,保持原始优化目标的Fisher一致性。
  • 将正则化目标表述为标准分类损失与鼓励更大平均边缘的惩罚项的组合。
  • 将该正则化目标应用于线性和非线性模型,包括MLP和CNN,在MNIST与CIFAR-10数据集上进行实验。
  • 采用PGD攻击在多种$ε$值下评估鲁棒性,对比干净准确率与鲁棒准确率,与标准训练、LCR、对抗训练及其他基线方法进行比较。
  • 通过理论证明确保正则化目标的合理性:该目标保持Fisher一致性,保证随着样本量增加,学习到的分类器可收敛至贝叶斯最优分类器。

实验结果

研究问题

  • RQ1标准深度学习训练是否本质上会降低平均边缘,同时最大化最小边缘,从而导致对抗脆弱性?
  • RQ2显式最大化平均边缘是否可在不降低标准准确率的前提下提升对抗鲁棒性?
  • RQ3所提出的正则化项是否具有Fisher一致性,从而保证学习到的分类器具有渐近最优性?
  • RQ4与对抗训练、Lipschitz正则化及其他防御机制相比,该方法在鲁棒性与效率方面表现如何?
  • RQ5最小边缘与平均边缘之间的权衡是否在不同架构与数据集上依然存在?

主要发现

  • 标准训练通过最大化最小边缘以提升准确率,但显著降低了平均边缘,从而增加了对对抗攻击的敏感性。
  • 在MNIST上,所提出的平均边缘正则化(AMR)在$\ell_2$ PGD攻击下$\epsilon=2.0$时达到97.33%的鲁棒准确率,优于标准训练(87.52%)和LCR(26.96%)。
  • 在CIFAR-10上,AMR在$\epsilon=2.0$时达到93.12%的鲁棒准确率,优于标准训练(22.64%),并达到与对抗训练相当的性能,同时比基于PGD的方法更高效。
  • 平均边缘正则化项在所有测试的$\epsilon$值下均一致提升鲁棒性,尤其在较大扰动下,LCR与标准训练的性能显著下降,而AMR表现更优。
  • AMR在MNIST与CIFAR-10上均优于最大边缘正则化(MMR),表明控制平均边缘比最大化线性区域更有效。
  • AMR的训练时间与标准训练相当,显著优于对抗训练或深度防御方法,后者需要迭代的PGD更新或微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。