Skip to main content
QUICK REVIEW

[论文解读] A Bayes-Optimal View on Adversarial Examples

Eitan Richardson, Yair Weiss|arXiv (Cornell University)|Feb 20, 2020
Adversarial Robustness in Machine Learning参考文献 33被引用 5
一句话总结

本文提出了一种可计算、现实的合成数据集框架,可在其中精确计算贝叶斯最优分类器,表明在高维空间中对抗性脆弱性并非不可避免。研究发现,尽管贝叶斯最优分类器在理论上是可证明鲁棒的,但卷积神经网络(CNNs)仍持续学习到脆弱的分类器,而RBF支持向量机(SVMs)则能可靠地学习到鲁棒模型,表明对抗性样本通常是训练方法的可避免缺陷,而非固有的几何限制。

ABSTRACT

Since the discovery of adversarial examples - the ability to fool modern CNN classifiers with tiny perturbations of the input, there has been much discussion whether they are a "bug" that is specific to current neural architectures and training methods or an inevitable "feature" of high dimensional geometry. In this paper, we argue for examining adversarial examples from the perspective of Bayes-Optimal classification. We construct realistic image datasets for which the Bayes-Optimal classifier can be efficiently computed and derive analytic conditions on the distributions under which these classifiers are provably robust against any adversarial attack even in high dimensions. Our results show that even when these "gold standard" optimal classifiers are robust, CNNs trained on the same datasets consistently learn a vulnerable classifier, indicating that adversarial examples are often an avoidable "bug". We further show that RBF SVMs trained on the same data consistently learn a robust classifier. The same trend is observed in experiments with real images in different datasets.

研究动机与目标

  • 创建可计算、现实的图像数据集,使得贝叶斯最优分类器能够被高效计算。
  • 分析在不同数据分布条件下,贝叶斯最优分类器是否可被证明是鲁棒或脆弱的。
  • 通过在相同数据上比较卷积神经网络(CNNs)、线性SVM和RBF SVM,分离对抗性脆弱性的根源。
  • 检验最优分类器中的鲁棒性是否能转化为真实模型的性能,特别是在对称与非对称数据分布下。
  • 评估对称合成数据集在多大程度上能近似真实数据,以得出关于对抗鲁棒性的结论。

提出的方法

  • 使用高斯混合因子分析模型(Mixture of Factor Analyzers, MFA)构建合成图像数据集,生成具有受控分布特性的现实、高维数据。
  • 定义数据分布,使得基于高斯混合成分的闭式解可解析计算出贝叶斯最优分类器。
  • 推导出贝叶斯最优分类器对任意L2有界对抗扰动均可被证明鲁棒的解析条件。
  • 在相同合成数据集上训练标准卷积神经网络(CNNs)、线性SVM和RBF SVM,以比较其相对于贝叶斯最优基准的鲁棒性。
  • 通过在对称合成数据上训练CNN并测试其在真实CelebA和MNIST数据上的表现,评估泛化能力,以评估其与真实世界分布的相似性。
  • 使用扰动幅度(L2范数)和视觉检查量化不同模型和数据集上的对抗鲁棒性。

实验结果

研究问题

  • RQ1在何种分布条件下,贝叶斯最优分类器可被证明对所有对抗攻击均鲁棒,即使在高维空间中?
  • RQ2当贝叶斯最优分类器是鲁棒时,标准CNN训练是否能学习到鲁棒分类器,还是脆弱性本质上源于网络架构?
  • RQ3在CNN失败的相同数据上,大间隔方法(如RBF SVM)是否始终能学习到鲁棒分类器?
  • RQ4对称与非对称数据分布如何影响贝叶斯最优分类器的鲁棒性?
  • RQ5对称合成数据集在多大程度上能近似真实世界数据,以支持模型泛化能力和对抗鲁棒性的结论?

主要发现

  • 在对称数据分布下,贝叶斯最优分类器可被证明是鲁棒的,需施加较大、具有感知意义的扰动(例如L2 ≈ 3.0–3.1)才能将其欺骗。
  • 尽管贝叶斯最优分类器是鲁棒的,标准CNN训练仍持续学习到脆弱分类器,在对称数据集上的对抗攻击成功率仅为0%至2%。
  • 在相同数据上训练的RBF SVM始终学习到鲁棒分类器,在对称数据集上实现86%至100%的对抗准确率(攻击成功率0%至26%)。
  • 在真实CelebA数据上,CNN和线性SVM表现出高度对抗脆弱性(例如攻击成功率5.3%至16.3%),而RBF SVM表现出改进的鲁棒性(例如攻击成功率10.3%至32.3%)。
  • 在对称合成数据上训练的CNN在真实数据上泛化良好,平均准确率仅下降5%,验证了合成数据的真实性及其在鲁棒性分析中的有效性。
  • 结果表明,CNN中的对抗脆弱性并非高维几何的必然结果,而是当前训练方法的失败所致,因为最优分类器在对称条件下仍保持鲁棒。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。