Skip to main content
QUICK REVIEW

[论文解读] $n$-ML: Mitigating Adversarial Examples via Ensembles of Topologically Manipulated Classifiers

Mahmood Sharif, Lujo Bauer|arXiv (Cornell University)|Dec 19, 2019
Adversarial Robustness in Machine Learning参考文献 84被引用 5
一句话总结

该论文提出 $n$-ML,一种通过拓扑扰动训练的深度神经网络(DNN)集成防御方法,用于对对抗性样本进行分类时产生差异化的预测结果,从而通过投票不一致实现检测。该方法在保持极小准确率损失的同时,实现了最先进的鲁棒性,并且推理速度优于以往的防御方法。

ABSTRACT

This paper proposes a new defense called $n$-ML against adversarial examples, i.e., inputs crafted by perturbing benign inputs by small amounts to induce misclassifications by classifiers. Inspired by $n$-version programming, $n$-ML trains an ensemble of $n$ classifiers, and inputs are classified by a vote of the classifiers in the ensemble. Unlike prior such approaches, however, the classifiers in the ensemble are trained specifically to classify adversarial examples differently, rendering it very difficult for an adversarial example to obtain enough votes to be misclassified. We show that $n$-ML roughly retains the benign classification accuracies of state-of-the-art models on the MNIST, CIFAR10, and GTSRB datasets, while simultaneously defending against adversarial examples with better resilience than the best defenses known to date and, in most cases, with lower classification-time overhead.

研究动机与目标

  • 为应对通过微小、难以察觉的扰动即可绕过最先进深度神经网络的对抗性样本日益增长的威胁。
  • 在不显著降低良性分类准确率的前提下提升防御鲁棒性,解决以往防御方法普遍存在的这一短板。
  • 相比现有基于检测的防御方法,降低推理时的计算开销,后者通常带来较高的计算成本。
  • 通过在 DNN 中引入受控的拓扑差异,使集成成员之间产生分歧,从而实现对对抗性输入的有效检测。
  • 提供一种实用且可扩展的防御方案,在多种数据集和攻击设置下均保持高性能。

提出的方法

  • 提出拓扑扰动——一种新颖的训练技术,可在训练 DNN 时指定对抗性样本的分类方式,同时保持对良性输入的高准确率。
  • 构建 $n$-ML 作为 $n$ 个 DNN 的集成,每个 DNN 使用不同且随机选择的类别标签错位(排列)进行训练,以引入拓扑多样性。
  • 通过集成中的多数投票进行分类:若超过阈值数量的 DNN 达成一致,则判定为正常输入;否则标记为对抗性输入。
  • 在训练过程中采用改进的损失函数,强制确保良性输入被正确分类,同时对对抗性样本施加指定的、差异化的预测结果。
  • 在多个数据集(MNIST、CIFAR10、GTSRB)和攻击类型($L_\infty$、$L_2$)上,于黑盒、灰盒和白盒设置下应用该方法。
  • 借鉴 $n$-版本编程原则,通过确保对抗性样本难以同时欺骗所有集成成员,从而提升系统韧性。

实验结果

研究问题

  • RQ1通过拓扑扰动训练的 DNN 集成是否能比现有防御方法更有效地检测对抗性样本,同时保持高良性分类准确率?
  • RQ2$n$-ML 在不同数据集(MNIST、CIFAR10、GTSRB)和不同攻击设置(黑盒、灰盒、白盒)下的表现如何?
  • RQ3拓扑扰动在不损害良性输入性能的前提下,能在多大程度上促使 DNN 对对抗性样本产生不同的分类结果?
  • RQ4$n$-ML 的推理速度与最先进对抗检测方法相比如何?
  • RQ5$n$-ML 在低类别数场景(如 $m=2$)下的局限性是什么?应如何解决?

主要发现

  • 在黑盒设置下的 CIFAR10 数据集上,$n$-ML 达到了 94.50% 的良性准确率,并成功防御了所有 $L_\infty$-扰动幅度为 $\frac{8}{255}$ 的对抗性样本,优于当前最先进防御方法(良性准确率为 87.24%,且 14.02% 的对抗样本成功绕过)。
  • $n$-ML 的推理速度比其他最先进基于检测的防御方法最高快 $\times$ 199.46 倍,展现出显著的效率优势。
  • 该方法在保持接近最先进模型性能(例如,在 CIFAR10 上最佳标准 DNN 的准确率为 95.38%)的同时,提供了更优的鲁棒性。
  • 由于拓扑扰动的 DNN 之间产生了有意的分歧,基于集成的投票机制能有效检测出对抗性输入,即使在强攻击下也表现稳健。
  • 该防御方法在多种数据集和攻击类型(包括 $L_\infty$ 和 $L_2$ 扰动)下,所有测试的威胁模型(黑盒、灰盒、白盒)中均表现出有效性。
  • 主要局限性出现在低类别数场景(如 $m=2$),此时可能的错位排列数量过少,难以构建多样化的集成,提示在该类场景下需采用其他拓扑扰动技术。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。