Skip to main content
QUICK REVIEW

[论文解读] Stochastic Combinatorial Ensembles for Defending Against Adversarial Examples

George-Alexandru Adam, Petr Smirnov|arXiv (Cornell University)|Aug 20, 2018
Adversarial Robustness in Machine Learning参考文献 16被引用 4
一句话总结

本文提出了一种概率防御框架,利用神经网络深度通过线性数量的变分自编码器(VAEs)生成指数级庞大的模型集合。通过在层间随机插入VAEs,该方法通过正交梯度降低对抗迁移性,并实现高检测准确率,仅有不到7%的对抗样本能欺骗联合防御与检测系统。

ABSTRACT

Many deep learning algorithms can be easily fooled with simple adversarial examples. To address the limitations of existing defenses, we devised a probabilistic framework that can generate an exponentially large ensemble of models from a single model with just a linear cost. This framework takes advantage of neural network depth and stochastically decides whether or not to insert noise removal operators such as VAEs between layers. We show empirically the important role that model gradients have when it comes to determining transferability of adversarial examples, and take advantage of this result to demonstrate that it is possible to train models with limited adversarial attack transferability. Additionally, we propose a detection method based on metric learning in order to detect adversarial examples that have no hope of being cleaned of maliciously engineered noise.

研究动机与目标

  • 为解决深度神经网络在白盒攻击设置下对对抗样本的脆弱性问题。
  • 通过在层间随机插入VAE来操纵模型梯度,从而减少模型间的对抗迁移性。
  • 开发一种轻量级、可扩展的防御机制,以极低的计算开销生成大规模模型集合。
  • 通过三元组网络架构中的度量学习提升对抗样本的检测能力。

提出的方法

  • 在深度神经网络的层间随机插入VAEs,以创建一个从线性训练成本中获得指数级规模的模型概率集成。
  • 训练VAEs以重建输入,同时引入受控的梯度差异,即使重建结果在视觉上与原始输入几乎完全相同。
  • 将模型间的梯度正交性作为关键防御机制,以降低对抗样本的迁移性。
  • 将基于VAE的分类器与使用度量学习区分自然输入与对抗输入的三元组网络检测器相结合。
  • 联合优化一个模型,其中检测器与分类器共同训练,检测器输出作为logit附加以提升鲁棒性。
  • 应用迭代攻击(如CW2)来评估联合防御与检测系统在对抗优化下的鲁棒性。

实验结果

研究问题

  • RQ1概率框架能否仅以线性计算成本从单个模型生成指数级庞大的模型集合?
  • RQ2随机VAE插入如何影响模型梯度与对抗迁移性?
  • RQ3模型间的梯度正交性在多大程度上能降低基于迁移的对抗攻击的成功率?
  • RQ4基于度量学习的检测器能否有效识别出对VAE清洗具有抵抗力的对抗样本?
  • RQ5分类器与检测器的联合训练在多大程度上提升了对强对抗攻击的整体鲁棒性?

主要发现

  • 该方法仅使用线性数量的VAEs,成功生成了指数级庞大的模型集合,在计算开销极低的情况下实现了高度多样的模型行为。
  • 尽管视觉重建结果几乎完全相同,不同VAE排列产生的梯度却显著不同,这挑战了VAE具有近似恒等梯度的假设。
  • 模型间的梯度正交性高度预测了对抗迁移性的降低,正交梯度显著增加了联合攻击的难度。
  • 三元组网络检测器在检测对抗样本方面准确率超过96%,即使分类器被欺骗也依然有效。
  • 联合防御与检测系统将CW2攻击的成功率降低至7%以下,未防御模型的成功率从0.702降至0.635(当两个组件均启用时)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。