Skip to main content
QUICK REVIEW

[论文解读] GAP++: Learning to generate target-conditioned adversarial examples

Xiaofeng Mao, Yuefeng Chen|arXiv (Cornell University)|Jun 9, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用 6
一句话总结

GAP++ 提出了一种基于模型的对抗性攻击框架,通过使用条件生成对抗网络(cGAN)同时基于输入图像和目标标签来生成目标条件化的扰动。该方法仅需训练一个模型,即可在 $L_\infty$、$L_2$ 和 $L_0$ 范数下实现卓越的欺骗率,优于单目标模型,并实现了无需微调的高效、通用攻击。

ABSTRACT

Adversarial examples are perturbed inputs which can cause a serious threat for machine learning models. Finding these perturbations is such a hard task that we can only use the iterative methods to traverse. For computational efficiency, recent works use adversarial generative networks to model the distribution of both the universal or image-dependent perturbations directly. However, these methods generate perturbations only rely on input images. In this work, we propose a more general-purpose framework which infers target-conditioned perturbations dependent on both input image and target label. Different from previous single-target attack models, our model can conduct target-conditioned attacks by learning the relations of attack target and the semantics in image. Using extensive experiments on the datasets of MNIST and CIFAR10, we show that our method achieves superior performance with single target attack models and obtains high fooling rates with small perturbation norms.

研究动机与目标

  • 为解决现有基于模型的对抗性攻击方法训练成本高且可重用性有限的问题,这些方法在针对每个新目标时都需要重新训练。
  • 通过学习同时基于输入图像和目标标签的统一扰动分布,提升攻击效率。
  • 使单个训练好的模型无需重新训练即可执行目标攻击和非目标攻击。
  • 在保持低扰动范数的同时,提升在多种扰动范数($L_\infty$、$L_2$、$L_0$)下的性能。

提出的方法

  • 使用条件生成对抗网络(cGAN)生成同时基于输入图像和目标标签的扰动。
  • 引入统一的攻击者网络,学习图像-扰动-目标三元组的联合分布,实现单个模型支持多目标攻击。
  • 在训练过程中应用 $L_\infty$、$L_2$ 和 $L_0$ 范数约束,以控制扰动的大小和结构。
  • 在训练期间使用参数固定的受害者网络来评估攻击成功率,确保生成对抗性样本的真实性。
  • 将非目标攻击视为一种特殊的目标攻击情形,通过使用单一目标标签,实现统一模型的部署。
  • 使用感知损失和归一化模块,确保生成扰动的不可察觉性和稳定性。

实验结果

研究问题

  • RQ1一个单一模型是否能够在不重新训练的情况下,为多个目标类别生成高质量、目标条件化的对抗性样本?
  • RQ2在 $L_\infty$、$L_2$ 和 $L_0$ 约束下,统一模型的攻击性能与单目标模型相比如何?
  • RQ3同时基于输入图像和目标标签来条件化扰动生成,是否能提升欺骗率和扰动效率?
  • RQ4同一个训练好的模型是否能有效执行目标攻击和非目标攻击?
  • RQ5不同的范数约束($L_\infty$、$L_2$、$L_0$)如何影响模型学习有效扰动模式的能力?

主要发现

  • 在 $\epsilon=0.2$ 的 $L_\infty$ 范数下,GAP++ 在 MNIST 上实现了 50.5% 的欺骗率,在 CIFAR10 上实现了 13.3% 的欺骗率,优于单目标模型。
  • 在 MNIST 上,该模型在所有五个目标类别上均保持了较高的攻击成功率,$L_\infty$ 范数下的平均攻击成功率达到了 12.8%。
  • 与 GAP 和 FGSM 相比,GAP++ 表现更优,尤其在使用单个模型为多个目标生成多样化、高质量扰动方面优势显著。
  • 在三种范数类型中,$L_\infty$ 表现最佳,而 $L_2$ 和 $L_0$ 存在收敛不佳和对局部极小值更敏感的问题。
  • 可视化结果显示,$L_\infty$ 生成平滑且不可察觉的扰动,$L_2$ 产生弥散的噪声,$L_0$ 则导致稀疏的盐胡椒状图案,其中 $L_\infty$ 在感知效果上最为优越。
  • 该模型通过将非目标攻击视为目标攻击的特例,成功实现了对非目标攻击的泛化,无需重新训练即可获得具有竞争力的欺骗率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。