Skip to main content
QUICK REVIEW

[论文解读] Customizing an Adversarial Example Generator with Class-Conditional GANs

Shih-Hong Tsai|arXiv (Cornell University)|Jun 27, 2018
Adversarial Robustness in Machine Learning参考文献 21被引用 4
一句话总结

本文提出自适应 GAN(Adaptive GAN),一种非扰动方法,利用类别条件 GAN 从零开始生成原生对抗样本,避免依赖现有干净数据。其攻击成功率具有竞争力——在 MNIST 上达到 64.20%,在 CIFAR10 上达到 61.90%,表明基于 GAN 的生成方法可将对抗样本多样性拓展至超越扰动方法的范围。

ABSTRACT

Adversarial examples are intentionally crafted data with the purpose of deceiving neural networks into misclassification. When we talk about strategies to create such examples, we usually refer to perturbation-based methods that fabricate adversarial examples by applying invisible perturbations onto normal data. The resulting data reserve their visual appearance to human observers, yet can be totally unrecognizable to DNN models, which in turn leads to completely misleading predictions. In this paper, however, we consider crafting adversarial examples from existing data as a limitation to example diversity. We propose a non-perturbation-based framework that generates native adversarial examples from class-conditional generative adversarial networks.As such, the generated data will not resemble any existing data and thus expand example diversity, raising the difficulty in adversarial defense. We then extend this framework to pre-trained conditional GANs, in which we turn an existing generator into an "adversarial-example generator". We conduct experiments on our approach for MNIST and CIFAR10 datasets and have satisfactory results, showing that this approach can be a potential alternative to previous attack strategies.

研究动机与目标

  • 解决基于扰动的方法生成的对抗样本多样性有限的问题,这些方法依赖于修改现有干净数据。
  • 克服对抗样本必须在视觉上与真实数据相似的限制,通过生成完全新颖的原生对抗样本。
  • 开发一种框架,将预训练的条件 GAN 自适应地转化为对抗样本生成器,而无需从头开始训练。
  • 证明基于 GAN 的生成方法可产生有效对抗样本,其性能可超越或匹配传统基于扰动的攻击方法。

提出的方法

  • 训练一个类别条件 GAN,以特定目标类别为条件生成图像,直接生成对抗样本,而无需对真实图像进行扰动。
  • 修改 GAN 的生成器损失函数,以促使目标分类器产生误分类,从而有效将生成器转变为对抗样本生成器。
  • 对预训练的条件 GAN(如 ACGAN 和 DCGAN)进行自适应微调,以最小的训练开销,优化生成器用于对抗生成。
  • 集成批量归一化、Leaky ReLU、标签平滑和小批量判别等技术,以提升 GAN 训练的稳定性与图像质量。
  • 将训练好的生成器应用于生成针对目标攻击的对抗样本,其中模型被优化为将生成图像误分类为目标类别。
  • 使用 PGD 和 FGSM 等标准基准在 MNIST 和 CIFAR10 上评估攻击成功率,并与基于扰动的基线方法进行性能对比。

实验结果

研究问题

  • RQ1能否有效将生成模型(如条件 GAN)重新用于生成不依赖于现有数据扰动的原生对抗样本?
  • RQ2所提出的自适应 GAN 框架是否能突破基于扰动方法的限制,拓展对抗样本子空间?
  • RQ3与最先进基于扰动的攻击方法相比,自适应 GAN 在 MNIST 和 CIFAR10 等标准数据集上实现高攻击成功率的有效性如何?
  • RQ4预训练的条件 GAN 在多大程度上可通过极少的微调被适配为对抗样本生成器?
  • RQ5与基于扰动的方法相比,基于 GAN 生成的对抗样本在图像质量与感知真实感方面存在哪些权衡?

主要发现

  • 自适应 GAN 在 MNIST 数据集上实现了 64.20% 的攻击成功率,优于所有测试的基于扰动的方法,包括 FGSM 和 PGD。
  • 在 CIFAR10 的鲁棒性挑战中,自适应 GAN 实现了 61.90% 的攻击成功率,超越了所有基线方法,如 20 步 PGD 和 FGSM。
  • 该方法仅通过 2 个训练周期的自适应微调,便成功将预训练的条件 GAN 转换为对抗样本生成器,显著减少了训练时间。
  • 尽管感知质量低于基于扰动的方法,但生成的对抗样本仍具有效性,表明该方法具备实际可行性。
  • 自适应 GAN 的攻击成功率不受扰动大小的限制,因其生成的是全新图像,这可能解释其在鲁棒分类器上表现更优的原因。
  • 该框架表明,基于 GAN 的生成方法可产生在结构上与真实数据显著不同的对抗样本,从而拓展了对抗样本子空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。