[论文解读] Generative Adversarial Examples.
本文提出生成对抗样本——完全从零开始使用条件生成模型(AC-GAN)合成的图像,尽管属于目标类别,但仍被目标分类器错误分类。该方法绕过了强防御机制,包括对抗训练和认证防御,展示了用于鲁棒性评估的一种新型、更隐蔽的威胁模型。
Adversarial examples are typically constructed by perturbing an existing data point, and current defense methods are focused on guarding against this type of attack. In this paper, we propose a new class of adversarial examples that are synthesized entirely from scratch using a conditional generative model. We first train an Auxiliary Classifier Generative Adversarial Network (AC-GAN) to model the class-conditional distribution over inputs. Then, conditioned on a desired class, we search over the AC-GAN latent space to find images that are likely under the generative model and are misclassified by a target classifier. We demonstrate through human evaluation that this new kind of adversarial inputs, which we call Generative Adversarial Examples, are legitimate and belong to the desired class. Our empirical results on the MNIST, SVHN, and CelebA datasets show that generative adversarial examples can easily bypass strong adversarial training and certified defense methods which can foil existing adversarial attacks.
研究动机与目标
- 为解决现有对抗样本的局限性,即依赖于对真实输入的扰动,因而易受检测或缓解此类扰动的防御机制影响。
- 探究是否可使用生成模型从零开始生成对抗样本,从而规避基于输入扰动检测机制的防御。
- 评估最先进防御方法对一种新型对抗样本的鲁棒性,此类样本并非源自真实数据点。
- 证明这些生成对抗样本在视觉上有效且人类可识别为属于目标类别,使其成为一种现实威胁。
提出的方法
- 在MNIST、SVHN和CelebA数据集上训练辅助分类器生成对抗网络(AC-GAN),以建模输入数据的类条件分布。
- 将AC-GAN条件化为目标类别标签,并在潜在空间中搜索,以生成在生成器下可能性最大、而在真实数据分布下可能性最小的图像。
- 使用目标分类器评估生成的图像是否被错误分类为其他类别,尽管这些图像是为属于目标类别而合成的。
- 通过基于梯度的搜索执行潜在空间优化,以寻找能生成高可能性且被错误分类的图像的潜在向量。
- 通过人工评估验证生成样本的真实性,确认其被人类视为目标类别的真实样本。
- 在强防御机制(包括对抗训练和认证防御)上测试生成样本,以评估其规避能力。
实验结果
研究问题
- RQ1是否可以完全从潜在空间生成对抗样本而不扰动真实图像,且其在鲁棒分类器上仍具有效性?
- RQ2生成对抗样本在视觉上是否有效,并且人类观察者是否能将其识别为真实的目标类别样本?
- RQ3这些合成样本是否能绕过最先进的防御机制(如对抗训练和认证防御),而这些防御机制对基于扰动的攻击有效?
- RQ4在攻击成功率和对防御机制的鲁棒性方面,生成对抗样本与传统对抗样本相比表现如何?
主要发现
- 生成对抗样本成功绕过了MNIST、SVHN和CelebA上的强对抗训练防御,实现了高攻击成功率,且不依赖于输入扰动。
- 该方法成功规避了认证防御机制,而这类防御机制旨在保证对基于扰动攻击的鲁棒性,表明当前防御设计存在根本性局限。
- 人工评估证实,生成样本被感知为合法且真实的目标题类样本,证明了其真实性和隐蔽性。
- 即使目标分类器对标准对抗样本具有鲁棒性,生成对抗样本的攻击成功率仍保持高位,凸显其有效性。
- 该方法揭示了一种新型威胁模型:对抗输入并非扰动,而是数据流形上高可能性的合成样本,挑战了现有防御机制的假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。