[论文解读] APE-GAN: Adversarial Perturbation Elimination with GAN
APE-GAN 使用生成对抗网络在将输入送入分类器之前去除对抗性扰动,从而改善在 MNIST、CIFAR-10和 ImageNet 上对多种攻击的鲁棒性。
Although neural networks could achieve state-of-the-art performance while recongnizing images, they often suffer a tremendous defeat from adversarial examples--inputs generated by utilizing imperceptible but intentional perturbation to clean samples from the datasets. How to defense against adversarial examples is an important problem which is well worth researching. So far, very few methods have provided a significant defense to adversarial examples. In this paper, a novel idea is proposed and an effective framework based Generative Adversarial Nets named APE-GAN is implemented to defense against the adversarial examples. The experimental results on three benchmark datasets including MNIST, CIFAR10 and ImageNet indicate that APE-GAN is effective to resist adversarial examples generated from five attacks.
研究动机与目标
- 激励对深度神经网络中难以察觉的对抗性扰动的防御。
- 提出一个基于GAN的框架(APE-GAN),从对抗性输入重建接近干净图像的输出。
- 在 MNIST、CIFAR-10 和 ImageNet 上对多种攻击方法展示有效性。
- 表明该防御在不需要目标模型架构知识的情况下也能运行。
提出的方法
- 在 DCGAN 风格的设置中引入生成器 G 和判别器 D,将对抗性输入 X_adv 映射为重构的 X_hat,使其更像干净的 X。
- 用组合损失 l_ape 训练 G,该损失将像素级内容损失与对抗性损失相结合,以确保输出落在干净图像流形上。
- 训练 D,以区分 G(X_adv) 与真实干净图像,形成 G 与 D 之间的最小化-最大化目标。
- 使用对抗扰动消除,其中学习去除扰动的同时保留图像内容。
- 在三类数据集(MNIST、CIFAR-10、ImageNet)上对六种对抗攻击(L-BFGS、FGSM、DeepFool、JSMA、CW L0/L2/L∞)进行评估。
- 提供 MNIST、CIFAR-10 和 ImageNet 变体(APE-GAN m、c、i)的架构细节以及训练设置(学习率、优化器、批量大小)。
实验结果
研究问题
- RQ1在无法获取目标模型参数的情况下,基于GAN的扰动消除器是否能够从对抗性输入重建出接近干净的图像?
- RQ2在多个数据集和对抗攻击方法下,APE-GAN 在恢复正确分类方面有多有效?
- RQ3使用 APE-GAN 的预处理会否影响良性输入(非对抗性输入)的性能?
- RQ4是否可以将 APE-GAN 与其他防御(如对抗性训练)结合,以提高鲁棒性?
主要发现
- 在 MNIST、CIFAR-10 和 ImageNet 上,APE-GAN 在所有攻击中显著降低对抗性错误率。例如,L-BFGS 对抗性输入在 MNIST 上从 93.4% 降至 2.2%,在 CIFAR-10 上从 92.7% 降至 19.9%,在 ImageNet Top-1 上重构后从 93.3% 降至 42.9%。
- 经应用 APE-GAN 后,FGSM 对抗性输入在 MNIST 上从 96.3% 降至 2.8%,在 ImageNet 上从 72.9% 降至 40.1%。
- DeepFool 对抗性输入在重构后从 97.1% 降至 2.2%(MNIST),在 ImageNet 上从 98.4% 降至 45.9%。
- JSMA 对抗性输入在 APE-GAN 后在 MNIST 上从 97.8% 降至 38.6%,在 CIFAR-10 上降至 38.3%。
- CW 攻击对目标模型仍然高度有效,但重构降低了其影响(例如 CW-L0 在 MNIST 上从 100.0% 降至 27.0%;CW-L2 在 MNIST 上从 100.0% 降至 1.5%)。
- 良性输入并未显著降低清洁准确率;APE-GAN 对干净或随机噪声图像的错误率没有显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。