[论文解读] AdvGAN++ : Harnessing latent layers for adversary generation
AdvGAN++ 通过使用目标模型的潜在特征图作为先验,而非原始输入图像,改进了对抗样本的生成,从而实现更高效且更具感知真实感的攻击。在 MNIST 和 CIFAR-10 上,即使在防御训练下,AdvGAN++ 的攻击成功率也高于 AdvGAN,同时通过消除编码器-解码器生成器的需求,降低了训练和推理开销。
Adversarial examples are fabricated examples, indistinguishable from the original image that mislead neural networks and drastically lower their performance. Recently proposed AdvGAN, a GAN based approach, takes input image as a prior for generating adversaries to target a model. In this work, we show how latent features can serve as better priors than input images for adversary generation by proposing AdvGAN++, a version of AdvGAN that achieves higher attack rates than AdvGAN and at the same time generates perceptually realistic images on MNIST and CIFAR-10 datasets.
研究动机与目标
- 为解决 AdvGAN 依赖输入图像作为先验进行对抗生成时存在的局限性,即可能无法充分利用最脆弱的表示形式。
- 探究潜在特征(已知对对抗扰动更敏感)是否可作为生成有效对抗样本的更好先验。
- 通过用从潜在特征到对抗图像的直接映射替代编码器-解码器生成器架构,降低训练和推理开销。
- 提升对抗样本在防御和非防御模型上的感知真实感与攻击成功率。
提出的方法
- AdvGAN++ 中的生成器接收目标模型 M 的中间层提取的潜在特征图 f(x) 和随机噪声向量 z 作为输入,生成对抗图像 x_adv = G(z|f(x))。
- 生成器通过 GAN 损失、用于误导目标模型 M 的对抗损失,以及确保与原始图像最小畸变的 L2 扰动损失进行训练。
- 判别器用于区分真实图像与生成的对抗样本,促使生成器产生外观逼真的扰动。
- 损失函数结合 GAN 损失、对抗损失 L_adv = E_x[M_t(G(z|f(x)))] 和扰动损失 L_pert = E_x||x - G(z|f(x))||_2,分别由超参数 α 和 β 加权。
- 使用目标模型的最后一个卷积层进行特征提取,生成器通过随机梯度下降端到端训练。
- 该方法避免了 AdvGAN 中的编码器-解码器结构,简化了网络架构并降低了计算成本。
实验结果
研究问题
- RQ1能否从深度神经网络中间层提取的潜在特征,作为生成对抗样本的先验,比原始输入图像更有效?
- RQ2是否用从潜在特征直接生成对抗图像的生成器替代 AdvGAN 中的编码器-解码器生成器,能够提升攻击成功率与感知质量?
- RQ3AdvGAN++ 在多大程度上保持对其他模型的高迁移性,特别是在黑盒攻击场景中?
- RQ4AdvGAN++ 在各种防御训练策略(如 FGSM、迭代 FGSM 和集成对抗训练)下的表现如何?
主要发现
- 在无防御的 MNIST 与 LeNet-C 模型下,AdvGAN++ 达到了 98.4% 的攻击成功率,高于 AdvGAN 的 97.9%。
- 在无防御的 CIFAR-10 与 Wide-ResNet-34-10 模型下,AdvGAN++ 实现了 99.92% 的攻击成功率,超过 AdvGAN 的 99.3%。
- 在 FGSM 防御训练下,AdvGAN++ 在 MNIST 上达到 27.31% 的攻击成功率,高于 AdvGAN 的 13.5%。
- 在 CIFAR-10 上采用迭代 FGSM 训练时,AdvGAN++ 实现了 43.2% 的攻击成功率,显著优于 AdvGAN 的 13.94%。
- 在 CIFAR-10 上,AdvGAN++ 生成的对抗样本对 ResNet-32 模型的迁移攻击成功率高达 89.4%,表现出极强的迁移能力。
- 视觉结果表明,即使在高畸变约束下,AdvGAN++ 生成的对抗样本在感知上与真实图像几乎无法区分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。