Skip to main content
QUICK REVIEW

[论文解读] Adaptive Generation of Unrestricted Adversarial Inputs

Isaac Dunn, Hadrien Pouget|arXiv (Cornell University)|May 7, 2019
Adversarial Robustness in Machine Learning参考文献 47被引用 10
一句话总结

本文提出一种方法,通过对抗性微调预训练的生成对抗网络(GAN),生成逼真但被错误分类的无限制对抗图像。与以往工作不同,该方法可迭代适应防御模型,在单次前向传播中实现80%的攻击成功率,效率比现有方法高出400至2000倍,同时保持高逼真度,并可扩展至ImageNet数据集。

ABSTRACT

Neural networks are vulnerable to adversarially-constructed perturbations of their inputs. Most research so far has considered perturbations of a fixed magnitude under some $l_p$ norm. Although studying these attacks is valuable, there has been increasing interest in the construction of (and robustness to) unrestricted attacks, which are not constrained to a small and rather artificial subset of all possible adversarial inputs. We introduce a novel algorithm for generating such unrestricted adversarial inputs which, unlike prior work, is adaptive: it is able to tune its attacks to the classifier being targeted. It also offers a 400-2,000x speedup over the existing state of the art. We demonstrate our approach by generating unrestricted adversarial inputs that fool classifiers robust to perturbation-based attacks. We also show that, by virtue of being adaptive and unrestricted, our attack is able to defeat adversarial training against it.

研究动机与目标

  • 解决生成能够绕过现代防御机制的逼真无限制对抗样本的挑战。
  • 克服现有基于GAN的对抗攻击方法在面对对抗性训练分类器时失效的局限性。
  • 通过减少每个对抗样本所需的前向/反向传播次数,提升效率。
  • 利用预训练GAN在无需辅助分类器的情况下,将对抗攻击生成扩展至ImageNet等大规模数据集。
  • 确保生成的图像保持高度逼真,同时在多种防御机制下最大化误分类率。

提出的方法

  • 对抗性微调预训练生成器,使其生成的图像在判别器眼中既逼真,又能被目标分类器错误分类。
  • 使用结合对抗损失(用于逼真度)和交叉熵损失(用于误分类)的损失函数,实现端到端训练。
  • 在推理过程中迭代调整生成器,以响应目标分类器的变化,特别是针对对抗性训练的场景。
  • 利用生成器的潜在空间采样输入,以在最小偏离真实数据分布的前提下最大化误分类率。
  • 在MNIST和ImageNet等多样化数据集上应用该方法,使用BigGAN等预训练GAN,无需辅助分类器。
  • 通过微调后仅需一次前向传播即可生成对抗样本,实现高效率,而以往方法通常需要100至500次迭代。

实验结果

研究问题

  • RQ1能否通过微调GAN,生成既逼真又能持续被错误分类的无限制对抗样本?
  • RQ2与以往基于GAN的攻击方法相比,该方法在对抗性训练分类器上的表现如何?
  • RQ3该方法在推理速度和计算成本方面相比现有方法的效率提升程度如何?
  • RQ4该方法是否可在无需辅助分类器的情况下,扩展至高维数据集(如ImageNet)?
  • RQ5该方法在实现高攻击成功率的同时,能在多大程度上保持图像的逼真度?

主要发现

  • 所提方法在目标对抗样本上实现了80%的攻击成功率,与最先进方法(88.8%)相当,但效率显著更高。
  • 对抗性微调后,80%的生成对抗图像被错误分类为正确的目标标签,而未经微调时仅为58%。
  • 该方法保持了高逼真度:在人工评估中,24%的生成图像被选为比真实图像更逼真(对比以往工作为21.8%),接近完全逼真图像的50%基准。
  • 该方法比以往工作高效400至2000倍,微调后每个对抗样本仅需一次前向传播。
  • 该方法能成功适应对抗性训练分类器,在防御机制存在时仍保持高攻击有效性,而以往方法在该情况下会失效。
  • 该方法可扩展至ImageNet,成功在比以往工作大16倍的数据集上实现对抗攻击生成,并可与任意预训练GAN(包括BigGAN)配合使用,无需辅助分类器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。