Skip to main content
QUICK REVIEW

[论文解读] Fine-grained Synthesis of Unrestricted Adversarial Examples

Omid Poursaeed, Tianxing Jiang|arXiv (Cornell University)|Nov 20, 2019
Adversarial Robustness in Machine Learning参考文献 63被引用 9
一句话总结

本文提出了一种新颖的方法,通过在最先进的生成模型(如StyleGAN)中对潜在变量进行细粒度操控,生成高分辨率、无限制的对抗性样本。与范数约束攻击不同,该方法生成的对抗性图像具有高度真实性且位于数据流形上,可绕过认证防御,并在对抗训练中提升模型鲁棒性;人类评估证实其外观自然且分类正确。

ABSTRACT

We propose a novel approach for generating unrestricted adversarial examples by manipulating fine-grained aspects of image generation. Unlike existing unrestricted attacks that typically hand-craft geometric transformations, we learn stylistic and stochastic modifications leveraging state-of-the-art generative models. This allows us to manipulate an image in a controlled, fine-grained manner without being bounded by a norm threshold. Our approach can be used for targeted and non-targeted unrestricted attacks on classification, semantic segmentation and object detection models. Our attacks can bypass certified defenses, yet our adversarial images look indistinguishable from natural images as verified by human evaluation. Moreover, we demonstrate that adversarial training with our examples improves performance of the model on clean images without requiring any modifications to the architecture. We perform experiments on LSUN, CelebA-HQ and COCO-Stuff as high resolution datasets to validate efficacy of our proposed approach.

研究动机与目标

  • 为解决范数约束对抗攻击的局限性,实现无需范数边界的图像特征细粒度操控。
  • 生成在视觉上与自然图像无法区分、位于流形上的真实对抗性样本,并通过人类评估加以验证。
  • 通过使用这些样本进行对抗训练,提升模型鲁棒性,且无需修改模型架构。
  • 在图像分类、语义分割和目标检测等多种任务上验证该方法的有效性。
  • 通过生成可绕过可证明鲁棒性保证的对抗性样本,打破基于随机平滑的认证防御。

提出的方法

  • 利用预训练的生成模型(如StyleGAN)解耦图像的可变因素,实现对特定属性的细粒度控制。
  • 利用目标模型的损失函数引导潜在空间优化,生成能误导分类器但保持真实感的对抗性样本。
  • 在潜在空间的多个分辨率上同时应用粗粒度和细粒度操控,生成多样化的对抗性扰动。
  • 通过生成模型将搜索空间限制在真实图像范围内,确保对抗性样本始终位于自然图像流形上。
  • 采用两阶段流程:首先通过潜在空间优化生成对抗性图像;其次通过人类评估和t-SNE可视化验证其真实性。
  • 使用这些对抗性样本进行模型训练,以提升在干净数据上的性能,且无需修改模型架构。

实验结果

研究问题

  • RQ1在生成模型中通过潜在空间的细粒度操控,能否生成绕过范数约束、具有真实感的无限制对抗性样本?
  • RQ2这些对抗性样本是否在人类评估中与自然图像在视觉上无法区分?
  • RQ3使用这些样本进行对抗训练是否能提升模型在干净图像上的准确率,而非如范数有界扰动通常导致的性能下降?
  • RQ4该方法能否在基于随机平滑的认证防御中取得成功,即使此类防御在范数约束下保证了鲁棒性?
  • RQ5该方法是否可迁移至复杂视觉任务,如语义分割和目标检测?

主要发现

  • 99.2%的人类评估者正确识别了基于噪声的对抗性样本,98.7%正确识别了基于风格的样本,证实其视觉真实性。
  • 74.7%的未受扰动StyleGAN生成图像被判定为真实图像,基于噪声的对抗性样本中有74.3%、基于风格的对抗性样本中有70.8%也被同样判定为真实,表明真实感感知下降不足4%。
  • 基于随机平滑的认证防御(ResNet-50,σ=0.5)在干净ImageNet图像上达到63.1%的准确率,但在基于风格的对抗性样本上降至21.7%,基于噪声的样本降至37.8%,证明其对本攻击无效。
  • 使用所提样本进行对抗训练,提升了LSUN图像分类任务的干净集准确率(89.5% vs. 88.9%)和COCO-Stuff语义分割任务的准确率(69.3% vs. 67.9%),而范数有界训练通常导致性能下降。
  • 该方法成功生成了适用于图像分类、语义分割和目标检测的定向与非定向对抗性样本,展现出广泛适用性。
  • 该方法无需修改目标模型架构,且保持高迁移性,如在多种任务和数据集上均表现出一致的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。