Skip to main content
QUICK REVIEW

[论文解读] AdvSPADE: Realistic Unrestricted Attacks for Semantic Segmentation

Guangyu Shen, Chengzhi Mao|arXiv (Cornell University)|Oct 6, 2019
Adversarial Robustness in Machine Learning参考文献 56被引用 12
一句话总结

该论文提出了一种名为AdvSPADE的新方法,通过使用SPADE架构的条件生成对抗网络(conditional GAN)并引入对抗损失,生成高质量、逼真且无限制的语义分割模型对抗样本。该方法在Cityscapes和ADE20K数据集上相比PGD攻击的成功率最高提升41.0%,甚至能成功欺骗经过范数有界对抗数据训练的鲁棒模型。

ABSTRACT

Due to the inherent robustness of segmentation models, traditional norm-bounded attack methods show limited effect on such type of models. In this paper, we focus on generating unrestricted adversarial examples for semantic segmentation models. We demonstrate a simple and effective method to generate unrestricted adversarial examples using conditional generative adversarial networks (CGAN) without any hand-crafted metric. The naïve implementation of CGAN, however, yields inferior image quality and low attack success rate. Instead, we leverage the SPADE (Spatially-adaptive denormalization) structure with an additional loss item to generate effective adversarial attacks in a single step. We validate our approach on the popular Cityscapes and ADE20K datasets, and demonstrate that our synthetic adversarial examples are not only realistic, but also improve the attack success rate by up to 41.0\% compared with the state of the art adversarial attack methods including PGD.

研究动机与目标

  • 解决范数有界攻击在鲁棒语义分割模型上效果有限的问题。
  • 生成在高分辨率图像上保持语义一致性和视觉保真度的逼真、无限制对抗样本。
  • 评估通过条件生成对抗网络生成的对抗样本是否能有效绕过最先进的鲁棒分割模型。
  • 探究利用此类对抗样本通过数据增强提升模型鲁棒性的潜力。

提出的方法

  • 将SPADE条件生成对抗网络架构改进,用于生成高分辨率(最高达100万像素)的语义分割对抗图像。
  • 在SPADE框架中引入额外的对抗损失项,以直接优化对目标分割模型的欺骗效果。
  • 结合特征匹配损失和VGG感知损失,以提升图像质量和语义一致性。
  • 通过单步训练从单张输入图像生成多样化的对抗样本。
  • 采用条件生成对抗网络设置,利用分割标签引导图像生成,确保结构和语义的一致性。
  • 利用SPADE结构的空间自适应归一化机制,在无需显式监督的情况下生成逼真的纹理和布局。

实验结果

研究问题

  • RQ1能否为语义分割模型生成既视觉逼真又与其标签语义一致的无限制对抗样本?
  • RQ2与传统范数有界攻击(如PGD)相比,这些无限制对抗样本在欺骗最先进的分割模型方面效果如何?
  • RQ3通过条件生成对抗网络生成的对抗样本能否绕过经过范数有界扰动训练的鲁棒模型?
  • RQ4当将此类对抗样本用于数据增强时,能在多大程度上提升分割模型的鲁棒性?
  • RQ5人类观察者如何评价生成的对抗样本的逼真度和语义一致性?

主要发现

  • AdvSPADE在Cityscapes数据集上实现了84%的攻击成功率,相比PGD的57.6%提升了41.0%,且在相同评估协议下。
  • AdvSPADE的FID得分为67.302,表明图像质量很高,显著优于基线GAN模型,且与真实图像相当。
  • 人工评估显示,94.4%的标注者能正确识别Cityscapes数据集中AdvSPADE生成图像的语义含义,证实了语义一致性。
  • 即使经过PGD生成的范数有界对抗样本训练的鲁棒模型,在AdvSPADE的无限制攻击下仍失败,DRN-105模型的mIoU仅达3.3%。
  • 当使用AdvSPADE生成的对抗样本进行训练数据增强时,所得模型在PGD攻击下的攻击成功率降至1.8%,表明鲁棒性得到提升。
  • 消融研究证实,若移除对抗损失,模型会退化为标准SPADE生成器,攻击成功率降为0%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。