Skip to main content
QUICK REVIEW

[论文解读] Generative Dynamic Patch Attack

Xiang Li, Shihao Ji|arXiv (Cornell University)|Nov 8, 2021
Adversarial Robustness in Machine Learning参考文献 40被引用 8
一句话总结

本文提出生成式动态补丁攻击(GDPA),一种端到端可微分框架,联合优化对抗性补丁图案与动态、图像特定的位置,以实现最大攻击成功率。GDPA 在多个基准测试中达到最先进攻击成功率,并能实现高度鲁棒的对抗性训练,显著提升对多样化补丁攻击的防御能力,同时比基于优化的基线方法快 40–50 倍。

ABSTRACT

Adversarial patch attack is a family of attack algorithms that perturb a part of image to fool a deep neural network model. Existing patch attacks mostly consider injecting adversarial patches at input-agnostic locations: either a predefined location or a random location. This attack setup may be sufficient for attack but has considerable limitations when using it for adversarial training. Thus, robust models trained with existing patch attacks cannot effectively defend other adversarial attacks. In this paper, we first propose an end-to-end patch attack algorithm, Generative Dynamic Patch Attack (GDPA), which generates both patch pattern and patch location adversarially for each input image. We show that GDPA is a generic attack framework that can produce dynamic/static and visible/invisible patches with a few configuration changes. Secondly, GDPA can be readily integrated for adversarial training to improve model robustness to various adversarial attacks. Extensive experiments on VGGFace, Traffic Sign and ImageNet show that GDPA achieves higher attack success rates than state-of-the-art patch attacks, while adversarially trained model with GDPA demonstrates superior robustness to adversarial patch attacks than competing methods. Our source code can be found at https://github.com/lxuniverse/gdpa.

研究动机与目标

  • 为解决现有补丁攻击使用固定或随机位置的局限性,该局限性阻碍了有效的对抗性训练。
  • 开发一种通用的、端到端可微分框架,联合学习补丁图案与最优图像相关位置。
  • 通过将攻击集成到对抗性训练中,提升模型对现实世界补丁攻击的鲁棒性。
  • 在保持显著快于基于优化的方法(如 PGD 和 ROA)的推理速度的同时,实现高攻击成功率。

提出的方法

  • GDPA 将补丁攻击建模为一个端到端可微分的优化问题,联合学习每个输入图像的补丁图案及其空间位置。
  • 该方法使用一个可学习的补丁生成器,通过一次前向传播同时输出补丁内容及其空间坐标。
  • 它采用可微分的渲染过程,将对抗性补丁插入到预测位置的输入图像中。
  • 攻击目标是最大化目标模型在带补丁输入上的交叉熵损失,从而实现对补丁和位置参数的反向传播。
  • 通过可配置的超参数,该框架支持动态(图像特定)和静态(通用)补丁,以及可见与不可见变体。
  • GDPA 通过将攻击集成到训练循环中,实现高效的对抗性训练,生成对多样化补丁攻击具有鲁棒性的模型。

实验结果

研究问题

  • RQ1一个端到端可微分框架能否联合优化补丁图案与位置,从而在攻击成功率上超越固定或随机位置的方法?
  • RQ2在多样化数据集和模型上,GDPA 的动态补丁生成与最先进补丁攻击相比,攻击成功率如何?
  • RQ3与现有防御方法相比,使用 GDPA 进行对抗性训练在多大程度上提升了对高调物理补丁攻击的鲁棒性?
  • RQ4在实际部署场景中,GDPA 的推理速度与基于优化的攻击(如 PGD 和 ROA)相比如何?

主要发现

  • GDPA 达到最先进攻击成功率,在 VGGFace 上使用动态补丁时达到 99.5%,在 ImageNet 上达到 99.8%,超越现有方法。
  • 使用 GDPA-AT 训练的模型在 Traffic Sign 数据集的贴纸攻击下准确率达 98.5%,在 ImageNet 的 LAVAN 攻击下准确率达 96.2%,优于 PGD-AT、DOA-Grad 和 DOA-Exh。
  • GDPA-AT 展现出更优的鲁棒性,在 VGGFace 上的眼镜攻击下,即使经过 300 次迭代,准确率仍保持在 94.9%,而 DOA-Grad 仅为 81.9%。
  • GDPA 比 PGD 快 40 倍,比 ROA 快 47 倍,每次攻击仅需一次前向传播,使其在实时应用中极为高效。
  • 消融实验表明,动态补丁位置选择显著提升攻击成功率,VGGFace 上的攻击成功率(ASR)从随机位置的 46.3% 提升至动态位置的 99.5%。
  • 该框架成功生成了可见与不可见补丁,在无需架构修改的情况下展现出在不同攻击配置下的多功能性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。