Skip to main content
QUICK REVIEW

[论文解读] Universal, transferable and targeted adversarial attacks

Junde Wu, Rao Fu|arXiv (Cornell University)|Aug 29, 2019
Adversarial Robustness in Machine Learning参考文献 13被引用 8
一句话总结

本文提出了一种首个通用、可迁移且定向的对抗性攻击方法,通过学习从自然图像到对抗样本的通用映射,使深度神经网络将所有输入误分类为特定目标类别。通过约束高层特征表示以匹配低频欺骗图像(这些图像本身具有更强的可迁移性),该方法在多种模型上实现了高成功率,包括黑盒服务器,且扰动极小。

ABSTRACT

Deep Neural Networks have been found vulnerable re-cently. A kind of well-designed inputs, which called adver-sarial examples, can lead the networks to make incorrectpredictions. Depending on the different scenarios, goalsand capabilities, the difficulties of the attacks are different.For example, a targeted attack is more difficult than a non-targeted attack, a universal attack is more difficult than anon-universal attack, a transferable attack is more difficultthan a nontransferable one. The question is: Is there existan attack that can meet all these requirements? In this pa-per, we answer this question by producing a kind of attacksunder these conditions. We learn a universal mapping tomap the sources to the adversarial examples. These exam-ples can fool classification networks to classify all of theminto one targeted class, and also have strong transferability.Our code is released at: xxxxx.

研究动机与目标

  • 解决在最严格威胁模型条件下,通用、可迁移且定向的对抗性攻击是否能够共存的开放性问题。
  • 开发一种方法,生成在多种模型(包括黑盒系统)上均有效的对抗样本,且无需访问受害模型的架构或梯度信息。
  • 通过利用对模型特定边界曲率不敏感的低频欺骗图像,提升可迁移性。
  • 设计一个通用映射网络(FTN),在保持定向误分类的同时,将对抗扰动泛化至所有输入图像。

提出的方法

  • 引入低频欺骗图像(LFIs)作为鲁棒、可迁移对抗模式的代理,通过优化生成,使其在缺乏视觉结构的情况下仍能以高置信度被分类为目标类别。
  • 利用VGG19的ReLU 5-2、5-3和5-4层的特征级约束,将生成的对抗样本的高层表示与LFIs的表示对齐,以确保可迁移性。
  • 训练一个神经网络(FTN)以学习从干净图像到对抗样本的通用映射,损失函数同时强制实现定向误分类和与LFI表示的相似性。
  • 采用基于梯度的优化方法,并引入高频噪声正则化,以确保对抗扰动微小且不可察觉,同时保持鲁棒性。
  • 利用特征的流形结构论证,低频模式对不同模型间的边界曲率差异更具鲁棒性,从而增强可迁移性。
  • 在白盒和黑盒模型(包括真实世界API)上测试该方法,以验证在实际约束下的可迁移性和有效性。

实验结果

研究问题

  • RQ1在最严格的威胁模型(白盒、通用、定向且可迁移)下,能否同时实现通用、可迁移且定向的对抗性攻击?
  • RQ2为何低频欺骗图像相比高频图像表现出更强的可迁移性?
  • RQ3通过约束高层特征表示以匹配低频欺骗图像的表示,能否提升通用对抗攻击的可迁移性?
  • RQ4当无法访问模型时,该方法在黑盒模型上的表现如何?
  • RQ5特征流形结构与边界曲率在决定对抗性可迁移性方面起到何种作用?

主要发现

  • 所提方法成功生成了通用、定向且可迁移的对抗样本,能以高置信度误导白盒和黑盒模型。
  • 通过约束对抗样本的高层表示以匹配低频欺骗图像的表示,其可迁移性显著高于标准梯度方法。
  • 该方法在多种模型(包括ResNet、DenseNet和Inception)上均实现了高攻击成功率,即使在无模型访问权限的黑盒API上攻击也表现优异。
  • 实验结果表明,低频欺骗图像在不同模型间的高层表示更为相似,暗示其鲁棒性源于其接近自然图像流形的特性。
  • 特征空间约束使攻击摆脱了对特定模型边界曲率的依赖,从而解释了其相比边界跟随方法具有更高可迁移性的原因。
  • 消融实验表明,若移除LFI表示约束,可迁移性将急剧下降,验证了该约束在方法成功中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。