[论文解读] Universal, transferable and targeted adversarial attacks
本文提出了一种首个通用、可迁移且定向的对抗性攻击方法,通过学习从自然图像到对抗样本的通用映射,使深度神经网络将所有输入误分类为特定目标类别。通过约束高层特征表示以匹配低频欺骗图像(这些图像本身具有更强的可迁移性),该方法在多种模型上实现了高成功率,包括黑盒服务器,且扰动极小。
Deep Neural Networks have been found vulnerable re-cently. A kind of well-designed inputs, which called adver-sarial examples, can lead the networks to make incorrectpredictions. Depending on the different scenarios, goalsand capabilities, the difficulties of the attacks are different.For example, a targeted attack is more difficult than a non-targeted attack, a universal attack is more difficult than anon-universal attack, a transferable attack is more difficultthan a nontransferable one. The question is: Is there existan attack that can meet all these requirements? In this pa-per, we answer this question by producing a kind of attacksunder these conditions. We learn a universal mapping tomap the sources to the adversarial examples. These exam-ples can fool classification networks to classify all of theminto one targeted class, and also have strong transferability.Our code is released at: xxxxx.
研究动机与目标
- 解决在最严格威胁模型条件下,通用、可迁移且定向的对抗性攻击是否能够共存的开放性问题。
- 开发一种方法,生成在多种模型(包括黑盒系统)上均有效的对抗样本,且无需访问受害模型的架构或梯度信息。
- 通过利用对模型特定边界曲率不敏感的低频欺骗图像,提升可迁移性。
- 设计一个通用映射网络(FTN),在保持定向误分类的同时,将对抗扰动泛化至所有输入图像。
提出的方法
- 引入低频欺骗图像(LFIs)作为鲁棒、可迁移对抗模式的代理,通过优化生成,使其在缺乏视觉结构的情况下仍能以高置信度被分类为目标类别。
- 利用VGG19的ReLU 5-2、5-3和5-4层的特征级约束,将生成的对抗样本的高层表示与LFIs的表示对齐,以确保可迁移性。
- 训练一个神经网络(FTN)以学习从干净图像到对抗样本的通用映射,损失函数同时强制实现定向误分类和与LFI表示的相似性。
- 采用基于梯度的优化方法,并引入高频噪声正则化,以确保对抗扰动微小且不可察觉,同时保持鲁棒性。
- 利用特征的流形结构论证,低频模式对不同模型间的边界曲率差异更具鲁棒性,从而增强可迁移性。
- 在白盒和黑盒模型(包括真实世界API)上测试该方法,以验证在实际约束下的可迁移性和有效性。
实验结果
研究问题
- RQ1在最严格的威胁模型(白盒、通用、定向且可迁移)下,能否同时实现通用、可迁移且定向的对抗性攻击?
- RQ2为何低频欺骗图像相比高频图像表现出更强的可迁移性?
- RQ3通过约束高层特征表示以匹配低频欺骗图像的表示,能否提升通用对抗攻击的可迁移性?
- RQ4当无法访问模型时,该方法在黑盒模型上的表现如何?
- RQ5特征流形结构与边界曲率在决定对抗性可迁移性方面起到何种作用?
主要发现
- 所提方法成功生成了通用、定向且可迁移的对抗样本,能以高置信度误导白盒和黑盒模型。
- 通过约束对抗样本的高层表示以匹配低频欺骗图像的表示,其可迁移性显著高于标准梯度方法。
- 该方法在多种模型(包括ResNet、DenseNet和Inception)上均实现了高攻击成功率,即使在无模型访问权限的黑盒API上攻击也表现优异。
- 实验结果表明,低频欺骗图像在不同模型间的高层表示更为相似,暗示其鲁棒性源于其接近自然图像流形的特性。
- 特征空间约束使攻击摆脱了对特定模型边界曲率的依赖,从而解释了其相比边界跟随方法具有更高可迁移性的原因。
- 消融实验表明,若移除LFI表示约束,可迁移性将急剧下降,验证了该约束在方法成功中的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。