Skip to main content
QUICK REVIEW

[论文解读] Adversarial Attacks against Deep Saliency Models

Zhaohui Che, Ali Borji|arXiv (Cornell University)|Apr 2, 2019
Adversarial Robustness in Machine Learning参考文献 28被引用 6
一句话总结

本文提出了首个针对深度显著性模型的稀疏特征空间对抗攻击,通过修改中间特征图而非输入像素,生成高度不可察觉且结构稀疏的扰动。该方法在感受野更大的深层网络中实现更高的攻击成功率,其攻击效果比图像空间方法更具隐蔽性,揭示了视觉系统中显著性模型存在的关键安全漏洞。

ABSTRACT

Currently, a plethora of saliency models based on deep neural networks have led great breakthroughs in many complex high-level vision tasks (e.g. scene description, object detection). The robustness of these models, however, has not yet been studied. In this paper, we propose a sparse feature-space adversarial attack method against deep saliency models for the first time. The proposed attack only requires a part of the model information, and is able to generate a sparser and more insidious adversarial perturbation, compared to traditional image-space attacks. These adversarial perturbations are so subtle that a human observer cannot notice their presences, but the model outputs will be revolutionized. This phenomenon raises security threats to deep saliency models in practical applications. We also explore some intriguing properties of the feature-space attack, e.g. 1) the hidden layers with bigger receptive fields generate sparser perturbations, 2) the deeper hidden layers achieve higher attack success rates, and 3) different loss functions and different attacked layers will result in diverse perturbations. Experiments indicate that the proposed method is able to successfully attack different model architectures across various image scenes.

研究动机与目标

  • 探究深度显著性模型在对抗攻击下的鲁棒性,尽管其在高层视觉任务中被广泛应用,但该问题仍鲜有研究。
  • 提出一种在特征空间而非图像空间中操作的新颖对抗攻击方法,以实现更稀疏且更隐蔽的扰动。
  • 分析损失函数、网络深度、感受野大小及层结构对对抗扰动有效性与结构的影响。
  • 评估不同模型与攻击类型之间对抗扰动的可迁移性与对抗性特性。
  • 通过识别有效与无效扰动的关键特征,为未来防御机制提供洞见。

提出的方法

  • 攻击在特征空间中进行,通过优化显著性模型中间特征图上的扰动,而非输入图像像素。
  • 采用稀疏正则化策略,生成最小化且空间局部化的扰动,视觉上几乎不可察觉,归一化空间中每通道最大强度低于0.07。
  • 该方法仅需部分威胁模型知识,包括网络架构及部分层参数,支持类黑盒攻击。
  • 使用不同的损失函数——KL散度、CC(皮尔逊相关系数)、L1和NSS——引导优化过程,生成多样化的扰动模式。
  • 在多个隐藏层上应用攻击,并通过CC及其他显著性评估指标测量攻击成功率。
  • 通过将一种模型或损失类型的扰动应用于另一模型,评估可迁移性与对抗性效应,利用CC指标评估性能下降程度。

实验结果

研究问题

  • RQ1深度显著性模型中哪些隐藏层对特征空间对抗攻击最为脆弱?层深度或感受野大小如何影响攻击成功率?
  • RQ2特征空间扰动的结构与感知特性与传统图像空间对抗扰动相比有何异同?
  • RQ3不同损失函数(如KL、CC、L1)对生成对抗扰动的模式、稀疏性及有效性有何影响?
  • RQ4对抗扰动在不同显著性模型架构之间的可迁移性如何?当扰动组合或被缓解时,其相互作用机制是怎样的?
  • RQ5图像空间扰动能否中和特征空间扰动,反之亦然?这是否表明存在共享或独立的对抗性模式?

主要发现

  • 所提出的特征空间攻击生成的扰动显著比图像空间攻击更稀疏,最大通道强度低于0.07,对人类观察者几乎不可察觉。
  • 感受野更大的深层隐藏层能生成更稀疏且更有效的对抗扰动,实现更高的攻击成功率。
  • 攻击成功率高度依赖于损失函数的选择:KL、CC和L1损失产生不同的扰动模式,导致显著性图输出各异。
  • 不同显著性模型之间扰动的可迁移性较弱,表明即使架构相似,扰动也具有高度模型特异性。
  • 图像空间与特征空间攻击的扰动具有不同的空间结构:图像空间扰动更密集,可部分缓解特征空间扰动,但反之不成立。
  • 扰动的空间结构至关重要——随机打乱扰动的行或列会完全破坏其对抗效果,证实空间一致性对攻击成功至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。