Skip to main content
QUICK REVIEW

[论文解读] CapsAttacks: Robust and Imperceptible Adversarial Attacks on Capsule Networks

Alberto Marchisio, Giorgio Nanfa|arXiv (Cornell University)|Jan 28, 2019
Adversarial Robustness in Machine Learning参考文献 24被引用 20
一句话总结

本文提出 CapsAttacks,一种贪婪的黑盒算法,用于在 GTSRB 数据集上为胶囊网络生成目标性、不可察觉的对抗性样本。该方法利用空间注意力和基于梯度的优化,生成最小扰动,以比标准 CNN 更有效地欺骗 CapsNets,揭示了 CapsNets 虽然具备鲁棒性但因输出概率置信度较低而存在脆弱性,而 VGGNet 由于置信度分数更高,表现出更高的鲁棒性。

ABSTRACT

Capsule Networks preserve the hierarchical spatial relationships between objects, and thereby bears a potential to surpass the performance of traditional Convolutional Neural Networks (CNNs) in performing tasks like image classification. A large body of work has explored adversarial examples for CNNs, but their effectiveness on Capsule Networks has not yet been well studied. In our work, we perform an analysis to study the vulnerabilities in Capsule Networks to adversarial attacks. These perturbations, added to the test inputs, are small and imperceptible to humans, but can fool the network to mispredict. We propose a greedy algorithm to automatically generate targeted imperceptible adversarial examples in a black-box attack scenario. We show that this kind of attacks, when applied to the German Traffic Sign Recognition Benchmark (GTSRB), mislead Capsule Networks. Moreover, we apply the same kind of adversarial attacks to a 5-layer CNN and a 9-layer CNN, and analyze the outcome, compared to the Capsule Networks to study differences in their behavior.

研究动机与目标

  • 研究胶囊网络在自动驾驶等安全关键应用中对对抗性攻击的脆弱性。
  • 在对抗性扰动下,比较胶囊网络与标准 CNN(5 层 LeNet 和 9 层 VGGNet)的鲁棒性。
  • 开发一种自动化、目标性且不可察觉的对抗性攻击方法,适用于黑盒环境。
  • 分析预测置信度和空间注意力如何影响不同架构下的对抗性鲁棒性。

提出的方法

  • 所提出的 CapsAttacks 算法采用贪婪优化策略,在黑盒环境中生成目标性对抗性样本,依赖于模型输出的梯度信息。
  • 通过基于距离的约束确保扰动保持不可察觉,使用最大扰动距离 $ D_{\text{MAX}} $ 控制视觉失真。
  • 该方法迭代地修改输入像素,以最大化目标类别的损失,同时最小化感知变化,使用模型决策边界的可微分近似。
  • 算法根据模型对目标类别的预测概率是否超过阈值来评估对抗性攻击的成功与否,成功度量基于收敛速度和扰动幅度。
  • 在相同攻击条件下,比较 CapsNet、LeNet 和 VGGNet 的行为,分析输出概率的变化和扰动敏感性。
  • 该框架在德国交通标志识别基准(GTSRB)上进行评估,使用真实世界交通标志图像来评估实际鲁棒性。

实验结果

研究问题

  • RQ1胶囊网络在黑盒环境下是否容易受到目标性、不可察觉的对抗性攻击?
  • RQ2在相同对抗性攻击下,胶囊网络的鲁棒性与标准 CNN(如 LeNet 和 VGGNet)相比如何?
  • RQ3预测置信度在决定神经网络对对抗性样本的脆弱性方面起什么作用?
  • RQ4仿射变换和输入级扰动如何影响胶囊网络与 CNN 的鲁棒性?
  • RQ5贪婪的、基于梯度的算法能否生成在不同架构上均有效、不可察觉且鲁棒的对抗性样本?

主要发现

  • 胶囊网络容易受到目标性、不可察觉的对抗性攻击影响,所提出的 CapsAttacks 算法在 GTSRB 数据集上成功生成了欺骗性样本。
  • 与 VGGNet 相比,CapsNet 在更少的迭代次数内就使图像误分类,表明其尽管扰动更难察觉,但敏感性更高。
  • 由于输出概率置信度更高,VGGNet 比 CapsNet 具有更高的鲁棒性,因为真实类别与目标类别之间的概率差距更大。
  • LeNet 是三者中最脆弱的模型,仅需 6 次迭代即可使目标图像误分类,且在 13 次迭代后扰动变得可见。
  • VGGNet 的 $ D(X^*, X) $ 值比 CapsNet 增长得更迅速,表明感知失真在 VGGNet 中积累更快,使其对抗性样本更易被察觉。
  • 尽管准确率相似,CapsNet 的输出概率置信度低于 VGGNet,这导致其对小扰动更敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。