Skip to main content
QUICK REVIEW

[论文解读] Is AmI (Attacks Meet Interpretability) Robust to Adversarial Examples?

Nicholas Carlini|arXiv (Cornell University)|Feb 6, 2019
Adversarial Robustness in Machine Learning参考文献 3被引用 18
一句话总结

本文评估了AmI防御机制,该机制利用可解释性技术识别关键神经元,并通过比较原始网络与修改后网络的预测结果来拒绝对抗性输入。尽管该防御被宣传为具有鲁棒性,但作者证明,一种简单且不针对防御机制的攻击方法在ℓ∞范数为0.01的无目标对抗样本上实现了100%的逃逸成功率,将检测率降至0%,从而证明该防御无效。

ABSTRACT

No.

研究动机与目标

  • 评估利用可解释性技术在人脸识别中检测对抗性样本的AmI防御的鲁棒性。
  • 研究当攻击者对防御机制的存在一无所知时,该防御在弱威胁模型下是否仍有效。
  • 在攻击失败时挑战防御声明的有效性,强调严谨评估的必要性。
  • 证明即使在原始模型上进行的简单、高置信度目标攻击,也能成功规避AmI的检测。
  • 通过倡导发布源代码并严格评估攻击有效性,推动防御研究的透明化。

提出的方法

  • 作者仅使用原始、未经修改的神经网络生成对抗性样本,完全忽略AmI防御机制。
  • 选择一个随机的错误目标标签,在原始模型上生成一个高置信度的目标对抗性样本。
  • 将该对抗性样本在原始网络和增强后的AmI网络上进行测试;若两者分类结果一致,则认为成功规避了检测。
  • 重复此过程直至找到成功逃逸的样本,平均需要25次尝试。
  • 该攻击为不针对防御机制的攻击,即不适应AmI防御的结构或行为特征。
  • 该方法依赖于如下假设:若原始网络与增强网络对预测结果达成一致,则输入不会被AmI拒绝。

实验结果

研究问题

  • RQ1不针对防御机制的攻击是否能成功规避AmI的检测机制?
  • RQ2AmI防御对ℓ∞范数为0.01的无目标对抗样本是否具有鲁棒性?
  • RQ3为何攻击无法检测AmI中的对抗性样本?这又对防御机制的有效性意味着什么?
  • RQ4AmI中使用可解释性技术是否真正提升了对对抗性输入的鲁棒性?
  • RQ5原始防御论文中缺乏明确威胁模型,在多大程度上阻碍了安全评估的严谨性?

主要发现

  • AmI防御在无目标对抗样本上的真正检出率为0%,意味着它未能检测到任何此类样本。
  • 该攻击实现了100%的逃逸成功率,平均需25次尝试即可达成。
  • 即使在攻击者对防御机制一无所知的弱威胁模型下,该防御仍完全无效。
  • 检测率低于原始未防御模型9.9%的假阳性率,表明其性能更差。
  • 作者确认,该防御所声称的鲁棒性无效,因其在最简假设下即告失败。
  • 本研究揭示了在攻击失败但无明确原因时,评估防御机制易陷入自我欺骗的风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。