Skip to main content
QUICK REVIEW

[论文解读] Deflecting Adversarial Attacks

Yao Qin, Nicholas Frosst|arXiv (Cornell University)|Feb 18, 2020
Adversarial Robustness in Machine Learning参考文献 25被引用 15
一句话总结

本文提出了一种名为“对抗攻击规避”的新型防御策略,利用具有循环一致性损失的胶囊网络,使对抗样本在视觉上与目标类别相似,从而在人类感知中不再被视为对抗样本。该方法在标准攻击和防御感知攻击下均实现了最先进水平的检测性能,且在SVHN数据集上成功规避了69.7%的未检测到的黑盒攻击,该结果通过人工标注研究得到验证。

ABSTRACT

There has been an ongoing cycle where stronger defenses against adversarial attacks are subsequently broken by a more advanced defense-aware attack. We present a new approach towards ending this cycle where we "deflect'' adversarial attacks by causing the attacker to produce an input that semantically resembles the attack's target class. To this end, we first propose a stronger defense based on Capsule Networks that combines three detection mechanisms to achieve state-of-the-art detection performance on both standard and defense-aware attacks. We then show that undetected attacks against our defense often perceptually resemble the adversarial target class by performing a human study where participants are asked to label images produced by the attack. These attack images can no longer be called "adversarial'' because our network classifies them the same way as humans do.

研究动机与目标

  • 为应对攻击-防御-攻击的持续循环,提出一种新防御策略,使对抗样本在人类感知中与目标类别无法区分。
  • 开发一种对标准攻击和防御感知攻击均具有鲁棒性的检测机制。
  • 通过证明未被检测到的对抗攻击在人类标注者眼中已不再真正‘对抗’,即被分类为目标类别,来验证其有效性。
  • 设计一种防御感知攻击,以严格测试所提检测机制的鲁棒性。

提出的方法

  • 引入一种循环一致性损失,强制使获胜胶囊的重建结果与原始输入的类别条件分布相匹配,从而提升检测与规避能力。
  • 采用双流架构:一个胶囊分类网络和一个基于胶囊姿态参数条件化的重建网络。
  • 结合三种检测机制——重建差异、基于注意力的检测和循环一致性损失,以提升整体鲁棒性。
  • 提出两种与攻击无关的检测方法,基于干净样本与对抗样本重建结果之间的差异。
  • 设计一种防御感知攻击,专门针对检测机制,以测试其抗性。
  • 通过Amazon Mechanical Turk的人工研究,评估未被检测到的对抗样本是否在人类眼中与目标类别在视觉上一致。

实验结果

研究问题

  • RQ1能否使对抗攻击被规避,使其在视觉上与目标类别相似,从而在人类感知中不再被视为对抗样本?
  • RQ2所提出的循环一致性损失是否能同时提升胶囊网络在对抗攻击检测与规避方面的能力?
  • RQ3该检测机制在SVHN和CIFAR-10上对标准攻击与防御感知攻击的检测效果如何?
  • RQ4未被检测到的对抗攻击在人类标注者眼中,与目标类别的视觉相似程度达到何种程度?
  • RQ5防御感知攻击是否能成功绕过检测机制?若能,模型为何仍能实现高比例的规避?

主要发现

  • 在SVHN数据集上,69.7%的未检测到的黑盒PGD攻击被人工标注者分类为目标类别,表明规避成功。
  • 检测机制在SVHN和CIFAR-10上均实现了最先进性能,优于先前方法在防御感知攻击下的表现。
  • 防御感知攻击能够生成逃逸检测的对抗样本,但这些样本在视觉上仍与目标类别保持一致。
  • 在CIFAR-10上,对抗攻击的规避一致性低于SVHN,但其与目标类别的视觉相似度仍显著高于与原始输入的相似度。
  • 循环一致性损失显著提升了模型重建类别条件分布的能力,从而增强了检测与规避性能。
  • 人工研究证实,针对基线CNN模型的攻击未表现出与目标类别在视觉上的一致性,验证了规避效应的独特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。