Skip to main content
QUICK REVIEW

[论文解读] Detecting Adversarial Examples from Sensitivity Inconsistency of Spatial-Transform Domain

Jinyu Tian, Jiantao Zhou|arXiv (Cornell University)|Mar 7, 2021
Adversarial Robustness in Machine Learning参考文献 52被引用 6
一句话总结

本文提出敏感性不一致检测器(SID),通过利用对抗样本在空间变换域中对决策边界波动的敏感性高于正常样本的特性,检测对抗样本。通过使用加权平均小波变换(WAWT)训练双分支分类器,SID 在小扰动水平下以及针对 BIM 和 C&W 等高级攻击,均实现了最先进(SOTA)的检测性能。

ABSTRACT

Deep neural networks (DNNs) have been shown to be vulnerable against adversarial examples (AEs), which are maliciously designed to cause dramatic model output errors. In this work, we reveal that normal examples (NEs) are insensitive to the fluctuations occurring at the highly-curved region of the decision boundary, while AEs typically designed over one single domain (mostly spatial domain) exhibit exorbitant sensitivity on such fluctuations. This phenomenon motivates us to design another classifier (called dual classifier) with transformed decision boundary, which can be collaboratively used with the original classifier (called primal classifier) to detect AEs, by virtue of the sensitivity inconsistency. When comparing with the state-of-the-art algorithms based on Local Intrinsic Dimensionality (LID), Mahalanobis Distance (MD), and Feature Squeezing (FS), our proposed Sensitivity Inconsistency Detector (SID) achieves improved AE detection performance and superior generalization capabilities, especially in the challenging cases where the adversarial perturbation levels are small. Intensive experimental results on ResNet and VGG validate the superiority of the proposed SID.

研究动机与目标

  • 解决深度神经网络对导致误分类的不可察觉对抗样本的脆弱性问题。
  • 识别一种几何特性——对决策边界波动的敏感性不一致,以区分正常样本与对抗样本。
  • 开发一种利用该不一致性的检测方法,实现鲁棒且可泛化的对抗样本检测。
  • 在现有方法表现困难的低扰动场景下,提升检测性能。

提出的方法

  • 利用加权平均小波变换(WAWT)构建双分支分类器,生成与原始(主干)分类器不同的变换决策边界。
  • 设计一种基于敏感性的特征,量化样本对边界波动的响应程度,利用对抗样本比正常样本更敏感的特性。
  • 在变换域中使用与主干分类器相同的数据进行双分支分类器的训练,以确保在高度弯曲的边界区域具有结构多样性。
  • 将主干分类器与双分支分类器之间的敏感性差异作为检测信号:显著的不一致性表明样本为对抗样本。
  • 基于两个分类器在边界扰动下预测置信度相对变化的检测分数进行公式化设计。
  • 在多个模型架构(ResNet、VGG)和数据集(CIFAR-10、SVHN)上应用该方法,以验证其泛化能力。

实验结果

研究问题

  • RQ1对决策边界波动的敏感性不一致是否可作为检测对抗样本的可靠信号?
  • RQ2在变换域中构建的双分支分类器是否在高度弯曲的边界区域与主干分类器表现出足够的结构差异?
  • RQ3所提方法是否能在检测准确率上超越 SOTA 检测器(如 LID、MD 和 FS),尤其是在小扰动条件下?
  • RQ4该检测器对旨在逃避检测的白盒对抗攻击是否具备强鲁棒性?
  • RQ5该检测器在不同攻击类型和模型架构之间的泛化能力如何?

主要发现

  • SID 在所有扰动水平下对 BIM 和 DeepFool 生成的对抗样本均取得最高的 AUC 分数,优于 LID、MD 和 FS。
  • 对于 FGSM 生成的样本,当扰动幅度 η ≤ 0.41 时,SID 是最佳检测器,并在具有挑战性的低-η 区域保持高度有效性。
  • 检测器展现出优越的泛化能力:在仅使用一种攻击类型(如 BIM)进行训练后,对其他攻击类型(如 C&W、DeepFool)仍保持高性能。
  • SID 在白盒攻击下表现出强鲁棒性:例如,当在 BIM-L 上训练时,其在白盒攻击策略生成的对抗样本上仍保持 98.31% 的 AUC。
  • 该方法的泛化能力源于:BIM 和 C&W 等复杂攻击生成的对抗样本集中出现在相同的高度弯曲边界区域,从而导致一致的敏感性不一致性。
  • 通过 WAWT 构建双分支分类器的设计,成功创建了与主干分类器具有足够几何差异的决策边界,从而实现有效检测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。