[论文解读] ML-LOO: Detecting Adversarial Examples with Feature Attribution
本文提出 ML-LOO,一种新颖的对抗性样本检测方法,通过利用深度神经网络的特征归因分数来识别对抗性输入。通过测量原始输入与扰动输入之间留一法(LOO)特征归因的尺度差异,并扩展至多层归因,该方法在多种攻击类型和置信度水平下均能有效检测对抗性样本,检测准确率和可迁移性均优于当前最先进检测器。
Deep neural networks obtain state-of-the-art performance on a series of tasks. However, they are easily fooled by adding a small adversarial perturbation to input. The perturbation is often human imperceptible on image data. We observe a significant difference in feature attributions of adversarially crafted examples from those of original ones. Based on this observation, we introduce a new framework to detect adversarial examples through thresholding a scale estimate of feature attribution scores. Furthermore, we extend our method to include multi-layer feature attributions in order to tackle the attacks with mixed confidence levels. Through vast experiments, our method achieves superior performances in distinguishing adversarial examples from popular attack methods on a variety of real data sets among state-of-the-art detection methods. In particular, our method is able to detect adversarial examples of mixed confidence levels, and transfer between different attacking methods.
研究动机与目标
- 为应对现有检测方法难以识别的对抗性样本检测挑战,特别是高置信度或混合置信度水平的样本。
- 利用对抗性样本在决策边界附近特征归因图的不稳定性,其中扰动会导致归因分数发生显著变化。
- 开发一种对不同攻击类型具有鲁棒性且可在不同攻击间实现可迁移性的检测框架,且无需进行模型特定调优。
- 将单层归因扩展至多层特征归因,以捕捉高置信度对抗性样本中的不确定性。
- 基于归因差异的统计摘要,提出一种模型无关且查询高效的检测方法。
提出的方法
- 使用留一法(LOO)特征归因计算重要性分数,通过系统性地屏蔽每个输入特征并测量模型预测的变化。
- 将归因分数的尺度(如 L2 范数或方差)作为原始样本与对抗性样本之间特征不一致性的统计代理指标。
- 对尺度估计值应用阈值机制,将输入分类为自然样本或对抗性样本,其中阈值通过干净数据学习得到。
- 通过聚合中间层的归因分数,将检测扩展至多层特征归因,即使模型对对抗性样本具有高置信度,也能保持敏感性。
- 采用统计检验或基于分布的阈值方法,根据归因偏移的幅度区分自然样本与对抗性样本。
- 在一种攻击类型(如 C&W)上训练检测器,并在其他攻击(如 PGD、FGSM、JSMA)上评估其可迁移性,验证其泛化能力。
实验结果
研究问题
- RQ1特征归因图是否能在决策边界附近揭示自然样本与对抗性样本之间的一致性统计差异?
- RQ2基于归因尺度差异的检测方法是否能泛化至多种对抗性攻击类型,包括不同置信度水平的攻击?
- RQ3在单层方法失效的高置信度对抗性样本中,引入多层特征归因是否能提升检测性能?
- RQ4在一种攻击类型上训练的检测器是否能成功检测由其他未见攻击生成的对抗性样本,体现其可迁移性?
- RQ5在多个数据集和攻击场景下,所提方法与当前最先进检测基线相比性能如何?
主要发现
- 在使用 C&W 攻击数据的 CIFAR-10 上,ML-LOO 的 AUC 达到 0.879,显著优于马氏距离(0.818)、LID(0.763)和 KD+BU(0.753),在检测混合置信度对抗性样本方面表现更优。
- 在 FPR = 0.01 时,ML-LOO 在混合置信度 C&W 攻击下的 TPR 为 0.21,而马氏距离、LID 和 KD+BU 的 TPR 分别为 0.08、0.14 和 0.20,表明在低误报率下检测性能更优。
- 在 $L_{∞}$-PGD 攻击下,ML-LOO 在 CIFAR-10 上保持高性能,AUC 达到 0.879,优于 KD+BU(0.753)、LID(0.763)和马氏距离(0.818)。
- ML-LOO 展现出强大的可迁移性:当在 C&W 攻击上训练时,其在 MNIST、CIFAR-10 和 CIFAR-100 上对 $L_{∞}$-PGD、FGSM 和边界攻击的 AUC 均超过 0.98。
- 对于高置信度 $L_{∞}$-PGD 攻击(ε=0.03),ML-LOO 在 FPR=0.01 时达到 TPR 0.48,而 KD+BU、LID 和马氏距离的 TPR 均低于 0.10,表明 ML-LOO 在高置信度场景下具有显著有效性。
- 该方法成功检测了混合置信度攻击中的对抗性样本,而其他检测器因失败,归因于其多层归因设计能够捕捉中间表示中的不确定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。