[论文解读] Gradient Similarity: An Explainable Approach to Detect Adversarial Attacks against Deep Learning
本文提出梯度相似性(Gradient Similarity, GS),一种计算高效的度量方法,利用影响函数检测对抗性输入,通过测量训练数据点对模型预测的影响来实现。GS使逻辑回归检测器在未见攻击上实现接近完美的ROC-AUC(95–100%),并在MNIST上对白盒攻击检测的AUC达到87–97%,即使攻击者完全掌握模型信息也具有强鲁棒性。
Deep neural networks are susceptible to small-but-specific adversarial perturbations capable of deceiving the network. This vulnerability can lead to potentially harmful consequences in security-critical applications. To address this vulnerability, we propose a novel metric called \emph{Gradient Similarity} that allows us to capture the influence of training data on test inputs. We show that \emph{Gradient Similarity} behaves differently for normal and adversarial inputs, and enables us to detect a variety of adversarial attacks with a near perfect ROC-AUC of 95-100\%. Even white-box adversaries equipped with perfect knowledge of the system cannot bypass our detector easily. On the MNIST dataset, white-box attacks are either detected with a high ROC-AUC of 87-96\%, or require very high distortion to bypass our detector.
研究动机与目标
- 解决深度神经网络对微小、有针对性的对抗扰动高度敏感的问题,这些扰动会导致高置信度下的误分类。
- 开发一种对零知识攻击者和白盒攻击者均具有鲁棒性的检测方法,包括那些完全掌握模型架构和参数的攻击者。
- 构建一种可解释的检测器,通过影响函数作为理论基础,将模型预测与训练数据的影响关联起来。
- 通过引入轻量级代理度量——梯度相似性,降低基于影响函数检测的计算成本,同时保持检测性能。
- 通过交叉验证评估检测器对未见攻击方法的泛化能力。
提出的方法
- 提出梯度相似性(GS)作为影响函数的低成本近似,计算方式为测试输入损失梯度与每个训练样本损失梯度之间的余弦相似度。
- 利用GS为每个测试输入计算一个特征向量,表示其梯度与所有训练样本梯度的相似性,从而捕捉训练数据对测试预测的影响。
- 在GS提取的特征上训练逻辑回归分类器,以区分正常输入与对抗性输入。
- 采用基于阈值的检测器进行白盒攻击检测,利用GS值标记具有异常影响模式的输入。
- 在MNIST和CIFAR2数据集上应用该方法,评估其在FGSM、BIM和C&W等多种攻击类型下的表现,涵盖零知识和白盒威胁模型。
- 通过交叉验证测试其对未见攻击的泛化能力,验证其在已知攻击模式之外的鲁棒性。
实验结果
研究问题
- RQ1能否通过识别训练样本在正常输入与对抗性输入上影响预测的差异,利用影响函数检测对抗性输入?
- RQ2像梯度相似性这样的计算高效代理度量,能否有效替代昂贵的影响函数计算,同时保持检测精度?
- RQ3针对完全掌握模型和攻击目标的白盒攻击者,基于GS的检测器具有多强的鲁棒性?
- RQ4通过交叉验证,检测器是否能泛化到此前未见的对抗性攻击方法?
- RQ5尽管在MNIST上表现优异,检测器在CIFAR2上表现较差,其根本原因是什么?是否存在数据或结构层面的因素?
主要发现
- 基于GS的检测器在多种未见对抗性攻击中实现了95–100%的ROC-AUC,表明其具有强大的泛化能力。
- 在MNIST数据集上,白盒攻击的检测AUC为87–97%,表明即使攻击者完全掌握模型信息,检测器仍具有高度鲁棒性。
- 能够绕过检测器的白盒攻击需要显著更高的L2扰动,表明检测器迫使攻击者引入更明显的视觉变化。
- 检测器在CIFAR2上的表现受限,AUC仅为50–59%,主要由于训练样本数量较少以及输入空间支持度高。
- 交叉验证实验表明,检测器能很好地泛化到新型攻击方法,说明其捕捉了对抗性输入的本质特性,而不仅限于特定攻击模式。
- 该方法对原始深度神经网络的修改极少,相比鲁棒优化或对抗训练,更易于在实际场景中部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。