[论文解读] Exposing Backdoors in Robust Machine Learning Models.
本文表明,尽管具备对抗鲁棒性的深度神经网络(DNN)在防御对抗样本方面表现良好,但仍易受后门攻击的影响,这种攻击在模型的特征表示中表现明显。作者提出AEGIS方法,通过特征聚类检测后门感染模型,对目标类别检测的准确率达到91.6%,误报率为11.1%。
The introduction of robust optimisation has pushed the state-of-the-art in defending against adversarial attacks. However, the behaviour of such optimisation has not been studied in the light of a fundamentally different class of attacks called backdoors. In this paper, we demonstrate that adversarially robust models are susceptible to backdoor attacks. Subsequently, we observe that backdoors are reflected in the feature representation of such models. Then, this observation is leveraged to detect backdoor-infected models via a detection technique called AEGIS. Specifically, AEGIS uses feature clustering to effectively detect backdoor-infected robust Deep Neural Networks (DNNs). In our evaluation of several visible and hidden backdoor triggers on major classification tasks using CIFAR-10, MNIST and FMNIST datasets, AEGIS effectively detects robust DNNs infected with backdoors. AEGIS detects a backdoor-infected model with 91.6% accuracy, without any false positives. Furthermore, AEGIS detects the targeted class in the backdoor-infected model with a reasonably low (11.1%) false positive rate. Our investigation reveals that salient features of adversarially robust DNNs break the stealthy nature of backdoor attacks.
研究动机与目标
- 探究尽管具备防御对抗样本的能力,对抗鲁棒DNN是否仍易受后门攻击。
- 分析后门触发器如何影响鲁棒模型的内部特征表示。
- 开发一种无需访问训练数据或标签即可识别后门感染鲁棒DNN的检测方法。
- 在多种数据集和后门触发器类型上评估所提检测技术的有效性。
提出的方法
- 作者分析对抗鲁棒DNN的特征表示,以识别后门污染的指示性模式。
- AEGIS采用特征聚类技术,检测特征空间中的异常,这些异常与后门触发器相对应。
- 该方法基于观察:后门触发器会破坏鲁棒模型中特征的显著性和分布特性。
- 检测过程仅依赖推理时的特征,不依赖训练数据或模型权重。
- 通过测量正常输入与注入触发器输入下特征表示的聚类偏离程度,识别后门感染模型。
- 通过分析特征空间中特定类别相关的聚 cluster 偏移,推断目标类别预测。
实验结果
研究问题
- RQ1尽管具备对对抗样本的鲁棒性,对抗鲁棒DNN是否仍易受后门攻击?
- RQ2后门触发器如何改变鲁棒DNN的特征表示?
- RQ3能否在不访问训练数据或标签的情况下检测鲁棒模型中的后门感染?
- RQ4AEGIS在不同数据集和触发器类型下的检测准确率和误报率如何?
主要发现
- 尽管具备对对抗扰动的鲁棒性,对抗鲁棒DNN仍易受后门攻击,其完整性因此受到威胁。
- 后门触发器在鲁棒模型的特征表示中留下可检测的痕迹,破坏了其隐蔽性。
- AEGIS以91.6%的准确率检测后门感染模型,表明其在识别恶意模型方面具有高度可靠性。
- 在后门感染模型中预测目标类别时,该方法的误报率为11.1%。
- 检测性能在多个数据集(包括CIFAR-10、MNIST和FMNIST)上保持一致。
- 研究发现,鲁棒模型中的显著特征易受后门影响,从而可通过聚类分析实现有效检测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。