[论文解读] Improved Detection of Adversarial Images Using Deep Neural Networks
本文提出特征图去噪(Feature Map Denoising),一种轻量级防御方法,通过在中间特征图上应用维纳滤波,检测各类攻击下的对抗性图像。该方法在任意预训练深度神经网络上应用时,计算开销极低,同时实现高检测准确率。
Machine learning techniques are immensely deployed in both industry and academy. Recent studies indicate that machine learning models used for classification tasks are vulnerable to adversarial examples, which limits the usage of applications in the fields with high precision requirements. We propose a new approach called Feature Map Denoising to detect the adversarial inputs and show the performance of detection on the mixed dataset consisting of adversarial examples generated by different attack algorithms, which can be used to associate with any pre-trained DNNs at a low cost. Wiener filter is also introduced as the denoise algorithm to the defense model, which can further improve performance. Experimental results indicate that good accuracy of detecting the adversarial examples can be achieved through our Feature Map Denoising algorithm.
研究动机与目标
- 解决高精度应用中深度神经网络(DNNs)对对抗性样本的脆弱性问题。
- 开发一种可普遍适用于任意预训练DNN且无需微调或重新训练的防御机制。
- 提升在多种对抗性攻击算法(包括FGSM、PGD和AutoAttack)下的检测鲁棒性。
- 在保持混合对抗数据集上高检测准确率的同时,最小化计算开销。
提出的方法
- 提出特征图去噪作为应用于预训练DNN中间特征图的后处理技术。
- 对特征图应用维纳滤波以实现去噪,利用对抗性扰动通常引入高频噪声的特性。
- 将原始特征图与去噪后特征图之间的重建误差作为对抗性输入的检测得分。
- 在推理时作为即插即用模块集成,无需模型微调或重新训练。
- 在重建误差上训练一个简单分类器,以区分自然输入与对抗性输入。
- 在混合数据集上评估该方法,该数据集结合了多种攻击算法生成的对抗性样本。
实验结果
研究问题
- RQ1一种轻量级、与网络架构无关的方法是否能在不重新训练的情况下,检测多种攻击类型下的对抗性样本?
- RQ2基于特征图重建性能,维纳滤波在区分对抗性输入与自然输入方面效果如何?
- RQ3特征图去噪在未在评估中使用过的新型攻击上泛化程度如何?
- RQ4所提方法在检测准确率与计算开销之间的权衡关系如何?
- RQ5该方法是否可有效应用于任意预训练DNN,且仅需极少修改?
主要发现
- 特征图去噪在多种攻击算法生成的混合对抗样本数据集上实现了高检测准确率。
- 该方法在不同攻击类型(包括FGSM、PGD和AutoAttack)间具有良好的泛化能力,且无需针对特定攻击进行调优。
- 维纳滤波显著提升了检测性能,能有效抑制特征图中的对抗性噪声。
- 该方法计算开销极低,适用于资源受限环境中的实时部署。
- 基于重建误差的检测机制在攻击强度变化时依然表现出鲁棒性和有效性。
- 该方法在多种预训练DNN上均保持高准确率,展现出强大的迁移能力与兼容性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。