Skip to main content
QUICK REVIEW

[论文解读] Evaluating a Simple Retraining Strategy as a Defense Against Adversarial Attacks

Nupur Thakur, Yuzhen Ding|arXiv (Cornell University)|Jul 20, 2020
Adversarial Robustness in Machine Learning参考文献 9被引用 4
一句话总结

本文评估了一种使用对抗性图像进行简单微调的策略,以防御深度神经网络免受对抗性攻击。结果表明,通过使用基于KNN的方法对对抗性样本进行标注后进行微调,可显著提升模型的鲁棒性,尤其在防御黑盒攻击方面效果显著;而由于白盒攻击可访问更新后的梯度,因此仍具有效力。

ABSTRACT

Though deep neural networks (DNNs) have shown superiority over other techniques in major fields like computer vision, natural language processing, robotics, recently, it has been proven that they are vulnerable to adversarial attacks. The addition of a simple, small and almost invisible perturbation to the original input image can be used to fool DNNs into making wrong decisions. With more attack algorithms being designed, a need for defending the neural networks from such attacks arises. Retraining the network with adversarial images is one of the simplest techniques. In this paper, we evaluate the effectiveness of such a retraining strategy in defending against adversarial attacks. We also show how simple algorithms like KNN can be used to determine the labels of the adversarial images needed for retraining. We present the results on two standard datasets namely, CIFAR-10 and TinyImageNet.

研究动机与目标

  • 评估使用对抗性样本对深度神经网络进行微调作为防御机制的有效性。
  • 解决为微调而标注对抗性图像的挑战,因为这些图像缺乏固有的真实标签。
  • 探究简单的机器学习方法(如KNN)是否能准确预测对抗性图像的真实标签。
  • 评估微调后模型对白盒和黑盒对抗性攻击的鲁棒性。
  • 确定微调是否可作为一种实际且轻量级的防御策略应用于现实世界场景。

提出的方法

  • 通过FGSM、DeepFool和GAP攻击生成的对抗性图像,对预训练分类器进行微调,将这些图像加入原始训练集。
  • 使用K=1的K近邻(KNN)方法,基于对抗性图像与原始训练图像在降维特征空间中的相似性,预测其真实标签。
  • 应用主成分分析(PCA)将输入维度降低至300(CIFAR-10)和2000(TinyImageNet),以实现高效的KNN推理。
  • 在使用不同数量的对抗性样本进行微调后,评估模型在原始测试集和对抗性测试集上的性能。
  • 将“欺骗率”(即微调后被错误分类的对抗性样本比例)作为防御有效性的关键指标进行测量。
  • 比较不同攻击类型下的防御性能:白盒攻击(FGSM、DeepFool、Carlini-Wagner)与黑盒攻击(GAP、RP2)

实验结果

研究问题

  • RQ1使用对抗性样本对深度神经网络进行微调是否能提升其对对抗性攻击的鲁棒性?
  • RQ2基于KNN的标签预测方法在为对抗性样本分配准确标签方面有多有效?
  • RQ3该微调防御策略在白盒攻击与黑盒攻击中是否具有同等效果?
  • RQ4在微调中使用不同数量的对抗性样本,对模型准确率和鲁棒性有何影响?
  • RQ5微调后欺骗率如何变化?这反映了模型的残余脆弱性如何?

主要发现

  • 使用对抗性图像进行微调显著提升了模型在对抗性样本上的准确率,在使用100,000个对抗性样本时,模型在对抗性CIFAR-10图像上的准确率达到69.2%。
  • 基于KNN的标签预测方法在CIFAR-10上达到98.29%的准确率,在TinyImageNet上达到98%,证实其在对抗性图像标注中的可靠性。
  • 微调后,CIFAR-10的欺骗率降至48.13%,TinyImageNet降至49.2%,表明近一半的对抗性样本被正确分类。
  • 白盒攻击(如DeepFool和Carlini-Wagner)在微调后仍具有效力,因为它们可利用微调后模型的更新梯度。
  • 黑盒攻击(如GAP和RP2)在微调后基本失效,表明微调是对抗性攻击(无梯度访问)的强防御手段。
  • 即使在引入对抗性样本后,微调策略在原始测试图像上仍保持高准确率(CIFAR-10为72.3%),表明对干净数据的性能下降可忽略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。