Skip to main content
QUICK REVIEW

[论文解读] Defending Against Adversarial Examples with K-Nearest Neighbor

Chawin Sitawarin, David Wagner|arXiv (Cornell University)|Jun 23, 2019
Adversarial Robustness in Machine Learning参考文献 35被引用 17
一句话总结

本文提出一种基于k近邻(kNN)的防御方法,利用神经网络中间层激活来提升对l2-扰动对抗样本的鲁棒性。该方法在MNIST和CIFAR-10上均达到最先进性能,分别需要平均3.07和2.30的扰动范数才能欺骗模型,并通过在Lipschitz正则化表征上的1-NN方法,首次提供了对抗扰动大小的可认证下界。

ABSTRACT

Robustness is an increasingly important property of machine learning models as they become more and more prevalent. We propose a defense against adversarial examples based on a k-nearest neighbor (kNN) on the intermediate activation of neural networks. Our scheme surpasses state-of-the-art defenses on MNIST and CIFAR-10 against l2-perturbation by a significant margin. With our models, the mean perturbation norm required to fool our MNIST model is 3.07 and 2.30 on CIFAR-10. Additionally, we propose a simple certifiable lower bound on the l2-norm of the adversarial perturbation using a more specific version of our scheme, a 1-NN on representations learned by a Lipschitz network. Our model provides a nontrivial average lower bound of the perturbation norm, comparable to other schemes on MNIST with similar clean accuracy.

研究动机与目标

  • 提升图像分类模型对l2-扰动对抗样本的鲁棒性。
  • 开发一种利用神经网络中间表征的防御机制,以提升泛化能力。
  • 通过在Lipschitz正则化特征上的1-NN方法,提供对抗扰动l2-范数的可认证下界。
  • 在保持标准基准测试中高干净准确率的前提下,超越现有防御方法的鲁棒性。

提出的方法

  • 该防御方法在神经网络中间层激活上应用k-NN分类,以检测并缓解对抗输入。
  • 采用1-NN变体,对Lipschitz正则化网络的表征进行处理,推导出对抗扰动l2-范数的可认证下界。
  • 根据变体不同,使用激活空间中的距离判断输入是否为对抗样本,k=1或k>1。
  • 该方法端到端训练,无需重新训练基础分类器,实现即插即用的鲁棒性。
  • Lipschitz约束确保输入扰动的微小变化仅导致输出变化有界,从而支持形式化鲁棒性保证。
  • 该防御在MNIST和CIFAR-10上针对l2-扰动攻击进行评估,测量欺骗性扰动范数与可认证下界。

实验结果

研究问题

  • RQ1在标准视觉基准上,基于中间神经激活的k-NN能否有效防御l2-扰动对抗样本?
  • RQ2防御模型在k-NN表征上,需要多小的l2-范数对抗扰动才能被欺骗?
  • RQ3在Lipschitz正则化特征上的1-NN能否提供对抗鲁棒性的可认证下界?
  • RQ4与最先进防御方法相比,该方法在MNIST和CIFAR-10上的鲁棒性与准确率表现如何?
  • RQ5与标准对抗训练相比,使用中间表征是否能提升泛化能力与鲁棒性?

主要发现

  • 基于kNN的防御在MNIST模型上实现平均3.07的扰动范数才能被欺骗,显著优于先前最先进防御方法。
  • 在CIFAR-10上,模型需平均2.30的扰动范数才能被欺骗,展现出对l2攻击的强大鲁棒性。
  • 该方法提供了非平凡的对抗扰动l2-范数可认证下界,其性能在MNIST上与具有相似干净准确率的其他方案相当。
  • 在Lipschitz正则化特征上的1-NN变体通过基于距离的认证机制,实现了形式化鲁棒性保证。
  • 该防御在显著提升鲁棒性的同时保持高干净准确率,表明其对对抗输入具有有效泛化能力。
  • 结果表明,中间表征在提升鲁棒性方面非常有效,其欺骗阈值优于标准对抗训练方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。