[论文解读] Defending Against Adversarial Examples with K-Nearest Neighbor
本文提出一种基于k近邻(kNN)的防御方法,利用神经网络中间层激活来提升对l2-扰动对抗样本的鲁棒性。该方法在MNIST和CIFAR-10上均达到最先进性能,分别需要平均3.07和2.30的扰动范数才能欺骗模型,并通过在Lipschitz正则化表征上的1-NN方法,首次提供了对抗扰动大小的可认证下界。
Robustness is an increasingly important property of machine learning models as they become more and more prevalent. We propose a defense against adversarial examples based on a k-nearest neighbor (kNN) on the intermediate activation of neural networks. Our scheme surpasses state-of-the-art defenses on MNIST and CIFAR-10 against l2-perturbation by a significant margin. With our models, the mean perturbation norm required to fool our MNIST model is 3.07 and 2.30 on CIFAR-10. Additionally, we propose a simple certifiable lower bound on the l2-norm of the adversarial perturbation using a more specific version of our scheme, a 1-NN on representations learned by a Lipschitz network. Our model provides a nontrivial average lower bound of the perturbation norm, comparable to other schemes on MNIST with similar clean accuracy.
研究动机与目标
- 提升图像分类模型对l2-扰动对抗样本的鲁棒性。
- 开发一种利用神经网络中间表征的防御机制,以提升泛化能力。
- 通过在Lipschitz正则化特征上的1-NN方法,提供对抗扰动l2-范数的可认证下界。
- 在保持标准基准测试中高干净准确率的前提下,超越现有防御方法的鲁棒性。
提出的方法
- 该防御方法在神经网络中间层激活上应用k-NN分类,以检测并缓解对抗输入。
- 采用1-NN变体,对Lipschitz正则化网络的表征进行处理,推导出对抗扰动l2-范数的可认证下界。
- 根据变体不同,使用激活空间中的距离判断输入是否为对抗样本,k=1或k>1。
- 该方法端到端训练,无需重新训练基础分类器,实现即插即用的鲁棒性。
- Lipschitz约束确保输入扰动的微小变化仅导致输出变化有界,从而支持形式化鲁棒性保证。
- 该防御在MNIST和CIFAR-10上针对l2-扰动攻击进行评估,测量欺骗性扰动范数与可认证下界。
实验结果
研究问题
- RQ1在标准视觉基准上,基于中间神经激活的k-NN能否有效防御l2-扰动对抗样本?
- RQ2防御模型在k-NN表征上,需要多小的l2-范数对抗扰动才能被欺骗?
- RQ3在Lipschitz正则化特征上的1-NN能否提供对抗鲁棒性的可认证下界?
- RQ4与最先进防御方法相比,该方法在MNIST和CIFAR-10上的鲁棒性与准确率表现如何?
- RQ5与标准对抗训练相比,使用中间表征是否能提升泛化能力与鲁棒性?
主要发现
- 基于kNN的防御在MNIST模型上实现平均3.07的扰动范数才能被欺骗,显著优于先前最先进防御方法。
- 在CIFAR-10上,模型需平均2.30的扰动范数才能被欺骗,展现出对l2攻击的强大鲁棒性。
- 该方法提供了非平凡的对抗扰动l2-范数可认证下界,其性能在MNIST上与具有相似干净准确率的其他方案相当。
- 在Lipschitz正则化特征上的1-NN变体通过基于距离的认证机制,实现了形式化鲁棒性保证。
- 该防御在显著提升鲁棒性的同时保持高干净准确率,表明其对对抗输入具有有效泛化能力。
- 结果表明,中间表征在提升鲁棒性方面非常有效,其欺骗阈值优于标准对抗训练方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。