Skip to main content
QUICK REVIEW

[论文解读] AdvKnn: Adversarial Attacks On K-Nearest Neighbor Classifiers With Approximate Gradients

Xiaodan Li, Yuefeng Chen|arXiv (Cornell University)|Nov 15, 2019
Adversarial Robustness in Machine Learning参考文献 28被引用 8
一句话总结

本文提出 AdvKNN,一种针对 k-最近邻(kNN)和深度 kNN(DkNN)分类器的新型对抗性攻击方法,通过可微分的深度 kNN 模块(DkNNB)近似 kNN 输出,利用梯度实现有效的基于梯度的对抗攻击。该方法还引入了基于概率分布的一致性学习,以提升对基于分布的防御机制的鲁棒性,与先前工作相比,在更小的扰动下实现了显著更高的攻击成功率。

ABSTRACT

Deep neural networks have been shown to be vulnerable to adversarial examples---maliciously crafted examples that can trigger the target model to misbehave by adding imperceptible perturbations. Existing attack methods for k-nearest neighbor~(kNN) based algorithms either require large perturbations or are not applicable for large k. To handle this problem, this paper proposes a new method called AdvKNN for evaluating the adversarial robustness of kNN-based models. Firstly, we propose a deep kNN block to approximate the output of kNN methods, which is differentiable thus can provide gradients for attacks to cross the decision boundary with small distortions. Second, a new consistency learning for distribution instead of classification is proposed for the effectiveness in distribution based methods. Extensive experimental results indicate that the proposed method significantly outperforms state of the art in terms of attack success rate and the added perturbations.

研究动机与目标

  • 为解决 kNN 和 DkNN 分类器难以进行基于梯度的对抗攻击的问题,因为其本身不具备可微性。
  • 开发 kNN 输出的可微分近似方法,以支持基于梯度的优化,从而生成具有微小失真的对抗样本。
  • 通过在概率分布而非类别标签上引入一致性学习方法,提升对 DkNN 模型的攻击效果,该模型依赖于多层预测聚合和可信度分数进行防御。
  • 在实际对抗性条件下评估基于 kNN 的防御机制的鲁棒性,尤其关注扰动大小和可检测性。

提出的方法

  • 提出一种可微分的深度 kNN 模块(DkNNB),用于近似 kNN 分类器的输出概率分布,从而支持对抗攻击生成过程中的梯度计算。
  • 引入一种一致性学习(CL)框架,基于概率分布而非类别标签对多层预测进行对齐,增强 DkNN 模型攻击的鲁棒性。
  • 将 DkNNB 与 CL 结合标准的基于梯度的攻击方法(如 FGSM 和 BIM),生成失真最小的对抗样本。
  • 使用 L∞ 和 L2 范数衡量扰动大小,并通过攻击成功率、准确率下降和可信度分数评估性能与可检测性。
  • 采用多层特征提取策略,对网络的不同层应用 DkNNB,以评估迁移性和各层特定的攻击有效性。
  • 在 MNIST、SVHN 和 Fashion-MNIST 数据集上验证该方法,使用标准 DNN 和基于 kNN 的模型(包括采用逐层聚合的 DkNN)进行实验。

实验结果

研究问题

  • RQ1能否构建 kNN 的可微分近似,以实现对原本不可微的 kNN 分类器的基于梯度的对抗攻击?
  • RQ2在基于多层预测聚合的 DkNN 模型中,基于概率分布的一致性学习在提升攻击成功率方面有多有效?
  • RQ3使 DkNN 模型失效所需的最小扰动是多少?与先前最先进方法相比,其 L2 失真和攻击成功率如何?
  • RQ4由 AdvKNN 生成的对抗样本能否规避 DkNN 模型中常见的基于可信度分数的检测机制?
  • RQ5当使用该方法生成对抗样本时,对抗样本在模型之间(尤其是标准 DNN 模型如 LeNet5)的迁移性如何?

主要发现

  • 所提出的 AdvKNN 方法在 L∞ 范数下将 MNIST 上 DkNN 的准确率降低至 5.71%,平均 L2 失真为 1.4909,显著优于先前工作(准确率为 17.44%,失真为 3.476)。
  • 引入一致性学习(CL)后,DkNN 在 BIM 攻击下的攻击成功率进一步提升,Fashion-MNIST 上的准确率降至 7.54%,平均 L2 失真为 1.4909。
  • 在结合 DkNNB 和 CL 的情况下,FGSM 攻击在 MNIST 上对 kNN 的攻击成功率高达 98.98%,准确率从 98.98% 降至 15.28%。
  • AdvKNN 生成的对抗样本具有更高的可信度分数(0.4608),高于先前方法(0.1037),表明其更难被 DkNN 的基于可信度的过滤机制检测到。
  • 在 LeNet5 上的迁移性实验表明,AdvKNN 生成的对抗样本优于标准 FGSM 和 BIM 攻击,在 FGSM 攻击下 DkNN 的准确率为 75.70%,而干净模型为 81.41%。
  • 消融研究证实,DkNNB 在所有层中均有效,其中第 3 层表现最佳,且该方法在 k 值较大时仍能保持高成功率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。