Skip to main content
QUICK REVIEW

[论文解读] Certified Robustness of Nearest Neighbors against Data Poisoning Attacks

Jinyuan Jia, Xiaoyu Cao|arXiv (Cornell University)|May 4, 2021
Adversarial Robustness in Machine Learning参考文献 1被引用 14
一句话总结

本文证明了k-最近邻(kNN)和半径最近邻(rNN)由于其内置的多数投票机制,天然具备对数据投毒攻击的认证鲁棒性。在MNIST和CIFAR10上的实验结果表明,这种内在鲁棒性优于当前最先进的认证防御方法。

ABSTRACT

Data poisoning attacks aim to corrupt a machine learning model via modifying, adding, and/or removing some carefully selected training examples, such that the corrupted model predicts any or attacker-chosen incorrect labels for testing examples. The key idea of state-of-the-art certified defenses against data poisoning attacks is to create a \emph{majority vote} mechanism to predict the label of a testing example. Moreover, each voter is a base classifier trained on a subset of the training dataset. Nearest neighbor algorithms such as k nearest neighbors (kNN) and radius nearest neighbors (rNN) have intrinsic majority vote mechanisms. In this work, we show that the intrinsic majority vote mechanisms in kNN and rNN already provide certified robustness guarantees against general data poisoning attacks. Moreover, our empirical evaluation results on MNIST and CIFAR10 show that the intrinsic certified robustness guarantees of kNN and rNN outperform those provided by state-of-the-art certified defenses.

研究动机与目标

  • 探究最近邻算法是否天然具备对数据投毒攻击的认证鲁棒性。
  • 评估kNN和rNN的鲁棒性保证,与现有认证防御方法进行比较。
  • 确定最近邻模型中的内在多数投票机制是否可在无需额外训练或架构修改的情况下作为强防御手段。
  • 在各种数据投毒攻击场景下,实证验证kNN和rNN的认证鲁棒性。

提出的方法

  • 利用kNN和rNN中固有的多数投票机制,其中预测标签由最近邻中出现频率最高的标签决定。
  • 通过分析需要多少训练样本被投毒才能改变测试样本的预测,形式化kNN和rNN的认证鲁棒性。
  • 将认证鲁棒性阈值定义为:为改变给定测试输入的模型预测,必须被投毒的最少训练样本数量。
  • 利用该阈值量化鲁棒性保证,确保只要被投毒样本数量低于该阈值,预测结果就保持正确。
  • 将该方法应用于标准基准数据集MNIST和CIFAR10,评估在真实投毒场景下的鲁棒性。
  • 在相同攻击设置下,将kNN和rNN的认证鲁棒性边界与最先进认证防御方法的边界进行比较。

实验结果

研究问题

  • RQ1kNN和rNN是否因其固有的多数投票机制,能够提供对数据投毒攻击的认证鲁棒性?
  • RQ2在标准数据集上,kNN和rNN的认证鲁棒性与最先进认证防御方法相比如何?
  • RQ3在kNN和rNN中,改变测试样本预测所需的最少被投毒训练样本数量是多少?
  • RQ4最近邻模型的内在鲁棒性在多种不同的数据投毒攻击模式下是否依然保持强劲?

主要发现

  • kNN和rNN中固有的多数投票机制提供了对数据投毒攻击的认证鲁棒性保证,且无需额外训练或模型修改。
  • 在MNIST和CIFAR10上,kNN和rNN的认证鲁棒性在可比设置下优于最先进认证防御方法。
  • kNN和rNN的认证鲁棒性阈值高于现有防御方法,表明其对投毒攻击具有更强的抗性。
  • 鲁棒性保证直接源于模型架构和训练数据,因此具有内在的可靠性与可验证性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。