Skip to main content
QUICK REVIEW

[論文レビュー] Certified Robustness of Nearest Neighbors against Data Poisoning Attacks

Jinyuan Jia, Xiaoyu Cao|arXiv (Cornell University)|May 4, 2021
Adversarial Robustness in Machine Learning参考文献 1被引用数 14
ひとこと要約

本稿では、k-最近傍法(kNN)および半径最近傍法(rNN)が、組み込みの多数決メカニズムのおかげで、データ汚染攻撃に対して本質的に認証可能(certified)な耐性を有することを示している。MNISTおよびCIFAR10における実験的結果から、この本質的耐性が最先端の認証可能防御を上回ることを示している。

ABSTRACT

Data poisoning attacks aim to corrupt a machine learning model via modifying, adding, and/or removing some carefully selected training examples, such that the corrupted model predicts any or attacker-chosen incorrect labels for testing examples. The key idea of state-of-the-art certified defenses against data poisoning attacks is to create a \emph{majority vote} mechanism to predict the label of a testing example. Moreover, each voter is a base classifier trained on a subset of the training dataset. Nearest neighbor algorithms such as k nearest neighbors (kNN) and radius nearest neighbors (rNN) have intrinsic majority vote mechanisms. In this work, we show that the intrinsic majority vote mechanisms in kNN and rNN already provide certified robustness guarantees against general data poisoning attacks. Moreover, our empirical evaluation results on MNIST and CIFAR10 show that the intrinsic certified robustness guarantees of kNN and rNN outperform those provided by state-of-the-art certified defenses.

研究の動機と目的

  • 最近傍法アルゴリズムが、データ汚染攻撃に対して本質的に認証可能耐性を提供するかどうかを調査すること。
  • 既存の認証可能防御手法と比較して、kNNおよびrNNの耐性保証の強さを評価すること。
  • 最近傍モデルに内蔵された多数決メカニズムが、追加の学習やアーキテクチャ変更なしに強力な防御として機能できるかどうかを特定すること。
  • さまざまなデータ汚染攻撃シナリオ下でのkNNおよびrNNの認証可能耐性を実験的に検証すること。

提案手法

  • kNNおよびrNNに内蔵された本質的多数決メカニズムを活用し、予測ラベルが最も近い近傍のラベルの頻度に基づいて決定されることを利用する。
  • kNNおよびrNNの認証可能耐性を形式的に定式化し、テスト例の予測を変更するためにどの程度の訓練例が汚染されている必要があるかを分析する。
  • 与えられたテスト入力に対してモデルの予測を変更するために必要な最小訓練例の汚染数を、認証可能耐性の閾値として定義する。
  • この閾値を用いて耐性保証を定量化し、汚染例の数が閾値未満である限り予測が正しく保たれることを保証する。
  • 標準ベンチマークであるMNISTおよびCIFAR10にこの手法を適用し、現実的な汚染シナリオ下での耐性を評価する。
  • 同一の攻撃設定下で、kNNおよびrNNの認証可能耐性境界を、最先端の認証可能防御と比較する。

実験結果

リサーチクエスチョン

  • RQ1kNNおよびrNNは、その内蔵された多数決メカニズムのおかげで、データ汚染攻撃に対して認証可能耐性を提供できるか?
  • RQ2標準データセット上でのkNNおよびrNNの認証可能耐性は、最先端の認証可能防御と比べてどの程度か?
  • RQ3kNNおよびrNNにおいて、テスト例の予測を変更するために必要な最小の汚染訓練例の数はどのくらいか?
  • RQ4多様なデータ汚染攻撃パターン下でも、最近傍モデルの本質的耐性は強固に保たれるか?

主な発見

  • kNNおよびrNNに内蔵された多数決メカニズムが、追加の学習やモデル変更なしに、データ汚染攻撃に対して認証可能耐性保証を提供する。
  • MNISTおよびCIFAR10において、同等の設定下でkNNおよびrNNの認証可能耐性は、最先端の認証可能防御を上回っている。
  • kNNおよびrNNの認証可能耐性閾値は、既存の防御手法よりも高いことが判明し、汚染に対してより強い耐性を示している。
  • 耐性保証はモデルのアーキテクチャと訓練データから直接導かれるため、本質的かつ検証可能で信頼性が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。