Skip to main content
QUICK REVIEW

[論文レビュー] AdvKnn: Adversarial Attacks On K-Nearest Neighbor Classifiers With Approximate Gradients

Xiaodan Li, Yuefeng Chen|arXiv (Cornell University)|Nov 15, 2019
Adversarial Robustness in Machine Learning参考文献 28被引用数 8
ひとこと要約

本稿では、k近傍法(kNN)および深層k近傍法(DkNN)分類器向けに、勾配を用いた攻撃を可能にするための微分可能で深いk近傍法ブロック(DkNNB)を用いた、新たな敵対的攻撃手法AdvKNNを提案する。この手法は、確率分布の整合性学習を導入することで、分布ベースの防御に対して高い耐性を示し、従来の手法と比較してより小さな摂動で顕著に高い攻撃成功率を達成する。

ABSTRACT

Deep neural networks have been shown to be vulnerable to adversarial examples---maliciously crafted examples that can trigger the target model to misbehave by adding imperceptible perturbations. Existing attack methods for k-nearest neighbor~(kNN) based algorithms either require large perturbations or are not applicable for large k. To handle this problem, this paper proposes a new method called AdvKNN for evaluating the adversarial robustness of kNN-based models. Firstly, we propose a deep kNN block to approximate the output of kNN methods, which is differentiable thus can provide gradients for attacks to cross the decision boundary with small distortions. Second, a new consistency learning for distribution instead of classification is proposed for the effectiveness in distribution based methods. Extensive experimental results indicate that the proposed method significantly outperforms state of the art in terms of attack success rate and the added perturbations.

研究の動機と目的

  • kNNおよびDkNN分類器は本質的に微分不能であるため、勾配ベースの敵対的攻撃に対して耐性を示すが、その挑戦に対処するため。
  • 微小な歪みで敵対的サンプルを生成可能な、kNN出力の微分可能な近似を構築するため。
  • 複数のレイヤーにわたる予測の集約に依存し、信頼性スコアを防御に用いるDkNNモデルに対して、ラベルではなく確率分布に基づく整合性学習を導入することで、攻撃効果を向上させるため。
  • 特に摂動の大きさと検出可能性を考慮した現実的な敵対的条件下で、kNNに基づく防御の耐性を評価するため。

提案手法

  • kNN分類器の出力確率分布を近似する微分可能な深層k近傍法ブロック(DkNNB)を提案し、敵対的攻撃生成に勾配計算を可能にする。
  • ラベルではなくクラスの確率分布に基づいて複数レイヤーの予測を一致させる整合性学習(CL)フレームワークを導入し、DkNNモデルにおける攻撃の耐性を強化する。
  • DkNNBとCLを、FGSMやBIMなどの標準的な勾配ベース攻撃と組み合わせ、最小限の歪みで敵対的サンプルを生成する。
  • 摂動の大きさをL∞およびL2ノルムで測定し、攻撃成功率、精度低下、信頼性スコアを評価指標として用い、性能と検出可能性を分析する。
  • 多層特徴抽出戦略を採用し、ネットワークの異なるレイヤーにDkNNBを適用することで、転送性およびレイヤーごとの攻撃効果を評価する。
  • 標準的なDNNおよびkNNベースのモデル(層別集約を用いたDkNNを含む)を用い、MNIST、SVHN、Fashion-MNISTデータセットで手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1微分可能なkNNの近似を構築することで、本来微分不能なkNN分類器に対し勾配ベースの敵対的攻撃を可能にすることができるか?
  • RQ2複数のレイヤーにわたる予測を集約するDkNNモデルに対して、確率分布に基づく整合性学習は、攻撃成功率を向上させるのにどの程度有効か?
  • RQ3DkNNモデルをだますために必要な最小摂動は何か? また、L2歪みと攻撃成功率の観点で、先行研究の最先端手法と比較してどうなるか?
  • RQ4AdvKNNで生成された敵対的サンプルは、DkNNモデルで一般的に用いられる信頼性スコアに基づくフィルタリングを回避できるか?
  • RQ5本手法で生成された敵対的サンプルは、LeNet5のような標準的なDNNにどの程度転送可能か?特に、生成された攻撃例が標準DNNにどの程度効果を発揮するか。

主な発見

  • 提案されたAdvKNN手法は、L∞ノルム下でMNISTのDkNN精度を1.4909の平均L2歪みで5.71%まで低下させ、先行研究が達成した3.476の歪みで17.44%の精度を上回る顕著な性能を示した。
  • 整合性学習(CL)の導入により、BIM攻撃下でFashion-MNISTのDkNN精度がさらに低下し、平均L2歪み1.4909で7.54%まで低下した。
  • DkNNBとCLを組み合わせたFGSM攻撃では、MNISTのkNN分類器で98.98%の攻撃成功率を達成し、精度を98.98%から15.28%まで低下させた。
  • AdvKNNで生成された敵対的サンプルは、DkNNの信頼性ベースのフィルタリングで検出されにくいことを示唆する。信頼性スコアは0.4608と、先行手法の0.1037よりも高かった。
  • LeNet5における転送性実験では、AdvKNNで生成された敵対的サンプルが、標準的なFGSMやBIM攻撃を上回り、FGSM攻撃でDkNNの精度が75.70%に低下した。これは、クリーンモデルの81.41%と比較して顕著な低下である。
  • アブレーションスタディにより、DkNNBはすべてのレイヤーで有効であることが確認され、特にレイヤー3で最良の性能を示した。また、kの値が大きくなっても高い攻撃成功率を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。