Skip to main content
QUICK REVIEW

[論文レビュー] Deep Probabilistic Models to Detect Data Poisoning Attacks

Mahesh Subedar, Nilesh Ahuja|arXiv (Cornell University)|Dec 3, 2019
Adversarial Robustness in Machine Learning参考文献 13被引用数 6
ひとこと要約

本稿では、深層ニューラルネットワークにおけるバックドアデータ汚染攻撃を検出するための2つの不確実性ベースの手法を提案する:(1) 入力の不確実性を推定するためのパラメトリック分布を用いた深層特徴の確率的モデリング、および (2) モデルの不確実性を推定するための平均場変分推論を用いたベイジアンニューラルネットワーク。深層特徴アプローチは、汚染されたサンプルを検出する際、AUPRが最大99.96に達する高い性能を示した。一方、ベイジアンネットワークは汚染されたデータで訓練された場合に困難をきたし、不確実性ベースの検出において、清浄な検証データの重要性が浮き彫りになった。

ABSTRACT

Data poisoning attacks compromise the integrity of machine-learning models by introducing malicious training samples to influence the results during test time. In this work, we investigate backdoor data poisoning attack on deep neural networks (DNNs) by inserting a backdoor pattern in the training images. The resulting attack will misclassify poisoned test samples while maintaining high accuracies for the clean test-set. We present two approaches for detection of such poisoned samples by quantifying the uncertainty estimates associated with the trained models. In the first approach, we model the outputs of the various layers (deep features) with parametric probability distributions learnt from the clean held-out dataset. At inference, the likelihoods of deep features w.r.t these distributions are calculated to derive uncertainty estimates. In the second approach, we use Bayesian deep neural networks trained with mean-field variational inference to estimate model uncertainty associated with the predictions. The uncertainty estimates from these methods are used to discriminate clean from the poisoned samples.

研究の動機と目的

  • クリーンな精度を損なわせることなくモデルの整合性を損なうデータ汚染攻撃の脅威に対処すること。
  • 推論時に汚染された入力を特定する不確実性ベースの検出メカニズムを開発すること。
  • 深層特徴からの不確実性推定とベイジアンニューラルネットワークからの不確実性推定が、汚染されたサンプルとクリーンなサンプルを効果的に区別できるかどうかを評価すること。
  • さまざまな汚染率とデータセットの特性の下で、不確実性推定のロバスト性を調査すること。

提案手法

  • 清浄なホールドアウト検証データから抽出された深層特徴に、パラメトリック確率分布(例:ガウス分布)をフィットさせ、特徴空間の分布をモデリングする。
  • 推論時、テストサンプルの特徴に対してフィットした分布との対数尤度スコアを計算する;低スコアは異常度の高い可能性を示す。
  • 平均場変分推論を用いてベイジアンニューラルネットワークを訓練し、ネットワーク重みの事後分布を近似する。
  • BALD(不確実性の高い予測の不確実性)を用いてモデルの不確実性を推定する。BALDは、重み事後分布と予測分布の相互情報量を測定する。
  • 不確実性スコアを判別信号として使用する:汚染されたサンプルでは高い不確実性、クリーンなサンプルでは低い不確実性。
  • クリーンなサンプルと汚染されたサンプルの二値分類設定において、AUPRを用いて検出性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1深層特徴の分布から導出された不確実性推定は、DNNにおけるバックドア汚染入力を効果的に検出できるか?
  • RQ2ベイジアンニューラルネットワークからのモデル不確実性は、データ汚染攻撃の検出において、特徴レベルの不確実性と比較してどう異なるか?
  • RQ3訓練データにおける汚染率の増加に伴い、不確実性ベースの検出性能は劣化するか?
  • RQ4汚染されたデータで訓練されたモデルでも、汚染検出のための信頼できる不確実性推定が得られるか?
  • RQ5特徴レベルとモデルレベルの不確実性を組み合わせることで、単独で用いる場合よりも効果的な検出が可能か?

主な発見

  • DeepFeatures(DF)手法は、MNISTではAUPRが最大99.96、CIFAR-10では91.87に達し、決定的DNNを著しく上回る性能を示した。
  • MNISTでは、50%の汚染率において、DF手法が汚染されたサンプルの分類精度を最低7.32%まで低下させ、強力な検出能力を示した。
  • 汚染されたデータで訓練されたベイジアンニューラルネットワーク(BNNs)は、クリーンセットおよび汚染セットの両方で90%以上の高い精度を維持した。これは、汚染分布に適合した結果であり、検出性能が低いことを示している。
  • BNNsは低汚染率(例:MNISTで10%汚染率の場合にAUPRが97.47%)では良好な検出性能を示したが、汚染率が増加するにつれて性能が低下した。
  • DF手法は、汚染率の変動に対しても安定しており、特徴分布のフィッティングにクリーンデータのみを使用したため、異常検出の安定した基準点を提供した。
  • 結果から、汚染されたデータで訓練されたモデルからの不確実性推定よりも、クリーンデータに anchored された特徴モデリングからの不確実性推定がより効果的であることが示された。これは、検出において清浄な検証データの必要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。