Skip to main content
QUICK REVIEW

[論文レビュー] Revealing Perceptible Backdoors, without the Training Set, via the Maximum Achievable Misclassification Fraction Statistic

Zhen Xiang, David J. Miller|arXiv (Cornell University)|Nov 18, 2019
Adversarial Robustness in Machine Learning参考文献 44被引用数 6
ひとこと要約

本稿では、訓練データにアクセスできない状況下で、DNN画像分類器における目に見えるバックドアを、最大達成可能な誤分類率(MAMF)統計量を用いて、後処理段階で検出する手法を提案する。空間的不変性と目に見えるバックドアパターンの頑健性を活用し、高い精度で攻撃を検出でき、既存手法を上回り、目に見えないバックドア検出器と組み合わせることで、すべての回避的攻撃を検出可能となる。

ABSTRACT

Recently, a backdoor data poisoning attack was proposed, which adds mislabeled examples to the training set, with an embedded backdoor pattern, aiming to have the classifier learn to classify to a target class whenever the backdoor pattern is present in a test sample. Here, we address post-training detection of innocuous perceptible backdoors in DNN image classifiers, wherein the defender does not have access to the poisoned training set, but only to the trained classifier, as well as unpoisoned examples. This problem is challenging because without the poisoned training set, we have no hint about the actual backdoor pattern used during training. This post-training scenario is also of great import because in many practical contexts the DNN user did not train the DNN and does not have access to the training data. We identify two important properties of perceptible backdoor patterns - spatial invariance and robustness - based upon which we propose a novel detector using the maximum achievable misclassification fraction (MAMF) statistic. We detect whether the trained DNN has been backdoor-attacked and infer the source and target classes. Our detector outperforms other existing detectors and, coupled with an imperceptible backdoor detector, helps achieve post-training detection of all evasive backdoors.

研究の動機と目的

  • 訓練済みモデルに対して、汚染された訓練セットにアクセスできない状況で、DNNにおける目に見えるバックドア攻撃を検出すること。
  • 訓練データや具体的なバックドアパターンに関する事前知識が欠如している状況で、バックドアパターンを同定することの課題に対処すること。
  • バックドア攻撃のソースクラスとターゲットクラスを推定することで、モデルの信頼性を向上させること。
  • 既存の目に見えないバックドア検出器を補完し、すべての回避的バックドア攻撃を包括的に後処理段階で検出可能とする。

提案手法

  • 本手法は、最大達成可能な誤分類率(MAMF)統計量に基づく。MAMFは、空間的に制限された摂動のもとで、あるソースクラスに属するテストサンプルのうち、最大でどの程度の割合がターゲットクラスに誤分類されるかを定量化する。
  • 各クラスペアについて、指定された幅のすべての可能な空間的サポート(領域)を探索し、元のテスト画像の誤分類率が最大となるものを特定する。
  • 目に見えるバックドアパターンの2つの重要な性質を活用する:空間的不変性(微小な空間的シフトに対して頑健であること)と頑健性(ぼかしのような軽微な変換に対しても持続すること)。
  • MAMF値にしきい値を設定し、バックドアの存在を判断する。高いMAMF値は、潜在的なバックドアの存在を示唆する。
  • 代替モデルの訓練を必要とせず、清浄で小規模なラベル付きデータセットを評価に使用する。
  • すべてのクラスペアに対してパターン推定を実施し、統計的に有意なMAMFの急上昇に基づいて検出を実施する。

実験結果

リサーチクエスチョン

  • RQ1訓練セットにアクセスできない状況で、DNNにおける目に見えるバックドアパターンを後処理段階で検出可能か?
  • RQ2目に見えるバックドアパターンの空間的不変性と頑健性をどのように活用して攻撃を検出できるか?
  • RQ3MAMF統計量は、自然なクラス誤認識と実際にバックドアによって引き起こされた誤分類を信頼性高く区別できるか?
  • RQ4MAMFにどのしきい値を設定すれば、高い検出性能を維持しながら偽陽性を最小限に抑えられるか?
  • RQ5この検出器は、目に見えないバックドア検出器と組み合わせることで、包括的な後処理段階のバックドア検出を実現できるか?

主な発見

  • 提案手法であるMAMFベースの検出器は、複数のデータセットおよび攻撃パターンにおいて、訓練データにアクセスできない状況下でも、目に見えるバックドア攻撃を効果的に検出できた。
  • 複数のソースクラスを有する攻撃(例:攻撃A’、B’、C’)に対しても、平均MAMFが最大となるクラスペアを特定することで、複雑なバックドアシナリオの検出が可能となった。
  • 既存手法に比べ、目に見えるバックドアの後処理段階検出において優れた性能を示し、強力な検出能力を実証した。
  • ぼかしベースの実行時検出手法は、目に見えるバックドアを信頼性高く検出できない。なぜなら、パターンはフィルタリングに対しても頑健であり、偽陽性率と真正陽性率の両方が高いためである。
  • 単純なMAMFのしきい値設定により高い検出性能を達成でき、実世界への展開に実用的である。
  • DNNのテスト精度が非常に高い場合でも、本検出器は有効であるため、自然なクラス誤認識とは混同されないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。