Skip to main content
QUICK REVIEW

[論文レビュー] Post-Training Detection of Backdoor Attacks for Two-Class and Multi-Attack Scenarios

Zhen Xiang, David J. Miller|arXiv (Cornell University)|Jan 20, 2022
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

本稿は、二クラスおよびマルチアタック設定における新たな微調整後バックドア攻撃検出フレームワークを提案する。バックドアパターン(BP)の逆設計と、新たな期待転送性(ET)統計量を用いる。ET統計量により、訓練データやクリーンな参照分類器へのアクセスなしに、ドメインに依存しない1つの閾値で効果的な検出が可能となり、訓練データやクリーンな参照分類器を必要とせず、6つのベンチマークデータセットで最先端の性能を達成する。

ABSTRACT

Backdoor attacks (BAs) are an emerging threat to deep neural network classifiers. A victim classifier will predict to an attacker-desired target class whenever a test sample is embedded with the same backdoor pattern (BP) that was used to poison the classifier's training set. Detecting whether a classifier is backdoor attacked is not easy in practice, especially when the defender is, e.g., a downstream user without access to the classifier's training set. This challenge is addressed here by a reverse-engineering defense (RED), which has been shown to yield state-of-the-art performance in several domains. However, existing REDs are not applicable when there are only {\it two classes} or when {\it multiple attacks} are present. These scenarios are first studied in the current paper, under the practical constraints that the defender neither has access to the classifier's training set nor to supervision from clean reference classifiers trained for the same domain. We propose a detection framework based on BP reverse-engineering and a novel {\it expected transferability} (ET) statistic. We show that our ET statistic is effective {\it using the same detection threshold}, irrespective of the classification domain, the attack configuration, and the BP reverse-engineering algorithm that is used. The excellent performance of our method is demonstrated on six benchmark datasets. Notably, our detection framework is also applicable to multi-class scenarios with multiple attacks. Code is available at https://github.com/zhenxianglance/2ClassBADetection.

研究の動機と目的

  • 既存の逆設計防御(REDs)が、帰無分布推定のための統計が不十分なために、二クラスおよびマルチアタック設定で失敗する課題に対処する。
  • 被害者分類器の訓練データにアクセスできない、および同じドメインで訓練されたクリーンな参照分類器からの監視が得られないという実用的制約下で動作する検出手法を開発する。
  • 低クラス設定(例:K=2)およびマルチアタック設定において、過去のREDsが適用不能または性能が低下する状況でも、信頼性の高い検出を可能にする。
  • 多様な分類ドメイン、攻撃設定、および逆設計アルゴリズムに普遍的に有効な検出閾値を確立する。

提案手法

  • 各クラスに対して独立して、既存または将来の逆設計技術を用いてバックドアパターン(BP)の逆設計に基づく検出フレームワークを提案する。
  • 期待転送性(ET)と呼ばれる新たな検出統計量を導入する。ETは、クリーンなテストサンプル上で逆設計されたBPの平均転送性として定義される。
  • ETを異常スコアとして使用する:ET > 1/2 であれば、そのクラスは潜在的なバックドア攻撃の兆候としてマークされる。これは、真のBPがランダムなパターンよりも優れた転送性を示すという事実を利用している。
  • 1/2という1つの検出閾値が、すべてのテストドメイン、攻撃タイプ、および逆設計手法において有効であることを実証し、ドメイン固有のキャリブレーションの必要性を排除する。
  • 二クラスおよびマルチクラス設定の両方、複数の同時攻撃が存在する場合も含めて、フレームワークを適用する。
  • アンサンブル分類器を用いて耐性を高め、一貫した検出性能を確保する。

実験結果

リサーチクエスチョン

  • RQ1既存のREDsが、帰無分布推定のための非標的クラスの統計が不十分なために失敗する二クラス設定において、バックドア検出フレームワークが有効に機能するか?
  • RQ2さまざまなデータセット、攻撃タイプ、および逆設計アルゴリズムに普遍的に有効なバックドア検出の閾値が存在するか?
  • RQ3提案された期待転送性(ET)統計量は、攻撃の数や性質を事前に知らなくても、マルチアタック設定におけるバックドア攻撃を検出可能か?
  • RQ4マルチアタック条件下において、ETベースのフレームワークの検出精度および誤検出率は、既存のRED手法と比較してどのように優れているか?

主な発見

  • ETベースの検出フレームワークは、1つの攻撃が存在する10の五クラスドメインおよび2つの攻撃が存在する10の五クラスドメインにおいて、100%の検出精度を達成し、誤検出はゼロであった。
  • 元のRED-APおよびRED-AP(MAD)ベースラインと比較して優れた性能を示し、これらは2つの攻撃インスタンスを一切検出できなかった。これは、マルチアタック設定における本手法の耐性の高さを示している。
  • 1/2という検出閾値は、6つのベンチマークデータセット、さまざまな攻撃設定、および多様な逆設計アルゴリズムにおいて普遍的に有効であり、ドメイン固有のキャリブレーションの必要性を排除した。
  • 誤検出はまれであり、主にRE-PR法を用いてクリーンな分類器を逆設計する場合に発生するが、それでも多様な二クラスドメインにおいて低頻度で発生する。
  • ET統計量は、BPの種類、逆設計の目的関数、最適化手法の変動に対しても頑健であり、既存および将来の逆設計手法との互換性を確保できる。
  • 本フレームワークは、二クラスおよびマルチクラス設定、複数の同時攻撃が存在する場合を含め、バックドア攻撃を効果的に検出でき、広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。