Skip to main content
QUICK REVIEW

[論文レビュー] AEVA: Black-box Backdoor Detection Using Adversarial Extreme Value Analysis

Junfeng Guo, Ang Li|arXiv (Cornell University)|Oct 28, 2021
Adversarial Robustness in Machine Learning参考文献 38被引用数 16
ひとこと要約

AEVAは、最終出力ラベルのみにアクセス可能なDNNにおけるブラックボックスバックドア検出手法を提案する。敵対的極値分析を用い、敵対的特異現象(敵対的摂動マップにおける急激なスパイク)を通じてバックドアを検出する。限定的なアクセスにもかかわらず、白ボックス手法と同等の86.7%以上の検出精度を達成し、多様なタスクおよび攻撃に対して安定した性能を示す。

ABSTRACT

Deep neural networks (DNNs) are proved to be vulnerable against backdoor attacks. A backdoor is often embedded in the target DNNs through injecting a backdoor trigger into training examples, which can cause the target DNNs misclassify an input attached with the backdoor trigger. Existing backdoor detection methods often require the access to the original poisoned training data, the parameters of the target DNNs, or the predictive confidence for each given input, which are impractical in many real-world applications, e.g., on-device deployed DNNs. We address the black-box hard-label backdoor detection problem where the DNN is fully black-box and only its final output label is accessible. We approach this problem from the optimization perspective and show that the objective of backdoor detection is bounded by an adversarial objective. Further theoretical and empirical studies reveal that this adversarial objective leads to a solution with highly skewed distribution; a singularity is often observed in the adversarial map of a backdoor-infected example, which we call the adversarial singularity phenomenon. Based on this observation, we propose the adversarial extreme value analysis(AEVA) to detect backdoors in black-box neural networks. AEVA is based on an extreme value analysis of the adversarial map, computed from the monte-carlo gradient estimation. Evidenced by extensive experiments across multiple popular tasks and backdoor attacks, our approach is shown effective in detecting backdoor attacks under the black-box hard-label scenarios.

研究の動機と目的

  • 最終出力ラベルのみが利用可能な完全ブラックボックスDNNにおけるバックドア検出の課題に対処すること。
  • モデルパラメータ、トレーニングデータ、信頼度スコアへのアクセスを必要とする既存手法の制限を克服すること。
  • モデル内部情報が入手不可能な状況下でも検出可能なバックドア感染の兆候を同定し、エッジおよびクラウド環境における実用的導入を可能にすること。
  • ラベルの可用性が低い状況や、1つのラベルに複数のトリガーが存在する状況においても耐性を持つ手法の開発

提案手法

  • 理論的分析を基に、敵対的目的で制限された最適化問題としてバックドア検出を定式化する。
  • ブラックボックスハードラベル設定下で、モンテカルロ勾配推定を用いて敵対的摂動マップを計算する。
  • 敵対的特異現象(敵対的マップにおける急激なピーク)を検出し、バックドア感染の兆候とみなす。
  • 複数の入力に対して敵対的ピーク値を極値分析し、グローバル敵対的ピーク(GAP)を統計的指標として用いる。
  • GAP値に対して中央絶対偏差(MAD)アルゴリズムを適用し、モデルを感染済みまたはクリーンと分類する。
  • 複数のトリガーに対応するため、上位5つの敵対的ピーク値の合計を用いることで特異性検出を維持する

実験結果

リサーチクエスチョン

  • RQ1最終ラベルのみにアクセス可能な完全ブラックボックス環境下でも、バックドア検出を効果的に行うことができるか?
  • RQ2バックドア検出における敵対的目的が、敵対的マップに検出可能な分布的異常を引き起こすか?
  • RQ3極端なピークによって特徴づけられる敵対的特異現象を、バックドア検出に信頼性を持って利用できるか?
  • RQ4ラベルの可用性が低い状況および1ラベルに複数のトリガーが存在する状況下で、提案手法の耐性はいかがいか?
  • RQ5マルチラベル感染や高密度トリガーといった適応的攻撃に対しても、本手法は耐性を示せるか?

主な発見

  • AEVAは、複数のタスク、DNNアーキテクチャ、バックドア攻撃手法において、ブラックボックスハードラベル条件下で86.7%以上の検出精度を達成した。
  • ラベルの4%(例:200個中8個)しか入手できない状況でも、AEVAは高い検出性能を維持し、低データ環境下での実用性を示した。
  • 敵対的特異現象(敵対的マップにおける極端なピーク)は、感染済み例の60%で観測され、信頼性の高い検出を可能にした。
  • 非常に少ないラベルでも、異常インデックス値が低いため、未感染モデルの同定において100%の精度を維持した。
  • 1つのラベルに複数のトリガーが挿入された場合、上位5つのピーク値の合計を用いることで、2つのトリガーでは93.3%、3つのトリガーでは88.3%の精度を達成し、性能低下はわずかにとどまった。
  • マルチラベル感染や高密度トリガーといった適応的攻撃に対しても、AEVAは耐性を示した。これらの攻撃はモデルの精度やロバストネスを低下させるため、攻撃の隠蔽性が制限される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。