Skip to main content
QUICK REVIEW

[論文レビュー] FreeEagle: Detecting Complex Neural Trojans in Data-Free Cases

Chong Fu, Xuhong Zhang|arXiv (Cornell University)|Feb 28, 2023
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

FreeEagle は、継承データや汚染データを必要とせず、DNN の分類器ヘッドを分析することで、複雑なニューラルトロイのウイルス(クラス固有および回避型トリガー攻撃を含む)を検出する画期的なデータフリーのバックドア検出手法である。最適化によりダミーの中間表現を生成し、クラス事後確率における異常を検出することで、GTSRB や CIFAR-10 などの多様なデータセットおよびモデルアーキテクチャで、最先端の手法(DF-TND など)を上回る性能を発揮する。

ABSTRACT

Trojan attack on deep neural networks, also known as backdoor attack, is a typical threat to artificial intelligence. A trojaned neural network behaves normally with clean inputs. However, if the input contains a particular trigger, the trojaned model will have attacker-chosen abnormal behavior. Although many backdoor detection methods exist, most of them assume that the defender has access to a set of clean validation samples or samples with the trigger, which may not hold in some crucial real-world cases, e.g., the case where the defender is the maintainer of model-sharing platforms. Thus, in this paper, we propose FreeEagle, the first data-free backdoor detection method that can effectively detect complex backdoor attacks on deep neural networks, without relying on the access to any clean samples or samples with the trigger. The evaluation results on diverse datasets and model architectures show that FreeEagle is effective against various complex backdoor attacks, even outperforming some state-of-the-art non-data-free backdoor detection methods.

研究の動機と目的

  • クリーンな検証データやトリガーを埋め込んだサンプルが入手できないモデル共有プラットフォームにおけるバックドア検出の重要なニーズに対応する。
  • DF-TND などの既存のデータフリー検出手法が、クラス固有および意味論的トリガーに対して失敗するという限界を克服する。
  • 外部データに依存せずに、クラスに依存しないおよびクラス固有のバックドアを効率的に検出できるようにする。
  • 微細なトリガーおよび意味的に意味のあるトリガーなど、従来の入力空間分析を回避する多様なトリガータイプに対しても、耐性を持つ。
  • AIモデルマーケットや共有プラットフォームでの実世界での展開に適したスケーラブルなソリューションを提供する。

提案手法

  • FreeEagle は DNN を特徴抽出部と分類器ヘッドに分解し、後者に注目することで、高レベル表現におけるバックドア行動を検出する。
  • 勾配ベースの最適化を用いて、各クラスに対してダミーの中間表現を生成することで、実際のクリーンデータや汚染データの必要性を排除する。
  • 定量値ベースの指標を用いて分類器の出力事後確率に異常検出を施し、トロイのウイルスの兆候となる外れ値行動を特定する。
  • すべての可能なソース・ターゲットクラスペアを検査することで、クラス固有のバックドアを検出するカバレッジを著しく向上させる。
  • 分類器の意思決定プロセスを分析することにより、複雑で意味論的なトリガーを含むトリガー形式の変化に対しても耐性を持つ。
  • 最後の数層に焦点を当てているため、計算が効率的であり、データフリー環境下で全クラスペアのスキャンが高速に可能になる。

実験結果

リサーチクエスチョン

  • RQ1クリーンデータやトリガーを埋め込んだサンプルが一切入手できない状況下でも、クラス固有のバックドアを効果的に検出できるバックドア検出手法は可能か?
  • RQ2従来の入力空間分析を回避する複雑で意味論的なトリガーに対して、データフリー検出器はどの程度の性能を示すか?
  • RQ3分類器ヘッド挙動にのみ依存する手法は、実世界の展開環境において高い正確性と低い偽陽性率でトロイのウイルスを検出できるか?
  • RQ4FreeEagle は、データフリーでない最先端の検出器と比較して、検出精度および耐性において優れているか?
  • RQ5トリガーのパターンやモデル挙動を変更して検出を回避しようとする能動的攻撃に対しても、FreeEagle は耐性を持つことができるか?

主な発見

  • FreeEagle は、GTSRB や CIFAR-10 などの多様なデータセットにおいて、クラスに依存しないおよびクラス固有のバックドアの両方で優れた検出性能を達成した。
  • 評価されたすべてのベンチマークで、最先端のデータフリー検出手法 DF-TND を上回ったが、特にクラス固有および複雑なトリガー攻撃の検出において顕著な優位性を示した。
  • トリガーのパターンを変更する能動的攻撃に対しても、真陽性率(TPR)を高い水準で維持し、偽陽性率(FPR)を 0.05 未満に抑えることができた。
  • GoogLeNet や VGG-16 などの異なるモデルアーキテクチャにおいても、強力な汎化性能を示し、耐性の高さを確認した。
  • データ拡張を無効化した場合でも、FreeEagle は有効に機能することが実験で示されたが、その際は性能がわずかに低下した。
  • 分類器ヘッドの分析に依存しているため、意味的およびパッチベースのトリガーを含むトリガー形式の変化に対しても、耐性を持つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。