Skip to main content
QUICK REVIEW

[論文レビュー] EX-RAY: Distinguishing Injected Backdoor from Natural Features in Neural Networks by Examining Differential Feature Symmetry

Yingqi Liu, Guangyu Shen|arXiv (Cornell University)|Mar 16, 2021
Adversarial Robustness in Machine Learning参考文献 87被引用数 7
ひとこと要約

EX-RAYは、被害者クラスとターゲットクラスを分離する最小の特徴集合を特定することで、ニューラルネットワークにおけるインジェクションされたバックドアと自然なトリガーを区別する対称的特徴差分法を提案する。バックドアスキャンにおける誤検出を78–100%削減し、誤検出の増加は0–30%にとどまる。全体の検出精度が17–41%向上し、TrojAIコンテストで最高のパフォーマンスを達成した。

ABSTRACT

Backdoor attack injects malicious behavior to models such that inputs embedded with triggers are misclassified to a target label desired by the attacker. However, natural features may behave like triggers, causing misclassification once embedded. While they are inevitable, mis-recognizing them as injected triggers causes false warnings in backdoor scanning. A prominent challenge is hence to distinguish natural features and injected backdoors. We develop a novel symmetric feature differencing method that identifies a smallest set of features separating two classes. A backdoor is considered injected if the corresponding trigger consists of features different from the set of features distinguishing the victim and target classes. We evaluate the technique on thousands of models, including both clean and trojaned models, from the TrojAI rounds 2-4 competitions and a number of models on ImageNet. Existing backdoor scanning techniques may produce hundreds of false positives (i.e., clean models recognized as trojaned). Our technique removes 78-100% of the false positives (by a state-of-the-art scanner ABS) with a small increase of false negatives by 0-30%, achieving 17-41% overall accuracy improvement, and facilitates achieving top performance on the leaderboard. It also boosts performance of other scanners. It outperforms false positive removal methods using L2 distance and attribution techniques. We also demonstrate its potential in detecting a number of semantic backdoor attacks.

研究の動機と目的

  • ニューラルネットワークにおける、バックドアに似た自然なクラス差(自然トリガー)と真正にインジェクションされたバックドアを区別する課題に対処すること。
  • 自然な特徴が誤ってインジェクションされたトリガーと誤検出されることが一般的であるため、バックドアスキャンにおける誤検出を低減すること。
  • トリガーのサイズに関する仮定に依存せず、既存のバックドア検出手法の精度を向上させる汎用的で頑健な手法を開発すること。
  • 特にTrojAIのような競争的ベンチマークを想定した、実世界のシナリオにおける高性能なバックドア検出を可能にすること。
  • 従来の小さな局所的トリガー(パッチやウォーターマーク)に限定されない、複雑な意味的バックドア攻撃への適用可能性を示すこと。

提案手法

  • 本手法は、ニューラルネットワークにおける被害者クラスとターゲットクラスを最も明確に分離する最小の特徴集合を計算するための対称的特徴差分法を導入する。
  • トリガーが2つのクラス間の最小分離特徴集合と著しく異なる場合、そのトリガーはインジェクションされたものと定義される。
  • モデルの活性化パターンを活用して、2つのクラスを分離する最小の特徉集合を特定するための特徴重要度分析を実施する。
  • このアプローチにより、トリガーがクラス分離特徴と一致する(自然なもの)か、それらから逸脱する(インジェクションされたもの)かを評価する。
  • ABSのような既存のスキャナと統合することで、自然トリガーによって引き起こされる誤検出をフィルタリングし、性能を向上させる。
  • トリガーのサイズや形状に依存しないため、大規模または意味的なトリガーが一般的な高度な攻撃に対しても頑健である。

実験結果

リサーチクエスチョン

  • RQ1特徴ベースの対称性解析は、ニューラルネットワークにおける自然トリガーとインジェクションされたバックドアを効果的に区別できるか?
  • RQ2対称的特徴差分法は、誤検出の増加を最小限に抑えつつ、バックドアスキャンにおける誤検出をどの程度低減できるか?
  • RQ3従来の小さな局所的トリガーに従わない、複雑な意味的バックドア攻撃の検出に、この手法はどの程度有効か?
  • RQ4ABSのような既存のバックドア検出ツールの性能を、TrojAIのような実世界のベンチマークで向上させられるか?
  • RQ5この手法は、ImageNetを含む多様なモデルアーキテクチャとデータセットに一般化可能か?

主な発見

  • EX-RAYは、最先端のスキャナABSと組み合わせて使用した際、誤検出を78–100%削減し、検出の信頼性を著しく向上させた。
  • バックドア検出における全体の精度が17–41%向上し、TrojAIラウンド2および4のリーダーボードで最高のパフォーマンスを達成した。
  • TrojAIラウンド3では2位にランクインし、多様なバックドアタイプおよびモデルアーキテクチャにわたる優れた一般化性能を示した。
  • L2距離やアトリビューション技術に基づく誤検出除去手法よりも、不正検出の低減において優れた性能を示した。
  • 反射やコンポジット攻撃など、大規模で意味的に意味のあるトリガーを持つ複雑な意味的バックドアの検出においても、EX-RAYは有望な結果を示した。
  • モデル修復実験では、自然トリガーはトリガーのサイズを34.4%程度にしか増加させなかったが、インジェクションされたトリガーでは78%の増加を示し、自然トリガーは破壊的でなく、より自然に存在するという仮説を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。