Skip to main content
QUICK REVIEW

[論文レビュー] Noise-response Analysis for Rapid Detection of Backdoors in Deep Neural Networks.

N. Benjamin Erichson, Dane Taylor|arXiv (Cornell University)|Jul 31, 2020
Adversarial Robustness in Machine Learning被引用数 9
ひとこと要約

本論文は、入力ノイズに対する感度を測定することで、深層ニューラルネットワークにおけるバックドアを迅速に検出するノイズ応答解析手法を提案する。この手法により、特徴的な指紋として機能するタイトラーション曲線が生成され、バックドアの検出を数秒で実現する。従来の手法と比較して、数個のオーダーも速く、信頼性の高いスケーラブルな検出を可能にする自動タイトラーションスコアを提供する。

ABSTRACT

The pervasiveness of deep neural networks (DNNs) in technology, matched with the ubiquity of cloud-based training and transfer learning, is giving rise to a new frontier for cybersecurity whereby `structural malware' is manifest as compromised weights and activation pathways for unsecure DNNs. In particular, DNNs can be designed to have backdoors in which an adversary can easily and reliably fool a classifier by adding to any image a pattern of pixels called a trigger. Since DNNs are black-box algorithms, it is generally difficult to detect a backdoor or any other type of structural malware. To efficiently provide a reliable signal for the absence/presence of backdoors, we propose a rapid feature-generation step in which we study how DNNs respond to noise-infused images with varying noise intensity. This results in titration curves, which are a type of `fingerprinting' for DNNs. We find that DNNs with backdoors are more sensitive to input noise and respond in a characteristic way that reveals the backdoor and where it leads (i.e,. its target). Our empirical results demonstrate that we can accurately detect a backdoor with high confidence orders-of-magnitude faster than existing approaches (i.e., seconds versus hours). Our method also yields a titration-score that can automate the detection of compromised DNNs, whereas existing backdoor-detection strategies are not automated.

研究の動機と目的

  • 深層ニューラルネットワークにおける構造的マルウェア、特に損なわれた重みや学習プロセスを介して導入されたバックドアの増加する脅威に対処すること。
  • 従来のバックドア検出手法の限界、すなわち遅さ、非自動化、侵入的またはブラックボックス分析に依存することを克服すること。
  • モデルの内部構造や学習データへのアクセスを必要とせず、迅速かつスケーラブルで自動化されたDNNにおけるバックドア検出手法を開発すること。
  • ノイズ感度から得られる特徴ベースの信号を信頼性のある指標として確立し、バックドア付きモデルとクリーンモデルを区別すること。

提案手法

  • 入力画像に所定の強度で制御されたノイズを注入し、モデルの応答ダイナミクスを調査する。
  • ノイズ強度を段階的に増加させた際のモデル出力の信頼度や活性化パターンをマップするタイトラーション曲線を生成する。
  • これらのタイトラーション曲線の形状と感度を、バックドアの存在とターゲットクラスを特定する指紋として利用する。
  • タイトラーションスコア特徴量を用いてシンプルな分類器を学習させ、多様なモデルにおけるバックドア検出を自動化する。
  • バックドア付きモデルは、特にトリガーパターン周辺でノイズに対して顕著に感度が高くなるという事実を活用する。
  • 学習後の軽量な解析ステップとしてこの手法を適用し、学習データやモデルアーキテクチャの詳細にアクセスする必要がない。

実験結果

リサーチクエスチョン

  • RQ1ノイズ応答解析は、バックドア付きの深層ニューラルネットワークとクリーンモデルを信頼性高く区別できるか?
  • RQ2DNNの入力ノイズに対する感度とバックドアの有無との相関関係は何か?
  • RQ3タイトラーション曲線は、バックドアのトリガーとそのターゲットを特定するための固有の指紋として機能できるか?
  • RQ4この手法は、従来の手動またはヒューリスティックなアプローチと比較して、どの程度自動化が可能か?
  • RQ5この手法の検出速度は、最先端のバックドア検出技術と比較してどの程度優れているか?

主な発見

  • バックドア付きモデルは、特にトリガー周辺でクリーンモデルと比較して顕著にノイズに対して感度が高いことが判明した。
  • ノイズ応答解析から得られるタイトラーション曲線は、バックドア付きモデルとクリーンモデルを高い信頼性で明確に区別できる。
  • 本手法は数秒でバックドアを検出でき、従来のアプローチ(例:数時間対数秒)と比較して検出時間を数個のオーダーも短縮した。
  • 提案されたタイトラーションスコアにより、従来の手動的かつスケーラブルでない手法の欠点を克服した完全自動化検出が可能になった。
  • 本手法は多様なDNNアーキテクチャおよびデータセットに対して強固であり、モデルの内部構造を覗く必要なく一般化性を示した。
  • タイトラーション曲線の形状とピーク応答の分析により、バックドアのターゲットクラスを効果的に同定できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。