Skip to main content
QUICK REVIEW

[論文レビュー] Cassandra: Detecting Trojaned Networks from Adversarial Perturbations

Xiaoyu Zhang, Ajmal Mian|arXiv (Cornell University)|Jul 28, 2020
Adversarial Robustness in Machine Learning参考文献 36被引用数 5
ひとこと要約

本稿では、敵対的摂動と攻撃の難易度を分析することで、トロイの木馬付きニューラルネットワークを検出する深層学習ベースの手法Cassandraを提案する。MNISTおよびNISTデータセットにおいて、トリガー情報やターゲットクラスの事前知識がなくても、92%を超える精度でモデルを健全またはトロイの木馬付きと分類する2ストリームニューラルネットワークを用いる。

ABSTRACT

Deep neural networks are being widely deployed for many critical tasks due to their high classification accuracy. In many cases, pre-trained models are sourced from vendors who may have disrupted the training pipeline to insert Trojan behaviors into the models. These malicious behaviors can be triggered at the adversary's will and hence, cause a serious threat to the widespread deployment of deep models. We propose a method to verify if a pre-trained model is Trojaned or benign. Our method captures fingerprints of neural networks in the form of adversarial perturbations learned from the network gradients. Inserting backdoors into a network alters its decision boundaries which are effectively encoded in their adversarial perturbations. We train a two stream network for Trojan detection from its global ($L_\infty$ and $L_2$ bounded) perturbations and the localized region of high energy within each perturbation. The former encodes decision boundaries of the network and latter encodes the unknown trigger shape. We also propose an anomaly detection method to identify the target class in a Trojaned network. Our methods are invariant to the trigger type, trigger size, training data and network architecture. We evaluate our methods on MNIST, NIST-Round0 and NIST-Round1 datasets, with up to 1,000 pre-trained models making this the largest study to date on Trojaned network detection, and achieve over 92\% detection accuracy to set the new state-of-the-art.

研究の動機と目的

  • 実世界の展開において、バックドアが仕込まれた事前学習済みディープニューラルネットワークが引き起こす深刻なセキュリティ脅威に対処する。
  • トリガー情報や大量の訓練データが入手できない状況でのトロイの木馬検出の課題を克服する。
  • わずかな健全なサンプルのみを用いて、スケーラブルでアーキテクチャに依存しないモデルの整合性検証手法を開発する。
  • トロイの木馬付きモデルのターゲットクラスを特定できることは、悪意ある振るまいを理解するために不可欠である。
  • トリガーの種類、サイズ、モデルアーキテクチャに依存しない、強力で一般化可能な検出フレームワークを確立する。

提案手法

  • モデルのグローバルな意思決定境界の指紋を捉えるために、普遍的な$L_\infty$および$L_2$バウンデッド敵対的摂動を生成する。
  • 摂動内に局所的な高エネルギー領域を特定し、未知のトリガー形状をエンコードする。
  • グローバルな摂動特徴と局所的なエネルギーパターンを統合する2ストリームニューラルネットワークを訓練し、トロイの木馬検出に用いる。
  • 最小摂動エネルギーでモデルをだませる必要があることを定量化する新しい指標、攻撃の難易度$\gamma$を導入し、主な識別子として用いる。
  • 2段階のパイプラインを用い、$\gamma$と予測されたトロイの木馬確率を組み合わせて、トロイの木馬付きモデルのターゲットクラスを予測する。
  • MNISTおよびNISTデータセットの1,000個の事前学習済みモデルからなる大規模データセットを活用し、検出ネットワークの訓練と検証を実施する。

実験結果

リサーチクエスチョン

  • RQ1敵対的摂動は、事前学習済みディープニューラルネットワークにおけるバックドア検出に信頼できる指紋として機能するか?
  • RQ2トリガー情報や訓練データが入手できない状況でも、モデルに依存しない検出手法をどのように設計できるか?
  • RQ3攻撃の難易度$\gamma$は、トロイの木馬付きモデルのターゲットクラスを効果的に示唆できるか?
  • RQ4トリガーの種類、サイズ、ネットワークアーキテクチャの変化に対して、検出手法はどの程度頑健か?
  • RQ5健全モデルとトロイの木馬付きモデルの大規模データセットで訓練された深層学習ベースの検出器は、最先端のパフォーマンスを達成できるか?

主な発見

  • Cassandraは、マルチバッチ摂動と2ストリームアーキテクチャを用いて、NIST-Round0データセットで92.5%の検出精度を達成した。
  • 予測されたトロイの木馬確率と攻撃の難易度を用いることで、トリガ付きMNISTデータセットにおけるターゲットクラス予測精度が、ベースラインの76.1%から90.0%に向上した。
  • 真値のトロイの木馬確率を用いることで、NIST-Round0データセットでの検出精度は95.0%に上昇し、$\gamma$がターゲットクラスを示す重要な指標であることが確認された。
  • 摂動生成におけるハイパーパramータの変動に対しても、検出精度が$L_\infty$および$L_2$設定の違いで5%未満にとどまるなど、本手法は頑健である。
  • アブレーションスタディにより、異なるデータバッチからの複数の摂動を用いることで、精度が77.5%から92.5%に向上したことが確認され、マルチバッチ解析の価値が示された。
  • 本手法は、1,000個の事前学習済みモデルを用いた最大規模の評価において、先行手法を上回る新しい最先端の性能を達成し、トロイの木馬検出分野の新たな基準を確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。