Skip to main content
QUICK REVIEW

[論文レビュー] The TrojAI Software Framework: An OpenSource tool for Embedding Trojans into Deep Learning Models

Kiran Karra, Chace Ashcraft|arXiv (Cornell University)|Mar 13, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用数 20
ひとこと要約

TrojAIソフトウェアフレームワークは、カスタム可能なトリガーを用いてデータセットを汚染することで、スケーラブルで再現可能なトロイの木馬付きディープラーニングモデルの生成を可能にするオープンソースのPythonツールキットである。MNIST分類器および強化学習エージェントにおける効果的なトロイの木馬埋め込みを示しており、トリガーの種類、バッチサイズ、汚染率が成功に顕著な影響を与えることが判明している。Neural Cleanseによる異常検出は、わずか18%のケースでのみ実現されている。

ABSTRACT

In this paper, we introduce the TrojAI software framework, an open source set of Python tools capable of generating triggered (poisoned) datasets and associated deep learning (DL) models with trojans at scale. We utilize the developed framework to generate a large set of trojaned MNIST classifiers, as well as demonstrate the capability to produce a trojaned reinforcement-learning model using vector observations. Results on MNIST show that the nature of the trigger, training batch size, and dataset poisoning percentage all affect successful embedding of trojans. We test Neural Cleanse against the trojaned MNIST models and successfully detect anomalies in the trained models approximately $18\%$ of the time. Our experiments and workflow indicate that the TrojAI software framework will enable researchers to easily understand the effects of various configurations of the dataset and training hyperparameters on the generated trojaned deep learning model, and can be used to rapidly and comprehensively test new trojan detection methods.

研究の動機と目的

  • トロイの木馬攻撃研究における標準化と再現可能性の欠如に応えるために、汚染されたデータセットおよびトロイの木馬付きモデルの生成を統合的かつ設定可能なフレームワークを提供すること。
  • トリガー設計、汚染率、学習ハイパーパrameterがトロイの木馬埋め込みの成功度と検出可能性に与える影響を体系的に調査すること。
  • さまざまなデータモダリティおよびモデルアーキテクチャを対象として、新しいトロイの木馬検出および緩和手法の迅速な評価とベンチマークを支援すること。
  • 画像分類を超えて、ベクトル観測環境を用いた強化学習への再現可能な研究を拡張すること。
  • より巧妙なトロイの木馬埋め込み手法および、音声やオブジェクト検出など、より広範なデータモダリティへの対応を今後の研究に促進すること。

提案手法

  • フレームワークは、ユーザー定義のトリガーを用いて汚染されたデータセットを生成するdatagen、およびこれらのデータセット上でディープラーニングモデルを訓練するmodelgenという2つのコアサブモジュールから構成される。
  • トリガーの種類(例:静的、動的、回転)、配置戦略、および入力データ全体における汚染率を設定可能にサポートしている。
  • 強化学習の文脈では、OpenAI Gym環境と統合されており、訓練中にベクトルベースの観測値にトリガーを埋め込むことができる。
  • バッチサイズやエポック数などのハイパーパrameterを変更した複数のモデルを一括で訓練でき、耐性や出力の評価が可能である。
  • 標準的な指標(クリーンデータおよびトリガー付きデータにおける正確性、RLタスクにおける累積報酬など)を用いた評価をサポートしている。
  • 検出のベースラインとしてNeural Cleanseが用いられ、さまざまな構成におけるトロイの木馬付きモデルの検出可能性が評価されている。

実験結果

リサーチクエスチョン

  • RQ1静的と動的なトリガーの違いや配置戦略が、MNIST分類器におけるトロイの木馬埋め込みの成功率にどのように影響するか?
  • RQ2データセット汚染率とバッチサイズが、モデルの出力率と耐性に与える影響は何か?
  • RQ3TrojAIフレームワークは、ベクトル観測を用いた強化学習エージェントに対して、機能的なトロイの木馬付きエージェントを効果的に生成できるか?
  • RQ4Neural Cleanse検出法は、さまざまなトロイの木馬構成において、異常検出率という観点でどの程度の性能を示すか?
  • RQ5あるトリガーや構成における結果が、他のトリガーや構成に一般化される程度はどの程度か?(検出可能性およびモデル性能の観点から)

主な発見

  • TrojAIフレームワークは、高いクリーン精度(>95%)と、トリガー付き入力における標的誤分類を達成するトロイの木馬付きMNIST分類器を成功裏に生成した。これは、効果的でスケーラブルなトロイの木馬埋め込みを実現していることを示している。
  • モデルの出力率と検出性能は、トリガーの種類や構成に大きく依存しており、動的トリガーは静的トリガーと比較してNeural Cleanseによる検出率が低かった。
  • バッチサイズは学習収束に顕著な影響を与え、大きなバッチ(64)は平均17.9±2.9エポックで収束したが、小さなバッチ(16)は14.1±2.4エポックで収束した。
  • Neural Cleanseは、すべての構成において約18%の成功率でトロイの木馬付きモデルを検出しており、検出性能の一般化が限定的であることが示された。
  • 強化学習の文脈では、Boxingエージェントはクリーン環境では高い性能(平均報酬52.22)を示し、汚染環境では低い性能(-62.69)を示した。これは、成功裏にトロイの木馬が埋め込まれたことを確認している。
  • フレームワークのモジュラー設計により、さまざまなデータモダリティ、ハイパーパrameter、モデルアーキテクチャを対象とした一貫性があり再現可能な実験が可能となり、大規模なベンチマークが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。