[論文レビュー] Design and Evaluation of a Multi-Domain Trojan Detection Method on Deep Neural Networks
本稿では、参照モデルを必要とせずに、視覚、テキスト、音声の分野における深層ニューラルネットワークにおけるバックドアトレインを検出できる、新しいランタイムトロイの木検出手法であるSTRIP-ViTAを提案する。入力レベルの摂動とエントロピー解析を活用し、低誤受容率(FAR)で異常を検出する。視覚タスクでは0%のFARおよびFRRを達成し、テキストおよび音声タスクではFARが4%未満である。モデルアーキテクチャーや分野をまたいで一般化性を示している。
This work corroborates a run-time Trojan detection method exploiting STRong Intentional Perturbation of inputs, is a multi-domain Trojan detection defence across Vision, Text and Audio domains---thus termed as STRIP-ViTA. Specifically, STRIP-ViTA is the first confirmed Trojan detection method that is demonstratively independent of both the task domain and model architectures. We have extensively evaluated the performance of STRIP-ViTA over: i) CIFAR10 and GTSRB datasets using 2D CNNs, and a public third party Trojaned model for vision tasks; ii) IMDB and consumer complaint datasets using both LSTM and 1D CNNs for text tasks; and speech command dataset using both 1D CNNs and 2D CNNs for audio tasks. Experimental results based on 28 tested Trojaned models demonstrate that STRIP-ViTA performs well across all nine architectures and five datasets. In general, STRIP-ViTA can effectively detect Trojan inputs with small false acceptance rate (FAR) with an acceptable preset false rejection rate (FRR). In particular, for vision tasks, we can always achieve a 0% FRR and FAR. By setting FRR to be 3%, average FAR of 1.1% and 3.55% are achieved for text and audio tasks, respectively. Moreover, we have evaluated and shown the effectiveness of STRIP-ViTA against a number of advanced backdoor attacks whilst other state-of-the-art methods lose effectiveness in front of one or all of these advanced backdoor attacks.
研究の動機と目的
- 複数の分野(視覚、テキスト、音声)およびモデルアーキテクチャにまたがる一般化可能なトロイの木検出手法の不足を解消すること。
- 真の基準モデル、トレーニングデータ、または特別な機械学習の専門知識を必要としない検出手法を開発すること。
- 多様なDNNアーキテクチャーやデータセットにおいて、高度で入力に依存しないバックドア攻撃に対しての耐性を評価すること。
- 実世界の展開環境において、高い検出精度と低い誤受容率および誤拒否率を達成すること。
提案手法
- STRIP-ViTAは、分野に応じた摂動パターン(視覚分野ではピクセルパッチ、テキスト分野では語の置換、音声分野ではスペクトルマスク)を用いて、入力に構造的かつ意図的な摂動を加える。
- 複数の摂動を加えた入力に対するモデル出力のエントロピーを計算し、異常な出力分散を検出することで、バックドアの兆候を特定する。
- 検出境界は、完全に展開済みモデルの動作からのみ決定され、基準モデルやクリーンなモデルの必要がない。
- 摂動パターンは、各分野において見えにくいか自然な形になるように設計されており、スパイクネスと実世界への適用可能性を確保する。
- 各入力に対して、可変な数の摂動パターン(N)を用いるが、検出感度とランタイムオーバーヘッドのバランスを最適化するためにNを調整する。
- 検出は推論時に行われ、再トレーニングやトレーニングデータへのアクセスなしにリアルタイム展開が可能である。
実験結果
リサーチクエスチョン
- RQ1モデル固有またはタスク固有の仮定に依存せずに、視覚、テキスト、音声分野にまたがるトロイの木検出手法は有効に機能するか?
- RQ2多様なDNNアーキテクチャにわたって、最小限の誤検出と誤検出を伴う高精度な検出手法は可能か?
- RQ3真の基準モデルや追加のトレーニングを必要とせずに、トロイの木を検出することは可能か?
- RQ4既存の防御を回避するように設計された高度で入力に依存しないバックドア攻撃に対しても、STRIP-ViTAは有効に機能するか?
- RQ5交通認識や音声処理などのリアルタイムアプリケーションにおけるSTRIP-ViTAのランタイムオーバーヘッドはどの程度か?
主な発見
- 視覚タスク(CIFAR10およびGTSRB)において、2D CNNおよび第三者が改ざんしたモデルを用いて、STRIP-ViTAは0%の誤受容率(FAR)および0%の誤拒否率(FRR)を達成した。
- IMDBおよび消費者苦情データセットを用いたテキストタスクでは、STRIP-ViTAは平均FARが1.1%、事前設定されたFRRが3%であった。
- 音声コマンドデータセットを用いた音声タスクでは、STRIP-ViTAは平均FARが3.55%、FRRが3%であった。これは強力なクロスドメイン一般化性を示している。
- Neural Cleanse や ABS といった最先端の防御を回避するように設計された複数の高度なバックドア攻撃に対しても、本手法は有効であった。
- ランタイムオーバーヘッドは最小限であった:視覚(ResNet20)で1.32倍、テキスト(IMDB+LSTM)で4.24倍、音声(SC+1D CNN)で1.62倍であり、最適化を行わずとも、リアルタイム実行が可能であることを示している。
- モデルの複雑さやデータセットの変動に対して頑健であり、9種類の異なるアーキテクチャおよび5つのデータセットにおいて、検出性能が安定していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。