Skip to main content
QUICK REVIEW

[論文レビュー] The Taboo Trap: Behavioural Detection of Adversarial Samples

Ilia Shumailov, Yiren Zhao|arXiv (Cornell University)|Nov 18, 2018
Adversarial Robustness in Machine Learning参考文献 22被引用数 10
ひとこと要約

本論文では、特定の変換関数(例:パーセンタイルクリッピングなど)を用いてトレーニング中にDNNの活性化行動を制限することで、敵対的サンプルを検出する軽量で行動ベースの防御であるTaboo Trapを提案する。実行時オーバーヘッドはほぼゼロに近く、FGSM、PGD、DeepFoolを含む多様な攻撃に対して効果的に検出可能であり、複数のネットワークや変換関数において優れた性能を示し、IoTデバイスのようなリソース制約のあるシステムにスケーラブルなソリューションを提供する。

ABSTRACT

Deep Neural Networks (DNNs) have become a powerful toolfor a wide range of problems. Yet recent work has found an increasing variety of adversarial samplesthat can fool them. Most existing detection mechanisms against adversarial attacksimpose significant costs, either by using additional classifiers to spot adversarial samples, or by requiring the DNN to be restructured. In this paper, we introduce a novel defence. We train our DNN so that, as long as it is workingas intended on the kind of inputs we expect, its behavior is constrained, in that some set of behaviors are taboo. If it is exposed to adversarial samples, they will often cause a taboo behavior, which we can detect. Taboos can be both subtle and diverse, so their choice can encode and hide information. It is a well-established design principle that the security of a system should not depend on the obscurity of its design, but on some variable (the key) which can differ between implementations and bechanged as necessary. We discuss how taboos can be used to equip a classifier with just such a key, and how to tune the keying mechanism to adversaries of various capabilities. We evaluate the performance of a prototype against a wide range of attacks and show how our simple defense can defend against cheap attacks at scale with zero run-time computation overhead, making it a suitable defense method for IoT devices.

研究の動機と目的

  • 特にIoTデバイスのような低リソース環境を想定し、計算コストを最小限に抑えて深層ニューラルネットワークにおける敵対的サンプルを検出する課題に対処すること。
  • 追加の分類器やアーキテクチャの変更に依存する既存の検出手法の限界を克服し、高い計算および設計のオーバーヘッドを回避すること。
  • ネットワーク構造を変更せずにトレーニング中の行動制約を活用し、推論時に敵対的入力を検出できる防御機構を開発すること。
  • 各導入に応じて変更可能なキーリンクの変換関数を用いることで、異なる能力を持つ攻撃者に対しても適応可能であるようにすること。
  • 行動制約が暗号的アプローチに類似した防御メカニズムとして機能できることを示し、ブラックボックスおよびホワイトボックス攻撃の両方に対して耐性を高めること。

提案手法

  • トレーニング中に層ごとの活性化値をプロファイリングし、行動制限の範囲を特定する。
  • 活性化値を事前に定義された範囲に制限する変換関数(例:n番目のパーセンタイルへのクリッピング)を適用し、『タブー』行動を生成する。
  • これらの活性化制約を用いてDNNを再トレーニングし、通常の入力がタブー範囲内に収まるようにし、敵対的サンプルはしばしばそれを逸脱するようにする。
  • 推論時に、活性化値が期待されるタブー範囲外にあればアラームを発動する検出関数を用いる。
  • 多様で設定可能な変換関数(例:層ごとのパーセンタイル閾値、複数範囲クリッピング)を用い、防御の予測不可能性を高める暗号的鍵として機能させる。
  • 計算リソースに余裕がある場合、非侵襲的な統合が可能であるため、MagNet や SafetyNet などの他の防御機構と組み合わせて使用する。

実験結果

リサーチクエスチョン

  • RQ1DNNトレーニング中の行動制約が、敵対的サンプル検出に効果的かつ低コストなメカニズムとして機能するか。
  • RQ2変換関数の選択(例:パーセンタイルクリッピング)が、異なる敵対的攻撃に対する防御の強度にどのように影響するか。
  • RQ3変換関数が秘密にされた場合、ブラックボックスおよびホワイトボックス攻撃の両方に対してTaboo Trapがどの程度防御できるか。
  • RQ4トレーニング時に活性化制約を課すことで、クリーンデータに対するネットワークの収束性や性能が損なわれるか。
  • RQ5Taboo Trapは、追加の計算オーバーヘッドをほとんど引き起こさずに、他の防御機構と効果的に組み合わせられるか。

主な発見

  • Taboo Trapは実行時計算オーバーヘッドがほぼゼロであり、トレーニング時間もわずかに増加するにとどまるため、IoTや組み込みシステムに最適である。
  • LeNet5(MNIST)において、使用する変換関数に応じて、FGSM攻撃では94–98%、PGD攻撃では92–61%、DeepFool攻撃では1–12%の検出率を達成した。
  • 異なる変換関数(例:1パーセンタイル、複数範囲クリッピング)は、それぞれ異なる防御能力を示し、特定の攻撃タイプにカスタマイズ可能である。
  • 複数の設定可能な変換関数を用いることで暗号的鍵として機能し、攻撃が判明した場合にモデルの再設計なしに鍵を変更することで防御を更新できる。
  • クリーンデータでは高い精度(約99%)を維持し、活性化制約下でも誤検出率は1%未満に抑えられた。
  • 既存の防御フレームワークと互換性があり、MagNet や SafetyNet などのより複雑なシステムとも組み合わせ可能であり、追加の実行時コストなしに全体のセキュリティを強化できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。