Skip to main content
QUICK REVIEW

[論文レビュー] A Target-Agnostic Attack on Deep Models: Exploiting Security Vulnerabilities of Transfer Learning

Shahbaz Rezaei, Xin Liu|arXiv (Cornell University)|Apr 8, 2019
Adversarial Robustness in Machine Learning参考文献 24被引用数 35
ひとこと要約

この論文は、公開済みの事前学習モデルのみを使用して転移学習モデルの任意のターゲットクラスをトリガーする入力を作成するターゲット非依存の総当たり攻撃を提案し、そのような設定でのSoftmaxの脆弱性を明らかにする。

ABSTRACT

Due to insufficient training data and the high computational cost to train a deep neural network from scratch, transfer learning has been extensively used in many deep-neural-network-based applications. A commonly used transfer learning approach involves taking a part of a pre-trained model, adding a few layers at the end, and re-training the new layers with a small dataset. This approach, while efficient and widely used, imposes a security vulnerability because the pre-trained model used in transfer learning is usually publicly available, including to potential attackers. In this paper, we show that without any additional knowledge other than the pre-trained model, an attacker can launch an effective and efficient brute force attack that can craft instances of input to trigger each target class with high confidence. We assume that the attacker has no access to any target-specific information, including samples from target classes, re-trained model, and probabilities assigned by Softmax to each class, and thus making the attack target-agnostic. These assumptions render all previous attack models inapplicable, to the best of our knowledge. To evaluate the proposed attack, we perform a set of experiments on face recognition and speech recognition tasks and show the effectiveness of the attack. Our work reveals a fundamental security weakness of the Softmax layer when used in transfer learning settings.

研究の動機と目的

  • 公開済みの事前学習モデルのみを使用して、転移学習ベースのシステムに対するターゲット非依存攻撃を実証する。
  • Softmaxの脆弱性が、ターゲットクラスのサンプルなしで高信頼度の誤分類を可能にすることを示す。
  • 顔認識と音声認識タスクで攻撃の有効性を評価する。
  • オープンセット/転移学習の文脈におけるSoftmaxベースの分類器の防御上の考慮点と限界について議論する。

提案手法

  • 特徴抽出器の出力に含まれる個々のニューロンを反復的に活性化して敵対的な画像を作成する。
  • 負の活性化を無視するためにreluを用いた修正MSEを用い、1つの活性化ニューロンを強調し他を抑制する標的損失Lを定義する。
  • 勾配に導かれた反復的な入力空間更新を用いて、M個のニューロン(活性化ベクター成分)を総当たり演算して敵対的入力を生成する。
  • 小規模な再訓練データセットと固定された特徴抽出器を使用し、最終分類器のみ再訓練して転移学習シナリオをシミュレートする。
  • 閾値ベースのモデルと拒否/未知クラスを追加したモデルの下で攻撃性能を比較する。
  • 顔認識(VGG-face)および音声認識設定に対して評価し、NABACと95%/99%信頼度での有効性を定量化する。

実験結果

リサーチクエスチョン

  • RQ1同じ事前学習特徴抽出器を共有する再訓練済みモデルのすべてを欺く普遍的な敵対的入力を、ターゲットクラスのサンプルや再訓練済みモデルへのアクセスなしで攻撃者が作成できるか。
  • RQ2転移学習におけるSoftmaxはターゲット非依存攻撃にどれだけ脆弱か、拒否クラスやオープンセット分類器のような防御下でこの脆弱性が持続するか。
  • RQ3顔認識と音声認識タスクにおけるこのような攻撃の実用的な有効性とクエリ効率はどの程度か。
  • RQ4この攻撃を緩和できる防御戦略(例:EVMのような分布認識型分類器)にはどんなものがあり、どのようなトレードオフを招くか。

主な発見

  • 攻撃は、ターゲット特定データなしでも、事前学習済みモデルのみを用いてすべてのターゲットクラスに対して高信頼度の敵対的入力を作成できる。
  • 同じ事前学習モデルを共有する再訓練済みモデル全体で、活性化ベクターニューロンの総当たりを1回行うだけでターゲットクラスを誘発できる。
  • 実用的な設定では閾値ベースまたは拒否クラス防御は攻撃を完全には緩和できず、高い有効性が依然として観察される。
  • 追加の再訓練層やより深い新分類器を追加すると攻撃の有効性は低下しがちだが、特に事前学習特徴抽出器が類似している場合はターゲット非依存性は残る。
  • Open-set/分布認識型分類器のようなEVMは攻撃の成功を抑制するが、全体的な精度とロバスト性にトレードオフを生む。
  • ブラックボックス Zoo攻撃と比較して、提案手法ははるかに少ないクエリ(通常は学生モデルへの1回のクエリ)で、同じ転移学習の仮定の下でより高い有効性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。