Skip to main content
QUICK REVIEW

[論文レビュー] ES Attack: Model Stealing against Deep Neural Networks without Data Hurdles

Xiaoyong Yuan, Lei Ding|arXiv (Cornell University)|Sep 21, 2020
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

ES Attackは、被害者モデルの学習データや補助データにアクセスする必要がない、機械学習サービス(MLaaS)APIから関数的に同等の深層ニューラルネットワーク(DNN)を再構築できる画期的なモデル盗難フレームワークである。反復的に合成データを生成し、代替モデルを知識蒸留によって精練することで、ベースライン攻撃よりも平均44.57%高い精度を達成し、大多数の既存防御を回避する。

ABSTRACT

Deep neural networks (DNNs) have become the essential components for various commercialized machine learning services, such as Machine Learning as a Service (MLaaS). Recent studies show that machine learning services face severe privacy threats - well-trained DNNs owned by MLaaS providers can be stolen through public APIs, namely model stealing attacks. However, most existing works undervalued the impact of such attacks, where a successful attack has to acquire confidential training data or auxiliary data regarding the victim DNN. In this paper, we propose ES Attack, a novel model stealing attack without any data hurdles. By using heuristically generated synthetic data, ES Attack iteratively trains a substitute model and eventually achieves a functionally equivalent copy of the victim DNN. The experimental results reveal the severity of ES Attack: i) ES Attack successfully steals the victim model without data hurdles, and ES Attack even outperforms most existing model stealing attacks using auxiliary data in terms of model accuracy; ii) most countermeasures are ineffective in defending ES Attack; iii) ES Attack facilitates further attacks relying on the stolen model.

研究の動機と目的

  • 被害者モデルの学習データや補助データへのアクセスを必要とするモデル盗難攻撃における重要なギャップを解消すること。
  • APIクエリと応答ラベルのみに依存して動作する、データフリーのモデル盗難フレームワークを開発すること。
  • データのハンディキャップがなく、既存手法と比較してES Attackの有効性を評価すること。
  • この新しい攻撃パラダイムに対して、現在の防御メカニズムの脆弱性を評価すること。
  • 盗まれたモデルを用いたブラックボックスの adversarial 攻撃を可能にするなど、下流のリスクを実証すること。

提案手法

  • ES Attackは反復的なE-ステップとS-ステップのプロセスを用いる:E-ステップでは、被害者モデルの応答から知識蒸留を用いて合成データ上で代替モデルを訓練する。
  • S-ステップでは、代替モデルを被害者モデルの代理として用い、予測クラスの信頼度を最大化するように入力ノイズを最適化することで合成データを生成する。
  • 複数の反復を通じて合成データが精錬され、被害者モデルの意思決定境界の多様性と表現力を向上させる。
  • 知識蒸留は、被害者モデルのソフトラベル(ログティス)を用い、代替モデルに機能的挙動を転送する。
  • 被害者モデルからの勾配計算に依存しないように、代替モデルを用いてデータ最適化のための勾配を生成する。
  • フレームワークはアーキテクチャに依存せず、被害者モデルの推論APIへのブラックボックスアクセスのみを要件とする。

実験結果

リサーチクエスチョン

  • RQ1被害者モデルの学習データや補助データにアクセスできない状況でも、モデル盗難攻撃がDNNを効果的に再構築できるか?
  • RQ2補助データに依存する攻撃と比較して、データフリーのモデル盗難攻撃の性能(代替モデルの精度)はどの程度か?
  • RQ3既存の防御メカニズムは、ES Attackのようなデータフリーのモデル盗難攻撃に対してどの程度有効か?
  • RQ4盗まれたモデルを用いたブラックボックスの adversarial 攻撃は、ホワイトボックス攻撃を上回る効果を示せるか?
  • RQ5ES Attackが生成する合成データの質と多様性は、実データまたは補助データセットと比較してどの程度か?

主な発見

  • ES Attackは、学習データや補助データが一切不要な状況でもMLaaSプロバイダーからDNNを効果的に盗み、補助データを用いたベースライン攻撃と比較して平均44.57%高い精度を達成した。
  • ES Attackが生成する合成データは、補助データセットよりも高い品質と多様性を示し、代替モデルの性能向上に寄与した。
  • クエリパターン検出や学習率モニタリングを含む大多数の既存防御は、ES Attackに対して無効であった。
  • 盗まれたモデルを用いたブラックボックスの adversarial 攻撃は、成功確率において時としてホワイトボックス攻撃を上回ることを示し、モデル盗難の脅威を実証した。
  • 被害者モデルのアーキテクチャやパラメータが不明であっても、ES Attackで訓練された代替モデルは、被害者モデルと高い機能的同等性を達成した。
  • 攻撃フレームワークは複数の画像分類データセットで堅牢であり、アーキテクチャやハイパーパrameterの知識が欠如している状況でも効果的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。