Skip to main content
QUICK REVIEW

[論文レビュー] MEGEX: Data-Free Model Extraction Attack against Gradient-Based Explainable AI

Takayuki Miura, Hasegawa Satoshi|arXiv (Cornell University)|Jul 19, 2021
Adversarial Robustness in Machine Learning参考文献 21被引用数 11
ひとこと要約

MEGEX は勾配ベースの説明可能AIに対するデータフリーなモデル抽出攻撃を提案する。モデルの説明を活用して生成モデルの学習をより効率化することで、従来手法に比べてクエリコストを 6/7 減少させた。CIFAR-10 と SVHN において、それぞれ 92.3% および 92.5% のクローンモデルの正確さを達成し、被害モデルの正確さの 97% および 98% を達成した。これは、解釈可能性とモデルのセキュリティの間の深刻なトレードオフを示している。

ABSTRACT

The advance of explainable artificial intelligence, which provides reasons for its predictions, is expected to accelerate the use of deep neural networks in the real world like Machine Learning as a Service (MLaaS) that returns predictions on queried data with the trained model. Deep neural networks deployed in MLaaS face the threat of model extraction attacks. A model extraction attack is an attack to violate intellectual property and privacy in which an adversary steals trained models in a cloud using only their predictions. In particular, a data-free model extraction attack has been proposed recently and is more critical. In this attack, an adversary uses a generative model instead of preparing input data. The feasibility of this attack, however, needs to be studied since it requires more queries than that with surrogate datasets. In this paper, we propose MEGEX, a data-free model extraction attack against a gradient-based explainable AI. In this method, an adversary uses the explanations to train the generative model and reduces the number of queries to steal the model. Our experiments show that our proposed method reconstructs high-accuracy models -- 0.97$ imes$ and 0.98$ imes$ the victim model accuracy on SVHN and CIFAR-10 datasets given 2M and 20M queries, respectively. This implies that there is a trade-off between the interpretability of models and the difficulty of stealing them.

研究の動機と目的

  • データフリーなモデル抽出攻撃の文脈において、勾配ベースの説明可能AIのセキュリティリスクを調査すること。
  • 従来のデータフリーなモデル抽出手法の高いクエリコストを、モデルの説明を活用することで生成モデルの学習効率を向上させることで解決すること。
  • Vanilla Gradient のような解釈可能メカニズムが、抽出攻撃に対するモデルのセキュリティを意図せず弱めるかどうかを評価すること。
  • 生成モデルの学習に説明を監視信号として用いる、新たな攻撃フレームワークの提案と検証すること。
  • モデルの解釈可能性とモデル盗難に対する脆弱性の間のトレードオフを定量化すること。

提案手法

  • 攻撃者は、被害モデルの勾配説明(Vanilla Gradient)を用いて、生成モデルの学習に必要な正確な勾配を計算する。
  • これらの勾配を用いて、実際の入力の分布に近い入力を合成する生成モデルを訓練する。
  • 生成されたデータに対する被害モデルの予測を用いてクローンモデルを訓練し、損失関数には ℓ₁ 範囲と KL 散布度が含まれる。
  • 二段階最適化を採用:まず生成モデルをリアルな入力を生成できるように訓練し、次にクローンモデルを被害モデルの振る舞いを模倣できるように訓練する。
  • SVHN には 200 万回、CIFAR-10 には 2000 万回のクエリ予算を設定し、収束を向上させるために適応的学習率とスケジューラーを用いる。
  • 説明からの正確な勾配情報を活用することで、従来のデータフリー手法に比べてクエリ数を 6/7 減少させた。
Figure 1: Model Extraction Attack.
Figure 1: Model Extraction Attack.

実験結果

リサーチクエスチョン

  • RQ1勾長ベースの説明可能AIメカニズムは、データフリーなモデル抽出攻撃における必要なクエリ数を削減するために悪用可能か?
  • RQ2モデルの説明を活用することで、モデル抽出攻撃における生成データの品質はどのように向上するか?
  • RQ3MEGEX と従来のデータフリーなモデル抽出手法との間で、クローンモデルの正確さとクエリ効率の面で、性能差はどの程度か?
  • RQ4説明からの正確な勾配の使用は、クローンモデルの収束速度と一般化性能を向上させるか?
  • RQ5データフリーなモデル抽出の文脈において、モデルの解釈可能性とセキュリティの間にはどのようなトレードオフが存在するか?

主な発見

  • MEGEX は CIFAR-10 で 2000 万回のクエリで 92.3% のクローンモデル正確さを達成し、被害モデルの 95.5% の 97% に相当する。
  • SVHN では 200 万回のクエリで 92.5% のクローン正確さを達成し、被害モデルの 94.8% の 98% に相当する。
  • MEGEX はベースラインの DFME 手法を上回り、同じクエリ予算下で CIFAR-10 で 80.6% の正確さにとどまる。
  • 従来のデータフリーなモデル抽出技術に比べ、必要なクエリ数を 6/7 減少させた。
  • MEGEX と DFME は ℓ₁ 損失を用いる場合、両方とも高い性能を示すが、KL 散布度損失は勾配の消失により性能が制限される。
  • 結果から、解釈可能性を高める勾配説明の使用は、モデルをデータフリーな抽出攻撃に対してより脆弱にするという顕著なトレードオフが示された。
Figure 2: Data-Free Model Extraction Attack.
Figure 2: Data-Free Model Extraction Attack.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。