Skip to main content
QUICK REVIEW

[論文レビュー] Stateful Detection of Model Extraction Attacks

Soham Pal, Yash Gupta|arXiv (Cornell University)|Jul 12, 2021
Adversarial Robustness in Machine Learning参考文献 31被引用数 10
ひとこと要約

本稿では、機械学習サービス(MLaaS)プラットフォームのユーザーから得られるクエリ分布を監視することで、モデル抽出攻撃を検出する状態保持型の異常検知システム、VarDetectを提案する。修正された変分オートエンコーダー(VAE)を用いて正常なクエリ分布をモデル化することで、合成攻撃者、敵対的摂動攻撃者、問題領域外攻撃者の3種類の攻撃者タイプを検出可能であり、白帽知識を持つ適応的攻撃者に対しても有効であり、抽出されたモデルの性能と移行性を著しく低下させる。

ABSTRACT

Machine-Learning-as-a-Service providers expose machine learning (ML) models through application programming interfaces (APIs) to developers. Recent work has shown that attackers can exploit these APIs to extract good approximations of such ML models, by querying them with samples of their choosing. We propose VarDetect, a stateful monitor that tracks the distribution of queries made by users of such a service, to detect model extraction attacks. Harnessing the latent distributions learned by a modified variational autoencoder, VarDetect robustly separates three types of attacker samples from benign samples, and successfully raises an alarm for each. Further, with VarDetect deployed as an automated defense mechanism, the extracted substitute models are found to exhibit poor performance and transferability, as intended. Finally, we demonstrate that even adaptive attackers with prior knowledge of the deployment of VarDetect, are detected by it.

研究の動機と目的

  • 機械学習サービス(MLaaS)プラットフォームにおける、ブラックボックスAPIクエリを用いた特許取得済モデルの抽出攻撃の増加する脅威に対処する。
  • 攻撃者データやモデル重みへのアクセスを必要としない検出メカニズムを設計し、本番環境での実用的導入を可能にする。
  • 合成、敵対的摂動、または問題領域外の入力を用いる多様な攻撃戦略に対しても、堅牢な検出を保証する。
  • 検出システムの白帽知識を持つ攻撃者による、検出を回避するようにクエリを変更する適応的攻撃に対する耐性を評価する。
  • VarDetectを防御として導入することで、抽出された代替モデルの精度と移行性が低下し、モデル機密性とビジネスモデルが保護されることを示す。

提案手法

  • VarDetectは、正当なユーザークエリの潜在的分布を学習するため、修正された変分オートエンコーダー(VAE)を用い、ユーザーごとに正常な行動をモデル化する。
  • 状態保持メカニズムを用いて継続的に到着するクエリの分布を監視し、観測されたクエリ分布と期待される分布との間の最大平均差(MMD)を計算する。
  • MMDを統計的乖離度として用い、正常なクエリパターンからの逸脱を検出する。乖離度が設定可能なしきい値を超えるとアラームが発動する。
  • VAEは、健全なクエリの代表的サンプル上で微調整され、データ多様体を学習することで、正常と悪意あるクエリ分布の区別が可能になる。
  • 検出しきい値はチューニング可能であり、感度と誤検出のバランスを取れる。高いしきい値では、希釈度が高くまたは影響度の大きな攻撃のみを検出可能となる。
  • 適応的攻撃者に対しても、VarDetectは有効である。攻撃者が悪意あるクエリをより健全なものに見せかけるために反復的FGSMに基づく摂動を適用しても、検出を回避できない。

実験結果

リサーチクエスチョン

  • RQ1状態保持型でクエリ分布に基づく監視システムは、攻撃者データへのアクセスを要せず、合成、敵対的摂動、問題領域外の3つの主要なモデル抽出攻撃者タイプをすべて検出可能か?
  • RQ2VarDetectを防御として導入した場合、抽出された代替モデルの性能と移行性はどの程度低下するか?
  • RQ3白帽知識を活用して正常な行動を模倣するようにクエリを設計する適応的攻撃者を、VarDetectは検出可能か?
  • RQ4クエリ希釈(悪意あるクエリの間で健全なクエリを挿入する)が検出効果に与える影響は何か?また、VarDetectはこのような回避戦術にどのように反応するか?
  • RQ5攻撃者が勾配ベースの手法を用いてクエリを反復的に摂動させ、MMDスコアを低下させる場合、システムは検出の堅牢性をどのように維持するか?

主な発見

  • VarDetectは、F-MNIST、GTSR、SVHNの3つの画像分類ベンチマークで、合成、敵対的摂動、問題領域外攻撃者の3タイプすべてを正常に検出できた。
  • VarDetectを防御として導入した場合、抽出された代替モデルの精度は著しく低下した:F-MNISTでは、防御なし時78.74%から防御時55.79%に低下した(問題領域外攻撃者)。
  • GTSRデータセットでは、非問題領域攻撃者下で、防御なし時94.56%から防御時37.94%に精度が低下し、顕著な性能劣化が確認された。
  • 希釈率15%で、δ = 0.25のしきい値設定でも攻撃者を検出可能であり、5%希釈では低いしきい値でのみ検出可能であった。これは、感度のチューニングが可能であることを示している。
  • 反復的FGSMを用いてクエリを摂動する適応的攻撃者でも、検出を回避できなかった。δ = 0.25で、潜在ベクトルの3次元PCAプロットにより、摂動済みサンプルが依然として検出可能であることが確認された。
  • VAEエンコーダーおよび統計的パラメータ(µC, σC)を完全に把握した白帽攻撃者に対しても、システムは有効であり、複数回のFGSMイテレーションおよびステップサイズの変更に対しても、成功した回避は観測されなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。