Skip to main content
QUICK REVIEW

[論文レビュー] Model Extraction and Defenses on Generative Adversarial Networks

Hailong Hu, Jun Pang|arXiv (Cornell University)|Jan 6, 2021
Adversarial Robustness in Machine Learning参考文献 71被引用数 4
ひとこと要約

本稿は、生成対抗ネットワーク(GANs)におけるモデル抽出攻撃を体系的かつ包括的に調査している。本研究では、ターゲットモデルのデータ分布を再現する「正確性抽出」と、学習データ分布を再現する「忠実性抽出」の2つに区別している。実証的に、攻撃者は約50,000回のクエリで高品質なGANを効果的に抽出可能であり、抽出したモデルを新たなドメインに移行可能であることを示している。また、特に意味的補間とガウスノイズを用いた入力・出力の摂動に基づく防御策を提案し、モデルの有用性を損なわずに性能を安定化させつつ、抽出攻撃を阻害している。

ABSTRACT

Model extraction attacks aim to duplicate a machine learning model through query access to a target model. Early studies mainly focus on discriminative models. Despite the success, model extraction attacks against generative models are less well explored. In this paper, we systematically study the feasibility of model extraction attacks against generative adversarial networks (GANs). Specifically, we first define accuracy and fidelity on model extraction attacks against GANs. Then we study model extraction attacks against GANs from the perspective of accuracy extraction and fidelity extraction, according to the adversary's goals and background knowledge. We further conduct a case study where an adversary can transfer knowledge of the extracted model which steals a state-of-the-art GAN trained with more than 3 million images to new domains to broaden the scope of applications of model extraction attacks. Finally, we propose effective defense techniques to safeguard GANs, considering a trade-off between the utility and security of GAN models.

研究の動機と目的

  • 生成対抗ネットワーク(GANs)に対するモデル抽出攻撃の実現可能性を調査すること。これは、識別モデルと比較してまだ十分に検討されていない分野である。
  • 2つの明確に区別された攻撃目的を定義し、評価すること:正確性抽出(ターゲットモデルの生成データ分布に一致)と忠実性抽出(実際の学習データ分布に一致)である。
  • 抽出されたGANモデルが新たなドメインに移行可能であることを実証し、モデル抽出攻撃の実用的影響を拡大することを目的とする。
  • 入力摂動(潜在コードの操作)と出力摂動(サンプルレベルのノイズ/フィルタリング)に基づく2つの新しい防御戦略を提案し、その有効性を評価すること。
  • 防御機構における妥当性と安全性のトレードオフを評価することで、モデルの有用性とセキュリティの両立を図ること。特にクエリ数の増加に対する安定性と耐性に焦点を当てる。

提案手法

  • 正確性抽出を、クエリアクセスまたは公開済みのサンプルのみを用いて、ターゲットGANの生成データ分布に一致させることとして定義する。
  • 忠実性抽出を、真の学習データ分布に一致させることとして定義する。これには、部分的な実データやターゲットディスクリミネーターの知識が必要となる。
  • CelebAデータセット上で評価するため、ターゲットモデルとしてProgressive GAN(PGGAN)とスペクトル正規化GAN(SNGAN)を採用する。
  • 潜在コードの意味的補間による入力摂動防御と、ランダムノイズ、 adversarialノイズ、フィルタリング、JPEG圧縮を用いた出力摂動防御を実装する。
  • FIDと視覚的品質指標を用いて、ブラックボックスの正確性抽出攻撃下での防御効果を評価する。攻撃者はクエリまたは公開リリースによりサンプルを入手可能である。
  • 知識蒸留後の微調整を適用することで、抽出されたGANモデルが新たなドメインに成功裏に移行可能であることを示し、攻撃の広範な適用可能性を検証する。

実験結果

リサーチクエスチョン

  • RQ1GANに対するモデル抽出攻撃は実現可能であり、識別モデルに対する攻撃とどのように異なるか?
  • RQ2クエリアクセスまたは公開サンプルのみを用いて、攻撃者がGANの抽出においてどの程度の正確性と忠実性を達成できるか?
  • RQ3部分的な実際の学習データやターゲットディスクリミネーターのアーキテクチャへのアクセスがあると、抽出モデルの忠実性はどの程度向上するか?
  • RQ4抽出されたGANモデルは、新たなドメインに成功裏に移行可能であり、モデルセキュリティにどのような影響を及えるか?
  • RQ5どのような防御機構が、モデルの有用性と性能を損なわずにモデル抽出を効果的に緩和できるか?

主な発見

  • GANに対するモデル抽出攻撃は、約50,000回のクエリで実現可能であり、ターゲットモデルの生成データ分布に十分な性能で一致する。
  • 部分的な実データやターゲットディスクリミネーターへのアクセスがあると、忠実性抽出によりモデル品質が著しく向上し、真のデータ分布への整合性が高まる。
  • 意味的補間とガウスノイズ防御は、クエリ数の増加に対しても安定した性能を示し、他の防御技術に比べて耐性が優れている。
  • アドバーシャルノイズとフィルタリング防御は、クエリ数の増加に伴い効果が低下する傾向にあり、適応的攻撃者に対して脆弱であることが示された。
  • 知識蒸留を経て微調整された抽出GANモデルは、新たなドメインに成功裏に移行可能であり、モデル抽出攻撃の現実世界における脅威の広がりを実証した。
  • 出力摂動に基づく防御、特にガウスノイズとJPEG圧縮は、生成サンプルの統計的整合性を損なうことで攻撃成功率を著しく低下させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。