Skip to main content
QUICK REVIEW

[論文レビュー] Invert and Defend: Model-based Approximate Inversion of Generative Adversarial Networks for Secure Inference

Wei-An Lin, Yogesh Balaji|arXiv (Cornell University)|Nov 23, 2019
Adversarial Robustness in Machine Learning参考文献 31被引用数 8
ひとこと要約

本稿では、訓練データにアクセスできない条件下で、事前学習済みのGAN生成器を近似的に逆方向に変換するデータフリーでモデルベースの手法、InvGANを提案する。この手法は、生成画像を元の潜在空間にマッピングするエンコーダー・ネットワークを学習することで、優れた再構成品質を達成し、DefenseGANに基づく敵対的防御の高速化を実現するとともに、有効な再パラメータ化白箱攻撃の実行を可能にする。従来手法に比べ、堅牢性と実行効率の両面で顕著な向上を示す。

ABSTRACT

Inferring the latent variable generating a given test sample is a challenging problem in Generative Adversarial Networks (GANs). In this paper, we propose InvGAN - a novel framework for solving the inference problem in GANs, which involves training an encoder network capable of inverting a pre-trained generator network without access to any training data. Under mild assumptions, we theoretically show that using InvGAN, we can approximately invert the generations of any latent code of a trained GAN model. Furthermore, we empirically demonstrate the superiority of our inference scheme by quantitative and qualitative comparisons with other methods that perform a similar task. We also show the effectiveness of our framework in the problem of adversarial defenses where InvGAN can successfully be used as a projection-based defense mechanism. Additionally, we show how InvGAN can be used to implement reparameterization white-box attacks on projection-based defense mechanisms. Experimental validation on several benchmark datasets demonstrate the efficacy of our method in achieving improved performance on several white-box and black-box attacks. Our code is available at https://github.com/yogeshbalaji/InvGAN.

研究の動機と目的

  • 訓練データにアクセスできない状況下で、GANによって生成された画像を元の潜在コードに逆方向に変換するという困難な課題に取り組む。
  • 最適化に基づく防御手法(例:DefenseGAN)の効率と性能を向上させるために、遅い最適化を学習済みエンコーダーに置き換える。
  • 再パラメータ化技術を用いて、最適化に基づく防御に対する効果的な白箱攻撃を実現する。
  • 逆方向変換フレームワークが、防御の堅牢性と攻撃検出能力の両方を向上させることを示す。
  • 多様なデータセットやGANアーキテクチャに適用可能なスケーラブルで高速かつ高精度な逆方向変換メカニズムを提供する。

提案手法

  • 再構成、知覚的、敵対的要因を組み合わせた新しい損失関数を用いて、生成器の出力空間から潜在空間への画像マッピングを目的としたエンコーダー・ネットワークを学習する。
  • DefenseGANにおける最適化の初期化にエンコーダーを用いることで、反復回数を削減し、ハイパーパrameterチューニングの必要性を排除する。
  • エンコーダーを効率的な多様体射影の事前分布として機能させる、微分可能な最適化問題として逆方向変換を定式化する。
  • 学習済みエンコーダーを用いて射影操作を近似することで、勾配ベースの攻撃生成を可能にする再パラメータ化攻撃を実装する。
  • 逆方向変換された画像が元のGAN生成物と意味論的に整合的であり、GANのデータ分布に従うように、エンコーダーを最適化する損失関数を設計する。
  • MNIST、Fashion-MNIST、CIFAR-10、CelebAを含むベンチマークデータセットにこのフレームワークを適用し、多様な設定下での性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1訓練データにアクセスできない状況下で、データフリーでモデルベースのエンコーダーを学習し、事前学習済みのGAN生成器を正確に逆方向に変換できるか?
  • RQ2InvGANは、最適化に基づく手法(例:DefenseGAN)と比較して、最適化に基づく敵対的防御の速度と精度をどのように向上させるか?
  • RQ3敵対的摂動が存在する状況下で、InvGANは攻撃検出性能をどの程度向上させるか?
  • RQ4InvGANを用いて、最適化に基づく防御に対して効果的な再パラメータ化白箱攻撃を実装できるか?
  • RQ5エンコーダー学習の目的関数における敵対的損失の有無が、逆方向変換品質および下流の防御性能に与える影響は何か?

主な発見

  • MNISTではクリーンな条件下でテスト精度が0.99を達成し、DefenseGAN(0.98)とNo Defense(0.99)を上回る。FGSMおよびCW攻撃に対する耐性も顕著に向上した。
  • Fashion-MNISTでは、FGSM攻撃(ε=0.3)下で0.88の精度を達成したのに対し、DefenseGANは0.34にとどまり、より優れた防御性能を示した。
  • CIFAR-10では、FGSM攻撃(ε=0.3)下で0.66の精度を達成し、DefenseGANの0.44を著しく上回った。複雑なデータセットでも優れた耐性を示した。
  • MNISTのFGSM攻撃において、攻撃検出のAUCを0.9985まで向上させた(DefenseGANは0.9878)。大規模摂動攻撃の検出能が向上した。
  • エンコーダーを初期化に用いることで、有効な推論反復回数を1回にまで削減し、再構成品質を維持または向上させつつ、DefenseGANに比べて顕著な高速化を達成した。
  • アブレーションスタディの結果、敵対的損失を削除するとFIDが28.07(対照群:19.85)に低下し、精度も0.603(対照群:0.625)に低下した。これは、知覚的リアリズムと性能向上の観点で敵対的損失の重要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。