Skip to main content
QUICK REVIEW

[論文レビュー] Membership Model Inversion Attacks for Deep Networks

Samyadeep Basu, Rauf Izmailov|arXiv (Cornell University)|Oct 9, 2019
Adversarial Robustness in Machine Learning参考文献 13被引用数 14
ひとこと要約

本稿では、深層ニューラルネットワークに対するGANベースのメンバーシップモデル逆転攻撃を提案する。この攻撃は、ドメイン固有の知識を活用して、手書き数字や衣類アイテムなどの現実的で識別可能なクラス表現を、連結された低次元の潜在多様体内で最適化することで生成する。従来の攻撃とは異なり、出力が解釈不能になるのではなく、意味的に意味のあるサンプルを効果的に回復できる。これは、攻撃者がデータドメインに関する文脈的知識を持つ場合、深層モデルがプライバシー漏洩に対して脆弱であることを示している。

ABSTRACT

With the increasing adoption of AI, inherent security and privacy vulnerabilities formachine learning systems are being discovered. One such vulnerability makes itpossible for an adversary to obtain private information about the types of instancesused to train the targeted machine learning model. This so-called model inversionattack is based on sequential leveraging of classification scores towards obtaininghigh confidence representations for various classes. However, for deep networks,such procedures usually lead to unrecognizable representations that are uselessfor the adversary. In this paper, we introduce a more realistic definition of modelinversion, where the adversary is aware of the general purpose of the attackedmodel (for instance, whether it is an OCR system or a facial recognition system),and the goal is to find realistic class representations within the corresponding lower-dimensional manifold (of, respectively, general symbols or general faces). To thatend, we leverage properties of generative adversarial networks for constructinga connected lower-dimensional manifold, and demonstrate the efficiency of ourmodel inversion attack that is carried out within that manifold.

研究の動機と目的

  • 従来のモデル逆転攻撃が、探索空間の高次元性と不適切な定式化のため、認識不能で使用不能な出力を生じるという限界を是正すること。
  • ターゲットモデルの応用ドメイン(例:OCR や顔認識)に関する一般知識を組み込むことで、意味的に意味のある代表的サンプルの回復が可能かどうかを調査すること。
  • GANを用いて、ターゲットドメインの多様なデータから構築された、連結された低次元多様体が、高信頼度で現実的なクラス表現への効果的かつ効率的な最適化を可能にすることを示すこと。
  • MNIST や Fashion MNIST などの実世界のデータセット上で、提案手法の有効性を評価し、ドメイン知識なしの標準的逆転攻撃を上回ることを示すこと。

提案手法

  • 本手法は、ターゲットアプリケーションドメイン(例:手書き文字や顔)のデータの連結された低次元多様体をモデル化するために生成的敵対ネットワーク(GAN)を用いる。これにより、より意味のある空間での制約付き探索が可能になる。
  • GANの生成器ネットワークは、連続的な潜在空間(例:正規分布ノイズ)から、実際のトレーニングデータと構造的・意味的に類似した合成データサンプルへマッピングする。
  • 最適化は、GANの潜在空間で実行され、特定のクラスに対するターゲット分類器の信頼度スコアを最大化する。ラベル信頼度と正則化を組み込んだ微分可能関数を目的関数として用いる。
  • 攻撃はターゲットモデルへのホワイトボックスアクセスを想定し、全高次元入力空間における直接的最適化の不適切さを、多様体構造の活用によって回避する。
  • 画像品質の向上のため、ℓpノルム(p=1 から 6)による正則化を適用したが、実験では最終結果にほとんど影響を及ぼさなかった。
  • 本手法は、MNIST および Fashion MNIST データセットで検証され、GANは全データセットを用いてトレーニングされ、逆転探索用の連結多様体が生成された。

実験結果

リサーチクエスチョン

  • RQ1攻撃者がターゲットモデルの応用ドメインに関するドメイン固有の知識を持つ場合、深層ニューラルネットワークに対するモデル逆転攻撃は、認識可能で意味的に意味のあるクラス表現を生成できるか?
  • RQ2GANを用いて連結された低次元潜在多様体を構築することで、全入力空間における直接的最適化と比較して、逆転サンプルの質と解釈可能性が向上するか?
  • RQ3ℓp正則化は、GANベースの逆転フレームワークにおける逆転サンプルの視覚的品質をどの程度向上させるか?
  • RQ4ターゲットモデルが一部のクラスのみでトレーニングされた場合、GANベースのアプローチが、MNIST や Fashion MNIST などの実世界データセットで代表的サンプルを回復するのにどの程度有効か?
  • RQ5GANの潜在空間の連結構造は、正確なトレーニングサンプルがGANのトレーニングデータに含まれていない場合でも、高信頼度で現実的な表現を見つけるために活用可能か?

主な発見

  • ドメイン知識を有する攻撃者に対して、提案されたGANベースのモデル逆転攻撃は、手書き数字や衣類アイテムなどの現実的で識別可能なクラス表現を効果的に回復できた。一方、標準的攻撃では出力が解釈不能になる。
  • ドメイン知識が欠落している場合、全入力空間における直接的最適化は、意味のあるサンプルを生成できず、図1ではクラス'5'、'6'、'9'の逆転画像が認識不能であることが示された。
  • ドメイン知識とGANベースの多様体探索を組み合わせることで、図2のMNISTクラス'0'、'1'、'3'および図3のFashion MNISTクラス'T-shirts'、'Coats'、'Sneakers'において、高信頼度で意味的に整合性のあるサンプルが得られた。
  • ℓpノルム(p=1 から 6)を用いた正則化は、画像品質にほとんど影響を及ぼさなかった。これは、GANの内在的構造が、既に視覚的に妥当な結果へ向かう最適化を制約していることを示唆している。
  • GANがより広範なデータセット(例:すべてのMNIST数字やすべてのFashion MNISTクラス)でトレーニングされた場合でも、攻撃は有効であり、GANのトレーニングデータに明示的に含まれていないターゲットクラスの表現回復が可能だった。
  • 結果から、GANは、実データ多様体の内在的幾何構造と整合する連結された構造的探索空間を提供するため、モデル逆転の強力なツールであると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。