Skip to main content
QUICK REVIEW

[論文レビュー] Improving Robustness to Model Inversion Attacks via Mutual Information Regularization

Tianhao Wang, Yuheng Zhang|arXiv (Cornell University)|Sep 11, 2020
Adversarial Robustness in Machine Learning参考文献 23被引用数 6
ひとこと要約

本稿では、モデルの入力と予測の間の相互情報量を最小化することで、モデル逆転(MI)攻撃の成功率を低下させる、モデルに依存しないアプローチである相互情報量正則化ベース防御(MID)を提案する。MIDは、ブラックボックスおよびホワイトボックス設定下で、線形モデル、決定木、ニューラルネットワークのあらゆる分野において、性能とプライバシーのトレードオフを、現在の最先端の水準に達しており、微分プライバシーおよびモデル固有の防御を上回っている。

ABSTRACT

This paper studies defense mechanisms against model inversion (MI) attacks -- a type of privacy attacks aimed at inferring information about the training data distribution given the access to a target machine learning model. Existing defense mechanisms rely on model-specific heuristics or noise injection. While being able to mitigate attacks, existing methods significantly hinder model performance. There remains a question of how to design a defense mechanism that is applicable to a variety of models and achieves better utility-privacy tradeoff. In this paper, we propose the Mutual Information Regularization based Defense (MID) against MI attacks. The key idea is to limit the information about the model input contained in the prediction, thereby limiting the ability of an adversary to infer the private training attributes from the model prediction. Our defense principle is model-agnostic and we present tractable approximations to the regularizer for linear regression, decision trees, and neural networks, which have been successfully attacked by prior work if not attached with any defenses. We present a formal study of MI attacks by devising a rigorous game-based definition and quantifying the associated information leakage. Our theoretical analysis sheds light on the inefficacy of DP in defending against MI attacks, which has been empirically observed in several prior works. Our experiments demonstrate that MID leads to state-of-the-art performance for a variety of MI attacks, target models and datasets.

研究の動機と目的

  • すべての属性を同時に保護する、一般化可能で高い性能を示すモデル逆転(MI)攻撃に対する防御が不足している問題に対処すること。
  • 訓練データにとどまらない、分布上のプライバシーリスクを形式化し、同じ分布からのテストデータに対しても脅威が及ぶことを認識すること。
  • 理論的保証はあるが実際のMI攻撃に対しては効果を示さない微分プライバシー(DP)の失敗要因を説明すること。
  • モデルに依存しない、実装可能な正則化手法を開発し、モデルの性能を損なわず、耐性を高めること。

提案手法

  • 予測に含まれる入力に関する情報量を最小化するため、訓練損失関数に相互情報量(MI)正則化項を導入する。
  • 線形回帰、決定木、ニューラルネットワークに対して、MI正則化項の実用的かつ計算可能な近似を構築し、実装可能にする。
  • MI攻撃をゲームベースの定式化として定義し、情報漏洩の度合いを厳密に定量化し、防御の有効性を評価する。
  • 変分推論およびニューラル推定器を用いて、損失関数における計算不能な相互情報量項を近似する。
  • 正則化された損失関数でモデルを学習させ、入力と出力の相関を低減し、攻撃者による推論能力を制限する。
  • ホワイトボックスおよびブラックボックスMI攻撃の両状況に防御を適用し、複数のデータセットおよびモデルアーキテクチャで耐性を評価する。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシー(DP)は理論的にはプライバシーを保証しているが、実際のMI攻撃に対してはなぜ機能しないのか?
  • RQ2モデルに依存しない防御機構を設計でき、モデルの性能を損なわず、MI攻撃に対する耐性を高められるか?
  • RQ3モデルの入力と予測の間の相互情報量は、MI攻撃の成功確率にどのように関係するか?
  • RQ4相互情報量に基づく正則化が、多様なモデルおよびデータセットにおいて、プライバシー-性能のトレードオフをどの程度改善できるか?
  • RQ5MI攻撃のプライバシーリスクは、訓練データにとどまらず、同じ分布からのテストデータに対しても拡大するか?

主な発見

  • MIDは、特に高いモデル性能を維持する状況下で、微分プライバシー(DP)を大きく上回り、ブラックボックスおよびホワイトボックスMI攻撃の両方に対して顕著に優れた防御効果を示す。
  • ニューラルネットワークでは、MIDはホワイトボックス攻撃(例:GMI)において再構成画像の品質をほぼランダムな水準まで低下させるが、DPでは顕著な顔貌特徴が依然として保持されている。
  • 決定木では、MIDはほとんどの場合、モデル固有の「Priority」防御を上回る耐性を示すが、F1スコアが0.57を超える場合を除く。
  • MIDは期待キャリブレーション誤差(ECE)をDPよりもより効果的に低減しており、攻撃下での信頼性の高いキャリブレーションを示している。
  • MIDおよびDPの両方において、訓練データとテストデータにおける攻撃性能はほぼ同一であり、MI攻撃が訓練例にとどまらず、全体のデータ分布を脅かす可能性があることを示している。
  • 理論的分析により、DPがMI攻撃に対して効果を示さない理由は、プライバシー保護に必要な高いノイズレベルが、モデルの性能を著しく劣化させるためであると確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。