Skip to main content
QUICK REVIEW

[論文レビュー] Black-box Model Inversion Attribute Inference Attacks on Classification Models

Shagufta Mehnaz, Ninghui Li|arXiv (Cornell University)|Dec 7, 2020
Privacy-Preserving Technologies in Data参考文献 32被引用数 7
ひとこと要約

本稿では、オракルアクセスを用いて分類モデルから感受性のある属性を推定する2つの新規なブラックボックスモデル逆転攻撃——信頼性モデリングベース攻撃(CMMIA)および信頼性スコアベース攻撃(CSMIA)——を提案する。これらの攻撃は、先行研究を上回り、特に非バランスなデータセットにおいて顕著な性能を示す。また、特定のデモグラフィックグループがより脆弱であることが判明し、非感受性属性が不明であっても性能が安定していることが示された。

ABSTRACT

Increasing use of ML technologies in privacy-sensitive domains such as medical diagnoses, lifestyle predictions, and business decisions highlights the need to better understand if these ML technologies are introducing leakages of sensitive and proprietary training data. In this paper, we focus on one kind of model inversion attacks, where the adversary knows non-sensitive attributes about instances in the training data and aims to infer the value of a sensitive attribute unknown to the adversary, using oracle access to the target classification model. We devise two novel model inversion attribute inference attacks -- confidence modeling-based attack and confidence score-based attack, and also extend our attack to the case where some of the other (non-sensitive) attributes are unknown to the adversary. Furthermore, while previous work uses accuracy as the metric to evaluate the effectiveness of attribute inference attacks, we find that accuracy is not informative when the sensitive attribute distribution is unbalanced. We identify two metrics that are better for evaluating attribute inference attacks, namely G-mean and Matthews correlation coefficient (MCC). We evaluate our attacks on two types of machine learning models, decision tree and deep neural network, trained with two real datasets. Experimental results show that our newly proposed attacks significantly outperform the state-of-the-art attacks. Moreover, we empirically show that specific groups in the training dataset (grouped by attributes, e.g., gender, race) could be more vulnerable to model inversion attacks. We also demonstrate that our attacks' performances are not impacted significantly when some of the other (non-sensitive) attributes are also unknown to the adversary.

研究の動機と目的

  • 機械学習モデルが感受性のあるデータを学習した場合に生じるプライバシーリスクに対処すること。
  • 非感受性属性が既知または部分的に既知である状況で、感受性属性を推定できる新たなモデル逆転攻撃を開発すること。
  • 特に感受性属性の分布が非バランスな状況下で、精度よりも優れた評価指標を同定すること。
  • データ分布のパターンにより、特定のデモグラフィックグループがモデル逆転攻撃に対してより脆弱であるかどうかを調査すること。
  • 攻撃者がターゲット個人の非感受性属性の完全な知識を持たない場合の攻撃のロバストネスを評価すること。

提案手法

  • ターゲットモデルと同一の母集団から得たスラッグデータセットを用いて、信頼性スコアをモデリングし、感受性属性を推定する信頼性モデリングベース攻撃(CMMIA)を設計する。
  • 補助データセットを必要とせず、ラベルと信頼性スコアの出力のみで動作する信頼性スコアベース攻撃(CSMIA)を設計する。
  • ターゲットモデルの信頼性スコアを特徴量-ラベル相関の代理として用い、感受性属性値を再構築する。
  • 非感受性属性が既知の入力インスタンスについて、ターゲットモデルの信頼性スコアを予測するスラッグモデルを訓練する。
  • 信頼性スコアを予測された感受性属性値にマッピングするために、メトリクス変換およびしきい値処理技術を適用する。
  • 非バランスなデータにおいてより有用であるとされるG-meanおよびマシューリング相関係数(MCC)を用いて攻撃のパフォーマンスを評価する。

実験結果

リサーチクエスチョン

  • RQ1オラクルアクセスのみが利用可能な状況で、ブラックボックスモデル逆転攻撃が感受性属性を効果的に推定できるか。
  • RQ2攻撃者による知識の仮定が異なる状況下で、提案されたCMMIAおよびCSMIA攻撃は、既存の最先端の攻撃と比較してどの程度の性能を示すか。
  • RQ3感受性属性の分布が非バランスな状況下で、G-meanおよびMCCは精度よりも優れた評価指標であるか。
  • RQ4性別や教育水準などのデモグラフィックグループ(例:特定の性別や教育レベルのサブグループ)が、データ分布のパターンによりモデル逆転攻撃に対してより脆弱であるか。
  • RQ5攻撃者がターゲット個人の非感受性属性の完全な知識を持たない場合、攻撃のパフォーマンスはどの程度低下するか。

主な発見

  • 提案されたCMMIAおよびCSMIA攻撃は、意思決定木および深層ニューラルネットワークモデルの両方において、既存の最先端の攻撃を顕著に上回る属性推定の精度を達成している。
  • 特に感受性属性が非バランスな状況下では、G-meanおよびマシューリング相関係数(MCC)は精度よりも優れた評価指標である。
  • 特定のデモグラフィックグループ(例:特定の性別や教育水準のサブグループ)がモデル逆転攻撃に対してより脆弱であることが判明し、モデルのプライバシーリスクに不平等性が存在することを示唆している。
  • 攻撃者が一部の非感受性属性の知識を持たない場合でも、攻撃の性能が維持されることから、部分的な情報に対してもロバストであることが示された。
  • 信頼性スコアベース攻撃(CSMIA)は、母集団レベルのデータセットを必要としないため、より制限された脅威モデルにも適用可能である。
  • 本研究では、予測精度が著しく高いモデルが属性推定攻撃に対してより脆弱であることが確認され、モデルの性能とプライバシー漏洩のリスクが密接に関連しているという仮説を支持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。