Skip to main content
QUICK REVIEW

[論文レビュー] Membership Privacy for Machine Learning Models Through Knowledge Transfer

Virat Shejwalkar, Amir Houmansadr|arXiv (Cornell University)|Jun 15, 2019
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、分類精度を損なわせることなくメンバーシッププライバシーを向上させる知識蒸留に基づく防御であるメンバーシッププライバシーのための蒸留(DMP)を提案する。保護されていない教師モデルから予測エントロピーが低い参照データを選択し、そのデータに基づいてソフトラベルを学生モデルに転送することで、最先端のプライバシー・ユーティリティトレードオフを達成する。例えば、CIFAR100では65.3%の精度でMIAリスクが53.7%に抑えられ、類似したプライバシー水準下で敵対的正則化より100%高い精度を達成する。

ABSTRACT

Large capacity machine learning (ML) models are prone to membership inference attacks (MIAs), which aim to infer whether the target sample is a member of the target model's training dataset. The serious privacy concerns due to the membership inference have motivated multiple defenses against MIAs, e.g., differential privacy and adversarial regularization. Unfortunately, these defenses produce ML models with unacceptably low classification performances. Our work proposes a new defense, called distillation for membership privacy (DMP), against MIAs that preserves the utility of the resulting models significantly better than prior defenses. DMP leverages knowledge distillation to train ML models with membership privacy. We provide a novel criterion to tune the data used for knowledge transfer in order to amplify the membership privacy of DMP. Our extensive evaluation shows that DMP provides significantly better tradeoffs between membership privacy and classification accuracies compared to state-of-the-art MIA defenses. For instance, DMP achieves ~100% accuracy improvement over adversarial regularization for DenseNet trained on CIFAR100, for similar membership privacy (measured using MIA risk): when the MIA risk is 53.7%, adversarially regularized DenseNet is 33.6% accurate, while DMP-trained DenseNet is 65.3% accurate.

研究の動機と目的

  • 既存のメンバーシップ推定攻撃(MIA)に対する防御における悪くないプライバシー・ユーティリティトレードオフを是正すること。
  • モデルのユーティリティを維持しつつ、メンバーシップ漏洩を顕著に低減する防御を開発すること。
  • 微分プライバシーと組み合わせるのではなく、知識蒸留をメンバーシッププライバシーのための単体技術として活用すること。
  • プライバシーを強化するための参照データの選定または生成基準を提供すること。
  • DMPの適応的攻撃および参照データからのプライバシー漏洩に対する耐性を評価すること。

提案手法

  • プライベートな訓練データ上で保護されていない教師モデルを訓練し、記憶されたパターンを捉える。
  • 教師モデルがそのデータに対して予測する際にエントロピーが低いように、参照データを選択または生成する。これにより、メンバーシップ情報の漏洩を最小限に抑える。
  • 知識蒸留を用いて、教師モデルのソフトラベルを保護された学生モデルに転送する。学生モデルは参照データ上で訓練される。
  • 教師モデルと学生モデルの両方に同一のアーキテクチャを適用することで、パフォーマンスを維持し、効果的な蒸留を実現する。
  • 教師モデルのソフトマックス層に温度スケーリングを適用し、さらに予測の信頼性を低下させ、漏洩を低減する。
  • GANを用いて参照データを合成することで、実際の参照データの必要性を緩和し、プライバシーとパフォーマンスを両立させる。

実験結果

リサーチクエスチョン

  • RQ1知識蒸留を単体の防御として用いることで、メンバーシッププライバシー・ユーティリティトレードオフを改善できるか?
  • RQ2参照データに対するモデル予測のエントロピーは、メンバーシップ推定リスクにどのように影響するか?
  • RQ3訓練データから生成された合成参照データは、強力なプライバシーとユーティリティを維持できるか?
  • RQ4DMPは、敵対的正則化やPATEといった最先端の防御と比較して、精度とMIA耐性の両面で優れているか?
  • RQ5適応的メンバーシップ推定攻撃は、DMPの参照データ選択メカニズムを悪用できるか?

主な発見

  • DenseNetを用いたCIFAR100では、DMPは65.3%のテスト精度と53.7%のMIAリスクを達成し、類似したプライバシー水準下で敵対的正則化モデル(33.6%)と比較して100%の精度向上を達成する。
  • 合成参照データを用いることで、DMPは高いパフォーマンスを維持する:CIFAR10では57.5%のテスト精度と52.1%のホワイトボックスMIA精度(37.5kの合成サンプルを使用)。
  • 参照データに対する低エントロピー予測の使用により、メンバーシップ推定リスクが顕著に低下し、37.5kの合成サンプルを使用した場合、MIAリスクは5.0%にまで低下する。
  • DMPはPATEを上回る精度とプライバシー性能を達成する:DMPは76.79%のテスト精度と50.8%のホワイトボックスMIA精度を達成するが、PATEは高いプライバシー予算下でも性能が低いままにとどまる。
  • 特徴空間における参照データとの類似度に基づく適応的攻撃は、類似度と予測エントロピーに相関がないため、顕著な利点を示さない。これは、このような戦略に対するDMPの耐性を示している。
  • 参照データ自体はメンバーシップ情報を漏洩しない。蒸留に用いられるソフトラベルが真のラベルを隠すため、$X_{\mathsf{ref}}$ に対して成功するMIAは成立しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。