Skip to main content
QUICK REVIEW

[論文レビュー] RelaxLoss: Defending Membership Inference Attacks without Losing Utility

Dingfan Chen, Ning Yu|arXiv (Cornell University)|Jul 12, 2022
Adversarial Robustness in Machine Learning被引用数 11
ひとこと要約

本稿では、訓練損失とテスト損失の分布の一般化ギャップを狭めるために意図的にターゲット訓練損失を緩和することで、メンバーシップ推定攻撃(MIA)への脆弱性を低減する、新しい防御フレームワークであるRelaxLossを提案する。これらの分布の区別可能性を最小限に抑えることで、ブラックボックスおよびホワイトボックス攻撃を含む多様なMIAsに対して効果的に防御可能であり、モデルの有用性を維持または向上させることができる。5つの多様なデータセットにおいて、最先端の防御手法を上回る性能を発揮する。

ABSTRACT

As a long-term threat to the privacy of training data, membership inference attacks (MIAs) emerge ubiquitously in machine learning models. Existing works evidence strong connection between the distinguishability of the training and testing loss distributions and the model's vulnerability to MIAs. Motivated by existing results, we propose a novel training framework based on a relaxed loss with a more achievable learning target, which leads to narrowed generalization gap and reduced privacy leakage. RelaxLoss is applicable to any classification model with added benefits of easy implementation and negligible overhead. Through extensive evaluations on five datasets with diverse modalities (images, medical data, transaction records), our approach consistently outperforms state-of-the-art defense mechanisms in terms of resilience against MIAs as well as model utility. Our defense is the first that can withstand a wide range of attacks while preserving (or even improving) the target model's utility. Source code is available at https://github.com/DingfanChen/RelaxLoss

研究の動機と目的

  • 医療や金融など、機微な分野に展開されるディープラーニングモデルにおける、継続的なプライバシー脅威であるメンバーシップ推定攻撃(MIA)に対処すること。
  • MIAの成功の鍵となる、訓練損失とテスト損失の分布の区別可能性を低減すること。
  • 多様なMIAsに対して強い耐性を示しつつ、モデルの有用性を維持または向上させる防御機構を開発すること。
  • 微分プライバシー(Differential Privacy)(有用性の低下を伴う)や adversarial training(攻撃モデルが既知であると仮定する)といった既存の防御の限界を克服すること。
  • 任意の分類モデルに簡単に統合可能で、最小限の実装コストで利用可能な、シンプルで即時適用可能な防御を提供すること。

提案手法

  • 訓練損失をより達成可能な水準に緩和することで、訓練損失とテスト損失の分布のギャップを縮小する、訓練フレームワークであるRelaxLossを導入する。
  • Yeomら(2018)が示したように、訓練損失とテスト損失の差が大きいほどメンバーシッププライバシーのリスクが高まることを洞察に活用する。
  • ベイジアン最適攻撃者モデルを用いて防御を形式化し、損失分布の乖離を最小限に抑えることで攻撃成功確率が低下することを示す。
  • モデルアーキテクチャを変更せずに、訓練中に緩和された損失を適用することで、既存のパイプラインへの容易な統合を可能にする。
  • 緩和の度合いを制御するハイパーパrameterを用い、プライバシーと有用性のバランスを調整する。
  • RelaxLossが訓練損失の分散を増加させ、メンバーと非メンバーの損失分布の重複ギャップを縮小することを実証し、MIAsの効果性を低下させることを示す。

実験結果

リサーチクエスチョン

  • RQ1モデルの有用性を低下させることなく、防御機構がメンバーシップ推定攻撃の成功率を低下させることができるか?
  • RQ2訓練損失とテスト損失の一般化ギャップを狭めることで、MIAへの脆弱性はどの程度低減できるか?
  • RQ3シンプルで有用性を保証する防御は、多様なデータモダリティおよび攻撃タイプに一般化可能か?
  • RQ4ラベルスムージング、DP-SGD、 adversarial regularization といった最先端の防御と比較して、RelaxLossはプライバシーと有用性のトレードオフにおいてどのように差をつけるか?
  • RQ5ブラックボックスおよびホワイトボックス両方のメンバーシップ推定攻撃において、緩和された損失アプローチは依然として有効性を保っているか?

主な発見

  • CIFAR-10、Texas100、Purchase100を含む5つのすべてのデータセットにおいて、ブラックボックスおよびホワイトボックス攻撃下で、RelaxLossは攻撃AUCをほぼランダム推測水準(≈0.5)にまで一貫して低下させる。
  • Texas100およびPurchase100において、RelaxLossはラベルスムージングを上回る。ラベルスムージングは攻撃が強い場合、AUC低下が0.55~0.8の範囲にとどまり、ランダム推測水準に達しない。
  • DP-SGDは矛盾した結果を示す:小さなノイズスケールでは攻撃AUCが低下するが、理論的プライバシー保証は弱く、大きなスケールでは有用性が著しく低下する。これは理論と実践のギャップを示している。
  • ドロップアウト、重み減衰などの正則化手法とは異なり、RelaxLossは訓練損失の分散を有意に増加させ、メンバーと非メンバーの損失分布のギャップを縮小することで、優れた防御性能の背後にあるメカニズムを説明できる。
  • すべてのデータセットで、RelaxLossはモデルの有用性を向上または維持するが、DP-SGDおよび adversarial 防御は一貫して有用性を低下させる。
  • 本手法は普遍的に適用可能で、最小限の実装コストを要するため、機微なアプリケーションにおける実世界での展開に実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。