Skip to main content
QUICK REVIEW

[論文レビュー] Antipodes of Label Differential Privacy: PATE and ALIBI

Mani Malek, Ilya Mironov|arXiv (Cornell University)|Jun 7, 2021
Privacy-Preserving Technologies in Data参考文献 34被引用数 8
ひとこと要約

本稿では、オンライン広告や垂直分割データなどの、ラベルのみが機微な状況を想定したラベルのみの微分プライバシーを実現する2つの新規手法——ALIBI(Additive Laplace with Iterative Bayesian Inference)とPATE-FM(FixMatchを用いたPATE)——を提案する。ALIBIはワンホットエンコードされたラベルにラプラスノイズを追加し、モデルの自身の予測を事前分布として用いた反復的ベイズ推論によりノイズ除去を行う。一方PATE-FMは、プライベートデータからラベルを除去して得られる公開のラベルなしデータセットを活用し、半教師あり学習を用いる。主な発見は、理論的プライバシー境界がはるかに弱いにもかかわらず、PATE-FMがALIBIよりもはるかに強い実効的プライバシーを示す点であり、理論的保証と現実世界における記憶リスクの間には顕著なギャップがあることを示している。

ABSTRACT

We consider the privacy-preserving machine learning (ML) setting where the trained model must satisfy differential privacy (DP) with respect to the labels of the training examples. We propose two novel approaches based on, respectively, the Laplace mechanism and the PATE framework, and demonstrate their effectiveness on standard benchmarks. While recent work by Ghazi et al. proposed Label DP schemes based on a randomized response mechanism, we argue that additive Laplace noise coupled with Bayesian inference (ALIBI) is a better fit for typical ML tasks. Moreover, we show how to achieve very strong privacy levels in some regimes, with our adaptation of the PATE framework that builds on recent advances in semi-supervised learning. We complement theoretical analysis of our algorithms' privacy guarantees with empirical evaluation of their memorization properties. Our evaluation suggests that comparing different algorithms according to their provable DP guarantees can be misleading and favor a less private algorithm with a tighter analysis. Code for implementation of algorithms and memorization attacks is available from https://github.com/facebookresearch/label_dp_antipodes.

研究の動機と目的

  • ラベルのみが機微な状況(例:オンライン広告、垂直分割データ)におけるラベルのみの微分プライバシーのニーズに対処すること。
  • ラベルDP設定において強力なプライバシー・ユーティリティトレードオフを達成する2つの新しいメカニズム——ALIBIとPATE-FM——を提案すること。
  • ラベル付き例(キャニオン)に対するメンバーシップインファレンス攻撃を用いて、理論的DP境界に依存するのではなく、実効的プライバシー損失を経験的に推定することによって、理論的DP境界への過度な依存を挑戦すること。
  • 理論的プライバシー境界が、よりプライベートなアルゴリズムよりも緩い解析を受けるより少ないプライベートなアルゴリズムを好む可能性があるため、理論的境界が誤解を招く可能性があることを示すこと。
  • スケーラブルでトレーナーに依存しない記憶攻撃を導入することで、理論的プライバシー保証と実効的プライバシー損失のギャップを埋めること。

提案手法

  • ALIBIはワンホットエンコードされたラベルに加法的ラプラスノイズを注入し、モデル自身の予測結果を事前分布として用いて反復的ベイズ推論を実行し、出力をノイズ除去する。
  • PATE-FMはPATEフレームワークを改変し、プライベートデータのラベルなし部分を公開のラベルなしデータセットとして扱い、アンサンブルモデルの集約によってラベルDPを実現する。
  • 精度と一般化性能の向上を図るため、最先端の半教師あり学習手法であるFixMatchを活用して、ラベルDP制約下での性能を強化する。
  • 1つのモデルに複数のキャニオン(誤ってラベル付けされた例)を挿入し、再トレーニングを避けながらも、攻撃の成功確率を効率的に推定するための新しいヒューリスティックを導入する。
  • ブラックボックス型メンバーシップインファレンス攻撃を用いて、キャニオンのラベルを当てる成功確率を測定することで、プライバシー係数εの下界を推定し、実効的プライバシー損失を推定する。
  • 理論的プライバシー保証は、微分プライバシーの合成および後処理定理を用いて導出され、両手法に対して(ε, δ)-DP境界が得られる。

実験結果

リサーチクエスチョン

  • RQ1反復的ベイズ推論を用いた加法的ラプラスノイズ(ALIBI)は、特に高プライバシー要件の状況下で、ランダム化応答よりも優れた性能を示すか?
  • RQ2プライベートデータからラベルを除去して得られる公開のラベルなしデータセットを用いてラベルDPに適応したPATEフレームワークは、他のラベルDPメカニズムと比較して、より強い実効的プライバシーを達成するか?
  • RQ3理論的(ε, δ)-DP境界と、メンバーシップインファレンス攻撃によって測定された実効的プライバシー損失の間には、どの程度の相関があるか?
  • RQ4複数のキャニオンを1つのモデルに挿入することで、再トレーニングを伴わずに実効的プライバシー損失を効率的に推定できるか?
  • RQ5理論的プライバシー境界がはるかに弱いにもかかわらず、PATE-FMはALIBIほど高い実効的記憶度を示さないのはなぜか?

主な発見

  • PATE-FMは、理論的(ε, δ)-DP境界と比較して、実効的プライバシー損失(εₘ)が最大で3桁低い水準にまで低下しており、ラベル記憶に対する強い耐性を示している。
  • ALIBIの実効的プライバシー損失は、理論的上界のおおよそ2倍の水準にとどまり、解析がほぼタイトであることを示唆している。
  • 理論的プライバシー境界がALIBIの100倍以上緩いにもかかわらず、キャニオンに対するメンバーシップインファレンス攻撃による測定結果では、PATE-FMがはるかに強い実効的プライバシーを示している。
  • ALIBIの攻撃成功確率は、特に高信頼度のケースでPATE-FMよりも顕著に高く、ALIBIのラベル回復に対する脆弱性が確認された。
  • ALIBIは任意の反復的トレーニング手順(例:SGD)と互換性が高く、より柔軟である一方、PATE-FMは半教師あり学習に依存しており、その手法が適用可能なタスクに限定される。
  • 本研究は、理論的DP境界と実効的プライバシーの間に顕著な乖離が存在することを明らかにした。これは、理論的境界のみに依存すると、プライバシー保護アルゴリズムの選定において誤解を招く可能性があることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。