Skip to main content
QUICK REVIEW

[論文レビュー] Data-dependent PAC-Bayes priors via differential privacy

Gintare Karolina Dziugaite, Daniel M. Roy|arXiv (Cornell University)|Feb 26, 2018
Privacy-Preserving Technologies in Data参考文献 35被引用数 9
ひとこと要約

本稿では、微分プライバシーを用いてデータに依存するPAC-Bayes事前分布を構築する手法を提案し、データの摂動に対して安定であることを保証することで、より緊密な一般化境界を得ることを可能にする。ϵ-差分プライバシーを持つ事前分布の平均が有効なPAC-Bayes境界をもたらすことを示し、実験的に従来の境界が無意味になる状況でも、特に高温のギブス事後分布において、この境界が非自明なままであることを示している。

ABSTRACT

The Probably Approximately Correct (PAC) Bayes framework (McAllester, 1999) can incorporate knowledge about the learning algorithm and (data) distribution through the use of distribution-dependent priors, yielding tighter generalization bounds on data-dependent posteriors. Using this flexibility, however, is difficult, especially when the data distribution is presumed to be unknown. We show how an ε-differentially private data-dependent prior yields a valid PAC-Bayes bound, and then show how non-private mechanisms for choosing priors can also yield generalization bounds. As an application of this result, we show that a Gaussian prior mean chosen via stochastic gradient Langevin dynamics (SGLD; Welling and Teh, 2011) leads to a valid PAC-Bayes bound given control of the 2-Wasserstein distance to an ε-differentially private stationary distribution. We study our data-dependent bounds empirically, and show that they can be nonvacuous even when other distribution-dependent bounds are vacuous.

研究の動機と目的

  • 固定された事前分布からの大きなKLダイバージェンスのため、データに依存する事後分布を用いると標準的なPAC-Bayes境界が無意味になるという限界を是正すること。
  • データ分布が未知であるにもかかわらず、微分プライバシーを安定性のメカニズムとして用いることで、PAC-Bayes理論においてデータに依存する事前分布の使用を可能にすること。
  • SGLDのような確率的最適化手法を用いて、プライバシー保証付きの有効で非自明な一般化境界を構築する実用的フレームワークを開発すること。
  • プライバシー保証付きのPAC-Bayes境界が、他のデータに依存する境界が無意味になる状況でも、特に高温の事後分布においても情報を持つことを実験的に検証すること。

提案手法

  • データ変更に対する感度を制御することで、ϵ-差分プライバシーを持つ事前分布の平均が有効なPAC-Bayes一般化境界を保証する理論的枠組みを提案する。
  • 適応的データ解析と微分プライバシーの結果を用い、データに依存する事前分布選択に対しても高い確率で成り立つ境界を導出する。
  • 特定の条件下でSGLDが(ϵ,δ)-差分プライバシーを満たすことを理論的に保証し、SGLDを用いてデータに依存する事前分布を学習する。
  • 二段階の最適化プロセスを定式化する:まず、小さなτ₁を用いてSGLDでプライバシー保証付きの事前分布を学習し、次に高いτ₂を用いて事後分布を訓練することで、一般化誤差に対するより緊密な境界を得る。
  • 特に高次元モデルにおいては、差分プライバシー事前分布からのモンテカルロサンプルを用いて、PAC-Bayes境界におけるKLダイバージェンス項を近似する。
  • MNISTおよび合成データセット上で、提案手法のプライバシー保証付きPAC-Bayes境界とLeverの境界(標準的なデータに依存する境界)を比較し、緊密さと非自明性を評価する。

実験結果

リサーチクエスチョン

  • RQ1データに依存する事前分布が、データ分布に依存するため、i.i.d.仮定に違反しないか?
  • RQ2微分プライバシーが、データに依存する事前分布が依然として有効な一般化境界をもたらすために十分な条件を提供するか?
  • RQ3SGLDを用いて、差分プライバシーかつ緊密な一般化境界を生成できるデータに依存する事前分布を構築できるか?
  • RQ4プライバシー保証付きPAC-Bayes境界の性能は、Leverの境界など既存のデータに依存する境界と比べて、特に高温領域でどう異なるか?
  • RQ5他の境界が無意味になる状況下で、どのような条件下でプライバシー保証付きPAC-Bayes境界が非自明のままであるか?

主な発見

  • 高温度のτにおいてLeverの境界が無意味になる状況でも、真のラベル設定においてプライバシー保証付きPAC-Bayes境界は非自明のままである。
  • 真のラベルを用いたMNISTデータセットにおいて、τ₂ ≥ 3×10⁴の範囲でプライバシー保証付きPAC-Bayes境界はLeverの境界よりも緊密であり、テスト誤差が0.06に低下する一方で、境界値は0.65未満のままである。
  • ランダムラベルの設定では、高温度のτにおいて一般化誤差が急激に上昇するが、これはLeverの境界が捉えるフェーズ転移を反映している。一方、プライバシー保証付きPAC-Bayes境界は依然として情報を持つ。
  • 二段階SGLDアプローチにより、無意味な境界になることなく、より高いτ₂値を実現でき、理論的妥当性を保ちつつ、より良い事後分布の性能が得られる。
  • プライバシー保証付き境界におけるKLダイバージェンス項は、データ分布に敏感であり、ベイズリスクが低いデータセットでは、Leverの結果における上界よりも顕著に低い値を示す。
  • 高次元設定において、10⁵個のサンプルを差分プライバシー事前分布から得て、対数パーティション関数(ln Z)のモンテカルロ近似を用いることで、KL項の実用的推定が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。