Skip to main content
QUICK REVIEW

[論文レビュー] On-Average KL-Privacy and its equivalence to Generalization for Max-Entropy Mechanisms

Yu-Xiang Wang, Jing Lei|arXiv (Cornell University)|May 8, 2016
Privacy-Preserving Technologies in Data参考文献 21被引用数 17
ひとこと要約

この論文は、一般化性と同等である弱いプライバシー概念「On-Average KL-Privacy」を導入している。これは、最大エントロピー機構—すなわち、p(h|Z) ∝ exp(−ℒ(h,Z))π(h) の形をとる分布—に対して成立する。この広範なアルゴリズムのクラス(ベイズ推論や経験的リスク最小化を含む)において、On-Average KL-Privacy は一般化誤差を特徴づけ、微分プライバシーに比べてより優れたユーティリティのトレードオフを実現する、新たな情報理論的リンクを提供する。

ABSTRACT

We define On-Average KL-Privacy and present its properties and connections to differential privacy, generalization and information-theoretic quantities including max-information and mutual information. The new definition significantly weakens differential privacy, while preserving its minimalistic design features such as composition over small group and multiple queries as well as closeness to post-processing. Moreover, we show that On-Average KL-Privacy is **equivalent** to generalization for a large class of commonly-used tools in statistics and machine learning that samples from Gibbs distributions---a class of distributions that arises naturally from the maximum entropy principle. In addition, a byproduct of our analysis yields a lower bound for generalization error in terms of mutual information which reveals an interesting interplay with known upper bounds that use the same quantity.

研究の動機と目的

  • 微分プライバシーの強い条件と実用的ユーティリティのギャップを埋めるために、一般化を保証するがより弱いプライバシー概念を提案すること。
  • 損失関数と事前分布を持つギブス分布からサンプリングする広範な統計的および機械学習アルゴリズムのクラスに対して、プライバシーと一般化性の関係を形式化すること。
  • On-Average KL-Privacy が最大エントロピー機構における一般化の必要十分条件であることを示すこと。
  • 微分プライバシーを弱めるフレームワークを提供し、合成と事後処理不変性といった重要な性質を保持すること。
  • 相互情報量を用いた一般化誤差の新たな下界を明らかにし、既知の上界と補完的関係を構築すること。

提案手法

  • 微分プライバシーの緩和として、隣接するデータセットにおける出力分布間の期待KLダイバージェンスとして定義される On-Average KL-Privacy を提案する。
  • ベイズ推論やERMで一般的な形 p(h|Z) ∝ exp(−ℒ(h,Z))π(h) の最大エントロピー分布からのサンプリングを行うアルゴリズムを分析する。
  • 相互情報量 I(𝒜(Z);Z) や最大情報量 I∞(𝒜,n) といった情報理論的ツールを用いて、プライバシーと一般化性を特徴づける。
  • 逐次クエリに対する適応的合成定理を適用し、On-Average KL-Privacy の境界を導出する。
  • ジェンセンの不等式とデータの摂動に関する期待値を用いて、On-Average KL-Privacy を一般化誤差に関連付ける。
  • 相互情報量を用いた一般化誤差の下界を導出し、同様の量を用いた既知の上界と対照的にする。

実験結果

リサーチクエスチョン

  • RQ1広範な学習アルゴリズムのクラスにおいて、弱いプライバシー概念が一般化性と同等に成立するか。
  • RQ2On-Average KL-Privacy は最大エントロピー機構における微分プライバシーおよび一般化性とどのように関係するか。
  • RQ3相互情報量は、事後分布サンプリングアルゴリズムにおける一般化誤差を特徴づける上で果たす役割は何か。
  • RQ4On-Average KL-Privacy は複数のクエリにわたって適応的に合成可能であり、プライバシー保証を維持できるか。
  • RQ5最大エントロピーサンプリングの文脈において、相互情報量と一般化誤差の相互作用は何か。

主な発見

  • On-Average KL-Privacy は、ベイズ推論や経験的リスク最小化を含むすべての最大エントロピー機構において、一般化性と同等である。
  • 論文は、相互情報量を用いた一般化誤差の下界を確立し、相互情報量が上界と下界の両方で果たす二重の役割を明らかにした。
  • On-Average KL-Privacy は、微分プライバシーの主要な性質—複数クエリにおける合成と事後処理不変性—を継承している。
  • On-Average KL-Privacy と一般化性の同等性は、損失関数と事前分布を持つギブス分布からサンプリングするアルゴリズムに特異的に成立する。
  • 適応的合成の結果により、On-Average KL-Privacy が逐次クエリにおいても保持され、クエリ数に線形に比例する境界が得られることが示された。
  • 解析により、隣接するデータセットにおける事後分布間の期待KLダイバージェンスが、最大エントロピー機構における一般化誤差を特徴づけることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。