Skip to main content
QUICK REVIEW

[論文レビュー] Locally Private Bayesian Inference for Count Models

Aaron Schein, Zhiwei Steven Wu|arXiv (Cornell University)|Mar 22, 2018
Privacy-Preserving Technologies in Data参考文献 47被引用数 4
ひとこと要約

本稿は、幾何的メカニズムをスケラム分布を介して再解釈し、スケラム分布とベッセル分布の間の定理を確立することにより、局所的プライバシー下でのポアソン因子分解モデルにおける新たなMCMCアルゴリズムを提案する。この手法は、単純なアプローチを上回り、実際のEnronメールデータを用いたトピックモデリングおよびリンク予測において、非プライベート推論でさえも上回る性能を示し、ノイズに対して頑健で、潜在構造の回復における一貫性が向上していることを示している。

ABSTRACT

We present a general method for privacy-preserving Bayesian inference in Poisson factorization, a broad class of models that includes some of the most widely used models in the social sciences. Our method satisfies limited precision local privacy, a generalization of local differential privacy, which we introduce to formulate privacy guarantees appropriate for sparse count data. We develop an MCMC algorithm that approximates the locally private posterior over model parameters given data that has been locally privatized by the geometric mechanism (Ghosh et al., 2012). Our solution is based on two insights: 1) a novel reinterpretation of the geometric mechanism in terms of the Skellam distribution (Skellam, 1946) and 2) a general theorem that relates the Skellam to the Bessel distribution (Yuan & Kalbfleisch, 2000). We demonstrate our method in two case studies on real-world email data in which we show that our method consistently outperforms the commonly-used naive approach, obtaining higher quality topics in text and more accurate link prediction in networks. On some tasks, our privacy-preserving method even outperforms non-private inference which conditions on the true data.

研究の動機と目的

  • 局所的プライバシー制約下において、特にポアソン因子分解を含むカウントデータモデルに対するプライバシー保護型ベイズ推論手法を開発すること。
  • 局所的微分プライバシーでノイズ処理されたデータのみが利用可能な状況下でのモデル適合という統計的課題に取り組むこと。
  • プライバシー化されたデータをノイズなしとみなして扱う単純なアプローチは過学習を引き起こし、潜在構造の回復が不十分になるため、これを改善すること。
  • スパースなカウントデータに特化した、限界精度局所プライバシー(LPLP)を導入し、標準的な局所的微分プライバシーを一般化すること。
  • プライバシー機構が正則化として機能し、モデルの頑健性と実世界データにおける性能を向上させることを示すこと。

提案手法

  • スパースなカウントデータに特化したポアソン因子分解モデルにおける、限界精度局所プライバシー(LPLP)を導入し、標準的な局所的微分プライバシーの一般化を実現する。
  • カウントデータのプライバシー化に幾何的メカニズム(Ghoshら、2012)を適用し、それがLPLPを満たすことを証明する。
  • 幾何的メカニズムをスケラム分布を用いて再解釈し、ノイズプロセスの解析的逆転を可能にする。
  • スケラム分布とベッセル分布の間の一般定理を確立し、後験分布の簡便なサンプリングを可能にする。
  • 局所的プライバシー下での後験分布近似を可能にする、新たなMCMCアルゴリズムを開発する。このアルゴリズムは、モデルパラメータが与えられたもとで真のデータをその逆分布から反復的に再サンプリングし、逆にモデルパラメータを再サンプリングすることで、反復的かつ効率的な推論を実現する。
  • アルゴリズムをモジュール化し、サンプリングされた真のデータに条件づけて、既存の非プライベートMCMCサンプラーを潜在変数に再利用可能にする。

実験結果

リサーチクエスチョン

  • RQ1局所的プライバシー化されたデータが与えられた場合、ポアソン因子分解モデルの潜在構造を正確に回復できるベイズ推論手法を開発できるか?
  • RQ2幾何的メカニズムがスケラム分布を介して再解釈された場合、プライバシー化プロセスの効率的かつ正確な逆転が可能か?
  • RQ3提案手法は、単純なアプローチ(プライバシー化されたデータをノイズなしとみなす)を上回り、モデルの一貫性および予測精度において優れているか?
  • RQ4適切にモデル化された局所的プライバシーは、正則化の一種として機能し、非プライベート推論を上回る性能を発揮するか?
  • RQ5プライバシー予算が変化する条件下で、本手法は実世界のスパースカウントデータ(例:メール通信ネットワーク)に対してどのように性能を発揮するか?

主な発見

  • 提案手法は、合成データおよび実際のEnronメールデータの両方において、真のデータを再構築する際に単純なアプローチを常に上回り、平均絶対誤差(MAE)が低くなる。
  • Enronコーパスにおいて、提案手法は単純なアプローチおよび真のデータを観測する非プライベート手法よりも低い再構築MAEを達成した。
  • 欠損リンク予測において、提案手法はほとんどの設定で、最も低いホールドアウトMAEを達成し、単純なアプローチおよび非プライベートベースラインを上回った。
  • トピックモデリングにおいて、提案手法が推定したトピックは単純なアプローチよりも一貫性が高く、意味的質が優れていることが示された。
  • 合成データにおいて、提案手法は高いノイズレベル下でも真のブロック構造を正しく回復できたが、単純なアプローチはノイズに過学習し、スパースパターンの回復に失敗した。
  • 驚くべきことに、プライバシー保護型手法が非プライベート推論を上回ることもあり、ノイズ機構が過学習を防ぎ、ポアソン因子分解における誤った構造への適合を抑制する正則化として機能している可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。