Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Pseudo Posterior Mechanism under Asymptotic Differential Privacy

Terrance D. Savitsky, Matthew R. Williams|arXiv (Cornell University)|Sep 25, 2019
Privacy-Preserving Technologies in Data参考文献 16被引用数 8
ひとこと要約

本稿では、データレコードインデックスに依存する重みを用いて高リスクレコードを的確に軽減することで、漸近的微分プライバシー下での合成データの有用性を向上させるベイジアン仮想後確率分布のメカニズムを提案する。このメカニズムは、指数分布よりも優れた有用性を達成するとともに、$\pi$ が漸近的に 0 に収束する $(\epsilon,\pi)$-確率的微分プライバシーを保証する。

ABSTRACT

We propose a Bayesian pseudo posterior mechanism to generate record-level synthetic databases equipped with an $(ε,δ)-$ probabilistic differential privacy (pDP) guarantee, where $δ$ denotes the probability that any observed database exceeds $ε$. The pseudo posterior mechanism employs a data record-indexed, risk-based weight vector with weight values $\in [0, 1]$ that surgically downweight the likelihood contributions for high-risk records for model estimation and the generation of record-level synthetic data for public release. The pseudo posterior synthesizer constructs a weight for each data record using the Lipschitz bound for that record under a log-pseudo likelihood utility function that generalizes the exponential mechanism (EM) used to construct a formally private data generating mechanism. By selecting weights to remove likelihood contributions with non-finite log-likelihood values, we guarantee a finite local privacy guarantee for our pseudo posterior mechanism at every sample size. Our results may be applied to \emph{any} synthesizing model envisioned by the data disseminator in a computationally tractable way that only involves estimation of a pseudo posterior distribution for parameters, $θ$, unlike recent approaches that use naturally-bounded utility functions implemented through the EM. We specify mild conditions that guarantee the asymptotic contraction of $δ$ to $0$ over the space of databases. We illustrate our pseudo posterior mechanism on the sensitive family income variable from the Consumer Expenditure Surveys database published by the U.S. Bureau of Labor Statistics. We show that utility is better preserved in the synthetic data for our pseudo posterior mechanism as compared to the EM, both estimated using the same non-private synthesizer, due to our use of targeted downweighting.

研究の動機と目的

  • 形式的なプライバシー保証を備えた、計算的に実行可能な記録レベルの合成データベースを生成するための方法を開発すること。
  • 合成データ生成におけるプライバシーとデータ有用性のトレードオフを解消するため、高リスクレコードにのみ局所的に重みを下げる手法を提供すること。
  • サンプルサイズが増加するにつれて $\pi$ が 0 に収束する漸近的 $(\epsilon,\pi)$-確率的微分プライバシー保証を提供すること。
  • 非プライベートな合成器を、そのコアなサンプリング手順を変更せずに形式的プライバシー機構に拡張できること。
  • 非有限の対数尤度値を持つ寄与を排除することで、すべてのサンプルサイズで有限の局所的プライバシー保証を確保すること。

提案手法

  • 高リスクレコードの尤度寄与を軽減するために、データレコードインデックスに依存する重みベクトル $\bm{\alpha} \in [0,1]^n$ を構築する。
  • 局所リプシッツバウンド $\Delta_{\bm{\alpha},\mathbf{x}}$ を計算するための対数仮想尤度関数を用い、各レコードのプライバシー評価を可能にする。
  • 重み分布にスケーリング($c<1$)とシフト($g<0$)を適用し、その後切断処理を施してすべての重みが $[0,1]$ の範囲に収まるようにする。
  • パrameter推定に、仮想後確率分布 $p(\theta \mid \mathbf{x}, \bm{\alpha}) \propto \prod_{i=1}^n f_\theta(x_i)^{\alpha_i} \times p(\theta)$ を採用する。
  • 切断ルールを導入:$M$ をグローバル収縮点として、$\alpha^*_i = 0$ if $\alpha_i \times f_\theta(x_i) > M$。
  • 局所プライバシー保証を $\epsilon_{\mathbf{x}} = 2 \times \Delta_{\bm{\alpha},\mathbf{x}} \times m$ として導出する。ここで $m=20$ は合成データベースの事後分布抽出回数である。

実験結果

リサーチクエスチョン

  • RQ1仮想後確率分布メカニズムを構築することで、既存の手法よりも高いデータ有用性を維持しつつ、形式的なプライバシー保証を提供できるか?
  • RQ2記録ごとのリスクをどのように定量化し、計算の実行可能性を保ちつつ高リスクレコードにのみ重みを下げるか?
  • RQ3どのような条件下で、任意のデータベースが $\epsilon$ を超える確率 $\pi$ が漸近的に 0 に収束するか?
  • RQ4指数分布で用いられるスカラー的軽減と比較して、高リスクレコードへの的確な軽減は、どれほど有用性を向上させるか?
  • RQ5提案されたメカニズムは、その事後分布抽出手順を変更せずに、任意の非プライベートな合成器モデルに適用可能か?

主な発見

  • 重み $\bm{\alpha}$ を用いた仮想後確率分布メカニズムは、構成すべてにおいて局所プライバシー保証($\Delta_{\bm{\alpha},\mathbf{x}}$)を 80% 減少させ、未重み付け時(78.7)から 2.25 にまで低下させた。
  • 仮想後確率分布メカニズム下での合成収入値の 90 パーセンタイルは、すべての $(c,g)$ 構成において、指数分布と比較して著しく平坦な劣化を示した。
  • 非有限の対数尤度寄与を除外することで、すべてのサンプルサイズで有限の局所的プライバシー保証を達成している。
  • 任意のデータベースが $\epsilon$ を超える確率 $\pi$ は漸近的に 0 に収束し、$(\epsilon,\pi)$-確率的微分プライバシー保証を満たしている。
  • 均一なスケーリングではなく、高リスクレコードにのみ的確に重みを下げるため、指数分布よりも優れた有用性の維持が可能である。
  • 非プライベートな合成器を、その事後分布抽出手順を最小限に変更することで、プライベートメカニズムに変換可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。