Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Differential Privacy through Posterior Sampling

Christos Dimitrakakis, Blaine Nelson|arXiv (Cornell University)|Jun 5, 2013
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本稿では、事後分布からのサンプリングを活用することで、ベイジアン微分プライバシーを達成するための新規フレームワークを提案する。特定の事前分布の条件下では、事後分布からのサンプリングが、制御された有効性を伴って自然に微分プライバシーを提供することを示している。主な貢献は、任意のデータセットメトリクスおよび分布族への微分プライバシーの一般化であり、Le Camの手法を用いてプライバシー、有効性、識別可能性に関する理論的バウンドを提示している。

ABSTRACT

Differential privacy formalises privacy-preserving mechanisms that provide access to a database. We pose the question of whether Bayesian inference itself can be used directly to provide private access to data, with no modification. The answer is affirmative: under certain conditions on the prior, sampling from the posterior distribution can be used to achieve a desired level of privacy and utility. To do so, we generalise differential privacy to arbitrary dataset metrics, outcome spaces and distribution families. This allows us to also deal with non-i.i.d or non-tabular datasets. We prove bounds on the sensitivity of the posterior to the data, which gives a measure of robustness. We also show how to use posterior sampling to provide differentially private responses to queries, within a decision-theoretic framework. Finally, we provide bounds on the utility and on the distinguishability of datasets. The latter are complemented by a novel use of Le Cam's method to obtain lower bounds. All our general results hold for arbitrary database metrics, including those for the common definition of differential privacy. For specific choices of the metric, we give a number of examples satisfying our assumptions.

研究の動機と目的

  • 標準的なベイジアン推論が、データやアルゴリズムを変更せずに、事後分布からのサンプリングによって inherently 微分プライバシーを提供できるかどうかを調査すること。
  • 微分プライバシーを i.i.d. および表形式データにとどまらず、任意のデータセットメトリクス、出力空間、および分布族に一般化すること。
  • 意思決定理論の枠組みにおいて、プライバシー(事後分布の感度)と有効性(データセットの識別可能性)の理論的バウンドを確立すること。
  • 後続のサンプリングが、固定されたプライバシー予算のもとで高い有効性を維持しながら、クエリに対して微分プライベートな応答を生成できることを示すこと。
  • プライバシーと有効性の両方の上界と下界を提示し、後者については Le Cam の手法を用いること。

提案手法

  • 微分プライバシーを任意のデータセットメトリクスおよび分布族に一般化し、非 i.i.d. および非表形式データへの応用を可能にする。
  • 外部クエリに対する微分プライベートな応答を生成するためのコアメカニズムとして、事後分布からのサンプリングを用いる。
  • 入力データセットの変化に対する事後分布の感度のバウンドを導出することで、そのロバストネスを定量化する。
  • プライバシー制約のもとで有効性を最大化するように応答を選ぶ意思決定理論的枠組みを適用する。
  • Le Cam の手法を用いて、データセットの識別可能性の下界を導出し、プライバシーの上界と補完する。
  • 指数型分布族、多変量正規分布、DAG 構造をもつ離散ベイジアンネットワークの具体例を提示する。

実験結果

リサーチクエスチョン

  • RQ1適切に選ばれた事前分布を用いた標準的なベイジアン推論が、事後分布からのサンプリングによって inherently 微分プライバシーを保証できるか?
  • RQ2微分プライバシーを i.i.d. および表形式データにとどまらず、任意のデータセットメトリクスおよび分布族にどのように一般化できるか?
  • RQ3後続のサンプリングを用いてプライベートなクエリ応答を生成する際、プライバシーと有効性の理論的バウンドは何か?
  • RQ4事後分布の感度とデータセットの識別可能性は、プライバシー保証とどのように関係するか?
  • RQ5Le Cam の手法を用いて、プライバシーの上界を補完する識別可能性の下界を導出できるか?

主な発見

  • 適切な事前分布とモデル族の下で、特定の条件下において、ベイジアンモデルからの事後分布からのサンプリングが、追加のノイズを一切用いずに微分プライバシーを達成する。
  • 本稿では、事後分布のプライバシー損失の上界を確立し、ややきめの緩い正則性条件のもとで、データ変更に対する感度が有界であることを示している。
  • 精度行列が既知の多変量正規分布モデルでは、事後分布の感度が固有値とデータ差分の関数として有界である。
  • DAG 構造をもつ離散ベイジアンネットワークでは、プライバシー損失が、異なる変数値の重み付き和として有界であり、重みはノードの次数に基づく。
  • Le Cam の手法を用いて、データセットの識別可能性の下界を導出し、プライバシーと有効性が本質的にトレードオフ制約を受けることを示している。
  • 固定されたプライバシー予算のもとで有効性が保持され、後続のサンプリングにより、微分プライバシーを維持しながら正確なクエリ応答が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。