Skip to main content
QUICK REVIEW

[論文レビュー] Per-instance Differential Privacy and the Adaptivity of Posterior Sampling in Linear and Ridge regression.

Yuxiang Wang|arXiv (Cornell University)|Jul 24, 2017
Advanced Causal Inference Techniques被引用数 3
ひとこと要約

本稿では、特定のデータセットに基づいて個々のプライバシーを定量的に評価する細粒度なプライバシー概念である個別インスタンス微分プライバシー(pDP)を導入する。このpDPは、データがi.i.d.である場合に一般化を示すことを示しており、線形回帰およびリッジ回帰におけるワン・ポストリアン・サンプル(OPS)推定器の分析を通じて、条件数が良好なデータにおいて$(\epsilon,\delta)$-pDPを達成し、理論的下界から$1+\tilde{O}(n^{-1}\epsilon^{-2})$の要因の範囲内で一致することを証明している。シミュレーションにより、データセット内の個々の個人に対して優れたプライバシー・ユーティリティトレードオフを実現していることが示された。

ABSTRACT

Differential privacy (DP), ever since its advent, has been a controversial object. On the one hand, it provides strong provable protection of individuals in a data set, on the other hand, it has been heavily criticized for being not practical, partially due to its complete independence to the actual data set it tries to protect. In this paper, we address this issue by a new and more fine-grained notion of differential privacy --- per instance differential privacy (pDP), which captures the privacy of a specific individual with respect to a fixed data set. We show that this is a strict generalization of the standard DP and inherits all its desirable properties, e.g., composition, invariance to side information and closedness to postprocessing, except that they all hold for every instance separately. When the data is drawn from a distribution, we show that per-instance DP implies generalization. Moreover, we provide explicit calculations of the per-instance DP for the output perturbation on a class of smooth learning problems. The result reveals an interesting and intuitive fact that an individual has stronger privacy if he/she has small leverage score with respect to the data set and if he/she can be predicted more accurately using the leave-one-out data set. Using the developed techniques, we provide a novel analysis of the One-Posterior-Sample (OPS) estimator and show that when the data set is well-conditioned it provides $(\epsilon,\delta)$-pDP for any target individuals and matches the exact lower bound up to a $1+ ilde{O}(n^{-1}\epsilon^{-2})$ multiplicative factor. We also propose AdaOPS which uses adaptive regularization to achieve the same results with $(\epsilon,\delta)$-DP. Simulation shows several orders-of-magnitude more favorable privacy and utility trade-off when we consider the privacy of only the users in the data set.

研究の動機と目的

  • 標準的な微分プライバシーが過剰に慎重であるという批判に応えるために、データに依存する、インスタンス固有のプライバシー概念を導入すること。
  • 固定されたデータセットに対する個々のプライバシーを定量的に評価する新しいプライバシー枠組み「個別インスタンス微分プライバシー(pDP)」を構築すること。
  • データがi.i.d.である場合にpDPが一般化を示し、合成や後処理不変性といった標準DPのコアな性質を個々のインスタンスに適用することで、それらを継承することを示すこと。
  • pDPにおける線形回帰およびリッジ回帰におけるワン・ポストリアン・サンプル(OPS)推定器のプライバシー保証を分析すること。
  • OPSと同等のpDP保証を達成するとともに、標準的な$(\epsilon,\delta)$-DPを満たすようにする適応的正則化法「AdaOPS」を提案すること。

提案手法

  • 標準DPの厳密な一般化として、個別インスタンス微分プライバシー(pDP)を定義し、プライバシー保証を個々のデータインスタンスと固定されたデータセットごとに計算すること。
  • pDPが個々のデータインスタンスに対して、合成、後処理不変性、グループプライバシーといった主要なDP性質を保持することを確立すること。
  • 滑らかな学習問題における出力摂動を分析し、明示的なpDPバウンドを導出し、プライバシーがレバレッジスコアおよび1人除いた予測精度に依存することを明らかにすること。
  • pDPフレームワークをワン・ポストリアン・サンプル(OPS)推定器に適用し、データ行列が良好に条件付けられている場合に、任意のターゲット個体に対して$(\epsilon,\delta)$-pDPを達成することを証明すること。
  • 適応的正則化を用いて、OPSと同等のpDP保証を達成するとともに、標準的な$(\epsilon,\delta)$-DPを満たすAdaOPSを導入すること。
  • リッジ回帰におけるpDPの明示的計算を通じて、レバレッジが低く、1人除いたモデルでより正確に予測可能な個体は、より強いプライバシーを享受することを示すこと。

実験結果

リサーチクエスチョン

  • RQ1すべての入力に一様に適用されるのではなく、特定のデータセットおよび個々の個人に依存する、より細粒度な微分プライバシーの定義が可能か?
  • RQ2データがi.i.d.である場合に、個別インスタンス微分プライバシー(pDP)は一般化を示すのか?また、標準DPとはどのように関係するのか?
  • RQ3線形回帰およびリッジ回帰における個別インスタンスDP下でのワン・ポストリアン・サンプル(OPS)推定器のプライバシー・ユーティリティトレードオフは何か?
  • RQ4理論的下界を達成する実用的推定器は存在するのか?また、OPS推定器はその下界からどの程度近いか?
  • RQ5AdaOPSにおける適応的正則化は、標準DPメカニズムと比較して、プライバシー・ユーティリティトレードオフをどのように改善するのか?

主な発見

  • 個別インスタンス微分プライバシー(pDP)は、標準DPの厳密な一般化であり、合成、後処理不変性、グループプライバシーといったすべての望ましい性質を、個々のデータインスタンスに個別に適用することで継承する。
  • データがi.i.d.である場合、pDPは一般化を示し、個々のプライバシーと統計的学習性能を結びつける。
  • pDP下での個体のプライバシーは、そのレバレッジスコアが低く、1人除いたデータセットからの予測がより正確にできる場合に強くなる。
  • ワン・ポストリアン・サンプル(OPS)推定器は、条件数が良好なデータにおいて、任意のターゲット個体に対して$(\epsilon,\delta)$-pDPを達成し、理論的下界から乗法的要因$1+\tilde{O}(n^{-1}\epsilon^{-2})$の範囲内で一致する。
  • 適応的正則化を用いるAdaOPSは、OPSと同等のpDP保証を達成するとともに、標準的な$(\epsilon,\delta)$-DPを満たし、シミュレーションによりデータセット内個々の個人に対して数個のオーダーも上回る優れたプライバシー・ユーティリティトレードオフを示している。
  • リッジ回帰における明示的なpDP計算により、プライバシーが個体ごとに一様ではなく、レバレッジや予測精度といったデータ固有の特性に依存することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。