Skip to main content
QUICK REVIEW

[論文レビュー] Differentially Private Empirical Risk Minimization with Input Perturbation

Kazuto Fukuchi, Quang Khai Tran|arXiv (Cornell University)|Oct 20, 2017
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

本稿は、微分プライバシーを満たす経験的リスク最小化(DP-ERM)のための新しい入力摂動フレームワークを提案する。各データ寄与者が提出前に自らのデータを局所的にランダム化することで、局所的微分プライバシー(LDP)とモデルレベルの微分プライバシー(DP)の両方を保証する。この手法は滑らかさ条件のもとで $O(1/n)$ の過剰リスクバウンドを達成し、最先端の性能と一致する。

ABSTRACT

We propose a novel framework for the differentially private ERM, input perturbation. Existing differentially private ERM implicitly assumed that the data contributors submit their private data to a database expecting that the database invokes a differentially private mechanism for publication of the learned model. In input perturbation, each data contributor independently randomizes her/his data by itself and submits the perturbed data to the database. We show that the input perturbation framework theoretically guarantees that the model learned with the randomized data eventually satisfies differential privacy with the prescribed privacy parameters. At the same time, input perturbation guarantees that local differential privacy is guaranteed to the server. We also show that the excess risk bound of the model learned with input perturbation is $O(1/n)$ under a certain condition, where $n$ is the sample size. This is the same as the excess risk bound of the state-of-the-art.

研究の動機と目的

  • データ収集中のプライバシー保証のギャップを埋めるために、モデルレベルの微分プライバシー(DP)に加え、局所的微分プライバシー(LDP)を確保すること。
  • 中央集権的なデータ収集に依存せず、データ寄与者が自身のデータを提出前に局所的に摂動するフレームワークを構築すること。
  • 訓練されたモデルが $(\alpha\epsilon,\delta)$-DP を満たすことを理論的に保証するとともに、データ寄与者のプライバシーを $(\beta\sqrt{\epsilon},\delta)$-LDP によって保証すること。
  • 特に滑らかな損失条件のもとで $O(1/n)$ の過剰リスクバウンドを達成し、最先端のDP-ERM手法と同等の性能を実現すること。

提案手法

  • 各データ寄与者が平均0、分散 $\sigma^2$ のガウスノイズを用いて、自らの入力データを独立に摂動する。これにより局所的微分プライバシーが保証される。
  • 摂動されたデータが中央サーバーに送信され、ノイズを含む入力を用いて標準的なERMが実行され、モデルが学習される。
  • フレームワークはガウスメカニズムを活用し、適切なノイズスケーリングのもとでモデル出力が $(\alpha\epsilon,\delta)$-DP を満たすことを導出する。
  • 理論的分析により、摂動機構がデータ寄与者レベルでの局所的プライバシーとモデルレベルでのグローバルプライバシーの両方を保証することを示す。
  • 直交変換とガウスランダム変数の尾確率バウンドを用いて、プライバシーパラメータを導出する。
  • プライバシーパラメータ $\alpha$, $\beta$ と標本サイズ $n$ の間のトレードオフを確立し、$O(\sqrt{\alpha n}) = \beta$ が成り立つ。

実験結果

リサーチクエスチョン

  • RQ1データ寄与者が入力を局所的にランダム化するような、微分プライバシーを満たすERMフレームワークを設計可能か? これにより、局所的およびモデルレベルの微分プライバシーが両方保証されるか?
  • RQ2中央集権的DP-ERM手法と比較して、入力摂動のユーティリティ的トレードオフ(過剰リスク)はどのように変化するか?
  • RQ3ノイズ分散 $\sigma^2$ の選択が、入力摂動フレームワークにおけるプライバシーとモデルユーティリティのバランスにどのように影響するか?
  • RQ4入力摂動による学習モデルの過剰リスクが、最先端のDP-ERM手法と同等の漸近的レートに達するか?
  • RQ5入力摂動モデルにおいて、局所的プライバシーパラメータ $\beta$ とグローバルプライバシーパラメータ $\alpha$ の関係は何か?

主な発見

  • 入力摂動フレームワークにより、最終的なモデルが $(\alpha\epsilon,\delta)$-微分プライバシーを満たすことが保証され、$\alpha$ がグローバルプライバシー予算を制御する。
  • 各データ寄与者に対して $(\beta\sqrt{\epsilon},\delta)$-LDP が保証され、$\beta$ がプライバシーパラメータの平方根に比例してスケーリングされる。
  • 入力摂動を用いて学習されたモデルの過剰リスクは $O\left(\frac{\eta\zeta\sqrt{d\log(1/\delta)}}{\epsilon\alpha n}\right)$ であり、滑らかな損失条件のもとで最先端の性能と一致する。
  • $\lambda$-滑らかな2次損失の仮定のもとで、このフレームワークは、最高の既存のDP-ERM手法と同等の $O(1/n)$ の過剰リスクレートを達成する。
  • 理論的分析により、ガウスノイズの尾確率バウンドと直交変換技術を用いて、プライバシー保証が成立することが確認された。
  • $O(\sqrt{\alpha n}) = \beta$ という関係を通じて、局所的およびグローバルプライバシーの間の原理的トレードオフを提供し、スケーラブルかつプライベートな学習を実現する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。