Skip to main content
QUICK REVIEW

[論文レビュー] Classification under local differential privacy

Thomas B. Berrett, Cristina Butucea|arXiv (Cornell University)|Dec 10, 2019
Privacy-Preserving Technologies in Data参考文献 14被引用数 9
ひとこと要約

本稿は、ユークリッド空間における二値分類のための非インタラクティブで $\alpha$-局所的微分プライバシー機構を提案し、このプライバシー制約下でも普遍的整合性を持つ分類器を構築する。過剰リスクの最小最大収束レートが、非プライベートな設定よりも遅いことが確立され、プライバシー水準 $\alpha$、次元 $d$、滑らかさ $\beta$、マージンパラメータ $\gamma$ に明示的な依存関係を示し、分類における局所的プライバシーの統計的コストを示している。

ABSTRACT

We consider the binary classification problem in a setup that preserves the privacy of the original sample. We provide a privacy mechanism that is locally differentially private and then construct a classifier based on the private sample that is universally consistent in Euclidean spaces. Under stronger assumptions, we establish the minimax rates of convergence of the excess risk and see that they are slower than in the case when the original sample is available.

研究の動機と目的

  • 局所的微分プライバシー(LDP)下での二値分類のための統計的推論フレームワークの欠如に応えること。
  • ユークリッド空間における分類タスクに適した非インタラクティブで $\alpha$-LDP プライバシー機構を構築すること。
  • プライバシー機構下でも普遍的整合性を示す分類器を構築すること。
  • LDP 下での過剰リスクの最小最大収束レートを導出し、プライバシーの統計的コストを定量化すること。
  • 滑らかさ($\beta$)、マージン条件($\gamma$)、およびプライバシー水準($\alpha$)が推定精度に与える影響を特定すること。

提案手法

  • 各データポイント $(X_i, Y_i)$ が独立にマークフ・カーネル $Q_i$ を介して $\alpha$-LDP を満たすように、非インタラクティブなプライバシー機構を提案する。
  • プライバシーと滑らかさを保証するため、小さな定数 $C_\phi$ でスケーリングされた有界かつホルダー滑らかな関数 $\phi$ を用いたプライバシー機構を定義する。
  • プライバシー化されたデータ $Z_1, \dots, Z_n$ のみに依存する分類器を構築し、$\mathbb{R}^d$ における普遍的整合性を保証する。
  • 各々が異なる回帰関数 $\eta_\sigma$ を持つ $2^m$ 個の分布 $P_\sigma$ をインデックス $\sigma \in \{-1,+1\}^m$ で添え字づけるテストフレームワークを採用する。
  • 尤度比の境界と全 Variation 距離を用いて、$d_{\text{TV}}(M_{+k}^{(n)}, M_{-k}^{(n)})$ を介して過剰リスクの下界を導出する。
  • ピンスカーの不等式と Duchi 他(2013)のKL発散境界を用いて、プライバシー損失と統計的推定誤差の関係を確立する。

実験結果

リサーチクエスチョン

  • RQ1ユークリッド空間における局所的微分プライバシー下でも、普遍的整合性を持つ分類器を構築できるか?
  • RQ2二値分類における $\alpha$-LDP 下での過剰リスクの最小最大収束レートは何か?
  • RQ3プライバシー水準 $\alpha$ は、非プライベートな状況と比較して分類の統計的効率にどのように影響するか?
  • RQ4滑らかさ($\beta$)およびマージン($\gamma$)条件が、プライバシー制約下での最小最大レートに果たす役割は何か?
  • RQ5分類において、プライバシーと統計的精度の間に根本的なトレードオフがあるか。その場合、どのように定量化されるか?

主な発見

  • 非インタラクティブな $\alpha$-LDP 機構が構築され、$\mathbb{R}^d$ 上での分類においてプライバシーを保持しながら普遍的整合性を達成している。
  • 過剰リスクの最小最大収束レートが $(n\alpha^2)^{-\frac{\beta(1+\gamma)}{2\beta+2d}}$ のオーダーであることが示され、これは古典的な非プライベートレートよりも遅い。
  • このレートは滑らかさ $\beta \in [0,1]$、マージンパラメータ $\gamma$、次元 $d$、およびプライバシー水準 $\alpha$ に依存する。
  • 下界は、$m \approx q^{d-\beta\gamma}$ となる $2^m$ 個の分布の上でのテストフレームワークを用いて導出されており、$q$ はプライバシーと推定誤差のバランスをとるために調整される。
  • 分析により、プライバシーの根本的統計的コストが確認された:最適設計のもとでも、プライバシー制約によりレートが劣化し、$n\alpha^2$ に明示的な依存関係が存在する。
  • ホルダー滑らかさの回帰関数とパrameter $\gamma$ のマージン条件という標準的仮定のもとで、結果は成り立つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。