[論文レビュー] Sample and Threshold Differential Privacy: Histograms and applications
本稿では、データ収集における内在的なサンプリングを活用することで、明示的なノイズ追加を不要とし、フェデレーテッド環境におけるヒストグラム推定に対して $(\epsilon,\delta)$-微分プライバシーを達成するサンプル・スレッショルド機構を提案する。この手法は正確な頻度推定を提供し、ハブ・ハッカーおよび分位数クエリをサポートし、最小限の実装コストで強力なプライバシーを実現する。
Federated analytics seeks to compute accurate statistics from data distributed across users' devices while providing a suitable privacy guarantee and being practically feasible to implement and scale. In this paper, we show how a strong $(ε, δ)$-Differential Privacy (DP) guarantee can be achieved for the fundamental problem of histogram generation in a federated setting, via a highly practical sampling-based procedure that does not add noise to disclosed data. Given the ubiquity of sampling in practice, we thus obtain a DP guarantee almost for free, avoid over-estimating histogram counts, and allow easy reasoning about how privacy guarantees may obscure minorities and outliers. Using such histograms, related problems such as heavy hitters and quantiles can be answered with provable error and privacy guarantees. Experimental results show that our sample-and-threshold approach is accurate and scalable.
研究の動機と目的
- フェデレーテッド分析における微分プライバシー付きヒストグラムを実用的かつ効率的に計算するための手法を提供すること。
- 明示的なノイズを追加せずに、サンプリングそのものだけで、頻度推定に対して強い微分プライバシー保証を達成できることを示すこと。
- ハブ・ハッカー、分位数、範囲クエリをサポートするようにこのメカニズムを拡張し、誤差およびプライバシーの保証された境界を提供すること。
- このアプローチがスケーラブルであり、すでにユーザーをサンプリングしている既存のフェデレーテッドシステムにシームレスに統合できることを示すこと。
- 望ましい $\epsilon$ および $\delta$ 値を満たすために、サンプリングレートおよびスレッショルドを設定するためのタイトな解析的境界を提供すること。
提案手法
- このメカニズムはポissonサンプリングを用いてユーザーのサブセットをランダムに選択し、その不確実性が微分プライバシーの根拠を形成する。
- 各クライアントは、バケットにマップされたアイテムのみを報告し、サーバーはそれらを頻度ヒストグラムに集約する。
- 周囲の頻度が事前に定義されたスレッショルド $\tau$ よりも低いアイテムは、出力ヒストグラムから除外される。
- サンプリングとスレッショルドの組み合わせにより、低頻度アイテムがサンプルに含まれたとしても、その真のカウントが全データセットで明らかになるのを防ぐ。
- 理論的分析により、このプロセスが $(\epsilon,\delta)$-微分プライバシーを満たすことが示され、その境界はサンプリングレートおよびスレッショルドから導出される。
- この手法はフェデレーテッド環境を想定しており、サンプリングはすでに一般的であるため、プライバシー機構は実装コストの観点から実質的に「無料」となる。
実験結果
リサーチクエスチョン
- RQ1明示的なノイズ追加なしに、サンプリングそのものだけで、ヒストグラム推定に対して強い $(\epsilon,\delta)$-微分プライバシー保証を達成できるか?
- RQ2サンプリングとスレッショルドをどのように組み合わせれば、プライバシーを確保しながら正確な頻度推定を維持できるか?
- RQ3このメカニズムは、誤差およびプライバシーの保証された境界を満たすように、ハブ・ハッカーおよび分位数クエリをどの程度まで拡張できるか?
- RQ4望ましい $\epsilon$ および $\delta$ 値を満たすために、サンプリングレートおよびスレッショルドを設定するためのタイトな解析的境界は何か?
- RQ5既存のシャッフルおよびローカル微分プライバシー・モデルと比較して、このアプローチの効率性およびプライバシー強化度はどの程度か?
主な発見
- サンプル・スレッショルド機構は、明示的なノイズを追加せずに、サンプリングによって生じる不確実性に依存して $(\epsilon,\delta)$-微分プライバシーを達成する。
- この手法は、入力データセット内のアイテムについて正確な頻度推定を提供し、誤差境界はサンプリングレートおよびスレッショルドに適切に比例する。
- 実験結果により、このアプローチが正確かつスケーラブルであることが確認され、現実のフェデレーテッド環境でも良好に動作することが示された。
- このメカニズムは、プライベートなヒストグラムを基盤として利用することで、ハブ・ハッカーおよび分位数推定などの後続分析を自然にサポートする。
- このアプローチは非常に実用的であり、フェデレーテッドシステムではすでに一般的なサンプリングを活用しているため、プライバシー機構は軽量で容易に導入可能である。
- 理論的分析により、プライバシー保証がタイトであり、サンプリングレートおよびスレッショルドを用いて、望ましい $\epsilon$ および $\delta$ 水準に正確にキャリブレーション可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。