[論文レビュー] PCKV: Locally Differentially Private Correlated Key-Value Data Collection with Optimized Utility
この論文は、最適化されたユーティリティを備えた相関するキー-バリュー データを収集するための局所差分プライバシーフレームワーク PCKV を導入します。PCKV-UE と PCKV-GRR のメカニズムと、Padding-and-Sampling サンプリング戦略を含みます。
Data collection under local differential privacy (LDP) has been mostly studied for homogeneous data. Real-world applications often involve a mixture of different data types such as key-value pairs, where the frequency of keys and mean of values under each key must be estimated simultaneously. For key-value data collection with LDP, it is challenging to achieve a good utility-privacy tradeoff since the data contains two dimensions and a user may possess multiple key-value pairs. There is also an inherent correlation between key and values which if not harnessed, will lead to poor utility. In this paper, we propose a locally differentially private key-value data collection framework that utilizes correlated perturbations to enhance utility. We instantiate our framework by two protocols PCKV-UE (based on Unary Encoding) and PCKV-GRR (based on Generalized Randomized Response), where we design an advanced Padding-and-Sampling mechanism and an improved mean estimator which is non-interactive. Due to our correlated key and value perturbation mechanisms, the composed privacy budget is shown to be less than that of independent perturbation of key and value, which enables us to further optimize the perturbation parameters via budget allocation. Experimental results on both synthetic and real-world datasets show that our proposed protocols achieve better utility for both frequency and mean estimations under the same LDP guarantees than state-of-the-art mechanisms.
研究の動機と目的
- 局所的にプライベートな収集における異種キー-バリュー データ(キーに対応する数値値を持つ)におけるユーティリティとプライバシーのトレードオフに対処する。
- キーと値の間の相関を活用してプライバシー予算の構成を改善しノイズを削減する。
- 大規模キー領域を扱う際、単ラウンドの平均推定と改善されたサンプリングを備えた非対話的メカニズムを提供する。
- LDP 保証の下で平均二乗誤差を最小化するようにほぼ最適なプライバシー予算配分を可能にする。
提案手法
- PCKV-UE(Unary Encoding ベース)と PCKV-GRR(Generalized Randomized Response ベース)の2つのメカニズムを組み合わせた統一的な PCKV フレームワークを提案する。
- 大規模なキー領域を扱う際に、 possessed ペアから各ユーザーにつき1つのキー-バリューペアをサンプリングする Padding-and-Sampling 戦略を用いる。
- キーと値の摂動を独立させない相関摂動スキームを実装し、プライバシー予算の構成をより厳密に可能にする。
- 校正済みの頻度の和から平均を算出する非対話的平均推定量を導出し、低 epsilon での外れ値補正を行う校正済み平均を用いて推定する。
- 推定量の期待値、MSE、漸近的な無偏性の理論分析を提供する。
- 締め切り付き予算構成の下で MSE を最小化する近似最適な予算配分式を提供し、閉形式の解を得る。
実験結果
リサーチクエスチョン
- RQ1複数のキー-バリューペアを所有するユーザーがいる場合、LDPの下で高いユーティリティを持つキー値データをどのように収集できるか?
- RQ2キーと値の相関摂動は独立摂動よりも厳密なプライバシー予算構成をもたらすことができるか?
- RQ3非対話的で単一ラウンドの平均推定量はLDP下のキー-バリュー データに対して漸近的無偏性を達成できるか?
- RQ4周波数推定と平均推定のためのキーと値の摂動間の最適な予算配分は何か?
- RQ5Padding-and-Sampling は大規模キー領域と実データセットのユーティリティを改善するか?
主な発見
- PCKV フレームワークの PCKV-UE および PCKV-GRR は、同じ LDP 保証の下で、周波数推定と平均推定の丮で最先端のメカニズムよりもより良いユーティリティを達成する。
- 相関摂動は独立摂動よりも厳密なプライバシー予算構成をもたらし、プライバシー-ユーティリティのトレードオフを改善する。
- 単一ラウンド平均推定量が提案され、 calibrated mean over calibrated frequency、低 epsilon での外れ値補正とともに漸近的無偏性を示す。
- Padding-and-Sampling は possessed ペアから1つのキー-バリューペアをサンプリングして大規模キー領域のユーティリティを向上させる。
- 閉形式での近似最適な予算配分は、素朴な等分割配分を上回り、与えられたプライバシー制約下の MSE を改善する。
- 実験結果は、理論分析と PrivKVM および関連研究よりもユーティリティの改善を検証する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。