[論文レビュー] Differentially private anonymized histograms
本論文は、匿名化されたヒストグラム(ラベル付きデータからの非ゼロカウントの多重集合)を公開するための、初めての微分プライバシー機構を提案する。この機構は、近似的に最適なプライバシー・ユーティリティのトレードオフを達成する。新たなノイズ追加戦略を用い、ヒストグラムの頻度構造に基づく。これにより、入力がコンpactに表現される場合にサブリニア時間で計算可能となり、微分プライバシー下での離散分布の対称的性質(例:エントロピー、サポートサイズ)の正確な推定を可能にする。
For a dataset of label-count pairs, an anonymized histogram is the multiset of counts. Anonymized histograms appear in various potentially sensitive contexts such as password-frequency lists, degree distribution in social networks, and estimation of symmetric properties of discrete distributions. Motivated by these applications, we propose the first differentially private mechanism to release anonymized histograms that achieves near-optimal privacy utility trade-off both in terms of number of items and the privacy parameter. Further, if the underlying histogram is given in a compact format, the proposed algorithm runs in time sub-linear in the number of items. For anonymized histograms generated from unknown discrete distributions, we show that the released histogram can be directly used for estimating symmetric properties of the underlying distribution.
研究の動機と目的
- パスワード頻度リストやソーシャルネットワークの次数分布といった、機微な応用分野において、匿名化ヒストグラム(非ゼロカウントの多重集合)を微分プライバシーを保ちつつ公開する課題に対処すること。
- プライバシー・パラメータ ε とアイテム数の両面で、近似的に最適なプライバシー・ユーティリティのトレードオフを達成する機構の開発。
- 入力ヒストグラムが頻度に基づくコンパクト表現で与えられる場合に、サブリニア時間で実行されるアルゴリズムを保証することで、計算の効率化を図ること。
- 未知の離散分布の対称的性質(例:エントロピー、サポートサイズ)を、公開された微分プライバシー付きヒストグラムを直接用いて、誤差が有界な範囲で推定できることを支援すること。
提案手法
- 匿名化ヒストグラムの頻度(φr)にノイズを追加する、微分プライバシー機構を提案。ここで φr は、カウントが r であるラベルの数を表す。
- ヒストグラムの頻度構造に適合した、新たなノイズ分布を用い、プライバシーを確保するとともに、ユーティリティの損失を最小限に抑える。
- ヒストグラム間のソート済み ℓ1 距離に基づく感度解析を採用し、後続の性質推定における誤差伝搬を制限する。
- ヒストグラムの頻度に基づくコンパクト表現を活用することで、すべてのカウントを明示的に列挙しないサブリニア時間アルゴリズムを設計。
- 離散分布の対称的性質の推定に適した、プラグイン推定量フレームワークに、プライベートヒストグラム公開を統合。
- 合計誤差を3つの成分に分解することで誤差バウンドを分析:プライベート推定量の推定誤差、サンプルサイズの差による摂動、ヒストグラム近似の誤差。
実験結果
リサーチクエスチョン
- RQ1プライバシー・パラメータ ε とアイテム数の両方で、近似的に最適なプライバシー・ユーティリティのトレードオフを達成する微分プライバシー機構を、匿名化ヒストグラムの公開に設計できるか?
- RQ2入力ヒストグラムが頻度に基づくコンパクト表現で与えられる場合、アルゴリズムがどのようにサブリニア時間計算量を達成できるか?
- RQ3公開された微分プライバシー付きヒストグラムを、元の離散分布の対称的性質(例:エントロピー、サポートサイズ)を誤差が有界な範囲で推定するために直接使用できるか?
- RQ4対称的性質 f(p) をプライベートヒストグラムを用いて推定する際の理論的誤差バウンドは何か?また、サンプルサイズとプライバシー・パラメータ ε にどのように依存するか?
- RQ5ε の異なる範囲(例:ε > 1 と ε ∈ [Ω(1/n), 1])において、誤差とサンプル複雑度の観点から、この機構はどのように性能を発揮するか?
主な発見
- 提案された機構は、近似的に最適なプライバシー・ユーティリティのトレードオフを達成し、誤差が ε > 1 の場合に O(n^{β−1/2} e^{−cε})、ε ∈ [Ω(1/n), 1) の場合に O(n^{β−1/2} √(1/ε log(2/ε))) にスケーリングする。ここで β < 1/2 である。
- 入力ヒストグラムが頻度に基づくコンパクト表現で与えられる場合、アルゴリズムはサブリニア時間で実行され、大規模データセットに対しても効率的である。
- 公開されたプライベートヒストグラムは、エントロピー、サポートサイズ、Rényi エントロピーなどの対称的性質のプラグイン推定量として直接使用可能である。
- 正確な推定に必要なサンプル複雑度は、ε > 1 の場合に O((1/(α e^{cε}))^{2/(1−2β)} + (1/ε) log(f_max/α))、ε ∈ [Ω(1/n), 1) の場合に O((√log(2/ε)/(α√ε))^{2/(1−2β)} + (1/ε) log(f_max/(αε))) である。
- 対称的性質 f(p) の推定誤差の期待値は、E[|f(p) − f̂^p|] ≤ E[ε( f̂, n)] + n^{β−1/2} e^{−cε} + f(p) e^{−nε}(ε > 1)でバウンドされ、同様に小さい ε に対しても成り立つ。これにより、プライバシーの異なる領域にわたっても安定性が保証される。
- 頻度ベクトルの感度を制御し、適切にキャリブレーションされたノイズを適用することで、微分プライバシーが確保され、プライバシーとユーティリティの両方について理論的保証が得られる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。