[論文レビュー] The Price of Differential Privacy under Continual Observation
本稿は、2つの基本的な問題—MaxSumとSumSelect—に対する微分プライバシーを満たす継続的リリース機構の誤差に関する、最初の強力な下界を確立している。その結果、最悪ケースの誤差はバッチモデルと比較してΩ̃(T^{1/3})倍大きくなり、これまでに知られていた多項式対数的境界を超える顕著な差が生じる。著者らはまた、適応的継続的リリースモデルにおいて、一致する上界を提供しており、この誤差のトレードオフは、より強いプライバシー要件のもとでも避けがたいことを示している。
We study the accuracy of differentially private mechanisms in the continual release model. A continual release mechanism receives a sensitive dataset as a stream of $T$ inputs and produces, after receiving each input, an accurate output on the obtained inputs. In contrast, a batch algorithm receives the data as one batch and produces a single output. We provide the first strong lower bounds on the error of continual release mechanisms. In particular, for two fundamental problems that are widely studied and used in the batch model, we show that the worst case error of every continual release algorithm is $ ilde Ω(T^{1/3})$ times larger than that of the best batch algorithm. Previous work shows only a polylogarithimic (in $T$) gap between the worst case error achievable in these two models; further, for many problems, including the summation of binary attributes, the polylogarithmic gap is tight (Dwork et al., 2010; Chan et al., 2010). Our results show that problems closely related to summation -- specifically, those that require selecting the largest of a set of sums -- are fundamentally harder in the continual release model than in the batch model. Our lower bounds assume only that privacy holds for streams fixed in advance (the "nonadaptive" setting). However, we provide matching upper bounds that hold in a model where privacy is required even for adaptively selected streams. This model may be of independent interest.
研究の動機と目的
- バッチモデルと比較して、継続的リリースモデルにおける微分プライバシーの精度コストを理解すること。
- 特に最大和の選択を要する問題に関連する誤差境界の根本的限界を特定すること。
- 非適応的および適応的入力設定下での継続的リリース機構について、既知の上界と下界のギャップを埋めること。
- 適応的プライバシー要件を満たす上界を構築し、下界がより強い脅威モデルでもタイトであることを示すこと。
- 微分プライバシー下でのリアルタイムデータ分析におけるプライバシーと精度のトレードオフを形式化し、分析すること。
提案手法
- バッチモデルにおける1ウェイマージナルクエリ問題から、継続的モデルにおけるMaxSumおよびSumSelect問題への還元を用いて下界を証明する。
- 敵対的入力ストリームを巧みに設計することで、固定(非適応的)ストリームであっても、継続的機構に高い誤差を強いる。
- 2分木機構を用い、トップ-k選択に指数関数的機構を周期的に再計算することで、適応的継続的リリース機構を設計する。
- ガウス分布およびラプラス分布のための濃度不等式(例:集中不等式)を適用し、プライバシー制約下での機構の誤差を評価する。
- zCDPおよび純粋DPのためのプライバシー合成定理を用いて、入力が適応的に選ばれても、機構が微分プライバシーを満たすことを証明する。
- 再計算回数とノイズレベルのバランスを最適化することで、タイトな漸近的誤差レートを得る。
実験結果
リサーチクエスチョン
- RQ1バッチモデルと比較して、継続的リリースモデルにおける微分プライバシーの根本的精度コストは何か?
- RQ2和関連の問題において、継続的モデルとバッチモデルのギャップがTの多項式対数的境界を上回る可能性はあるか?
- RQ3MaxSumおよびSumSelect問題におけるΩ̃(T^{1/3})の誤差下界は、適応的入力選択のもとでもタイトか?
- RQ4適応的入力ストリームを満たすプライバシーを維持しつつ、下界誤差と一致する上界を構築できるか?
- RQ5適応的継続的リリースモデルにおいて、誤差はプライバシーパラメータ(例:ρ, ε)および問題パラメータ(例:d, T)にどのように依存するか?
主な発見
- MaxSumに対する任意の微分プライバシーを満たす継続的リリース機構の最悪ケース誤差は、最良のバッチアルゴリズムと比較してΩ̃(T^{1/3})倍大きい。
- SumSelectに対しても、誤差はバッチモデルと比較してΩ̃(T^{1/3})倍大きい。これは、最大和の選択における根本的な困難さを示している。
- 非適応的設定(入力が事前に固定される)でも下界が成立しており、問題の本質的難易度を示している。
- 適応的継続的リリースモデルにおいて、一致する上界が達成されており、Ω̃(T^{1/3})の誤差ギャップがタイトであることが示された。
- zCDPモデルでは誤差がO(min{T, T^{1/3} log^{2/3}(dT)/ρ^{1/3}})、純粋DPではO(√(T log T)/ε)であり、下界と対数要因を除いて一致する。
- これらの結果は、ストリーミング公共保健データにおいて最も一般的な疾患を特定するような、和の選択を要する問題が、継続的設定下でプライバシー保護を実現するのが根本的に難しいことを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。