Skip to main content
QUICK REVIEW

[論文レビュー] Constrained Differential Privacy for Count Data

Graham Cormode, Tejas Kulkarni|arXiv (Cornell University)|Oct 2, 2017
Privacy-Preserving Technologies in Data参考文献 14被引用数 3
ひとこと要約

本稿は、線形計画法によって導かれる最適化機構における病理的行動(ギャップ:特定の出力を報告しないこと、スパイク:特定の値を過剰に報告すること)を排除する、カウントクエリの制約付き微分プライバシー機構を提案する。公平性や単調性といった構造的性質を強制することで、著者らは最適化機構が非常に少数に制限されることを示し、新規の機構とよく知られた幾何機構が含まれる。実験により、制約付き機構が制約なしのものよりも優れていることが示され、特に高いプライバシー予算と非極端な入力分布下で顕著である。

ABSTRACT

Concern about how to aggregate sensitive user data without compromising individual privacy is a major barrier to greater availability of data. The model of differential privacy has emerged as an accepted model to release sensitive information while giving a statistical guarantee for privacy. Many different algorithms are possible to address different target functions. We focus on the core problem of count queries, and seek to design mechanisms to release data associated with a group of n individuals. Prior work has focused on designing mechanisms by raw optimization of a loss function, without regard to the consequences on the results. This can leads to mechanisms with undesirable properties, such as never reporting some outputs (gaps), and overreporting others (spikes). We tame these pathological behaviors by introducing a set of desirable properties that mechanisms can obey. Any combination of these can be satisfied by solving a linear program (LP) which minimizes a cost function, with constraints enforcing the properties. We focus on a particular cost function, and provide explicit constructions that are optimal for certain combinations of properties, and show a closed form for their cost. In the end, there are only a handful of distinct optimal mechanisms to choose between: one is the well-known (truncated) geometric mechanism; the second a novel mechanism that we introduce here, and the remainder are found as the solution to particular LPs. These all avoid the bad behaviors we identify. We demonstrate in a set of experiments on real and synthetic data which is preferable in practice, for different combinations of data distributions, constraints, and privacy parameters.

研究の動機と目的

  • カウントクエリのための既存の微分プライバシー機構に見られる病理的行動(ギャップとスパイク)を是正すること。これは、損失関数の非制約的最適化に起因する。
  • 機構が良好に動作し、極端な出力バイアスを回避するための望ましい構造的性質(例:公平性、弱的誠実性、単調性)を同定および形式化すること。
  • これらの性質の任意の組み合わせを線形計画法を用いて制約として導入できることを示し、L0損失関数下で少数の最適化機構が得られることを示すこと。
  • さまざまな入力分布、グループサイズ、プライバシーパラメータの下で、制約付き機構と標準的機構(例:幾何、一様)の実用的性能を評価すること。
  • 制約付き機構、特に新規の機構と制約付き指数機構が、実世界の設定において、特に高いプライバシー予算下で幾何機構を一貫して上回ることを示すこと。

提案手法

  • 著者らは、機構設計を制約し、病理的出力分布を回避するための7つの構造的性質(例:公平性、弱的誠実性、単調性)を定義する。
  • 微分プライバシーの線形計画法フレームワークを拡張し、これらの性質を制約として組み込み、L0誤差(真の入力からd以上逸脱する出力の確率)を最小化する。
  • 得られた最適化機構は、望ましい性質を強制する制約付き線形計画問題を解くことで導出され、一意に異なる少数の最適化機構が得られる。
  • 公平性と単調性の制約下で最適な新規の機構を導入し、これは幾何機構とは異なる。
  • 実験では、実データと合成データを用い、入力分布(pでパrameter化)、グループサイズ(n)、プライバシーパラメータ(α)を変化させ、L0,d、L0,1、およびRMSE誤差を測定する。
  • 評価では、制約付き機構(EM、WM)を幾何機構(GM)および一様機構(UM)と比較し、結果を30回の繰り返し平均化することで分散を低く保つ。

実験結果

リサーチクエスチョン

  • RQ1カウントクエリのための微分プライバシー機構における病理的行動(ギャップとスパイク)を排除するための構造的制約を形式的に定義可能か?
  • RQ2L0損失関数下で、どの構造的性質の組み合わせが最適化機構を導き、そのような異なる最適化機構はいくつ存在するか?
  • RQ3さまざまな入力分布とプライバシー予算において、制約付き機構は広く使われている幾何機構と比べて利便性に優れているか?
  • RQ4公平性または単調性を強制することで、入力分布の偏りに対して耐性が高まり、特に高いプライバシーパラメータ下でその効果が顕著になるか?
  • RQ5RMSEと尾部誤差の観点から、幾何機構が一様機構や制約付き機構を上回らない条件は何か。特に、どのような状況で幾何機構が単純な機構を下回るのか?

主な発見

  • 幾何機構は、特に高いプライバシー予算(α > 0.7)下では、真の入力に近い値を報告しないことが多く、場合によってはランダム推測よりも劣ることがある。
  • 公平性と単調性を強制する制約付き機構(例:EMおよびWM)は、入力分布が入力空間全体に広がっている場合(p ≈ 0.5)に、幾何機構を一貫して上回る。
  • 高いプライバシー予算(α = 0.91)下では、新規の制約付き指数機構(EM)が、すべてのグループサイズと入力分布で幾何機構よりも低いRMSEを達成する。
  • 入力分布が偏っている場合(p ≈ 0 または 1)には幾何機構がより優れるが、制約付き指数機構は依然として優れた性能を維持し、一様機構を上回り、しばしば幾何機構をも上回る。
  • 公平性を強制する制約付き機構(WM)は、入力分布の偏りへの感受性を低くし、非極端な状況下で幾何機構よりも耐性がある。
  • L0,d誤差の分析から、制約付き指数機構(EM)は尾部確率質量を顕著に低減しており、特にdが大きい場合に顕著で、dが増加してもその優位性を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。