Skip to main content
QUICK REVIEW

[論文レビュー] An Uncertainty Principle is a Price of Privacy-Preserving Microdata

John M. Abowd, Robert Ashmead|arXiv (Cornell University)|Oct 25, 2021
Privacy-Preserving Technologies in Data参考文献 32被引用数 4
ひとこと要約

本稿は、微分プライバシーにおける不確実性原理を確立し、集計(合計)クエリとサブ集団(ポイント)クエリの間の固有の妥協を定量化する。微データ出力が求められる場合、純粋・近似的・集中的微分プライバシーのいずれにおいても、非微データシステムと比較して誤差境界が対数的または多項式的劣化(最大で log²d または d² 要因)を受けることが示された。PUMS データセットを用いた実証的検証も行われた。

ABSTRACT

Privacy-protected microdata are often the desired output of a differentially private algorithm since microdata is familiar and convenient for downstream users. However, there is a statistical price for this kind of convenience. We show that an uncertainty principle governs the trade-off between accuracy for a population of interest ("sum query") vs. accuracy for its component sub-populations ("point queries"). Compared to differentially private query answering systems that are not required to produce microdata, accuracy can degrade by a logarithmic factor. For example, in the case of pure differential privacy, without the microdata requirement, one can provide noisy answers to the sum query and all point queries while guaranteeing that each answer has squared error $O(1/ε^2)$. With the microdata requirement, one must choose between allowing an additional $\log^2(d)$ factor ($d$ is the number of point queries) for some point queries or allowing an extra $O(d^2)$ factor for the sum query. We present lower bounds for pure, approximate, and concentrated differential privacy. We propose mitigation strategies and create a collection of benchmark datasets that can be used for public study of this problem.

研究の動機と目的

  • 微分プライバシーのアルゴリズムが、単にノイズののったクエリ回答を出力するのではなく、微データを出力することを要請した場合の統計的コストを特定・形式化すること。
  • この要請が、集団レベルの合計クエリとサブ集団のポイントクエリの間で避けがたい精度の妥協をもたらすことを示すこと。
  • 微データの出力が義務付けられる状況下で、純粋・近似的・集中的微分プライバシーの下での誤差劣化の理論的下界を確立すること。
  • さまざまなノイズ機構を用いて、実世界の PUMS データセットを用いた実証的ベンチマークにより理論的発見を検証すること。
  • この妥協を緩和する戦略を提案し、この問題を研究するための公開ベンチマークデータセットを提供すること。

提案手法

  • 主に各クエリの期待二乗誤差を指標として、先行研究で用いられる同時誤差や外れ値誤差とは区別する。
  • d 個の互いに素なポイントクエリと、それらを集計する一つの合計クエリを定義し、国勢調査データや選挙区再編のような実世界のユースケースをモデル化する。
  • 微データの出力が義務付けられる状況下で、純粋・近似的・集中的微分プライバシーの下で、合計クエリとポイントクエリの両方の誤差に関する理論的下界を導出する。
  • ρ = 0.005 のガウス機構を用いてプライバシー保護された微データを生成し、複数のアルゴリズム(olsalg, nnlsalg, maxalg, seqalg, weightalg)間でのクエリ誤差を比較する。
  • 各クエリタイプとアルゴリズムごとに計算された二乗誤差と標準偏差を含む、PUMS データセットの公開ベンチマークスイートを構築する。
  • 元のノイズののったクエリ回答と、合成された微データから導出されたクエリ誤差との差を分析し、誤差の拡大を定量化する。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシーのアルゴリズムが、単にノイズののったクエリ回答を出力するのではなく、微データを出力することを要請した場合の、根本的な精度コストは何か?
  • RQ2微データの公開が求められる場合、微分プライバシー下で合計クエリの誤差境界とその構成ポイントクエリの誤差境界にどのような影響を与えるか?
  • RQ3微データの出力が義務付けられる状況下で、純粋・近似的・集中的微分プライバシーの下での誤差劣化に理論的下界を確立できるか?
  • RQ4実世界の微データ合成手法は、直接的なノイズののったクエリ公開と比較して、どの程度誤差を拡大するか?
  • RQ5集計クエリとサブ集団クエリの精度の間の誤差妥協を軽減するための緩和戦略は何か?

主な発見

  • 微データ出力が求められる場合、誤差境界に対数的または多項式的劣化が生じる。純粋微分プライバシー下では、合計クエリの誤差が O(d²) 要因で増加する可能性がある一方、ポイントクエリの誤差は log²d で増加する。
  • 微データの出力が不要であれば、合計クエリとポイントクエリの両方が O(1/ε²) の二乗誤差を達成可能であるが、微データが出力される場合、片方のクエリタイプがより高い誤差ペナルティを負わなければ、この保証は失われる。
  • PUMS データセットを用いた実証的結果から、微データの合成は元のノイズののった測定値と比較して顕著に高いクエリ誤差をもたらすことが判明。二乗誤差はクエリとアルゴリズムに応じて約 300 から 7,000 を超える範囲で変動した。
  • ρ = 0.005 のガウス機構により、合計クエリの二乗誤差は 323.4 から 1,661.8 の間で変動し、標準偏差は ±12.2 から ±283.4 の範囲であった。これは、データセットやアルゴリズムによって誤差のばらつきが顕著に異なることを示している。
  • 元の測定誤差と、合成微データから導出された誤差との乖離を確認したところ、微データの合成が、特にポイントクエリにおいて体系的な誤差拡大をもたらすことが判明した。
  • 本研究で公開されたベンチマークデータセットは、誤差拡大がランダムではなく、クエリ構造と使用されたプライバシー機構に強く関連した予測可能なパターンに従うことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。