Skip to main content
QUICK REVIEW

[論文レビュー] Subspace Differential Privacy

Jie Gao, Ruobin Gong|arXiv (Cornell University)|Aug 26, 2021
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

本稿では、人口合計や時空間的制約といった必須のデータ不変量を差分プライバシー機構の設計段階から統合する、部分空間差分プライバシーというフレームワークを提案する。標準的な機構(例:ラプラス分布やガウス分布からのノイズ)を不変量の部分空間に射影することにより、偏りのない、透明性のある、後処理を要しない出力を保証するとともに、形式的なプライバシー保証を維持する。

ABSTRACT

Many data applications have certain invariant constraints due to practical needs. Data curators who employ differential privacy need to respect such constraints on the sanitized data product as a primary utility requirement. Invariants challenge the formulation, implementation, and interpretation of privacy guarantees. We propose subspace differential privacy, to honestly characterize the dependence of the sanitized output on confidential aspects of the data. We discuss two design frameworks that convert well-known differentially private mechanisms, such as the Gaussian and the Laplace mechanisms, to subspace differentially private ones that respect the invariants specified by the curator. For linear queries, we discuss the design of near-optimal mechanisms that minimize the mean squared error. Subspace differentially private mechanisms rid the need for post-processing due to invariants, preserve transparency and statistical intelligibility of the output, and can be suitable for distributed implementation. We showcase the proposed mechanisms on the 2020 Census Disclosure Avoidance demonstration data, and a spatio-temporal dataset of mobile access point connections on a large university campus.

研究の動機と目的

  • 人口合計や合計制約といったハードな不変量を差分プライバシーによるデータ公開で強制する際の課題に取り組むこと。これによりバイアスが生じないようにする。
  • 後処理の必要性を排除すること。後処理はしばしば結果を歪め、プライバシー保証の解釈を曇らせるからである。
  • 統計的に透明でバイアスがなく、分散型デプロイメントに適したメカニズムを開発すること。
  • 連続表や時系列集計のような、線形等式制約を満たさなければならない状況への差分プライバシーの拡張を図ること。
  • 2020年国勢調査DASデータや大学のWiFi時空間データセットといった実世界のデータセットを用いて、フレームワークの有用性と正確性を実証すること。

提案手法

  • 線形等式不変量をメカニズム設計段階に明示的に組み込む新しいプライバシーモデル「部分空間差分プライバシー」を提唱する。
  • 標準的な差分プライバシー機構(例:ラプラス、ガウス)を部分空間DP準拠に変換する2つの一般的なフレームワーク(射影と拡張)を設計する。
  • 制約なしの分布から抽出したノイズ変数を不変量の部分空間に射影することで、最終出力が不変量の部分空間内に位置することを保証する。
  • 線形クエリの文脈では、部分空間制約下で平均二乗誤差を最小化する近似的最適なメカニズムを導出する。
  • プライバシーとバイアスのない性質を理論的に保証する、主な構成要素としての射影ラプラスおよび射影ガウスメカニズムを採用する。
  • 後処理ではなく設計段階での距離最小化を採用することで、データ依存のバイアスを回避する。

実験結果

リサーチクエスチョン

  • RQ1差分プライバシーを、人口合計や合計制約といったハードな不変量を尊重する形に正式に拡張する方法は何か?
  • RQ2ノイズ注入後に不変量を強制する場合、後処理がバイアスおよびプライバシー解釈に与える影響は何か?
  • RQ3線形等式制約を満たしつつもバイアスのない差分プライバシー機構を設計することは可能か?
  • RQ4提案されたメカニズムの誤差スケールは、Census DASのような既存のシステムと比較してどうなるか?
  • RQ5不変量をメカニズム設計段階に埋め込むことの統計的および実装上の利点は何か?

主な発見

  • 提案された部分空間差分プライバシー機構は、2020年国勢調査DASで用いられたTopDownアルゴリズムとは異なり、明確にバイアスのないことが証明されている。実際、真の人口規模と誤差の間に系統的な負の相関が観察されている。
  • 2020年国勢調査のデモデータにおいて、48件の州レベル回帰分析のうち11件で、DAS誤差と対数人口規模との間に統計的に有意な負の傾きが観察された。これは明確なバイアストレンドを示している。
  • イリノイ州の郡レベルに適用した射影ラプラスメカニズムでは、このようなバイアストレンドが認められず、誤差はバイアスのない射影された確率変数に起因している。
  • 時空間WiFiデータセットにおいて、射影ガウスメカニズムは要素ごとの誤差の中央値が0.88を示し、90%分位数は0.86から0.91の間であった。
  • 50回の繰り返しにおいて、誤差スケールは一貫して維持され、後処理を一切行わずとも統計的に解釈可能な結果が得られた。
  • 不変量がメカニズムの設計段階から組み込まれているため、後処理に起因するプライバシー漏洩の懸念を回避できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。