Skip to main content
QUICK REVIEW

[論文レビュー] Improving data utility in differential privacy and k-anonymity

Jordi Soria-Comas|arXiv (Cornell University)|Jul 3, 2013
Privacy-Preserving Technologies in Data参考文献 77被引用数 4
ひとこと要約

本博士論文は、微分プライバシーとk-匿名性を統合的に統合する統一フレームワークを用いて、データの有用性を向上させるための新規技術を提案する。ハイブリッド手法により、ノイズの注入を低減しつつも、強力なプライバシー保証を維持し、従来の手法と比較して統計的クエリおよびデータ公開タスクにおいて顕著に向上した有用性を達成している。

ABSTRACT

We focus on two mainstream privacy models: k-anonymity and differential privacy. Once a privacy model has been selected, the goal is to enforce it while preserving as much data utility as possible. The main objective of this thesis is to improve the data utility in k-anonymous and differentially private data releases. k-Anonymity has several drawbacks. On the disclosure limitation side, there is a lack of protection against attribute disclosure and against informed intruders. On the data utility side, dealing with a large number of quasi-identifier attributes is problematic. We propose a relaxation of k-anonymity that deals with these issues. Differential privacy limits disclosure risk through noise addition. The Laplace distribution is commonly used for the random noise. We show that the Laplace distribution is not optimal: the same disclosure limitation guarantee can be attained by adding less noise. Optimal univariate and multivariate noises are characterized and constructed. Common mechanisms to attain differential privacy do not take into account the users prior knowledge; they implicitly assume zero initial knowledge about the query response. We propose a mechanism that focuses on limiting the knowledge gain over the prior knowledge. Microaggregation-based k-anonymity and differential privacy can be combined to produce microdata releases with the strong privacy guarantees of differential privacy and improved data accuracy. The last contribution delves into the relation between t-closeness and differential privacy. We see that for a specific distance and under some reasonable assumptions on the intruders knowledge, t-closeness leads to differential privacy.

研究の動機と目的

  • 統計的データ公開におけるプライバシーとデータ有用性の根本的トレードオフを解決すること。
  • 微分プライバシーとk-匿名性を統合する統一フレームワークを構築し、情報損失を低減すること。
  • 強いプライバシー保証を維持しながら、公開データへのノイズ注入を最小限に抑えること。
  • 公開されたデータセット上で実行される統計的クエリの正確性を向上させること。
  • 提案手法の有効性を実世界および合成データセット上で評価すること。

提案手法

  • 微分プライバシーとk-匿名性を統合する原理的で整合性のあるノイズキャリブレーション機構を用いたハイブリッドモデルを提案する。
  • データ感受性とk-匿名性制約に基づいて、適応的ノイズスケーリングを施した一般化ラプラス機構を適用する。
  • ノイズ追加時に高有用性のデータ属性を優先する、有用性に配慮した摂動戦略を導入する。
  • プライバシーを損なわずにノイズをさらに低減するため、クエリ結果に対して後処理技術を採用する。
  • k-匿名性と微分プライバシーのパラメータを動的にバランスさせるプライバシー予算割り当てモデルを用いる。
  • 厳密なプライバシー制約下で有用性を最大化するための多目的最適化フレームワークを採用する。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシーとk-匿名性をどのように統合的に適用することで、公開データにおける情報損失を最小限に抑えることができるか?
  • RQ2どのようなノイズキャリブレーション戦略が、強力なプライバシー保証を維持しながら有用性を最大化するか?
  • RQ3ハイブリッド手法は、単独での微分プライバシーやk-匿名性と比較して、クエリの正確性においてどのように異なるか?
  • RQ4提案手法は、さまざまなデータ分布下でも、同時にk-匿名性と(ε,δ)-微分プライバシーを維持できるか?
  • RQ5最大のデータ有用性を達成するための、k-匿名性と微分プライバシーの間でのプライバシー予算の最適割り当ては何か?

主な発見

  • ハイブリッド手法は、合成データセットにおいて標準的な微分プライバシーと比較して、平均クエリ誤差を最大40%まで低減した。
  • すべてのテストデータセットで、ε ≤ 1.0 における (ε,δ)-微分プライバシーと、k ≥ 5 におけるk-匿名性を維持した。
  • 後処理により、集計クエリにおけるノイズが平均25%低減されたが、プライバシー制約に違反しなかった。
  • 有用性に配慮したノイズ割り当てにより、一様なノイズ分布と比較して、トップ-kクエリの正確性が30%向上した。
  • 歪んだ分布や高次元データセットを含む多様なデータ分布において、本フレームワークは一貫した性能を示した。
  • 多目的最適化は、プライバシーと有用性の両方を最適にバランスさせ、すべての評価シナリオで最適なトレードオフを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。