Skip to main content
QUICK REVIEW

[論文レビュー] An Information-theoretic Approach to Privacy

Lalitha Sankar, S. Raj Rajagopalan|arXiv (Cornell University)|Oct 1, 2010
Privacy-Preserving Technologies in Data参考文献 21被引用数 6
ひとこと要約

本稿は、レート歪み理論と同値化(equivocation)を用いて、データベースにおけるデータの有用性とプライバシーの根本的トレードオフを定量化する情報理論的枠組みを導入する。これは、情報漏洩の最小化が有用性の最大化と同時にプライバシーの最大化をもたらす、きわめてタイトな解析的境界を確立しており、ヤマモトの歪み-同値化トレードオフをプライバシー保護型データ公開に一般化したものである。

ABSTRACT

Ensuring the usefulness of electronic data sources while providing necessary privacy guarantees is an important unsolved problem. This problem drives the need for an overarching analytical framework that can quantify the safety of personally identifiable information (privacy) while still providing a quantifable benefit (utility) to multiple legitimate information consumers. State of the art approaches have predominantly focused on privacy. This paper presents the first information-theoretic approach that promises an analytical model guaranteeing tight bounds of how much utility is possible for a given level of privacy and vice-versa.

研究の動機と目的

  • データ公開におけるプライバシーと有用性のトレードオフを定量化する普遍的で解析的な枠組みを構築すること。ヒューリスティック的またはアプリケーション固有の手法にとどまらない。
  • 公開属性とプライベート属性を併せ持つデータベースをモデル化し、アプリケーションに依存しない有用性とプライバシーの指標を可能にすること。
  • 歪みと同値化といった情報理論的ツールを用いて、達成可能な有用性-プライバシートレードオフの根本的限界を確立すること。
  • ヤマモトの歪み-同値化トレードオフをデータ匿名化およびプライバシー保護型データ公開の文脈に拡張すること。
  • 外部知識や攻撃者の推論能力を反映する側情報モデルを提供すること。

提案手法

  • 各行を独立同分布に従う離散的ソース X からの抽出とみなすデータベースをソースモデルとして定式化し、プライベートおよびパブリック属性を有する。
  • 有用性の指標として一般化されたハミング歪みを用い、誤った再構築確率として定義される:D = Pr{X ≠ X̂}。
  • プライバシーは、公開されたバージョン X̂ が与えられたもとでの元のデータ X に関する不確実性、すなわち同値化 H(X|X̂) として定義する。
  • 率歪み理論を適用し、歪み(有用性)と同値化(プライバシー)の根本的トレードオフを導出する。
  • 情報漏洩を最小化する最適出力分布を達成するために、逆転水割り(upside-down waterfilling)を用いる。
  • 連続的かつ共分散ガウス分布に従うソースへと枠組みを拡張し、歪みを加法的ノイズチャネルでモデル化し、同値化の閉形式表現を導出する。

実験結果

リサーチクエスチョン

  • RQ1データベースから洗練されたデータを公開する際、有用性-プライバシートレードオフの根本的限界は何か?
  • RQ2特定のアプリケーションやデータタイプに依存しない方法でプライバシーをどのように定量化できるか?
  • RQ3率歪み理論をプライバシーを同値化としてモデル化するために適応可能か? その場合の境界は何か?
  • RQ4外部知識(側情報)は達成可能なプライバシー-有用性トレードオフにどのように影響するか?
  • RQ5カテゴリカルデータにおける情報抑制(例:集計)とプライバシー最大化の関係は何か?

主な発見

  • K=1 の離散的ソースに対して、最大同値化は Γ(D) = -D̄ log D̄ - |X̂_supp| λ log λ - Σ p_k log p_k で与えられ、ここで D̄ = 1-D であり、λ は水割り条件によって決定される。
  • 最適なデータ洗練戦略は、逆転水割りを用いて出力分布を平坦化し、高確率および低確率の値を抑制することで情報伝達を最小化し、プライバシーを最大化する。
  • 相関係数 ρ の共分散ガウス分布に対して、最大同値化は Γ(D) = σ_Y²[(1-ρ²) + ρ²D/σ_X²] で与えられ、D ≤ σ_X² の範囲で有効である。
  • 完全な有用性(D=0)では、最大プライバシーは X に対して独立な Y の部分のエントロピーに制限されるが、最大歪み(D=σ_X²)ではプライバシーは H(Y) に達する。
  • 与えられた有用性レベルにおいて情報漏洩を最小化することは、プライベートデータのプライバシーを最大化することに等しく、きわめてタイトな双対性を確立する。
  • 本手法はヤマモトの歪み-同値化トレードオフをプライバシー文脈に一般化し、プライバシー保護型データ公開のための普遍的で解析的なモデルを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。