Skip to main content
QUICK REVIEW

[論文レビュー] Towards Breaking the Curse of Dimensionality for High-Dimensional Privacy: An Extended Version

Hessam Zakerzadeh, Charų C. Aggarwal|arXiv (Cornell University)|Jan 6, 2014
Privacy-Preserving Technologies in Data参考文献 32被引用数 4
ひとこと要約

本稿では、次元の呪いに起因するプライバシー保護データ公開における性能劣化を軽減するために、高次元データ内の属性間相関を活用した断片化ベースの匿名化手法を提案する。相互情報量を用いてデータを垂直的に断片化し、各断片に対してk匿名性、ℓ多様性、またはt近傍性を独立に適用することで、プライバシーを確保しながらデータの有用性を維持する。この手法は、身元、属性、メンバーシップ情報の漏洩攻撃に対しても耐性を示し、非断片化手法と比較して最大28%高いF値を達成する。

ABSTRACT

The curse of dimensionality has remained a challenge for a wide variety of algorithms in data mining, clustering, classification and privacy. Recently, it was shown that an increasing dimensionality makes the data resistant to effective privacy. The theoretical results seem to suggest that the dimensionality curse is a fundamental barrier to privacy preservation. However, in practice, we show that some of the common properties of real data can be leveraged in order to greatly ameliorate the negative effects of the curse of dimensionality. In real data sets, many dimensions contain high levels of inter-attribute correlations. Such correlations enable the use of a process known as vertical fragmentation in order to decompose the data into vertical subsets of smaller dimensionality. An information-theoretic criterion of mutual information is used in the vertical decomposition process. This allows the use of an anonymization process, which is based on combining results from multiple independent fragments. We present a general approach which can be applied to the k-anonymity, l-diversity, and t-closeness models. In the presence of inter-attribute correlations, such an approach continues to be much more robust in higher dimensionality, without losing accuracy. We present experimental results illustrating the effectiveness of the approach. This approach is resilient enough to prevent identity, attribute, and membership disclosure attack.

研究の動機と目的

  • 次元の呪いに起因する高次元データにおける匿名化効果の低下という課題に対処すること。
  • 特徴選択に依存せずに、貴重な属性を棄却することなく、プライバシー保護公開におけるデータの有用性を維持すること。
  • k匿名性、ℓ多様性、t近傍性モデルを高次元環境に適用可能な汎用的なフレームワークを構築すること。
  • 実世界のデータに内在する相関関係を活用することで、プライバシーと有用性のトレードオフを改善できることを示すこと。

提案手法

  • 相互情報量を用いて、次元を低減するための意味のある属性サブセットに高次元データを垂直的に断片化する。
  • 各断片に対して、k匿名性、ℓ多様性、t近傍性などの標準的なモデルを独立に適用して、プライバシーを確保する。
  • 複数の断片の匿名化結果を後処理で統合し、全体として匿名化されたデータセットを再構築する。
  • 断片化プロセスをガイドし、意味のある属性グループの形成を保証するため、相互情報量を情報理論的基準として用いる。
  • 各属性の情報損失を低減するため、全体の摂動を避けて断片ごとに局所的に匿名化を実施する。
  • 本手法はメタアルゴリズムとして設計されており、任意の既存のk匿名性、ℓ多様性、t近傍性の実装と互換性を持つ。

実験結果

リサーチクエスチョン

  • RQ1実世界の高次元データに内在する属性間相関を活用することで、次元の呪いがデータ匿名化に与える悪影響を軽減できるか?
  • RQ2低次元かつ相関のあるサブセットにデータを垂直的に断片化することで、グローバル匿名化と比較して匿名化データの有用性が向上するか?
  • RQ3断片化ベースのアプローチは、高次元環境下で身元、属性、メンバーシップ情報の漏洩攻撃に対してどの程度のプライバシー保護を維持できるか?
  • RQ4次元数やk匿名性の水準が変化する条件下で、本手法は非断片化匿名化と比較して分類精度(F値)にどの程度の差を示すか?

主な発見

  • Muskデータセットにおいて、断片化ベースのアプローチは非断片化ベースラインと比較して、ℓ多様性匿名化で最大28%高いF値を達成した。
  • ナーブな断片化スキームですら、F値の観点で非断片化匿名化を上回っており、断片設計の簡素化に対しても頑健であることが示された。
  • k匿名性の文脈では、kが増加するに従い、断片化アプローチが非断片化匿名化と比較してF値で最大54%の向上を示した。
  • 断片化環境では次元数が増加してもF値が比較的安定または向上した一方、非断片化匿名化は過剰な摂動により深刻な有用性損失を被った。
  • 断片内での属性固有情報の保持により、身元、属性、メンバーシップ情報の漏洩攻撃に対して効果的に耐性を示した。
  • 結果として、断片化による属性相関の活用によって、理論的な次元の呪いの制限が実際の場面では顕著に緩和されることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。