Skip to main content
QUICK REVIEW

[論文レビュー] Slicing: A New Approach to Privacy Preserving Data Publishing

Tiancheng Li, Ninghui Li|ArXiv.org|Sep 12, 2009
Privacy-Preserving Technologies in Data参考文献 29被引用数 8
ひとこと要約

この論文は、垂直方向(相関が高い属性を列にグループ化)および水平方向(タプルをバケツにクラスタリング)にデータを分割することで、列内での属性相関を保持するとともに、列間の関連を断つ、プライバシー保護型データ匿名化技術「スライシング」を紹介する。スライシングは、一般化およびバケツ化よりもデータの有用性に優れ、特に高次元データセットにおいて、属性漏洩およびメンバーシップ漏洩の両方を効果的に防止する。

ABSTRACT

Several anonymization techniques, such as generalization and bucketization, have been designed for privacy preserving microdata publishing. Recent work has shown that generalization loses considerable amount of information, especially for high-dimensional data. Bucketization, on the other hand, does not prevent membership disclosure and does not apply for data that do not have a clear separation between quasi-identifying attributes and sensitive attributes. In this paper, we present a novel technique called slicing, which partitions the data both horizontally and vertically. We show that slicing preserves better data utility than generalization and can be used for membership disclosure protection. Another important advantage of slicing is that it can handle high-dimensional data. We show how slicing can be used for attribute disclosure protection and develop an efficient algorithm for computing the sliced data that obey the l-diversity requirement. Our workload experiments confirm that slicing preserves better utility than generalization and is more effective than bucketization in workloads involving the sensitive attribute. Our experiments also demonstrate that slicing can be used to prevent membership disclosure.

研究の動機と目的

  • 高次元マイクロデータにおいて、一般化およびバケツ化の限界を克服し、データの有用性を保ちつつプライバシー侵害を防止すること。
  • 相関する属性のグループ内で属性相関を維持するとともに、相関のない属性間のリンクを遮断することで再識別リスクを低減する技術を開発すること。
  • 既存の手法が包括的に対応できない、属性漏洩(ℓ-多様性による対策)およびメンバーシップ漏洩の両方を保護するソリューションを提供すること。
  • 意味のある相関を保持し、情報損失を最小限に抑えることで、匿名化されたデータに対する有効なデータ分析を可能にすること。
  • スライシングが実世界のワークロードにおいて、一般化よりも優れた有用性を示し、バケツ化よりも高いプライバシー保護を実現することを実証すること。

提案手法

  • 垂直分割では、属性の相関強度に基づいて属性を列にグループ化し、相関が高い属性を同一列にまとめる。これにより、データの有用性が保持される。
  • 水平分割では、タプルをバケツにクラスタリングし、各バケツに同一のQI(準識別子)値を持つタプルの集合が含まれる。これにより、kアナニマスティックな保護が可能になる。
  • 各バケツ内では、各列の値がランダムに並び替えられるため、列間の関連が断たれ、属性漏洩およびメンバーシップ漏洩のリスクが低減される。
  • ℓ-多様性を満たすために、各バケツに少なくともℓ個の異なる感応的属性値が存在することを保証することで、属性漏洩を防止する。
  • ℓ-多様性要件を満たしつつ情報損失を最小限に抑えるスライスデータを計算するための効率的なアルゴリズムが開発された。
  • 一般化が仮定する一様分布を避ける一方で、バケツレベルで属性間相関を保持するが、バケツ化とは異なり、跨る属性相関を維持する。

実験結果

リサーチクエスチョン

  • RQ1高次元データセットにおいて、一般化よりも高いデータ有用性を保ちつつ、属性漏洩を防止できるデータ匿名化技術は存在するか?
  • RQ2スライシングは、バケツ化に存在する脆弱性であるメンバーシップ漏洩を効果的に防止できるか?
  • RQ3感応的属性を含む実世界のワークロードにおいて、スライシングは一般化およびバケツ化と比較して、有用性およびプライバシー保護の両面で優れているか?
  • RQ4スライシングは、準識別子と感応的属性の間の属性相関を維持できるか?これはバケツ化では失われる。
  • RQ5属性が複数の列に重複して現れる「重複スライシング」を許容する場合、プライバシーと有用性のトレードオフはどのように変化するか?

主な発見

  • スライシングは、列内での属性相関の保持により、特に高次元データセットにおいて、一般化よりも顕著に高いデータ有用性を実現する。
  • 感応的属性を含むワークロードにおいて、スライシングはバケツ化を上回る性能を示す。これは、準識別子と感応的属性の間の相関を維持しているためである。
  • スライシングはメンバーシップ漏洩を効果的に防止する。一方、バケツ化は元のQI値が公開されるため、このような攻撃に対して脆弱である。
  • 実験結果から、スライシングは一般化よりも高い有用性を維持し、感応的属性を含むワークロードにおけるプライバシー保護の観点でもバケツ化を上回ることが確認された。
  • スライシングにおけるランダムなタプルグループ化は、メンバーシップ漏洩防止にあまり効果がなく、今後の研究ではより知的なバケツ化アルゴリズムの開発が求められる。
  • スライシングは、属性が複数の列に重複して現れる「重複スライシング」に拡張可能であり、有用性の向上が見込めるが、プライバシー解析の複雑性が増加する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。