Skip to main content
QUICK REVIEW

[論文レビュー] ($k$,$\epsilon$)-Anonymity: $k$-Anonymity with $\epsilon$-Differential Privacy

Naoise Holohan, Spiros Antonatos|arXiv (Cornell University)|Oct 4, 2017
Privacy-Preserving Technologies in Data参考文献 21被引用数 12
ひとこと要約

本稿では、k-匿名性とϵ-微分プライバシーを統合して、データセットにおけるプライバシー保護を強化する統一フレームワークである(k,ϵ)-匿名性を提案する。k-匿名性を準識別子の部分集合に適用し、残りの部分にϵ-微分プライバシーを適用することで、情報損失を低減し、次元の呪いを緩和し、わずか数値のkとϵを用いても、レコードの抑制率が5%未塔、リンクリスクが5%未塔を達成する。

ABSTRACT

The explosion in volume and variety of data offers enormous potential for research and commercial use. Increased availability of personal data is of particular interest in enabling highly customised services tuned to individual needs. Preserving the privacy of individuals against reidentification attacks in this fast-moving ecosystem poses significant challenges for a one-size fits all approach to anonymisation. In this paper we present ($k$,$\epsilon$)-anonymisation, an approach that combines the $k$-anonymisation and $\epsilon$-differential privacy models into a single coherent framework, providing privacy guarantees at least as strong as those offered by the individual models. Linking risks of less than 5\% are observed in experimental results, even with modest values of $k$ and $\epsilon$. Our approach is shown to address well-known limitations of $k$-anonymity and $\epsilon$-differential privacy and is validated in an extensive experimental campaign using openly available datasets.

研究の動機と目的

  • k-匿名性の限界、特に次元の呪いを解消し、微分プライバシーの高コストな情報損失を改善すること。
  • 両者の強みを統合した統一プライバシーモデルの開発。
  • k-匿名性のクラスタ構造を活用して、微分プライバシーにおけるノイズ注入を最小限に抑えることで、情報損失を低減すること。
  • レコードリンクリスクと抑制率を用いて、フレームワークのプライバシー保証を評価すること。
  • 実世界のデータセット上での、統合モデルの実現可能性と制御可能性を示すこと。

提案手法

  • 特定の準識別子サブセットにのみk-匿名性を適用し、同値クラスを形成する。
  • 残りの準識別子にϵ-微分プライバシーを適用し、個々のレコードを保護するため、調整されたノイズを追加する。
  • 信頼度ベースのk-匿名性を用い、各レコードが確率99%以上で少なくともk−1個の他のレコードと区別不能であることを保証する。
  • 抑制予算を導入し、抑制レコード数を制限する。最大で5%を上限とする。
  • k-匿名性から得られるクラスタ構造を活用して、微分プライバシーに必要な次元空間の次元を低減する。
  • OLAおよびMondrianアルゴリズムをk-匿名性の基本手法として用い、残りの属性にϵ-微分プライバシーを拡張する。

実験結果

リサーチクエスチョン

  • RQ1k-匿名性とϵ-微分プライバシーを意味的に統合した単一で整合性のあるプライバシー枠組みとして構築可能か?
  • RQ2両モデルを統合することで、単独で使用する場合と比較して情報損失が低減するか?
  • RQ3フレームワークは、データ利用価値を維持しつつ、どの程度再識別リスクを制限できるか?
  • RQ4異なるデータセットにおいて、kとϵの値を変化させた場合、抑制率はどのように変化するか?
  • RQ5ハイブリッドモデルは、k-匿名性における次元の呪いを緩和し、微分プライバシーにおけるノイズを低減できるか?

主な発見

  • (k,ϵ)-匿名性フレームワークは、すべての評価対象データセットで、きびしい99%信頼度k-匿名性要件下でも、レコード抑制率が5%未塔に抑えられた。
  • 実験全体を通じて、リンクリスクは一貫して5%未塔であり、再識別攻撃に対する強い耐性を示した。
  • OLAベースの匿名化では、(k,ϵ)-匿名性がk-匿名性単独と比較して、14倍から32倍の性能向上を達成した。これは、探索空間の縮小によるものである。
  • Mondrianアルゴリズムでは、ノイズ適用のための追加ループにより実行時間が延長されたが、小さなϵ値では抑制率が5%未塔を維持した。
  • 準識別子空間の次元を効果的に低減し、その結果、微分プライバシー部におけるノイズ量も削減された。
  • kとϵの値を控えめに設定しても、強力なプライバシー保証を維持でき、実世界への適用における実現可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。