Skip to main content
QUICK REVIEW

[論文レビュー] Enabling Multi-level Trust in Privacy Preserving Data Mining

Yaping Li, Minghua Chen|arXiv (Cornell University)|Apr 4, 2011
Privacy-Preserving Technologies in Data参考文献 33被引用数 5
ひとこと要約

本稿では、複数の信頼レベルに対応するための、マルチレベル信頼プライバシー保護型データマイニング(MLT-PPDM)を提案する。データ所有者は、異なる信頼レベルに応じて、それぞれ異なるノイズを加えたデータコピーを生成できる。ノイズ同士の相関関係を、'コーナーウェーブ'特性を持つ共分散行列を用いて制御することで、攻撃者が多様性攻撃によって元のデータをより正確に再構築する利点を得るのを防ぎ、どの1つのコピーを使用しても同等以上の推論精度が得られないように保証する。

ABSTRACT

Privacy Preserving Data Mining (PPDM) addresses the problem of developing accurate models about aggregated data without access to precise information in individual data record. A widely studied \emph{perturbation-based PPDM} approach introduces random perturbation to individual values to preserve privacy before data is published. Previous solutions of this approach are limited in their tacit assumption of single-level trust on data miners. In this work, we relax this assumption and expand the scope of perturbation-based PPDM to Multi-Level Trust (MLT-PPDM). In our setting, the more trusted a data miner is, the less perturbed copy of the data it can access. Under this setting, a malicious data miner may have access to differently perturbed copies of the same data through various means, and may combine these diverse copies to jointly infer additional information about the original data that the data owner does not intend to release. Preventing such \emph{diversity attacks} is the key challenge of providing MLT-PPDM services. We address this challenge by properly correlating perturbation across copies at different trust levels. We prove that our solution is robust against diversity attacks with respect to our privacy goal. That is, for data miners who have access to an arbitrary collection of the perturbed copies, our solution prevent them from jointly reconstructing the original data more accurately than the best effort using any individual copy in the collection. Our solution allows a data owner to generate perturbed copies of its data for arbitrary trust levels on-demand. This feature offers data owners maximum flexibility.

研究の動機と目的

  • 単一の信頼レベルに依存する従来の摂動ベースのPPDMを、複数の信頼レベル環境をサポートするように拡張すること。
  • 複数の摂動済みコピーにアクセス可能なデータマイナーが、多様性攻撃を実行して元のデータをより正確に再構築するリスクに対処すること。
  • 異なる信頼レベルのコピー間で、いかなる共同再構築も得られないようにするノイズ相関メカニズムを設計すること。
  • データ所有者が最大限の柔軟性を確保できるように、任意の信頼レベルで摂動済みデータコピーをオンデマンドで生成できるようにすること。

提案手法

  • 本手法は、'コーナーウェーブ'構造を示す carefully 設計された共分散行列を用いて、信頼レベル間で摂動を相関付ける、加法的ガウスノイズを用いる。
  • ノイズは、平均ベクトルと、必要な相関関係を強制する共分散行列を持つ多変量正規分布から生成される。
  • 本手法により、複数のコピーにアクセス可能な任意のデータマイナーの共同推論能力は、最小の摂動を加えた1つのコピーのみを使用する場合よりも優れたものにはならないことが保証される。
  • 3つのアルゴリズムが提案される:1つは独立ノイズ(ベースライン)、残り2つは相関ノイズ用で、特にアルゴリズム3は信頼レベルのマッピングにおいて最大の柔軟性を提供する。
  • 信頼レベルと摂動強度の間には1対1の対応関係が確立され、ノイズ共分散が多様性利得を防ぐように構造化される。
  • 理論的分析により、プライバシーの目的が、最良の個別コピーの再構築精度に制限される条件下で、多様性攻撃に対して耐性があることが証明されている。

実験結果

リサーチクエスチョン

  • RQ1摂動ベースのPPDMは、プライバシーを損なわせることなく、複数の信頼レベルをサポートできるか?
  • RQ2異なる摂動度のコピー間でノイズを相関させることで、共同再構築攻撃をどのように防げるか?
  • RQ3複数の摂動済みコピー間で、いかなる多様性利得も生じない理論的条件は何か?
  • RQ4提案手法は、強力なプライバシー保証を維持したまま、効率的に実装可能か?
  • RQ5実用的利便性とスケーラビリティの観点から、相関ノイズ手法は独立ノイズ手法と比較してどのように性能を発揮するか?

主な発見

  • コーナーウェーブ共分散行列を用いた本手法により、複数の摂動済みコピーを組み合わせても、最小の摂動を加えた1つのコピーのみを使用する場合よりも、元のデータを正確に再構築することはできない。
  • IrisおよびWisconsin乳癌データセットを用いた実験では、本手法による摂動済みデータの実用性が、独立ノイズ方式と同等またはそれ以上であり、特に高ノイズレベル下で顕著に優れていることが示された。
  • アルゴリズム3の実行時間は信頼レベル数Mに対して概ね線形に増加し、30個のコピーを生成するのに平均0.37秒で完了した。これは、高い効率性を示している。
  • 実際の実行時間は理論的上限O(M³ + N³ + T(M²N + MN²))よりも顕著に低く、実用的性能が優れていることが裏付けられた。
  • ノイズ相関が適切に設計されていれば、複数のコピーが漏洩したり、共謀されたりしても、本手法はプライバシーの強度を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。