Skip to main content
QUICK REVIEW

[論文レビュー] Randomization Resilient To Sensitive Reconstruction

Ke Wang, Chao Han|arXiv (Cornell University)|Feb 15, 2012
Privacy-Preserving Technologies in Data参考文献 21被引用数 3
ひとこと要約

本稿では、特定の個人の感受性属性を推定する微小再構築攻撃(micro-reconstruction attack)の精度を制限することで、その再構築が高確率で高い誤差を持つように保証する、新たなプライバシー定義である$(\varepsilon,\delta)$-reconstruction-privacyを提案する。この手法により、独立したランダム化試行の回数を削減することで微小再構築を弱体化させつつ、正確な集計再構築を維持することができ、実データセットを用いた評価でプライバシーと有用性のトレードオフが向上した。

ABSTRACT

With the randomization approach, sensitive data items of records are randomized to protect privacy of individuals while allowing the distribution information to be reconstructed for data analysis. In this paper, we distinguish between reconstruction that has potential privacy risk, called micro reconstruction, and reconstruction that does not, called aggregate reconstruction. We show that the former could disclose sensitive information about a target individual, whereas the latter is more useful for data analysis than for privacy breaches. To limit the privacy risk of micro reconstruction, we propose a privacy definition, called (epsilon,delta)-reconstruction-privacy. Intuitively, this privacy notion requires that micro reconstruction has a large error with a large probability. The promise of this approach is that micro reconstruction is more sensitive to the number of independent trials in the randomization process than aggregate reconstruction is; therefore, reducing the number of independent trials helps achieve (epsilon,delta)-reconstruction-privacy while preserving the accuracy of aggregate reconstruction. We present an algorithm based on this idea and evaluate the effectiveness of this approach using real life data sets.

研究の動機と目的

  • 非感受性属性と摂動済みデータを用いて特定個人の感受性属性を推定する微小再構築攻撃が引き起こすプライバシーリスクに対処すること。
  • 微小再構築の精度を制限しつつ有用な集計再構築を許容する新たなプライバシー定義、$(\varepsilon,\delta)$-reconstruction-privacyを形式化すること。
  • 独立したランダム化試行の回数を減らすことで、微小再構築が集計再構築よりも著しく劣化することを示し、より良いプライバシー-有用性トレードオフを実現できることを示すこと。
  • 上記の知見に基づき、分析に有用なデータの有用性を維持しながら標的型推論攻撃に耐性を持つ実用的なアルゴリズムを提供すること。

提案手法

  • 微小再構築(プライバシーのリスク)と集計再構築(分析に有用)の区別を導入することで、標的的なプライバシー保護を可能にする。
  • 微小再構築の誤差が$\varepsilon$を超える確率が$1-\delta$以上であることを要件とする$(\varepsilon,\delta)$-reconstruction-privacyを提案する。
  • チェルノフの不等式を用いて尾確率の上界を導出し、微小再構築の精度が制限されることを保証する。
  • 独立したランダム化試行の回数を減らすことで、微小再構築の誤差を増加させつつ、集計再構築の正確性を維持する。
  • 最大尤度推定法(MLE)を用いて微小グループ内の頻度を推定し、観測された摂動済みデータを基に再構築リスクを評価する。
  • 実データセット(EDU-500K および OCC-500K)を用いて手法を検証し、さまざまなグループサイズや頻度分布における誤差率とプライバシー漏洩度を測定した。

実験結果

リサーチクエスチョン

  • RQ1非感受性属性が既知である場合、従来のプライバシー定義(例:$\rho_1$-$\rho_2$プライバシー)は微小再構築攻撃を回避できるか?
  • RQ2微小再構築の精度を特に制限しつつ、集計再構築の有用性を保つプライバシー定義をどのように形式化できるか?
  • RQ3独立したランダム化試行の回数を減らすことで、微小再構築が集計再構築よりも著しく劣化するか?
  • RQ4提案された$(\varepsilon,\delta)$-reconstruction-privacy定義は、実世界のデータセットにおいてどの程度プライバシー漏洩を低減できるか?

主な発見

  • EDU-500Kでは、$\lambda=0.1$および$\varepsilon=0.2$の条件下で、グループ2の74件中25件が微小再構築誤差20%を超えており、感受性属性推定における高い誤差が確認された。
  • OCC-500Kでは、$\lambda=0.1$および$\varepsilon=0.2$の条件下で、グループ2の213件中28件が誤差20%を超えており、提案されたメカニズム下でも顕著な微小再構築誤差が確認された。
  • 感受性属性頻度が高水準(EDU-500Kでは76–87%)のグループでは、全体のデータセット(2.5%)と比較して微小再構築推定が著しく正確であったため、プライバシーのリスクが露呈した。
  • $\lambda$を0.1から0.05に低下させることで、微小再構築の誤差が増加した。これは、低いノイズレベル(高い$\lambda$)が誤差を増加させ、プライバシーを向上させることを示している。
  • 微小再構築が著しくペナルティを受けても、集計再構築の正確性が維持されているため、望ましいプライバシー-有用性トレードオフが実現された。
  • 微小再構築誤差が高確率で大きくなるように保証することで、プライバシー漏洩が効果的に制限され、$(\varepsilon,\delta)$-reconstruction-privacy定義を満たしていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。