Skip to main content
QUICK REVIEW

[論文レビュー] Individual Privacy vs Population Privacy: Learning to Attack Anonymization

Graham Cormode|arXiv (Cornell University)|Nov 10, 2010
Privacy-Preserving Technologies in Data参考文献 19被引用数 7
ひとこと要約

この論文は、プライバシーの基準とされる微分プライバシーを適用したデータですら、個人の機微な属性を正確に推定できる分類器を訓練するのに使用可能であることを示している。攻撃者は集団レベルの統計的パターンを活用することで、高い推定精度を達成でき、これは個人のプライバシーと集団レベルのプライバシー保護の間に根本的な矛盾があることを示している。

ABSTRACT

Over the last decade there have been great strides made in developing techniques to compute functions privately. In particular, Differential Privacy gives strong promises about conclusions that can be drawn about an individual. In contrast, various syntactic methods for providing privacy (criteria such as kanonymity and l-diversity) have been criticized for still allowing private information of an individual to be inferred. In this report, we consider the ability of an attacker to use data meeting privacy definitions to build an accurate classifier. We demonstrate that even under Differential Privacy, such classifiers can be used to accurately infer "private" attributes in realistic data. We compare this to similar approaches for inferencebased attacks on other forms of anonymized data. We place these attacks on the same scale, and observe that the accuracy of inference of private attributes for Differentially Private data and l-diverse data can be quite similar.

研究の動機と目的

  • 微分プライバシーを適用したデータが、個人の機微な属性を高い精度で推定するために使用可能かどうかを調査すること。
  • 微分プライバシーを適用したデータと、l-多様性などの文法的匿名化手法(例:k-匿名性)に対する推定攻撃の有効性を比較すること。
  • 個人のプライバシー保証と、集団レベルの推定攻撃のリスクの間にある乖離を浮き彫りにすること。
  • 微分プライバシーが実際の場面で個人のプライバシーを完全に保護すると仮定することの妥当性を疑うこと。
  • 形式的な定義を超えた、より洗練されたプライバシー評価の必要性を強調すること。

提案手法

  • 著者らは、微分プライバシーを適用したデータ上で機械学習分類器を訓練し、準識別子(例:年齢、性別、場所)に基づいて機微な属性を予測する。
  • 攻撃はヒストグラムクエリ(グループ化されたデータに対するカウントクエリ)を用い、微分プライバシーを確保するためにラプラスまたは幾何分布のメカニズムに従ってノイズを追加する。
  • 各クエリの感度は、個々の個人がクエリ結果に与える最大のL1影響として計算される。
  • ノイズは、感度とプライバシー予算 ϵ から導かれるパrameterを用いて、各カウントクエリに対して独立にラプラス分布または対称的幾何分布で追加される。
  • その後、準識別子が既知の個人に対して分類器をテストし、予測された機微な値の正確さを測定する。
  • k-匿名性やl-多様性に対する既知の攻撃と比較することで、両手法で同程度の推定精度が得られることを示している。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシーを適用したデータで学習した分類器は、個人の機微な属性を正確に推定できるか?
  • RQ2微分プライバシーを適用したデータに対する推定攻撃の精度は、l-多様性やk-匿名化データに対する攻撃と比べてどの程度か?
  • RQ3匿名化されたデータに含まれる集団レベルの統計が、個人のプライバシーをどの程度損なうか?
  • RQ4微分プライバシーのような形式的プライバシー定義が、確率的推定攻撃を防げないのはなぜか?
  • RQ5このような攻撃が、データ共有やプライバシーポリシーに及ぼす実用的影響は何か?

主な発見

  • 微分プライバシーのもとでも、分類器は非自明な精度で機微な属性を推定可能であり、形式的なプライバシー保証が推定リスクを完全に排除しないことを示している。
  • 微分プライバシーを適用したデータに対する推定精度は、l-多様性や他の文法的匿名化手法と同等であり、同様の脆弱性を示している。
  • 攻撃は、微分プライバシーが適用されても保持される集団レベルの統計的相関を利用することで成功する。
  • この手法は最小限の計算負荷で実行可能であり、非適応的クエリの1ラウンドで動作するため、実用的でスケーラブルである。
  • 結果として、微分プライバシーが保護する個人のプライバシーと、統計的推論によって露呈する集団レベルのプライバシーの間に根本的な矛盾があることが明らかになった。
  • 本研究は、微分プライバシーが確率的漏洩を防げないことを示しており、攻撃者が個人の機微なデータについての信念を高めるが、絶対的確実性は得ない状況が生じることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。