Skip to main content
QUICK REVIEW

[論文レビュー] Attacks on Deidentification's Defenses

Aloni Cohen|arXiv (Cornell University)|Feb 27, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本論文は、すべての属性を準識別子として扱う場合でさえも、k-匿名性などの準識別子に基づく脱識別技術のセキュリティを根底から覆す、新しい理論的・実践的攻撃を提示する。実世界の条件下ではk-匿名性が意味的なプライバシー保護を提供しないことが示されており、厳格な規制基準に従って脱識別されたEdXデータセットから学生の再識別が行われた。

ABSTRACT

Quasi-identifier-based deidentification techniques (QI-deidentification) are widely used in practice, including $k$-anonymity, $\ell$-diversity, and $t$-closeness. We present three new attacks on QI-deidentification: two theoretical attacks and one practical attack on a real dataset. In contrast to prior work, our theoretical attacks work even if every attribute is a quasi-identifier. Hence, they apply to $k$-anonymity, $\ell$-diversity, $t$-closeness, and most other QI-deidentification techniques. First, we introduce a new class of privacy attacks called downcoding attacks, and prove that every QI-deidentification scheme is vulnerable to downcoding attacks if it is minimal and hierarchical. Second, we convert the downcoding attacks into powerful predicate singling-out (PSO) attacks, which were recently proposed as a way to demonstrate that a privacy mechanism fails to legally anonymize under Europe's General Data Protection Regulation. Third, we use LinkedIn.com to reidentify 3 students in a $k$-anonymized dataset published by EdX (and show thousands are potentially vulnerable), undermining EdX's claimed compliance with the Family Educational Rights and Privacy Act. The significance of this work is both scientific and political. Our theoretical attacks demonstrate that QI-deidentification may offer no protection even if every attribute is treated as a quasi-identifier. Our practical attack demonstrates that even deidentification experts acting in accordance with strict privacy regulations fail to prevent real-world reidentification. Together, they rebut a foundational tenet of QI-deidentification and challenge the actual arguments made to justify the continued use of $k$-anonymity and other QI-deidentification techniques.

研究の動機と目的

  • すべての属性を準識別子として扱うことで、k-匿名性のもとで意味的なプライバシー保護が保証されるという基本的仮定に反論すること。
  • 専門家による検証と規制準拠の脱識別が実際には侵害可能であることを示すこと。
  • QI-脱識別が、後処理に対する耐性、合成における滑らかな劣化、分布に関する仮定の回避といったプライバシーの核心的性質を満たさないことを示すこと。
  • k-匿名性およびその拡張が、法的および実務的プライバシー保証として不十分であるという理論的・実践的証拠を提供すること。

提案手法

  • QI-脱識別における最小限および階層的一般化スキームを悪用する、新たなプライバシー攻撃クラス「ダウンコーディング攻撃」を導入する。
  • ダウンコーディング攻撃を述語単一特定(PSO)攻撃に変換し、GDPRの法的脱識別基準に照らして失敗を示す。
  • LinkedInデータを用いて実世界の再識別攻撃を実施し、EdXのk-匿名化データセットに含まれる個人の再識別に成功した。
  • EdXデータセットの分析を通じて、後処理(例:行の削除)がk-匿名性を破る可能性があることを示し、後処理に対する耐性の欠如を特定した。
  • 理論的分析により、QI-脱識別におけるプライバシーは明示されていないデータ分布の仮定に依存していることを示した。
  • 理論的モデリングと実データセットを用いた実証的検証を組み合わせ、複数の次元で脆弱性を示した。

実験結果

リサーチクエスチョン

  • RQ1すべての属性を準識別子として扱う場合、k-匿名性などのQI-脱識別技術が意味的なプライバシー保護を提供できるか?
  • RQ2専門家が厳格なプライバシー規制に準拠して脱識別を行ったデータセットに対しても、理論的および実践的攻撃によって個人を再識別できるか?
  • RQ3QI-脱識別は、後処理に対する耐性や合成における滑らかな劣化といったプライバシーの核心的性質を満たしているか?
  • RQ4最小限および階層的一般化スキームでさえも、ダウンコーディング攻撃を構築・利用可能か?
  • RQ5実世界の再識別攻撃は、GDPRおよびFERPA準拠の主張をどの程度損なうか?

主な発見

  • 本論文は、すべての属性を準識別子として扱う場合でも機能する初の理論的攻撃である「ダウンコーディング攻撃」を提示した。
  • 実践的再識別攻撃により、専門家によるFARPA準拠とされる脱識別が施されたEdXデータセットから3名の学生が再識別された。
  • EdXデータセットは、厳格な規制手順に従って処理されたが、コース属性に関しては真正の5-匿名性を満たしておらず、k-匿名性の定義に違反していた。
  • 攻撃は、QI-脱識別が後処理に対して耐性がないことを示しており、行の削除がk-匿名性を破る可能性があるため、定義上の構文的欠陥を示している。
  • 研究は、QI-脱識別が合成において滑らかに劣化しないことを示しており、複数回のk-匿名化リリースから元のデータが回復可能であることが確認された。
  • 結果として、k-匿名性および関連技術の法的・実務的根拠が揺るがされ、分布の耐性や後処理への耐性といったプライバシーの核心的性質を満たさないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。