Skip to main content
QUICK REVIEW

[論文レビュー] Vulnerabilities in the use of similarity tables in combination with pseudonymisation to preserve data privacy in the UK Office for National Statistics' Privacy-Preserving Record Linkage

Chris Culnane, Benjamin I. P. Rubinstein|arXiv (Cornell University)|Dec 4, 2017
Data Quality and Management参考文献 1被引用数 8
ひとこと要約

この論文は、英国統計局(ONS)のプライバシー保護記録連携手法における深刻な脆弱性を特定している。この手法はHMAC保護された名前と類似度テーブルを組み合わせるものである。著者らは、このアプローチが厳密に制御された統計研究環境(SRE)の外では安全でないことを示しており、公開情報と構造的攻撃を用いることで平文の名前を回復可能である。これは、主張される暗号的セキュリティが崩れ、より保護の薄い環境に展開された場合にプライバシーリスクが生じることを意味する。

ABSTRACT

In the course of a survey of privacy-preserving record linkage, we reviewed the approach taken by the UK Office for National Statistics (ONS) as described in their series of reports "Beyond 2011". Our review identifies a number of matters of concern. Some of the issues discovered are sufficiently severe to present a risk to privacy.

研究の動機と目的

  • 『Beyond 2011』シリーズに記載されたONSのプライバシー保護記録連携手法のセキュリティを評価すること。
  • 個人識別情報の保護に向けたHMACと類似度テーブルの組み合わせにおける暗号的およびプロトコルレベルの欠陥を特定すること。
  • 実際のデータへのアクセスなしに、公開情報と構造的分析を用いて、平文の名前を再識別可能な攻撃が実行可能であることを実証すること。
  • 特にエントロピーの仮定と用語の誤解に関して、HMACおよびハッシュ関数のセキュリティに関する誤解を是正すること。
  • 類似度テーブル技術は、セキュアなSREの外では使用すべきでないと提言すること。これは、固有のプライバシーリスクが内在しているからである。

提案手法

  • 著者らは、暗号的仮定とプロトコル構成に焦点を当て、ONSの手法に対する形式的セキュリティ分析を実施した。
  • HMAC鍵のエントロピーに関する誤った仮定と、特に名前のような低エントロピー入力におけるハッシュ関数の単方向性の性質に関する誤解を特定した。
  • 頻度ベースの攻撃をモデル化し、類似度テーブルがHMAC処理済み名前の頻度を露呈するため、一般的な名前を推定可能であることを示した。
  • 部分グラフマッチング技術を用いて、類似度テーブルのグラフにおける接続パターンを分析することで、平文の名前を再構築した。
  • 実際のデータやSREへのアクセスなしに、ONSが公開した公的文書のみを用いて、理論的および実用的セキュリティを評価した。
  • 特に次数の高いノードと連結成分に注目し、頻度分析と構造的マッチングを組み合わせることで、名前の回復可能性を評価した。

実験結果

リサーチクエスチョン

  • RQ1公開情報と構造的分析のみを用いて、HMAC保護済み名前と類似度テーブルから平文の名前を回復できるか?
  • RQ2特にエントロピーと単方向性に関する誤った暗号的仮定が、ONSの手法のセキュリティをどの程度損なうか?
  • RQ3HMACと類似度テーブルの組み合わせが、個々のコンポONENTが安全に見える場合でも、全体のプライバシー保証を弱体化させる仕組みは何か?
  • RQ4類似度テーブルと偽名化を組み合わせることの、保護が薄い環境における再識別への影響は何か?
  • RQ5なぜONSが『現在の技術で可能な攻撃すべてに耐性がある』と主張しているのが誤りであるのか?具体的にどのような攻撃がその不適切さを示しているか?

主な発見

  • ONSの仮定であるHMAC鍵に最小限のエントロピーで十分であるという考えは誤りであり、名前のような低エントロピー入力のため、ブルートフォース攻撃に脆弱である。
  • 類似度テーブルの使用により、HMAC処理済み名前の頻度が露呈され、頻度ベースの再識別攻撃が可能となり、一般的な名前を高い信頼性で回復できる。
  • 平文の類似度スコアがHMAC処理済み名前へのインデックスとして機能し、類似度グラフの構造的分析により、スコアから元の名前をマッピング可能である。
  • SREを厳密に制御しない環境では、この手法は安全ではなく、暗号的仮定とプロトコル構成の失敗により、実用的な再識別攻撃が可能である。
  • 誤った用語の使用、誤ったエントロピー仮定、類似度テーブルの使用が組み合わさることで、このアプローチはSRE外での展開に不適切である。
  • ONSの『現在の技術で可能な攻撃すべてに耐性がある』という主張は誤りであり、既存および新規の攻撃が、このシステムの設計上の欠陥を突くことでその不適切さが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。