Skip to main content
QUICK REVIEW

[論文レビュー] Assessing the risk of re-identification arising from an attack on anonymised data

Anna Antoniou, Giacomo Dossena|arXiv (Cornell University)|Mar 31, 2022
Ethics in Clinical Research被引用数 4
ひとこと要約

本稿では、標的型攻撃下におけるk-匿名化された電子歴史記録(EHR)データセットにおける再特定リスクを推定する分析フレームワークを提案する。再帰的確率モデルとモンテカルロシミュレーションを用いて、攻撃者が取得するデータの割合が増えるほど再特定の可能性が上昇し、等価クラスのサイズが大きいほど低下することを定量化し、望ましいリスク閾値に基づく体系的なk-匿名化パrameterizationを可能にする。

ABSTRACT

Objective: The use of routinely-acquired medical data for research purposes requires the protection of patient confidentiality via data anonymisation. The objective of this work is to calculate the risk of re-identification arising from a malicious attack to an anonymised dataset, as described below. Methods: We first present an analytical means of estimating the probability of re-identification of a single patient in a k-anonymised dataset of Electronic Health Record (EHR) data. Second, we generalize this solution to obtain the probability of multiple patients being re-identified. We provide synthetic validation via Monte Carlo simulations to illustrate the accuracy of the estimates obtained. Results: The proposed analytical framework for risk estimation provides re-identification probabilities that are in agreement with those provided by simulation in a number of scenarios. Our work is limited by conservative assumptions which inflate the re-identification probability. Discussion: Our estimates show that the re-identification probability increases with the proportion of the dataset maliciously obtained and that it has an inverse relationship with the equivalence class size. Our recursive approach extends the applicability domain to the general case of a multi-patient re-identification attack in an arbitrary k-anonymisation scheme. Conclusion: We prescribe a systematic way to parametrize the k-anonymisation process based on a pre-determined re-identification probability. We observed that the benefits of a reduced re-identification risk that come with increasing k-size may not be worth the reduction in data granularity when one is considering benchmarking the re-identification probability on the size of the portion of the dataset maliciously obtained by the adversary.

研究の動機と目的

  • 悪意あるデータ漏洩状況下における匿名化医療データセットの再特定リスクを定量化すること。
  • k-匿名化EHRデータセットにおける1名の患者の再特定確率を推定する分析的手法を開発すること。
  • 1名の患者向けモデルを一般化し、同時に複数名の患者を標的にする再特定リスクを推定すること。
  • さまざまな攻撃シナリオにおいて、分析的推定値の正確性を合成モンテカルロシミュレーションで検証すること。
  • 事前に定義された再特定リスク閾値に基づき、k-匿名化パrameterの体系的選定を支援すること。

提案手法

  • 組み合わせ確率を用いて、k-匿名化データセットにおける1名の患者の再特定確率の解析的表現を導出する。
  • 1名の患者向けモデルを再帰的定式化に一般化し、任意のk-匿名化方式における複数名の患者を同時に再特定する確率を計算する。
  • 合成EHRデータセットを用いたモンテカルロシミュレーションを実施し、さまざまな攻撃シナリオにおいて分析的リスク推定の正確性を検証する。
  • 攻撃者が取得するデータの割合や等価クラスのサイズといった主要な変数が再特定リスクに与える影響を評価する。
  • 再特定確率の上界推定を保証するため、モデルに慎重な仮定を適用し、リスク評価の安全性を高める。
  • 目標とする再特定リスクレベルに基づき、k-匿名化パrameterを体系的に設定する手法を提案する。

実験結果

リサーチクエスチョン

  • RQ1標的型攻撃下におけるk-匿名化EHRデータセットにおける1名の患者の再特定確率は何か?
  • RQ2複数名の患者が同時に標的にされた場合、再特定確率はどのように変化するか?
  • RQ3さまざまな攻撃条件において、分析的リスク推定値と実験的シミュレーション結果の一致度はどの程度か?
  • RQ4攻撃者が取得するデータの割合が、k-匿名化データセットにおける再特定リスクにどのように影響するか?
  • RQ5kを増加させることによる再特定リスクの低減と、部分的データ漏洩を考慮した場合のデータの粒度損失のトレードオフは何か?

主な発見

  • 複数のテストシナリオにおいて、分析モデルの再特定確率推定値がモンテカルロシミュレーションの結果とよく一致している。
  • 攻撃者が悪意を持って取得するデータの割合が増えるほど、再特定リスクは顕著に上昇する。
  • k-匿名化における再特定リスクと等価クラスサイズの間には逆相関関係が存在する。
  • 再帰的定式化により、任意のk-匿名化方式における複数名同時再特定攻撃に対応するモデルの拡張に成功した。
  • 部分的データ漏洩を考慮した場合、kを増加させることによる再特定リスク低減の利点は、データの粒度損失によって上回られる可能性がある。
  • 提案されたフレームワークにより、事前に定義された許容可能なリスク閾値に基づくk-匿名化パrameterの体系的設定が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。