Skip to main content
QUICK REVIEW

[論文レビュー] Fidelity and Privacy of Synthetic Medical Data

Ofer Mendelevitch, Lesh|arXiv (Cornell University)|Jan 18, 2021
Privacy-Preserving Technologies in Data参考文献 22被引用数 18
ひとこと要約

本論文は、合成医療データセットの統計的整合性とプライバシー保護の定量的評価を可能にするフレームワークを提案し、Syntegraが生成したデータへの応用を示している。合成データは統計的性質において実データに非常に近い類似性を示す一方で、再識別化に対する強い耐性を維持しており、精密医療研究における安全なデータ共有を可能にする。

ABSTRACT

The digitization of medical records ushered in a new era of big data to clinical science, and with it the possibility that data could be shared, to multiply insights beyond what investigators could abstract from paper records. The need to share individual-level medical data to accelerate innovation in precision medicine continues to grow, and has never been more urgent, as scientists grapple with the COVID-19 pandemic. However, enthusiasm for the use of big data has been tempered by a fully appropriate concern for patient autonomy and privacy. That is, the ability to extract private or confidential information about an individual, in practice, renders it difficult to share data, since significant infrastructure and data governance must be established before data can be shared. Although HIPAA provided de-identification as an approved mechanism for data sharing, linkage attacks were identified as a major vulnerability. A variety of mechanisms have been established to avoid leaking private information, such as field suppression or abstraction, strictly limiting the amount of information that can be shared, or employing mathematical techniques such as differential privacy. Another approach, which we focus on here, is creating synthetic data that mimics the underlying data. For synthetic data to be a useful mechanism in support of medical innovation and a proxy for real-world evidence, one must demonstrate two properties of the synthetic dataset: (1) any analysis on the real data must be matched by analysis of the synthetic data (statistical fidelity) and (2) the synthetic data must preserve privacy, with minimal risk of re-identification (privacy guarantee). In this paper we propose a framework for quantifying the statistical fidelity and privacy preservation properties of synthetic datasets and demonstrate these metrics for synthetic data generated by Syntegra technology.

研究の動機と目的

  • 精密医療およびパンデミック研究を加速させるために、個別レベルの医療データを共有する必要を満たすため。
  • 特に従来の脱識別化手法の脆弱性に鑑み、データ共有を妨げるプライバシー懸念を克服するため。
  • 合成医療データにおける統計的整合性とプライバシー保証の両方を標準化され、定量的に評価できるフレームワークを開発するため。
  • Syntegra技術によって生成された合成データを用いてフレームワークを検証し、実世界のデータを反映しつつ再識別リスクを最小限に抑えることを確認するため。
  • 臨床およびバイオメディカル研究における実世界の証拠の代替として、合成データの利用を支援するため。

提案手法

  • 統計的整合性を評価するため、実データと合成データの間の統計的性質(例:分布、相関)を比較するためのメトリクスのセットをフレームワークが導入する。
  • 再識別化リスクに基づくプライバシー評価プロトコルを採用し、合成レコードが実個人にリンクされる可能性を測定する。
  • 統計的検定と敵対的再識別アタックを組み合わせることで、プライバシー保証を定量的に評価する。
  • GANベースの合成データ生成手法であるSyntegraを用いて生成された合成データに、フレームワークを適用し、複数の臨床データセットにおける性能を評価する。
  • 差分プライバシーを比較のベースラインとして用い、合成データが同等またはより優れたプライバシーを達成しつつ、高い整合性を示すことを検証する。
  • 評価には単変量および多変量の統計的比較に加え、再識別化リスクをテストするためのリンクアタックシミュレーションを含む。

実験結果

リサーチクエスチョン

  • RQ1合成医療データは、主要な臨床変数において、実データと同等の統計的整合性を達成できるか?
  • RQ2リンクアタックによる再識別化を、どの程度防止できるか?
  • RQ3従来の脱識別化手法を用いた実データと比較して、合成データの整合性とプライバシー特性はどのように異なるか?
  • RQ4標準化されたフレームワークは、合成データセットにおける整合性とプライバシーの両方を信頼性高く定量的に評価できるか?
  • RQ5Syntegraを用いた合成データ生成は、実医療データの統計的構造を保持しつつ、プライバシー漏洩を最小限に抑えることができるか?

主な発見

  • Syntegraが生成した合成データは高い統計的整合性を示し、コルモゴロフ・スミルノフ検定およびカイ二乗検定のp値から、単変量分布において実データと有意差がないことが示された。
  • 多変量統計的比較では、実データと合成データの間で相関構造および周辺分布に強い類似性が確認された。
  • 合成データに対する再識別アタックでは、成功確率が5%未満にとどまり、個人の再識別リスクが低いことが示された。
  • フレームワークはプライバシー保証を効果的に定量化でき、合成データが従来の脱識別化手法よりも再識別化耐性に優れていることを示した。
  • 結果として、合成データは患者のプライバシーを損なうことなく、臨床研究における実世界の証拠の信頼できる代替として機能できることを確認した。
  • フレームワークは再現可能でスケーラブルな方法を提供し、精密医療および規制応用分野における合成データの採用を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。