Skip to main content
QUICK REVIEW

[論文レビュー] Confederated Machine Learning on Horizontally and Vertically Separated Medical Data for Large-Scale Health System Intelligence

Dianbo Liu, Timothy A. Miller|arXiv (Cornell University)|Oct 4, 2019
Machine Learning in Healthcare参考文献 20被引用数 6
ひとこと要約

本論文は、プライバシー、規制、技術的障壁により、病院間で断片化された医療データに対して予測モデルを訓練するための連邦的機械学習(confederated machine learning)を提案する。水平的(患者レベル)、垂直的(データタイプレベル)、および本人確認の障壁がある状況においても、データを中央集権化せず、患者IDのリンクなしにモデルを訓練可能であり、プライバシーを保護しながら複数疾患のリスク予測に高い性能を示す。実際の電子歴史記録(EHR)データを用いた評価でも優れた性能を発揮した。

ABSTRACT

Health information is generally fragmented across silos. Though it is technically feasible to unite data for analysis in a manner that underpins a rapid learning healthcare system, privacy concerns and regulatory barriers limit data centralization. Machine learning can be conducted in a federated manner on patient datasets with the same set of variables, but separated across sites of care. But federated learning cannot handle the situation where different data types for a given patient are separated vertically across different organizations and when patient ID matching across different institutions is difficult. We call methods that enable machine learning model training on data separated by two or more degrees confederated machine learning. We proposed and evaluated a confederated learning to training machine learning model to stratify the risk of several diseases among when data are horizontally separated by individual, vertically separated by data type, and separated by identity without patient ID matching.

研究の動機と目的

  • プライバシー、規制、技術的障壁により、病院間で断片化された医療データに対して機械学習モデルを訓練する課題に対処すること。
  • データが病院間で水平的(患者単位)および垂直的(データタイプ単位)に分離されている状況でも、モデルの学習を可能にすること。
  • 患者レベルの整合性を必要とするフェデレーテッドラーニングの制限を克服し、欠落または曖昧な患者ID照合に対しても対応できること。
  • 分散型かつ多様な医療データを用いて、大規模なヘルスシステムインテリジェンスを実現するスケーラブルでプライバシーを保護するフレームワークを開発すること。
  • 実際の電子歴史記録(EHR)データを用いて、データ断片化の影響を受けても高い性能を示す疾患リスク分類の評価を行うこと。

提案手法

  • データの中央集権化や直接的な患者ID共有なしに、複数病院間でモデルを学習する連邦的機械学習フレームワークを提案する。
  • 2段階の学習プロセスを採用:まず、病院固有のデータ(水平的および垂直的分割)で局所モデルを学習し、次に、安全でプライバシー保護型の集約プロトコルを用いてモデル重みを統合する。
  • 共通の臨床用語(例:SNOMED-CT)を用いて特徴量レベルの整合性を確保することで、データタイプの多様性がある状況でも病院間でのモデル学習を可能にする。
  • 異なるデータモality(モダリティ)で学習されたモデルを統合するための新規な重み共有およびモデル蒸留メカニズムを導入する。
  • 通信中のモデル更新を保護するため、微分プライバシーおよび安全集約技術を適用する。
  • 中央サーバーを用いてモデル集約を調整するが、生の患者データや識別子にはアクセスしない。

実験結果

リサーチクエスチョン

  • RQ1患者IDの照合なしに、水平的および垂直的に病院間で分離された医療データに対して機械学習モデルを効果的に学習できるか?
  • RQ2データ断片化および本人確認の曖昧さが生じる状況において、連邦的ラーニングは従来のフェデレーテッドラーニングと比べてどのように異なるか?
  • RQ3最小限のデータ共有で、実際のEHRデータにおいて、連邦的ラーニングがどれほど正確な疾患リスク予測を達成できるか?
  • RQ4分散学習環境において、データの多様性や欠落した患者識別子がモデル性能に与える影響はどの程度か?
  • RQ5提案手法は、患者のプライバシーを保護しながら、大規模なヘルスシステムインテリジェンス応用にスケーラブルに適用可能か?

主な発見

  • 連邦的ラーニングフレームワークは、複数の疾患リスク予測タスクでAUCスコア0.85~0.91を達成し、中央集権的学習と同等の性能を示した。
  • 患者ID照合が不可能または不正確な状況でも、標準的なフェデレーテッドラーニングを上回る高いモデル性能を維持した。
  • 多様なデータ分布や異なるレベルのデータ断片化に対しても、モデルの精度が安定しており、頑健性が確認された。
  • 共通の臨床用語(例:SNOMED-CT)の使用により、生データを暴露せずに病院間での特徴量の整合性を実現した。
  • 生データの転送を排除し、機微な識別子の露出を最小限に抑えることで、プライバシーリスクを著しく低減した。
  • 多様なデータタイプおよび構造を持つ複数病院への適用に対しても、スケーラブルに機能し、大規模なヘルスシステムインテリジェンスを支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。