Skip to main content
QUICK REVIEW

[論文レビュー] Patient Clustering Improves Efficiency of Federated Machine Learning to predict mortality and hospital stay time using distributed Electronic Medical Records

Huang Li, Dianbo Liu|arXiv (Cornell University)|Mar 22, 2019
Machine Learning in Healthcare参考文献 36被引用数 20
ひとこと要約

本稿では、診断および地理的要因に基づいて分散型ICU電子カルテ(EMR)を臨床的に意味のあるグループにクラスタリングすることで、データプライバシーを保ちながら局所的なモデル学習を可能にするコミュニティベースのフェデレーテッドラーニング(CBFL)フレームワークを提案する。CBFLは、標準的なフェデレーテッドラーニングと比較して、死亡率および入院期間予測のパフォーマンスを向上させるとともに、通信コストを削減する。非IIDデータにおいても、AUCおよびPR AUCの指標が優れている。

ABSTRACT

Electronic medical records (EMRs) supports the development of machine learning algorithms for predicting disease incidence, patient response to treatment, and other healthcare events. But insofar most algorithms have been centralized, taking little account of the decentralized, non-identically independently distributed (non-IID), and privacy-sensitive characteristics of EMRs that can complicate data collection, sharing and learning. To address this challenge, we introduced a community-based federated machine learning (CBFL) algorithm and evaluated it on non-IID ICU EMRs. Our algorithm clustered the distributed data into clinically meaningful communities that captured similar diagnoses and geological locations, and learnt one model for each community. Throughout the learning process, the data was kept local on hospitals, while locally-computed results were aggregated on a server. Evaluation results show that CBFL outperformed the baseline FL algorithm in terms of Area Under the Receiver Operating Characteristic Curve (ROC AUC), Area Under the Precision-Recall Curve (PR AUC), and communication cost between hospitals and the server. Furthermore, communities' performance difference could be explained by how dissimilar one community was to others.

研究の動機と目的

  • 医療機械学習における分散型で非IIDかつプライバシーに配慮した電子カルテ(EMR)の課題に対処すること。
  • 死亡率や入院期間予測などの患者アウトカム予測におけるフェデレーテッドラーニングの効率性とパフォーマンスを向上させること。
  • 中央集権化せずに分散型EMRを臨床的に意味のあるコミュニティにクラスタリングする手法を開発すること。
  • モデルの正確性を維持しながら、病院とサーバー間の通信オーバーヘッドを低減すること。

提案手法

  • CBFLフレームワークは、臨床的類似性(例:診断)および地理的近接性に基づいて分散型EMRをコミュニティにクラスタリングする。
  • 各コミュニティは自らのデータを用いて局所モデルを独立して学習し、データプライバシーを保持する。
  • 局所モデルの更新は中央サーバーで集約され、生のデータ転送を回避する。
  • 臨床的および空間的特徴を用いてクラスタリングプロセスをガイドすることで、意味のあるコミュニティ形成を実現する。
  • モデルは局所で学習され、勾配またはモデル重みのみが共有されるフェデレーテッドラーニングパイプラインを用いる。
  • パフォーマンスは、標準的な指標(ROC AUC、PR AUC、通信コスト)を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1分散型EMRを臨床的に意味のあるコミュニティにクラスタリングすることで、患者アウトカム予測におけるフェデレーテッドラーニングのパフォーマンスが向上するか?
  • RQ2非IIDのICUデータにおいて、CBFLは標準的なフェデレーテッドラーニングと比較して、予測精度および通信効率の面で優れているか?
  • RQ3コミュニティ構成の差がモデルパフォーマンスにどの程度影響を与えるか?
  • RQ4コミュニティレベルのクラスタリングは、予測パフォーマンスを損なわずに通信コストを低減できるか?

主な発見

  • CBFLは、死亡率および入院期間予測タスクにおいて、ベースラインのフェデレーテッドラーニングアルゴリズムよりも高い受検者作動特性曲線下積分(ROC AUC)を達成した。
  • CBFLは、不均衡な患者アウトカム予測において優れた性能を示すため、精度-再現率曲線下積分(PR AUC)が向上した。
  • クラスタリングされたコミュニティ間での最適化されたモデル集約のおかげで、病院とサーバー間の通信コストが顕著に削減された。
  • 他のコミュニティとより異なるコミュニティでは、パフォーマンスのばらつきが大きかったため、データ分布の非同一性に感受することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。