Skip to main content
QUICK REVIEW

[논문 리뷰] Patient Clustering Improves Efficiency of Federated Machine Learning to predict mortality and hospital stay time using distributed Electronic Medical Records

Huang Li, Dianbo Liu|arXiv (Cornell University)|2019. 03. 22.
Machine Learning in Healthcare참고 문헌 36인용 수 20
한 줄 요약

이 논문은 진단 및 지리적 요소를 바탕으로 분산된 중환자실(ICU) 전자의료기록(EMRs)을 임상적으로 의미 있는 그룹으로 군집화하는 커뮤니티 기반 연합학습(CBFL) 프레임워크를 제안한다. 이는 데이터 프라이버시를 유지하면서 국지적 모델 훈련을 가능하게 하며, 표준 연합학습 대비 예측 성능을 향상시키고 통신 비용을 절감한다. 비독립 동일분포(Non-IID) 데이터에서 AUC 및 PR AUC 지표가 뛰어나며, 사망률 및 입원 기간 예측 성능이 향상된다.

ABSTRACT

Electronic medical records (EMRs) supports the development of machine learning algorithms for predicting disease incidence, patient response to treatment, and other healthcare events. But insofar most algorithms have been centralized, taking little account of the decentralized, non-identically independently distributed (non-IID), and privacy-sensitive characteristics of EMRs that can complicate data collection, sharing and learning. To address this challenge, we introduced a community-based federated machine learning (CBFL) algorithm and evaluated it on non-IID ICU EMRs. Our algorithm clustered the distributed data into clinically meaningful communities that captured similar diagnoses and geological locations, and learnt one model for each community. Throughout the learning process, the data was kept local on hospitals, while locally-computed results were aggregated on a server. Evaluation results show that CBFL outperformed the baseline FL algorithm in terms of Area Under the Receiver Operating Characteristic Curve (ROC AUC), Area Under the Precision-Recall Curve (PR AUC), and communication cost between hospitals and the server. Furthermore, communities' performance difference could be explained by how dissimilar one community was to others.

연구 동기 및 목표

  • 의료 기계학습 분야에서 분산형, 비독립 동일분포(Non-IID), 프라이버시 민감한 전자의료기록(EMRs)의 과제를 해결하기 위해.
  • 환자 예후(예: 사망률 및 입원 기간) 예측에서 연합학습의 효율성과 성능을 향상시키기 위해.
  • 중앙 집중화 없이 분산된 EMRs를 임상적으로 의미 있는 커뮤니티로 군집화하는 방법을 개발하기 위해.
  • 모델 정확도를 유지하면서 병원과 서버 간의 통신 오버헤드를 줄이기 위해.

제안 방법

  • CBFL 프레임워크는 임상 유사성(예: 진단)과 지리적 근접성을 기반으로 분산된 EMRs를 커뮤니티로 군집화한다.
  • 각 커뮤니티는 자체 데이터를 사용하여 독립적으로 로컬 모델을 훈련시며, 데이터 프라이버시를 유지한다.
  • 로컬 모델 업데이트는 원시 데이터 전송 없이 중앙 서버에서 집계된다.
  • 의미 있는 커뮤니티 형성을 위해 임상적 및 공간적 특징을 기반으로 군집화 과정이 이끌린다.
  • 모델은 로컬에서 훈련되고 오직 기울기 또는 모델 가중치만 공유되는 연합학습 파이프라인을 사용한다.
  • 성능 평가는 ROC AUC, PR AUC 및 통신 비용과 같은 표준 지표를 사용하여 평가된다.

실험 결과

연구 질문

  • RQ1분산된 EMRs를 임상적으로 의미 있는 커뮤니티로 군집화하는 것이 환자 예후 예측에서 연합학습의 성능을 향상시킬 수 있는가?
  • RQ2비독립 동일분포(ICU 데이터)에서 CBFL은 표준 연합학습 대비 예측 정확도와 통신 효율성 측면에서 어떻게 비교되는가?
  • RQ3커뮤니티 구성의 차이가 모델 성능에 어느 정도 영향을 미치는가?
  • RQ4커뮤니티 수준의 군집화가 예측 성능을 희생시키지 않고도 통신 비용을 줄일 수 있는가?

주요 결과

  • CBFL은 사망률 및 입원 기간 예측 작업에서 기준 연합학습 알고리즘보다 더 높은 수준의 수신기 작동 특성 곡선 아래 면적(ROC AUC)을 달성했다.
  • CBFL은 정밀도-재현율 곡선 아래 면적(PR AUC)이 향상되어 비균형 환자 예후 예측에서 더 우수한 성능을 보였다.
  • 군집화된 커뮤니티 간 최적화된 모델 집계 덕분에 병원과 서버 간의 통신 비용이 크게 감소했다.
  • 다른 커뮤니티와 더 다를수록 성능 변동성이 커져 데이터 분포 이질성에 민감함을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.