Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy-preserving patient clustering for personalized federated learning

Ahmed El‐Hussein, Gamze Gürsoy|PubMed|2023. 07. 17.
Privacy-Preserving Technologies in Data참고 문헌 38인용 수 6
한 줄 요약

이 논문은 환자 수준의 유사도 점수를 원시 데이터를 공유하지 않고 병원 간에 계산하기 위해 보안 다자간 계산(secure multiparty computation)을 사용하는 프라이버시 보장형 분산학습 프레임워크인 PCBFL을 제안한다. 이는 임상적으로 의미 있는 환자 군집화를 가능하게 하며, 기존의 전통적 및 기존의 군집화된 FL 방법 대비 사망 예측 성능을 AUC 기준 4.3% 향상시키고 AUPRC 기준 7.8% 향상시킨다.

ABSTRACT

Federated Learning (FL) is a machine learning framework that enables multiple organizations to train a model without sharing their data with a central server. However, it experiences significant performance degradation if the data is non-identically independently distributed (non-IID). This is a problem in medical settings, where variations in the patient population contribute significantly to distribution differences across hospitals. Personalized FL addresses this issue by accounting for site-specific distribution differences. Clustered FL, a Personalized FL variant, was used to address this problem by clustering patients into groups across hospitals and training separate models on each group. However, privacy concerns remained as a challenge as the clustering process requires exchange of patient-level information. This was previously solved by forming clusters using aggregated data, which led to inaccurate groups and performance degradation. In this study, we propose Privacy-preserving Community-Based Federated machine Learning (PCBFL), a novel Clustered FL framework that can cluster patients using patient-level data while protecting privacy. PCBFL uses Secure Multiparty Computation, a cryptographic technique, to securely calculate patient-level similarity scores across hospitals. We then evaluate PCBFL by training a federated mortality prediction model using 20 sites from the eICU dataset. We compare the performance gain from PCBFL against traditional and existing Clustered FL frameworks. Our results show that PCBFL successfully forms clinically meaningful cohorts of low, medium, and high-risk patients. PCBFL outperforms traditional and existing Clustered FL frameworks with an average AUC improvement of 4.3% and AUPRC improvement of 7.8%.

연구 동기 및 목표

  • 의료 기관 간 비독립 동일분포(non-i.i.i.d.) 데이터 분포로 인한 성능 저하 문제를 해결하기 위해.
  • 개별 수준의 데이터를暴露하지 않고도 분산 환경에서 환자 군집화를 가능하게 하여 환자 프라이버시를 보호하기 위해.
  • 다양한 병원 간 환자 수준 임베딩을 활용하여 임상적으로 의미 있는 환자 군집을 형성하는 보안적이고 확장 가능한 방법을 개발하기 위해.
  • 데이터 국지성(데이터 로컬리티)을 유지하면서 유사도 기반으로 환자를 그룹화함으로써 개인 맞춤형 분산학습의 모델 성능을 향상시키기 위해.
  • 보안적 군집화가 실세계 임상 데이터셋(예: eICU)에서의 후행 예측 성능을 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • PCBFL은 보안 다자간 계산(SMPC)을 사용하여 병원 간 환자 간 코사인 유사도 점수를 원시 환자 데이터를 폭 드러내지 않고 계산한다.
  • 각 병원에서 암호화된 환자 임베딩을 기여하고, SMPC를 통해 참가하는 모든 사이트 간에 공동으로 유사도 점수를 계산한다.
  • 유사도 계산 중에 어느 한 병원도 개별 환자 정보를 재구성할 수 있도록 비밀 공유 프로토콜을 사용한다.
  • 집계된 프라이버시 보장 유사도 점수를 기반으로 클러스터링(예: k-means)을 적용하여 환자 군집을 형성한다.
  • 개별 군집별로 FedAvg를 사용하여 별도의 모델을 훈련하는 개인 맞춤형 분산학습 파이프라인을 적용하여 비독립 동일분포 데이터에서의 성능을 향상시킨다.
  • 최소한의 민감 정보 泄露를 동반하면서도 20개의 eICU 사이트에 걸쳐 대규모 배포를 지원한다.

실험 결과

연구 질문

  • RQ1개별 환자 데이터를暴露하지 않고도 분산 환경에서 환자 군집화를 수행할 수 있는가?
  • RQ2프라이버시 보장 군집화가 비독립 동일분포 의료 데이터 환경에서 모델 성능을 향상시키는가?
  • RQ3생성된 군집이 임상적으로 의미 있는가? 즉, 환자의 중증도 또는 위험 프로파일을 반영하는가?
  • RQ4전통적 FL 및 기존의 군집화된 FL 프레임워크에 비해 PCBFL의 예측 성능은 어떻게 비교되는가?
  • RQ5다중 사이트 분산 환경에서 보안 군집화의 통신 및 계산 비용은 얼마인가?

주요 결과

  • PCBFL은 사망 예측에서 기존의 전통적 FL 및 기존의 군집화된 FL 프레임워크 대비 평균 AUC 향상 4.3%와 AUPRC 향상 7.8%를 달성했다.
  • PCBFL이 형성한 군집은 임상적으로 의미 있었으며, 생명체징후, 진단, 약물 처방 등의 임상적 특징을 바탕으로 환자를 저위험, 중간위험, 고위험 사망군으로 분류했다.
  • 사이트별 성능 분석 결과, PCBFL은 개별 병원에서 다른 방법보다 일관되게 뛰어난 성능을 보였으며, 참여 유인성을 높였다.
  • 20개의 다양한 인터넷 치료실(ICU) 사이트를 거쳐도 오류를 유발하지 않고 정확한 군집을 형성하여 확장성과 강건성을 입증했다.
  • SMPC를 통해 강력한 프라이버시 보장을 유지하여, 차등적 프라이버시 방법에서 관찰되는 성능 저하를 피했다.
  • 사전 정의된 예측 작업이 필요 없이 비지도 형식의 표현형 분석(unsupervised phenotyping)과 위험 분류를 가능하게 하여, 사망 예측을 넘어서 더 넓은 응용 가능성을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.