Skip to main content
QUICK REVIEW

[논문 리뷰] Federated and Differentially Private Learning for Electronic Health Records

Stephen Pfohl, Andrew M. Dai|arXiv (Cornell University)|2019. 11. 13.
Privacy-Preserving Technologies in Data참고 문헌 10인용 수 44
한 줄 요약

이 논문은 eICU-CRD 데이터셋을 사용하여 임상 예측 작업에 대해 중앙집중식, 연합학습 및 차등 프라이버시(DP) 학습을 비교하고, DP-SGD가 중앙집중에서 효과적이지만 프라이버시를 보장하는 학습에서 연합 설정은 도전적임을 보여준다.

ABSTRACT

The use of collaborative and decentralized machine learning techniques such as federated learning have the potential to enable the development and deployment of clinical risk predictions models in low-resource settings without requiring sensitive data be shared or stored in a central repository. This process necessitates communication of model weights or updates between collaborating entities, but it is unclear to what extent patient privacy is compromised as a result. To gain insight into this question, we study the efficacy of centralized versus federated learning in both private and non-private settings. The clinical prediction tasks we consider are the prediction of prolonged length of stay and in-hospital mortality across thirty one hospitals in the eICU Collaborative Research Database. We find that while it is straightforward to apply differentially private stochastic gradient descent to achieve strong privacy bounds when training in a centralized setting, it is considerably more difficult to do so in the federated setting.

연구 동기 및 목표

  • 병원 간 협력을 촉진하여 원시 환자 데이터를 공유하지 않고 예측 모델링을 수행하는 동시에 프라이버시 보장을 다루는 것을 목표로 한다.
  • 임상 작업에 대해 비프라이빗 설정과 DP 설정에서 중앙집중식 vs. 연합 학습을 평가한다.
  • 차등 프라이버시를 중앙집중식 및 연합 설정에 적용할 때의 프라이버시-유틸리티 트레이드오프를 정량화한다.

제안 방법

  • 31개 병원에서 eICU-CRD를 사용하여 로지스틱 회귀와 한 은닉층 네트워크를 학습하기 위해 연합 평균(FedAvg)과 DP-SGD를 활용한다.
  • 입원 24시간 이내의 검사 주문/결과, 약물, 진단, 환자 인구통계로부터 특징을 구성한다.
  • 두 가지 작업(입원 중 사망 및 장기 체류)에서 로컬, 중앙집중식, 연합 학습을 차등 프라이버시 여부와 관계없이 비교한다.
  • DP 매개변수(epsilon, delta)로 프라이버시를 평가하고 DeLong 신뢰구간이 있는 AUC-ROC로 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1연합학습이 ICU 결과 예측 작업에서 중앙학습과 유사한 예측 성능을 제공할 수 있는가?
  • RQ2차등 프라이버시의 추가가 중앙 집중식 vs 연합 설정에서 모델 유용성에 어떤 영향을 미치는가?
  • RQ3임상 데이터에 대한 프라이버시 보장을 고려할 때 DP-SGD가 연합 학습에서 실용적인가? 프라이버시 보장 및 정확성 측면에서?

주요 결과

  • 연합학습은 종종 중앙집중 학습에 가까운 AUC-ROC를 보이고 종종 로컬 병원 모델보다 향상되지만, 차이가 항상 통계적으로 유의하지는 않는다.
  • 차등 프라이버시가 적용된 중앙집중식 학습은 프라이버시를 강하게 달성할 수 있으며(ε가 약 1 정도), AUC-ROC 감소도 완만하다(예: 체류: 0.763 vs 0.73; 사망: 0.876 vs 0.832).
  • DP-SGD를 사용한 연합 학습은 비-DP 설정에 비해 사망 예측에서 AUC-ROC나 프라이버시 비용(ε) 측면에서 종종 성능이 나쁘다.
  • 로컬 데이터에서 최적화된 DP-SGD 하이퍼파라미터를 연합 설정으로 바로 옮길 수 없어 분산 임상 데이터에 대한 프라이버시-유틸리티 트레이드오프의 도전을 강조한다.
  • 연구는 모델 선택의 프라이버시 비용을 무시하면 낙관적인 프라이버시 추정치를 낳을 수 있음을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.