Skip to main content
QUICK REVIEW

[논문 리뷰] Chasing Your Long Tails: Differentially Private Prediction in Health Care Settings

Vinith M. Suriyakumar, Nicolas Papernot|arXiv (Cornell University)|2020. 10. 13.
Healthcare Policy and Management참고 문헌 105인용 수 9
한 줄 요약

이 논문은 임상 데이터(НИХ X-ray 및 MIMIC-III EHR)를 사용하여 차등적 비밀유지(differential privacy, DP) 기계학습의 상호보완적 특성에 대해 연구한다. DP-SGD와 목적 함수 편향을 활용하여 모델을 훈련시키며, 심각한 개인정보-유용성 상호보완적 특성, 데이터 분포 변화에 대한 저항력 감소, 특히 높은 개인정보 보호 수준에서 다수 집단의 영향력 증가를 발견한다. 이는 실생활 의료 환경에서 공정성과 모델 안정성에 악영향을 미친다.

ABSTRACT

Machine learning models in health care are often deployed in settings where it is important to protect patient privacy. In such settings, methods for differentially private (DP) learning provide a general-purpose approach to learn models with privacy guarantees. Modern methods for DP learning ensure privacy through mechanisms that censor information judged as too unique. The resulting privacy-preserving models, therefore, neglect information from the tails of a data distribution, resulting in a loss of accuracy that can disproportionately affect small groups. In this paper, we study the effects of DP learning in health care. We use state-of-the-art methods for DP learning to train privacy-preserving models in clinical prediction tasks, including x-ray classification of images and mortality prediction in time series data. We use these models to perform a comprehensive empirical investigation of the tradeoffs between privacy, utility, robustness to dataset shift, and fairness. Our results highlight lesser-known limitations of methods for DP learning in health care, models that exhibit steep tradeoffs between privacy and utility, and models whose predictions are disproportionately influenced by large demographic groups in the training data. We discuss the costs and benefits of differentially private learning in health care.

연구 동기 및 목표

  • 차등적 비밀유지(DP)가 임상 기계학습에서 모델의 유용성, 저항성, 공정성에 미치는 영향을 평가하기.
  • 데이터 꼬리 부분에서 소수 집단이 부족하기 때문에 DP 학습이 이들의 성능에 비례하여 악영향을 미치는지 조사하기.
  • 전자건강기록(EHR)에서 흔히 발생하는 데이터셋 이동 상황에서 DP가 모델 안정성에 어떤 영향을 미치는지 평가하기.
  • 비공개 설정과 공개 설정에서 개별 훈련 환자가 테스트 예측에 미치는 영향을 정량화하기.
  • 실생활 의료 데이터셋에서의 개인정보-공정성 및 개인정보-저항성 상호보완적 특성 규명하기.

제안 방법

  • NIH 흉부 X-ray 및 MIMIC-III EHR 데이터셋을 대상으로 DP-SGD와 목적 함수 편향을 사용하여 차등적 비밀유지 모델을 훈련시켰다.
  • 모델 성능을 세 가지 임상 과제에서 평가: 생존 예측, 장기 입원 기간(LOS) 예측, 혈압 강하제 투여 시기 예측.
  • 연간 모델을 MIMIC-III에서 훈련하고 시간대별 성능 변동성을 측정하여 저항성 평가.
  • 표준 지표를 사용하여 공정성 평가: 인구집단 간 성능 격차, 평등성 격차, 재현율 격차, 특이도 격차.
  • 영향 함수를 적용하여 비공개 및 공개 설정에서 개별 훈련 환자가 테스트 예측에 기여하는 정도를 측정.
  • 다양한 개인정보 보호 수준 간의 영향 패턴을 비교하여 DP가 특정 환자의 영향력을 감소시키는지 평가.

실험 결과

연구 질문

  • RQ1차등적 비밀유지 학습 방법이 임상 예측 과제에서 모델 정확도와 유용성에 어떤 영향을 미치는가?
  • RQ2차등적 비밀유지가 종단적 EHR 데이터에서 데이터셋 이동에 대한 모델 저항성에 어느 정도 영향을 미치는가?
  • RQ3DP 학습이 의료 데이터에서 부족한 인구집단에 대해 공정성에 어떤 영향을 미치는가?
  • RQ4차등적 비밀유지가 개별 훈련 환자가 테스트 예측에 미치는 영향을 어떻게 변화시키는가?
  • RQ5개인정보 보호 수준과 모델 예측에서 영향력 있는 훈련 환자에 대한 개인화 수준 간의 관계는 무엇인가?

주요 결과

  • MIMIC-III EHR 데이터에서 DP 모델은 심각한 개인정보-유용성 상호보완적 특성을 보였으며, 중간 개인정보 보호 예산에서도 정확도가 크게 감소했다.
  • 높은 개인정보 보호 수준에서 퇴원 후 생존 및 장기 입원 예측 과제에서 연간 데이터 분포 변화에 대해 더 높은 안정성을 보였으며, 개념 및 데이터 분포 변화에 대한 저항성이 향상됨을 시사했다.
  • 영향 함수 분석 결과, 높은 개인정보 보호 수준에서 가장 도움이 되고 해로운 훈련 환자들이 개별 테스트 환자에 맞게 더 개인화되었으며, 특정 환자의 영향력이 감소했다.
  • 공동으로 가장 영향력 있는 훈련 환자 빈도는 비공개 모델에서 25%에서 고비밀성 모델로 7%로 감소하여, 글로벌 영향력 감소와 함께 개인화 증가를 나타냈다.
  • 다수의 민족 집단(예: 백인 환자)은 고비밀성 환경에서 영향력이 크게 증가했으며, 이는 DP가 집단 수준의 편향을 악화시켜 공정성 문제를 악화시킬 수 있음을 시사한다.
  • 생존 예측 과제에서 고비밀성 모델은 연간으로 일관된 영향력을 유지했지만, 비공개 모델은 높은 변동성을 보였으며, 이는 DP가 비정적 조건 하에서도 안정성을 향상시킨다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.