Skip to main content
QUICK REVIEW

[논문 리뷰] Generation of Differentially Private Heterogeneous Electronic Health Records

Kieran Chin-Cheong, Thomas M. Sutter|arXiv (Cornell University)|2020. 06. 05.
Privacy-Preserving Technologies in Data참고 문헌 18인용 수 8
한 줄 요약

이 논문은 하향류 기계학습 작업을 위해 고품질의 차별적 비밀유지 합성 이질적 전자건강기록(EHR)을 생성하기 위해 기울기 보정이 있는 워샤르스타인 GAN(WGAN-GP)을 제안한다. 이 방법은 강력한(1, 10⁻⁵) 차별적 비밀유지 조건에서도 기준 성능에 근접한 성능(auROC, AUPRC 및 정확도 기준 3–5% 이내)을 달성하였으며, 성별 또는 연령군 하위집단 간에 유의미한 편향이 발생하지 않았다.

ABSTRACT

Electronic Health Records (EHRs) are commonly used by the machine learning community for research on problems specifically related to health care and medicine. EHRs have the advantages that they can be easily distributed and contain many features useful for e.g. classification problems. What makes EHR data sets different from typical machine learning data sets is that they are often very sparse, due to their high dimensionality, and often contain heterogeneous (mixed) data types. Furthermore, the data sets deal with sensitive information, which limits the distribution of any models learned using them, due to privacy concerns. For these reasons, using EHR data in practice presents a real challenge. In this work, we explore using Generative Adversarial Networks to generate synthetic, heterogeneous EHRs with the goal of using these synthetic records in place of existing data sets for downstream classification tasks. We will further explore applying differential privacy (DP) preserving optimization in order to produce DP synthetic EHR data sets, which provide rigorous privacy guarantees, and are therefore shareable and usable in the real world. The performance (measured by AUROC, AUPRC and accuracy) of our model's synthetic, heterogeneous data is very close to the original data set (within 3 - 5% of the baseline) for the non-DP model when tested in a binary classification task. Using strong $(1, 10^{-5})$ DP, our model still produces data useful for machine learning tasks, albeit incurring a roughly 17% performance penalty in our tested classification task. We additionally perform a sub-population analysis and find that our model does not introduce any bias into the synthetic EHR data compared to the baseline in either male/female populations, or the 0-18, 19-50 and 51+ age groups in terms of classification performance for either the non-DP or DP variant.

연구 동기 및 목표

  • 개인정보 위험이 높은 EHR 데이터 공유 문제를 해결하기 위해, 특히 훈련된 모델로부터 재식별 위험이 높은 상황에서의 개인정보 보호를 고려한다.
  • 혼합 데이터 유형과 고도로 희박한 특성을 포함한 고품질의 이질적 EHR(합성)를 생성하여 하향류 기계학습 작업에 대한 유효성을 유지한다.
  • 합성 EHR 데이터에 대한 엄격한 개인정보 보호 보장을 보장하기 위해 GAN 훈련 과정에 차별적 비밀유지를 통합한다.
  • 실제 데이터와 비교하여 성별 및 연령군 하위집단 간 성능 분석을 통해 합성 데이터가 편향을 유발하는지 평가한다.

제안 방법

  • 두 가지 다른 GAN 변종과의 경험적 평가를 통해 선택된, 기울기 보정이 있는 워샤르스타인 GAN(WGAN-GP)을 사용하여 합성 EHR를 생성한다.
  • 생성자에 대해 (1, 10⁻⁵)-DP를 보장하기 위해 훈련 중에 차별적 비밀유지 확률적 경사하강법(DP-SGD)을 적용한다.
  • 수치형(예: 연령, 체중) 및 희박한 범주형 특성(예: ICD 코드)을 혼합한 이질적 EHR 데이터를 처리하며, 테이블 형식 데이터 전용 전처리 및 조건부 처리를 수행한다.
  • 실제 및 합성 EHR 데이터를 바탕으로 하향류 이진 분류기를 훈련하여 유효성을 평가하며, auROC, AUPRC 및 정확도를 지표로 사용한다.
  • 성별(남성/여성) 및 연령군(0–18세, 19–50세, 51세 이상) 간 하위집단 분석을 수행하여 모델 성능의 공정성과 편향을 평가한다.
  • WGAN-GP, GAN 및 조건부 GAN을 비교하여 최고의 성능을 보이는 아키텍처를 선택하는 데이터 기반의 모델 선택 절차를 시행한다.

실험 결과

연구 질문

  • RQ1GAN 기반 모델이 하향류 이진 분류 작업에 충분한 유효성을 유지하는 합성 EHR를 생성할 수 있는가? 이는 실제 데이터와 유사한 성능을 보일 수 있는가?
  • RQ2DP-SGD를 통해 차별적 비밀유지를 적용할 경우, 하향류 분류 작업에서 생성된 합성 EHR의 성능에 어떤 영향을 미치는가?
  • RQ3합성 데이터 생성 과정이 원본 데이터와 비교해 성별 또는 연령군 하위집단 간에 편향을 유발하거나 악화시키는가?
  • RQ4차별적 비밀유지가 훈련 데이터의 불균형 또는 이방성 샘플에 미치는 영향을 어느 정도 완화하는가?

주요 결과

  • 차별적 비밀유지가 적용되지 않은 WGAN-GP 모델은 auROC, AUPRC 및 정확도 지표에서 기준 성능(실제 데이터 기준)과 3–5% 이내의 성능을 달성한다.
  • 강력한 (1, 10⁻⁵)-차별적 비밀유지 조건 하에서, 최악의 지표(정확도)에서 17%의 성능 손실가 발생하지만, 여전히 하향류 작업에 사용 가능한 데이터를 생성한다.
  • 합성 데이터에 유의미한 편향이 발생하지 않았다: 남성 및 여성 하위집단 간 성능 차이는 모든 지표에서 3% 이내였다.
  • 연령군 간 성능 분석 결과 일관된 추세를 보였다—0–18세 연령대는 auROC와 정확도가 가장 높았고, 51세 이상 연령대는 AUPRC가 가장 우수했다—이는 모델 편향이 아닌 데이터 자체의 복잡성 때문임을 시사한다.
  • DP 버전은 성능 노이즈가 증가했지만, 하위집단 간 성능 차이는 최소한(auROC 기준 ≤3%) 유지되어, DP가 데이터 불균형 또는 이방성 샘플의 영향을 감소시킬 수 있음을 시사한다.
  • 결과적으로 모델이 새로운 편향을 유도하지 않으며, 차별적 비밀유지는 개별 샘플의 영향력을 감소시켜 존재하는 데이터 편향을 완화시킬 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.