Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Representations of Missing Data for Predicting Patient Outcomes

Brandon Malone, Alberto García-Durán|arXiv (Cornell University)|2018. 11. 12.
Machine Learning in Healthcare참고 문헌 21인용 수 7
한 줄 요약

이 논문은 전자 건강 기록(EHR)에서 누락된 데이터를 명시적으로 모델링하기 위해 관측된 데이터 및 누락된 데이터 모odalities에 대해 별도의 임베딩을 학습하는 그래프 기반 표현 학습 방법인 EP-md를 제안한다. 환자 유사성 그래프를 통해 메시지 전파를 활용함으로써 누락된 특성에 대한 정보를 전파하여, 입원 사망률, 퇠퇴 기간, 퇠퇴 목적지 예측 성능을 향상시킨다. 다중 모odal 데이터(시계열, 텍스트, 인구통계학적 데이터)를 사용할 경우 최신 기술을 능가한다.

ABSTRACT

Extracting actionable insight from Electronic Health Records (EHRs) poses several challenges for traditional machine learning approaches. Patients are often missing data relative to each other; the data comes in a variety of modalities, such as multivariate time series, free text, and categorical demographic information; important relationships among patients can be difficult to detect; and many others. In this work, we propose a novel approach to address these first three challenges using a representation learning scheme based on message passing. We show that our proposed approach is competitive with or outperforms the state of the art for predicting in-hospital mortality (binary classification), the length of hospital visits (regression) and the discharge destination (multiclass classification).

연구 동기 및 목표

  • 기존 기계 학습 접근법을 방해하는 전자 건강 기록(EHR) 내 누락 및 완성되지 않은 데이터 문제를 해결하기 위해.
  • 시계열, 자유 텍스트, 인구통계학적 데이터와 같은 다양한 데이터 모달리티를 통합된 표현 학습 프레임워크 내에서 모델링하기 위해.
  • 누락된 데이터를 학습 가능한 임베딩으로 명시적으로 표현하고, 환자 유사성 그래프를 통해 전파함으로써 예측 성능을 향상시키기 위해.
  • 입원 사망률, 퇠퇴 기간, 퇠퇴 목적지와 같은 핵심 임상 예측 과제에서 성능 향상을 입증하기 위해.
  • 특징이 누락되어도 모델 예측에 가장 영향을 미치는 요소를 식별함으로써 해석 가능성 제공하기 위해.

제안 방법

  • 관측된 데이터와 누락된 데이터를 모두 모델링하기 위해 각 모달리티당 이중 표현을 사용하는 임베딩 전파(EP) 기법을 확장한다.
  • 임상적 유사성 기반으로 환자 유사성 그래프를 구축하며, 유사한 특성 또는 진단을 가진 환자 간에 간선을 연결한다.
  • 모달리티별 임베딩 학습을 위해 복원 손실을 사용함으로써, 일부 환자에게 데이터가 부재하더라도 표현 학습이 가능하도록 한다.
  • 각 환자 및 모달리티당 두 가지 표현을 학습한다: 관측된 데이터용 표현과 누락된 데이터용 표현이며, 양측 모두 이웃 환자로부터의 메시지 전파를 통해 정보를 얻는다.
  • 모달리티별 임베딩을 통합하여 최종 예측 과제를 위한 통합된 환자 표현을 구성한다.
  • MIMIC-III 벤치마크에 모델를 적용하여 시계열, 정의사서(텍스트), 인구통계학적 데이터를 통합하여 다중 모달 학습을 수행한다.

실험 결과

연구 질문

  • RQ1그래프 기반 표현 학습 프레임워크가 누락된 데이터에 대해 명시적인 임베딩을 학습함으로써 EHR 내 누락된 데이터를 효과적으로 모델링할 수 있는가?
  • RQ2학습 가능한 표현으로 누락된 데이터를 모델링할 경우 임상 예후 예측 성능이 어떻게 향상되는가?
  • RQ3시계열, 텍스트, 인구통계학적 데이터 등 다양한 데이터 모달리티를 누락된 데이터 모델링과 결합할 경우 예측 성능이 향상되는가?
  • RQ4학습된 표현이 관측되지 않은 특성의 영향을 얼마나 잘 반영하는가, 특히 해당 특성이 부재한 경우에도?
  • RQ5특징이 누락되어도 모델이 예측에 가장 영향을 미치는 임상적 특징을 식별할 수 있는가?

주요 결과

  • 다중 모달 데이터(시계열, 텍스트, 인구통계학적 데이터)를 사용할 경우, EP-md는 퇠퇴 기간 및 퇠퇴 목적지 예측에서 최신 기술을 능가한다.
  • 시계열 데이터만을 사용할 경우에도 EP-md는 입원 사망률 예측에서 장기 기억망(LSTM) 네트워크와 경쟁 가능한 성능을 달성한다.
  • 흡제 기간 예측에서, 100개의 레이블된 샘플로 훈련했을 경우, 원시 특성 대비 평균 절대 오차(MAE)를 최대 15%까지 감소시켰다.
  • 관측된 경우와 누락된 경우의 비교에서 음수의 MAE 차이를 보이며, 누락된 특성이 있는 환자에 대해서도 기준 모델보다 더 정확하게 예측함을 입증했다.
  • 온도와 pH는 흡제 기간 예측에서 가장 영향력 있는 특징이며, 관측되었을 때나 누락되었을 때나 일관되게 기여함을 보여주며, 누락된 데이터에 대한 정보 전파가 효과적으로 이루어졌음을 시사한다.
  • 그레고리 콤마 척도 특징는 누락되었을 경우 기여도가 낮아지며, 이는 모델이 관측되지 않은 임상 지표의 예측 능력 저하를 효과적으로 반영하고 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.