Skip to main content
QUICK REVIEW

[논문 리뷰] Using Interpretable Machine Learning to Predict Maternal and Fetal Outcomes

Tomas M. Bosschieter, Zifei Xu|arXiv (Cornell University)|2022. 07. 12.
Statistical Methods in Epidemiology인용 수 4
한 줄 요약

이 연구는 설명 가능한 부스팅 머신(EBM)이라는 유리 상자 해석 가능한 기계학습 모델을 사용하여 222,001명의 익명화된 환자로 구성된 대규모 실생활 산과 데이터셋을 바탕으로 산모 및 태반 합병증—심각한 산모 합병증(SMM), 어깨 탈출, 조산 전 임신성 고혈압—을 예측한다. EBMs는 XGBoost나 딥 뉴럴 네트워크와 같은 블랙박스 모델과 유사한 예측 성능를 달성하면서도, 자궁경부가 완전히 확장된 후 분만까지의 시간과 산모 신장과 같은 직관에 어긋나는 위험 요인을 드러내어 전통적인 임상 가정을 도전한다.

ABSTRACT

Most pregnancies and births result in a good outcome, but complications are not uncommon and when they do occur, they can be associated with serious implications for mothers and babies. Predictive modeling has the potential to improve outcomes through better understanding of risk factors, heightened surveillance, and more timely and appropriate interventions, thereby helping obstetricians deliver better care. For three types of complications we identify and study the most important risk factors using Explainable Boosting Machine (EBM), a glass box model, in order to gain intelligibility: (i) Severe Maternal Morbidity (SMM), (ii) shoulder dystocia, and (iii) preterm preeclampsia. While using the interpretability of EBM's to reveal surprising insights into the features contributing to risk, our experiments show EBMs match the accuracy of other black-box ML methods such as deep neural nets and random forests.

연구 동기 및 목표

  • 세 가지 심각한 산과 합병증—SMM, 어깨 탈출, 조산 전 임신성 고혈압—에 대한 가장 중요한 위험 요인을 특정하고 정량화하는 것.
  • 특히 설명 가능한 기계학습 모델인 설명 가능한 부스팅 머신(EBM)이 높은 정확도와 투명성으로 이러한 결과를 예측하는 성능을 평가하는 것.
  • 모델의 해석 가능성 덕분에 놀라운 데이터 기반 관계를 드러내어 전통적인 임상 가정을 도전하고 수정하는 것.
  • EBM이 표준 로지스틱 회귀 모델보다 예측 성능가 뛰어나면서도 완전한 해석 가능성을 유지할 수 있음을 보여주어 임상 의사결정 지원에 적합함을 입증하는 것.

제안 방법

  • 이 연구는 설명 가능한 부스팅 머신(EBM)을 활용한다. EBM은 각 특성에 대해 단변량 형태 함수를 학습하는 일반화된 가산 모델(GAM)의 일종으로, 전역 및 국소적 해석 가능성을 제공한다.
  • EBMs는 미국 내 20개 병원에서 수집한 익명화된 임상 데이터셋을 기반으로 훈련되며, 408개의 특성과 222,001건의 환자 기록을 포함한다. 결과는 임상 진단 코드로 정의된다.
  • 특성 선택은 임상적 타당성과 시간적 우선 순서에 기반한다. 즉, 결과가 발생하기 이전에 측정 가능한 변수들만 예측에 사용된다.
  • 모델은 예측 정확도 향상을 위해 중요한 이원 상호작용 항목을 자동으로 탐지하고 통합하면서도 해석 가능성은 유지한다.
  • 모델 성능 평가는 AUROC와 캘리브레이션 곡선를 사용하여 XGBoost, 랜덤 포레스트, 딥 뉴럴 네트워크, 로지스틱 회귀와 비교한다.
  • 해석 가능성은 외부 백킹에서 유도된 불확실성의 오차 막대를 포함한 형태 함수를 통해 시각화되며, 각 특성이 예측 위험에 미치는 경계 효과를 보여준다.

실험 결과

연구 질문

  • RQ1해석 가능한 기계학습 모델에 따르면, 심각한 산모 합병증(SMM), 어깨 탈출, 조산 전 임신성 고혈압에 대해 가장 중요한 예측 변수는 무엇인가?
  • RQ2설명 가능한 부스팅 머신(EBM)의 성능는 XGBoost나 딥 뉴럴 네트워크와 같은 블랙박스 모델과 비교해 어떻게 되는가?
  • RQ3EBM 모델은 전통적인 임상 가정을 도전하는 놀라운 또는 비직관적인 위험 요인 관계를 무엇으로 드러내는가?
  • RQ4인종과 민족성 같은 인구통계학적 요소가 위험에 얼마나 기여하는가? 이러한 영향은 임상적·생물학적 변수에 의해 어떻게 매개되는가?

주요 결과

  • EBM은 XGBoost, 랜덤 포레스트, 딥 뉴럴 네트워크, 로지스틱 회귀와 유사한 AUROC 점수를 기록하여 강력한 예측 성능를 확보하면서도 완전한 해석 가능성을 유지함을 입증했다.
  • SMM의 가장 중요한 위험 요인은 전두 고혈압 또는 임신성 고혈압이었으며, 그 다음으로는 자궁경부가 완전히 확장된 후 분만까지의 시간과 제왕절개력이었다.
  • 어깨 탈출의 경우 태아의 체중이 가장 큰 기여를 했지만, 양막파열 후 분만까지의 시간과 산모 신장 역시 매우 유의미한 요소였으며, 이는 태아 크기와 산모 당뇨병의 우선성을 도전하는 결과였다.
  • 조산 전 임신성 고혈압의 경우 산모의 체질량지수(BMI), 이전 기록상의 사산 횟수, 임신 이전 고혈압이 상위 3개 위험 요인으로 나타났으며, 44세 이상의 나이는 강한 기여도를 보였다.
  • 모델은 태아 체중 3250g~4250g 범위에서 어깨 탈출 위험과의 거의 선형 관계를 드러내어 이전에 강조되지 않은 임계값 효과를 시사했다.
  • 백색 이외의 인종과 히스패닉/라티노 배경은 SMM과 어깨 탈출 모두에서 높은 위험과 관련이 있었지만, 이러한 연관성은 의료 접근성 및 기타 관련 요인에 의해 매개될 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.