Skip to main content
QUICK REVIEW

[논문 리뷰] Coarse race data conceals disparities in clinical risk score performance

Rajiv Movva, Divya Shanmugam|arXiv (Cornell University)|2023. 04. 18.
Emergency and Acute Care Studies인용 수 11
한 줄 요약

논문은 granular race 데이터가 coarse race categories로는 가려지는 임상 위험 점수 성능의 차이를 418K의 응급실 방문과 26개의 세부 그룹을 사용해 입증한다.

ABSTRACT

Healthcare data in the United States often records only a patient's coarse race group: for example, both Indian and Chinese patients are typically coded as "Asian." It is unknown, however, whether this coarse coding conceals meaningful disparities in the performance of clinical risk scores across granular race groups. Here we show that it does. Using data from 418K emergency department visits, we assess clinical risk score performance disparities across 26 granular groups for three outcomes, five risk scores, and four performance metrics. Across outcomes and metrics, we show that the risk scores exhibit significant granular performance disparities within coarse race groups. In fact, variation in performance within coarse groups often *exceeds* the variation between coarse groups. We explore why these disparities arise, finding that outcome rates, feature distributions, and the relationships between features and outcomes all vary significantly across granular groups. Our results suggest that healthcare providers, hospital systems, and machine learning researchers should strive to collect, release, and use granular race data in place of coarse race data, and that existing analyses may significantly underestimate racial disparities in performance.

연구 동기 및 목표

  • coarse 인종 그룹 내에서 이질성이 존재하므로 의료 분석에서 세부 인종 데이터의 필요성을 동기화한다.
  • 세부 인종 하위 그룹 간에 위험 예측 점수의 차이를 정량화한다.
  • coarse-인종 분석이 위험 점수 성능의 인종 차이를 과소 추정하는 정도를 평가한다.
  • 세부 차이가 야기하는 데이터 분포 요인(outcome 비율, 특징 분포, X→y 관계)을 분석한다.

제안 방법

  • BIDMC의 418K ED 방문에 대해 self-identified coarse 및 granular 인종 범주를 가진 MIMIC-IV-ED 데이터를 사용한다.
  • 다섯 가지 위험 점수(두 개의 임상 점수와 세 개의 ML 모델)를 세 가지 ED 결과에 대해 평가한다.
  • 95% 신뢰구간으로 coarse 및 granular 그룹에 걸쳐 네 가지 성능 지표(AUPRC, AUROC, FPR, FNR)를 계산한다.
  • granular 하위 그룹을 coarse 그룹과 비교할 때 다중 가설 검정에 Bonferroni 보정을 적용한다.
  • 샘플 크기 확인, 결과 빈도, 특징 분포, p(y|X) 변동을 통해 데이터 분포가 격차에 기여하는 정도를 분석한다.
  • robustness 확인을 위해 대체 모델(LR 및 XGBoost)을 사용해 ML 결과를 재현한다.

실험 결과

연구 질문

  • RQ1 동일한 coarse 인종 범주 내에서 granular 인종 그룹 간의 예측 위험 점수 성능이 유의하게 차이나는가?
  • RQ2 coarse 그룹 간의 차이보다 coarse 그룹 내 변동성이 더 큰가, 즉 coarse 그룹 분석 아래 숨겨진 차이가 있는가?
  • RQ3 granular 차이가 성능의 어떤 데이터 분포 요인(샘플 크기, 결과 빈도, 특징 분포, 특징-결과 관계)에 의해 발생하는가?
  • RQ4 세부 인종 데이터의 수집 및 사용이 임상 위험 점수의 공정성 평가 및 개선에 도움이 되는가?

주요 결과

  • Granular 인종 그룹은 여러 결과 및 지표에 걸쳐 coarse 인종 그룹으로는 포착되지 않는 중요한 성능 차이를 보인다.
  • coarse 그룹 내 성능 변동이 종종 coarse 간 변동과 동일하거나 더 크며, 때로는 두 배 이상 차이가 난다.
  • 결과 빈도가 세부 그룹 간 의미 있게 다르며, 이는 AUPRC, FPR, FNR와 같은 지표의 차이에 기여한다.
  • 특징 분포와 특징–결과 관계가 세부 그룹 간 다르게 나타나며, 공변량 이동 및 서로 다른 예측 신호를 시사한다.
  • 회귀 분석은 granular 인종 상호 작용이 결과 예측 적합도를 크게 개선함을 보여주며, p(y|X)가 coarse 내에서 granular 그룹 간에 다르게 나타난다는 것을 시사한다.
  • 선별 Orang 특성의 예측 중요도는 그룹별로 달라져 위험 점수가 granular 그룹 간에 다르게 보정될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.