Skip to main content
QUICK REVIEW

[論文レビュー] Coarse race data conceals disparities in clinical risk score performance

Rajiv Movva, Divya Shanmugam|arXiv (Cornell University)|Apr 18, 2023
Emergency and Acute Care Studies被引用数 11
ひとこと要約

本論文は、granular race data(細分化された人種データ)が、coarse race categoriesを用いた場合には隠れてしまう臨床リスクスコアの性能に顕著な格差を明らかにすることを示しており、26の細分化グループにまたがる418Kの救急部門訪問を用いて検証している。

ABSTRACT

Healthcare data in the United States often records only a patient's coarse race group: for example, both Indian and Chinese patients are typically coded as "Asian." It is unknown, however, whether this coarse coding conceals meaningful disparities in the performance of clinical risk scores across granular race groups. Here we show that it does. Using data from 418K emergency department visits, we assess clinical risk score performance disparities across 26 granular groups for three outcomes, five risk scores, and four performance metrics. Across outcomes and metrics, we show that the risk scores exhibit significant granular performance disparities within coarse race groups. In fact, variation in performance within coarse groups often *exceeds* the variation between coarse groups. We explore why these disparities arise, finding that outcome rates, feature distributions, and the relationships between features and outcomes all vary significantly across granular groups. Our results suggest that healthcare providers, hospital systems, and machine learning researchers should strive to collect, release, and use granular race data in place of coarse race data, and that existing analyses may significantly underestimate racial disparities in performance.

研究の動機と目的

  • 粗い人種グループ内の異質性のため、医療分析において粒度の高い人種データの必要性を喚起する。
  • 粒度の高い人種のサブグループ間で予測的リスクスコアがどのように異なるかを定量化する。
  • 粗い人種分析がリスクスコアの性能における人種差を過小評価する程度を評価する。
  • 粒度の高い格差を生み出すデータ分布要因(アウトカム頻度、特徴分布、およびX→yの関係)を調査する。

提案手法

  • BIDMCの418K回の救急訪問について、自己申告の粗い人種カテゴリと細分化人種カテゴリを用いたMIMIC-IV-EDデータを使用。
  • 3つのEDアウトカムに対して、5つのリスクスコア(2つの臨床スコアと3つのMLモデル)を評価。
  • 粗い群と細分化群を横断して、95%信頼区間付きで4つの性能指標(AUPRC、AUROC、FPR、FNR)を計算。
  • 粗群と細目群を比較する際、重複検定補正としてBonferroni補正を適用。
  • サンプルサイズの検証、アウトカム頻度、特徴分布、p(y|X)の変動を通じて、データ分布が格差に寄与する程度を分析。
  • ロジスティック回帰(LR)とXGBoostなどの代替モデルを用いてML結果を再現し、頑健性を検証。

実験結果

リサーチクエスチョン

  • RQ1同じ粗い人種カテゴリー内で、粒度の高い人種グループ間で予測リスクスコアの性能が有意に異なるか?
  • RQ2粗群内の性能変動が粗群間の変動より大きく、粗群分析下で潜在する格差を示しているか?
  • RQ3粒度の高い格差を生み出すデータ分布要因は何か(サンプルサイズ、アウトカム頻度、特徴分布、特徴とアウトカムの関係)?
  • RQ4粒度の高い人種データを収集・活用して、臨床リスクスコアの公正性をより適切に評価・改善すべきか?

主な発見

  • 粒度の高い人種グループは、粗い人種グループには捉えられない顕著な性能格差を示す。
  • 粗群内の性能変動は、粗群間の変動と同等かそれ以上であり、場合によっては2倍超になる。
  • アウトカム頻度は粒度グループ間で有意に異なり、AUPRC、FPR、FNRなどの指標の格差に寄与する。
  • 特徴分布と特徴–アウトカムの関係は粒度グループ間で異なり、共変量シフトとグループ間で異なる予測信号を示している。
  • 回帰分析は、粒度人種の相互作用がアウトカム予測の適合を有意に改善することを示し、p(y|X)が粗群内の粒度グループ間で異なることを示唆する。
  • トリアージの急度や特定の併存疾患はグループ固有の予測的重要性を持ち、リスクスコアが粒度グループ間で異なるキャリブレーションを受ける可能性を示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。