Skip to main content
QUICK REVIEW

[论文解读] Limitations of ROC on Imbalanced Data: Evaluation of LVAD Mortality Risk Scores

Faezeh Movahedi, Rema Padman|arXiv (Cornell University)|Oct 29, 2020
Imbalanced Data Classification Techniques参考文献 22被引用 4
一句话总结

本论文表明,在不平衡的医疗数据中,如90天LVAD死亡率预测(仅8%的患者死亡),ROC曲线可能对分类器性能给出过于乐观的错觉。本文提出精确率-召回率曲线(PRC)作为更优、互补的评估指标,能更准确地衡量少数类(死亡)的表现。与ROC相比,PRC显示HMRS和随机森林分类器在PRC上的AUC显著更低,揭示了其在真实世界中对死亡率预测能力的不足。

ABSTRACT

Objective: This study illustrates the ambiguity of ROC in evaluating two classifiers of 90-day LVAD mortality. This paper also introduces the precision recall curve (PRC) as a supplemental metric that is more representative of LVAD classifiers performance in predicting the minority class. Background: In the LVAD domain, the receiver operating characteristic (ROC) is a commonly applied metric of performance of classifiers. However, ROC can provide a distorted view of classifiers ability to predict short-term mortality due to the overwhelmingly greater proportion of patients who survive, i.e. imbalanced data. Methods: This study compared the ROC and PRC for the outcome of two classifiers for 90-day LVAD mortality for 800 patients (test group) recorded in INTERMACS who received a continuous-flow LVAD between 2006 and 2016 (mean age of 59 years; 146 females vs. 654 males) in which mortality rate is only %8 at 90-day (imbalanced data). The two classifiers were HeartMate Risk Score (HMRS) and a Random Forest (RF). Results: The ROC indicates fairly good performance of RF and HRMS classifiers with Area Under Curves (AUC) of 0.77 vs. 0.63, respectively. This is in contrast with their PRC with AUC of 0.43 vs. 0.16 for RF and HRMS, respectively. The PRC for HRMS showed the precision rapidly dropped to only 10% with slightly increasing sensitivity. Conclusion: The ROC can portray an overly-optimistic performance of a classifier or risk score when applied to imbalanced data. The PRC provides better insight about the performance of a classifier by focusing on the minority class.

研究动机与目标

  • 强调ROC在评估不平衡医疗数据中分类器性能时的局限性,特别是在LVAD死亡率预测中的应用。
  • 证明当少数类(死亡)罕见时,ROC可能对分类器性能提供具有欺骗性的乐观评估。
  • 提出精确率-召回率曲线(PRC)作为不平衡数据集中少数类预测更合适、更具信息量的评估指标。
  • 通过ROC和PRC对比评估两种LVAD死亡率分类器(HeartMate风险评分,HMRS和随机森林,RF)的性能,揭示评估结果的差异。
  • 倡导在临床风险模型评估中将PRC作为标准补充指标,特别是在低发生率结局的情况下。

提出的方法

  • 在来自INTERMACS注册库的800名LVAD患者测试集中评估了两种分类器——HMRS和随机森林,以90天死亡率为结局。
  • 计算了两种分类器的ROC AUC和PRC AUC,以比较其在生存率92%、死亡率8%的不平衡数据下的表现。
  • 采用标准的基于阈值的分类方法,将预测概率转换为硬标签以进行性能评估。
  • 在INTERMACS中的11,967名患者中采用70/30的训练-测试划分,使用235个术前临床变量训练随机森林模型。
  • 通过聚焦精确率和召回率,特别是少数类(DEAD)的表现,突出PRC对数据不平衡的敏感性。
  • 对比ROC(对两类均等关注)与PRC(聚焦少数类)的解释,说明为何PRC更能反映真实临床实用性。

实验结果

研究问题

  • RQ1在不平衡数据中,ROC与PRC在评估LVAD死亡率风险分类器性能方面有何差异?
  • RQ2当结局类别高度不平衡(如LVAD术后90天死亡率)时,ROC在多大程度上高估了分类器的预测性能?
  • RQ3精确率-召回率曲线能否提供对预测罕见不良结局(如LVAD死亡率)更准确、更具临床意义的分类器性能评估?
  • RQ4为何传统指标如AUC-ROC无法反映风险评分在低发生率结局中的真实临床效用?
  • RQ5在术前LVAD风险评估中,使用ROC与PRC对临床决策有何影响?

主要发现

  • 随机森林分类器的ROC AUC为0.77,表明中等至良好性能,但其PRC AUC仅为0.43,表明在少数类上的表现极差。
  • HMRS的ROC AUC为0.63,表明表现尚可,但其PRC AUC仅为0.16,揭示其对90天死亡率的预测能力极弱。
  • PRC显示,即使在适度敏感度下,HMRS的精确率也迅速降至10%,表明假阳性率极高,且在识别真实死亡病例方面可靠性差。
  • ROC与PRC结果之间的显著差异表明,ROC在不平衡数据设置中可能对分类器性能给出危险的、误导性的乐观判断。
  • 本研究结论认为,PRC是评估临床环境中罕见结局(如LVAD术后死亡率)分类器性能更富信息量且更现实的指标。
  • 研究结果表明,广泛使用的风险评分(如HMRS)可能因依赖ROC而被高估其性能,应使用PRC重新评估,以提供更好的临床决策支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。