[论文解读] Exploiting Uncertainties from Ensemble Learners to Improve Decision-Making in Healthcare AI
本文提出使用集成均值作为优于集成方差的不确定性度量,以提升医疗人工智能中的决策能力,特别是在检测早期糖尿病视网膜病变方面。理论分析与真实世界数据集上的实证验证表明,集成均值比方差更能有效减少假阴性,从而在几乎不增加重新检查负担的前提下,实现更优的人机协作。
Ensemble learning is widely applied in Machine Learning (ML) to improve model performance and to mitigate decision risks. In this approach, predictions from a diverse set of learners are combined to obtain a joint decision. Recently, various methods have been explored in literature for estimating decision uncertainties using ensemble learning; however, determining which metrics are a better fit for certain decision-making applications remains a challenging task. In this paper, we study the following key research question in the selection of uncertainty metrics: when does an uncertainty metric outperforms another? We answer this question via a rigorous analysis of two commonly used uncertainty metrics in ensemble learning, namely ensemble mean and ensemble variance. We show that, under mild assumptions on the ensemble learners, ensemble mean is preferable with respect to ensemble variance as an uncertainty metric for decision making. We empirically validate our assumptions and theoretical results via an extensive case study: the diagnosis of referable diabetic retinopathy.
研究动机与目标
- 为解决由于AI预测不确定性过高而导致早期阶段高风险疾病被误分类的问题。
- 在集成学习用于医学诊断的背景下,比较并理论分析两种常见的不确定性度量:集成均值与集成方差。
- 通过真实世界中的糖尿病视网膜病变案例研究,对理论发现进行实证验证。
- 通过识别不确定的负样本并提交专家重新评估,提升人机协作效率,从而最小化假阴性。
提出的方法
- 作者定义了一种人机协作机制,将那些被集成模型分类为阴性但极有可能是假阴性的不确定负样本标记出来,交由人工审查。
- 他们提出使用模型预测的集成均值作为不确定性度量,以按假阴性可能性对负样本进行排序。
- 他们将该方法与集成方差及组合度量(均值 + 方差)进行比较,采用基于阈值的不确定负样本率(q%)来控制人工审查的工作量。
- 该方法在糖尿病视网膜病变数据集上,针对三种集成技术(堆叠集成、MC Dropout、测试时增强,TTA)进行了评估。
- 采用一种称为假阴性精确率(FNP)的性能指标,衡量被标记为不确定负样本中实际假阴性的比例。
- 在较温和的假设下进行的理论分析表明,集成均值在基于不确定性的决策中优于集成方差。
实验结果
研究问题
- RQ1在医疗AI的集成学习背景下,何种情况下一种不确定性度量会优于另一种?
- RQ2在早期疾病诊断中,集成均值是否是识别假阴性预测的更优不确定性度量,相较于集成方差?
- RQ3不同集成方法(堆叠、MC Dropout、TTA)在利用不确定性度量检测早期疾病方面的能力如何比较?
- RQ4基于不确定性的协作能否在几乎不增加人工重新检查的前提下,显著减少假阴性?
- RQ5与分布外输入相比,早期疾病病例是否对基于不确定性的决策构成更大挑战?
主要发现
- 理论分析表明,在较温和的假设下,集成均值作为识别假阴性的不确定性度量,优于集成方差。
- 在糖尿病视网膜病变上的实证结果表明,采用集成均值的堆叠集成方法,在不确定负样本率为1.0%时,可将假阴性减少高达18.13%。
- 将均值与方差组合为度量时,在1.0%的不确定负样本率下实现了最高的假阴性减少(18.13%),优于单一度量。
- MC Dropout与TTA表现出更稳定的不确定性估计,但在减少假阴性方面不如堆叠集成有效。
- 研究发现,早期疾病比分布外输入更难通过不确定性检测,表明需要专门的不确定性估计方法。
- 所提出的方法在使用均值 + 方差度量、不确定负样本率为0.8%时,实现了13.48%的假阴性减少,表明在极低人工审查成本下仍具有优异性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。