[论文解读] Trust Issues: Uncertainty Estimation Does Not Enable Reliable OOD Detection On Medical Tabular Data
本研究评估了在真实世界ICU患者数据的医疗表格数据中,用于分布外(OOD)检测的不确定性估计技术。尽管采用了包括贝叶斯神经网络和集成模型在内的多种方法,几乎所有方法在临床相关场景下均无法可靠检测出分布外患者,揭示了高风险医疗应用中模型可信度的关键缺陷。
When deploying machine learning models in high-stakes real-world environments such as health care, it is crucial to accurately assess the uncertainty concerning a model's prediction on abnormal inputs. However, there is a scarcity of literature analyzing this problem on medical data, especially on mixed-type tabular data such as Electronic Health Records. We close this gap by presenting a series of tests including a large variety of contemporary uncertainty estimation techniques, in order to determine whether they are able to identify out-of-distribution (OOD) patients. In contrast to previous work, we design tests on realistic and clinically relevant OOD groups, and run experiments on real-world medical data. We find that almost all techniques fail to achieve convincing results, partly disagreeing with earlier findings.
研究动机与目标
- 评估不确定性估计技术是否能在真实医疗表格数据中可靠检测出分布外(OOD)患者。
- 设计临床相关的OOD情景,包括患者人口统计学变化、临床指南调整以及数据污染。
- 在两个大型真实世界混合类型医疗数据集(MIMIC-III 和 eICU)上对不确定性方法进行基准测试。
- 挑战在医疗AI中,良好校准的不确定性估计即意味着稳健OOD检测的假设。
- 为未来医疗机器学习中的OOD检测研究提供开源基准和测试套件。
提出的方法
- 本研究使用两个大型真实世界混合类型表格数据集:MIMIC-III 和 eICU,包含具有高度类别不平衡的ICU患者记录。
- 通过选择急诊/紧急入院、择期入院以及临床指南调整的患者子群体,构建临床相关的OOD组。
- 评估一系列不确定性估计技术,包括贝叶斯神经网络(BBB)、蒙特卡洛丢弃法以及集成方法(如锚定集成)。
- 使用AUC-ROC和AUPR等OOD检测指标衡量每种方法的性能,置信度分数基于预测熵及其他不确定性度量得出。
- 评估包括合成扰动和真实世界分布偏移,以模拟临床OOD情景。
- 作者对比了不同模型间的不确定性估计,并通过小样本示例分析决策边界行为,以解释失败模式。
实验结果
研究问题
- RQ1不确定性估计技术是否能在真实医疗表格数据中可靠检测出分布外(OOD)患者?
- RQ2在人工协变量偏移下表现良好的不确定性方法,是否也能推广到临床相关的OOD情景?
- RQ3不同不确定性估计技术(如贝叶斯、集成、丢弃)在真实EHR数据的多样化OOD群体中表现如何?
- RQ4为何深度神经网络即使在分布内数据上校准良好,仍无法对OOD样本产生低置信度预测?
- RQ5模型架构和训练正则化(如锚定集成)在多大程度上影响OOD检测性能?
主要发现
- 所有测试的神经判别器不确定性估计技术在真实医疗表格数据的多个临床相关OOD情景中,均无法可靠检测出OOD样本。
- 在急诊/紧急入院组的OOD检测AUC-ROC仅为约0.71–0.74,表明性能仅略优于随机猜测。
- 即使在不确定性校准良好的模型(如贝叶斯神经网络BBB)中,OOD检测性能仍表现欠佳,可能由于训练不稳定和欠拟合。
- 在扰动实验中,锚定集成和BBB表现出相对更好的性能,可能得益于引入的模型多样性与正则化。
- 无法检测OOD患者的原因与神经网络中大型过度自信的决策区域有关,即使采用事后不确定性估计亦无法避免。
- 本研究揭示了一个关键断层:模型可能在分布内数据上校准良好,但仍无法标记分布外输入,导致临床部署中存在有害预测的风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。