[论文解读] Trustworthy clinical AI solutions: a unified review of uncertainty quantification in deep learning models for medical image analysis
本文对深度学习在医学图像分析中的不确定性量化(UQ)方法进行了全面综述,评估了130篇同行评审的研究,涵盖分类与分割任务。它整合了诸如贝叶斯深度学习、蒙特卡洛丢弃和置信性预测等UQ技术,展示了其在提升模型可信度、识别模型失效以及通过校准置信度估计支持临床决策方面的作用。
The full acceptance of Deep Learning (DL) models in the clinical field is rather low with respect to the quantity of high-performing solutions reported in the literature. Particularly, end users are reluctant to rely on the rough predictions of DL models. Uncertainty quantification methods have been proposed in the literature as a potential response to reduce the rough decision provided by the DL black box and thus increase the interpretability and the acceptability of the result by the final user. In this review, we propose an overview of the existing methods to quantify uncertainty associated to DL predictions. We focus on applications to medical image analysis, which present specific challenges due to the high dimensionality of images and their quality variability, as well as constraints associated to real-life clinical routine. We then discuss the evaluation protocols to validate the relevance of uncertainty estimates. Finally, we highlight the open challenges of uncertainty quantification in the medical field.
研究动机与目标
- 为解决临床领域对深度学习模型因‘黑箱’特性及预测过度自信而产生的抵触情绪。
- 评估不确定性量化(UQ)在提升人工智能驱动的医学图像分析可解释性、安全性与可信度方面的作用。
- 系统性回顾应用于医学图像分类与分割任务的UQ方法,重点关注其临床适用性。
- 评估UQ可靠性验证协议,并识别当前验证实践中的不足之处。
- 突出在真实临床工作流中部署可信UQ所面临的开放性挑战。
提出的方法
- 对130篇关于深度学习在医学图像分析中UQ的同行评审论文进行系统性综述,涵盖分类与分割任务。
- 将UQ方法分类为贝叶斯深度学习、蒙特卡洛丢弃、置信性预测、证据深度学习以及基于特征的方法。
- 分析集成不确定性估计的模型架构与训练策略,包括辅助网络与高斯过程。
- 使用校准误差、预测熵和覆盖率保证等指标评估不确定性估计技术。
- 根据测试时增强、MC丢弃和分布偏移鲁棒性等框架对评估协议进行分类。
- 整合跨模态(MRI、CT、X光、超声、组织病理学)与应用(如肿瘤分割、结节检测等)的研究发现。
实验结果
研究问题
- RQ1不同不确定性量化方法在多样化的医学影像任务与模态中的表现如何?
- RQ2哪些最有效的评估协议可用于验证临床深度学习模型中不确定性估计的可靠性?
- RQ3不确定性量化在哪些方面可提升临床信任度并减少人工智能辅助诊断中的‘无声失败’?
- RQ4在真实临床环境中部署具备不确定性感知的深度学习模型时,其关键局限与开放挑战是什么?
- RQ5不确定性估计与模型失效模式、数据质量问题或医学影像中的分布偏移之间存在何种关联?
主要发现
- 不确定性量化通过提供置信度估计显著提升了模型可解释性,帮助临床医生识别高风险或模糊的预测结果。
- 蒙特卡洛丢弃、贝叶斯神经网络和置信性预测等方法在多种影像模态中均表现出可靠的不确定性估计性能。
- 证据深度学习与标签分布模型能有效捕捉认知不确定性与随机不确定性,尤其在数据量少或分布外场景中表现突出。
- 基于校准指标与覆盖率保证的评估协议对验证UQ可靠性至关重要,但目前研究间标准化程度仍不一致。
- 大量UQ应用集中于分割任务(如肿瘤、前列腺、肺结节等),分类与异常检测方向的关注度也在持续上升。
- 尽管已有进展,但在泛化能力、对分布偏移的鲁棒性以及临床工作流中的集成方面仍面临挑战,主要因缺乏标准化的评估与部署框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。