Skip to main content
QUICK REVIEW

[论文解读] Towards safe deep learning: accurately quantifying biomarker uncertainty in neural network predictions

Zach Eaton-Rosen, Felix Bragman|arXiv (Cornell University)|Jun 22, 2018
Radiomics and Machine Learning in Medical Imaging参考文献 7被引用 9
一句话总结

本文提出使用贝叶斯深度学习结合蒙特卡洛 dropout 方法,量化医学图像分割中的不确定性,将体素级别的不确定性转化为校准良好的体积置信区间,用于生物标志物测量。该方法使深度学习系统能够报告带有可靠误差条的肿瘤体积估计,提升临床安全性,并增强对噪声和分布偏移的鲁棒性。

ABSTRACT

Automated medical image segmentation, specifically using deep learning, has shown outstanding performance in semantic segmentation tasks. However, these methods rarely quantify their uncertainty, which may lead to errors in downstream analysis. In this work we propose to use Bayesian neural networks to quantify uncertainty within the domain of semantic segmentation. We also propose a method to convert voxel-wise segmentation uncertainty into volumetric uncertainty, and calibrate the accuracy and reliability of confidence intervals of derived measurements. When applied to a tumour volume estimation application, we demonstrate that by using such modelling of uncertainty, deep learning systems can be made to report volume estimates with well-calibrated error-bars, making them safer for clinical use. We also show that the uncertainty estimates extrapolate to unseen data, and that the confidence intervals are robust in the presence of artificial noise. This could be used to provide a form of quality control and quality assurance, and may permit further adoption of deep learning tools in the clinic.

研究动机与目标

  • 解决基于深度学习的医学图像分割中缺乏不确定性量化的问题,以降低生物标志物测量中的临床错误风险。
  • 开发一种方法,将体素级别的分割不确定性有效聚合为下游生物标志物(如肿瘤体积)的校准体积置信区间。
  • 确保不确定性估计在不同数据质量条件下(包括噪声或分布外输入)仍保持可靠且校准良好。
  • 通过提供可操作的不确定性估计,无需修改网络架构,实现深度学习在临床流程中的安全部署。

提出的方法

  • 在 High-Res Net 架构中使用蒙特卡洛 dropout,以近似贝叶斯推理,并通过多次前向传播估计预测不确定性。
  • 对每个受试者执行 200 次随机前向传播,生成每类(如“整体”、“核心”、“活跃”肿瘤)的分割体积分布。
  • 构建预测体积的累积分布函数(CDF),以推导分位数基础的置信区间。
  • 应用仿射校准方法对置信区间进行缩放,提升不同受试者中真实体积的覆盖概率。
  • 通过向输入图像注入高斯噪声来验证鲁棒性,并评估置信区间是否仍包含真实体积。
  • 使用单个训练好的带 dropout 模型生成不确定性估计,避免使用集成方法或架构修改。

实验结果

研究问题

  • RQ1在深度神经网络中使用蒙特卡洛 dropout 是否能产生有意义且校准良好的不确定性估计,用于医学图像分割?
  • RQ2体素级别的不确定性能否被有效聚合为如肿瘤体积等生物标志物的可靠体积置信区间?
  • RQ3在添加噪声等数据扰动下,所得置信区间对真实体积的覆盖性能如何?
  • RQ4不确定性估计能否在临床环境中作为图像质量或数据可靠性的代理指标?

主要发现

  • 单个随机网络的 200 次体积预测原始分布未能在足够多情况下包含真实体积,表明初始校准性能较差。
  • 应用仿射校准后,'核心'分割的 95% 置信区间覆盖性能显著改善,更频繁地包含真实体积。
  • 即使在高斯噪声水平逐渐增加的情况下,校准后的置信区间仍持续包含真实体积,表明对数据质量退化具有鲁棒性。
  • 该方法成功将不确定性外推至未见数据,并在人工噪声下保持可靠性,表明其在临床流程质量控制中的潜在价值。
  • 该方法仅需标准推理与 dropout,计算成本极低,即可实现校准良好的不确定性报告。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。