Skip to main content
QUICK REVIEW

[论文解读] Learn to Estimate Labels Uncertainty for Quality Assurance

Agnieszka Tomczack, Nassir Navab|arXiv (Cornell University)|Sep 17, 2019
Machine Learning in Healthcare参考文献 14被引用 5
一句话总结

本文提出了一种新颖的深度学习框架,通过基于变分自编码器并结合蒙特卡洛丢弃的方法,联合建模认识论不确定性(模型不确定性)和标签不确定性(医学标注中的观察者间差异)。该方法表明,通过为标注者特定潜在码设计后验编码器所捕捉的标签不确定性,相较于仅使用认识论不确定性,能提供更准确且更具区分度的不确定性度量,尤其在标签存在噪声或模糊的临床数据集中表现更优。

ABSTRACT

Deep Learning sets the state-of-the-art in many challenging tasks showing outstanding performance in a broad range of applications. Despite its success, it still lacks robustness hindering its adoption in medical applications. Modeling uncertainty, through Bayesian Inference and Monte-Carlo dropout, has been successfully introduced for better understanding the underlying deep learning models. Yet, another important source of uncertainty, coming from the inter-observer variability, has not been thoroughly addressed in the literature. In this paper, we introduce labels uncertainty which better suits medical applications and show that modeling such uncertainty together with epistemic uncertainty is of high interest for quality control and referral systems.

研究动机与目标

  • 解决深度学习在医学影像中缺乏稳健不确定性量化的问题,特别是针对标注中的观察者间差异。
  • 指出仅依赖认识论不确定性的现有方法无法捕捉因临床医生意见不一致导致的标签噪声所引发的不确定性。
  • 开发一个统一框架,显式建模认识论不确定性(通过蒙特卡洛丢弃)和标签不确定性(通过标注者差异的后验编码器)。
  • 证明标签不确定性是医学应用中一种独立且关键的不确定性来源,而非被模型不确定性所涵盖。
  • 通过提供可解释的、来源感知的不确定性估计,支持质量控制和转诊系统。

提出的方法

  • 构建一个变分贝叶斯神经网络,同时建模模型权重(认识论不确定性)和代表单个标注者的潜在码(标签不确定性)。
  • 使用后验编码器 $ p_{ heta}(oldsymbol{z}_y | oldsymbol{X}, oldsymbol{Y}) $,从多标注者标签中推断观察者间差异的潜在表示。
  • 通过将潜在标签不确定性向量 $ oldsymbol{z}_y $ 与全连接层之前的最终特征图拼接,实现其集成。
  • 在推理过程中应用蒙特卡洛丢弃以估计认识论不确定性,而标签不确定性则通过 $ oldsymbol{z}_y $ 后验分布的方差推导得出。
  • 使用变分下界(ELBO)优化模型,其中包含针对模型权重和标签不确定性的独立KL散度项。
  • 训练时,$ oldsymbol{z}_y $ 从后验分布采样;推理时,从先验编码器 $ p_{oldsymbol{ heta}}(oldsymbol{z}_y | oldsymbol{X}) $ 采样。

实验结果

研究问题

  • RQ1能否在深度学习中有效建模并区分来自医学标注中观察者间差异的标签不确定性与认识论不确定性?
  • RQ2在临床影像任务中,建模标签不确定性是否能提供比仅依赖认识论不确定性更可靠的不确定性估计?
  • RQ3当真实标签模糊或标注不一致时,该框架在识别不确定样本方面的表现如何?
  • RQ4该框架能否通过提供可解释的、来源特定的不确定性估计,改善质量控制和转诊系统?
  • RQ5在识别高观察者间分歧样本方面,标签不确定性是否比认识论不确定性更具信息量?

主要发现

  • 在引入人工标签噪声(25%类别互换)的MNIST数据集中,所提方法对未改变类别的标签不确定性接近零,而对改变类别的标签不确定性显著更高(0.5502 ± 0.5789),正确捕捉了观察者间差异。
  • 相比之下,认识论不确定性(EU)表现出高方差和不可靠的指标,尤其在测试集中,表明其无法区分真实标签不确定性与模型不确定性。
  • 在CheXpert数据集中,所提的标签不确定性(LU)度量正确识别出在 Consolidation(0.0283)和 Atelectasis(0.0609)类别中存在更高不确定性——这两个类别均包含较高比例的不确定标签,而认识论不确定性保持较低水平(0.0001–0.0024)。
  • 尽管在引入不确定标签后,所提模型的AUC从0.71降至0.51,基线模型的AUC从0.52降至0.51,但模型的标签不确定性度量可靠地反映了数据中增加的不确定性。
  • 结果证实,标签不确定性和认识论不确定性是独立且互补的:仅认识论不确定性无法捕捉观察者间差异,而标签不确定性能有效实现这一点。
  • 该框架能够可靠识别模糊或不一致的病例,支持医学AI系统中的临床决策与质量保障。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。