Skip to main content
QUICK REVIEW

[论文解读] Improving Medical Image Classification with Label Noise Using Dual-uncertainty Estimation

Lie Ju, Xin Wang|arXiv (Cornell University)|Feb 28, 2021
Machine Learning and Data Classification参考文献 48被引用 11
一句话总结

本文提出一种双不确定性估计框架,通过区分专家变异引起的分歧噪声(disagreement noise)与错误诊断引起的单目标噪声(single-target noise),提升在标签噪声下的医学图像分类性能。该方法采用改进的直接不确定性预测(improved Direct Uncertainty Prediction)与蒙特卡洛丢弃(Monte Carlo Dropout)来估计不确定性,通过归一化不确定性得分对样本进行重加权,并采用基于提升(boosting-based)的课程学习训练流程,在新发布的多眼科医生标注基准数据集上,于皮肤、前列腺和视网膜疾病数据集上实现了最先进性能。

ABSTRACT

Deep neural networks are known to be data-driven and label noise can have a marked impact on model performance. Recent studies have shown great robustness to classic image recognition even under a high noisy rate. In medical applications, learning from datasets with label noise is more challenging since medical imaging datasets tend to have asymmetric (class-dependent) noise and suffer from high observer variability. In this paper, we systematically discuss and define the two common types of label noise in medical images - disagreement label noise from inconsistency expert opinions and single-target label noise from wrong diagnosis record. We then propose an uncertainty estimation-based framework to handle these two label noise amid the medical image classification task. We design a dual-uncertainty estimation approach to measure the disagreement label noise and single-target label noise via Direct Uncertainty Prediction and Monte-Carlo-Dropout. A boosting-based curriculum training procedure is later introduced for robust learning. We demonstrate the effectiveness of our method by conducting extensive experiments on three different diseases: skin lesions, prostate cancer, and retinal diseases. We also release a large re-engineered database that consists of annotations from more than ten ophthalmologists with an unbiased golden standard dataset for evaluation and benchmarking.

研究动机与目标

  • 系统定义并解决医学影像中两类常见标签噪声:由专家变异引起的分歧噪声,以及由错误诊断引起的单目标噪声。
  • 开发一种双不确定性估计框架,通过同时测量标注分歧与预测置信度的不确定性来检测噪声样本。
  • 通过基于不确定性得分的样本重加权,提升在高度不平衡医学数据集中的模型鲁棒性,同时保留少数类样本与难分类样本的影响。
  • 引入一种类似提升的课程学习训练流程,以数据驱动方式迭代地在干净样本与重加权的噪声样本上进行训练,从而提升泛化能力。
  • 发布一个大规模、高质量的基准数据集,包含超过十位眼科医生对17种视网膜疾病的标注,以支持未来研究。

提出的方法

  • 采用改进的直接不确定性预测(iDUP)来估计来自多位专家标注的不确定性,以捕捉分歧噪声。
  • 应用蒙特卡洛丢弃(MC-Dropout)来估计多数票标注样本的预测不确定性,以检测单目标标签噪声。
  • 计算归一化不确定性得分以重加权训练样本,确保难分类样本与少数类样本的影响得以保留。
  • 设计一种基于提升的课程学习训练流程,以数据驱动方式按顺序在干净样本与重加权的噪声样本上进行训练。
  • 整合Focal Loss与加权交叉熵(Weighted Cross-Entropy)以提升在类别不平衡下的训练稳定性和性能。
  • 在三个医学影像任务上评估该方法:ISIC 2019(皮肤病变)、Gleason 2019(前列腺癌)与Kaggle DR+(视网膜疾病)。

实验结果

研究问题

  • RQ1如何有效建模并区分医学图像分类中来自多位专家标注的分歧噪声与干净标签?
  • RQ2通过MC-Dropout进行预测不确定性估计,在多大程度上能检测医学图像数据集中单目标标签噪声?
  • RQ3基于不确定性得分的样本重加权是否能在不丢弃难分类或少数类样本的前提下,提升模型在类别不平衡医学数据集上的性能?
  • RQ4与标准训练相比,所提出的基于提升的课程学习训练流程在标签噪声环境下如何增强模型鲁棒性?
  • RQ5双不确定性估计框架对具有真实世界标签噪声的基准医学图像分类任务有何影响?

主要发现

  • 在Kaggle DR+数据集上,该方法取得了55.91的F1分数,显著优于使用多数票标签的基线(F1: 51.05)与原始标签(F1: 45.42)。
  • 在ISIC 2019数据集上,该方法取得了81.01的F1分数,超越了最佳基线(F1: 80.09),并展现出在标签噪声下的鲁棒性。
  • 消融实验表明,将Focal Loss与双不确定性估计结合可带来微小增益,但完整框架的性能优于所有单一组件。
  • 在Gleason 2019数据集上,iUOD模块在η=1时达到最优性能,表明其能更有效地处理医生数量方差更高的不一致标注。
  • 基于不确定性的异常值检测(UoSL)成功识别出一个误分类样本(UoSL = 0.73),表明其对误标图像具有敏感性。
  • 在区分视觉差异微小的邻近类别时(如NPDRI与NPDRII),观察到局限性,其UoSL得分中等(0.51),表明对细粒度误标情形的敏感性降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。