Skip to main content
QUICK REVIEW

[论文解读] Robust Learning at Noisy Labeled Medical Images: Applied to Skin Lesion Classification

Cheng Xue, Qi Dou|arXiv (Cornell University)|Jan 23, 2019
Machine Learning and Data Classification参考文献 13被引用 6
一句话总结

本文提出了一种用于在噪声医学图像标签下实现鲁棒皮肤病变分类的迭代深度学习框架,通过在线不确定性样本挖掘抑制噪声样本,并采用样本重加权策略保留困难样本和少数类样本。该方法在无需事先了解噪声分布或干净验证数据的情况下,在噪声皮肤病变数据集上实现了最先进性能。

ABSTRACT

Deep neural networks (DNNs) have achieved great success in a wide variety of medical image analysis tasks. However, these achievements indispensably rely on the accurately-annotated datasets. If with the noisy-labeled images, the training procedure will immediately encounter difficulties, leading to a suboptimal classifier. This problem is even more crucial in the medical field, given that the annotation quality requires great expertise. In this paper, we propose an effective iterative learning framework for noisy-labeled medical image classification, to combat the lacking of high quality annotated medical data. Specifically, an online uncertainty sample mining method is proposed to eliminate the disturbance from noisy-labeled images. Next, we design a sample re-weighting strategy to preserve the usefulness of correctly-labeled hard samples. Our proposed method is validated on skin lesion classification task, and achieved very promising results.

研究动机与目标

  • 解决医学图像数据集中标签噪声带来的关键挑战,其中由于对专业领域知识要求高,专家标注容易出错。
  • 在训练数据包含误标图像的情况下,提升深度神经网络在皮肤病变分类任务上的性能。
  • 开发一种不依赖于预先估计的噪声转移矩阵或额外干净标注数据的方法。
  • 在噪声标签条件下训练过程中,保留困难样本和少数类样本的有用性。

提出的方法

  • 一种在线不确定性样本挖掘(OUSM)策略选择训练损失较低(不确定性较低)的样本进行反向传播,从而在每次训练迭代中有效过滤出高不确定性(可能为噪声)样本。
  • 一种样本重加权模块基于深度特征为样本分配独立权重,突出显示困难样本和少数类样本,防止其在训练过程中被掩盖。
  • 该框架采用迭代方式训练,首先在前五轮中不使用重加权以稳定初始学习,随后在后续阶段同时应用OUSM和重加权。
  • 损失函数结合了重加权的Softmax损失与在线不确定性损失,仅对低不确定性样本计算梯度。
  • 该方法端到端可训练,无需显式估计噪声转移矩阵或外部干净数据。
  • 该方法应用于ResNet-101,采用SGD优化,使用带有自适应加权的交叉熵损失和批量归一化。

实验结果

研究问题

  • RQ1在线不确定性样本挖掘是否能在不假设噪声分布的前提下,有效抑制皮肤病变分类中噪声标签的影响?
  • RQ2当噪声医学数据集中存在困难样本和少数类样本时,个体样本重加权如何提升模型泛化能力?
  • RQ3在存在标签噪声的情况下,结合不确定性挖掘与重加权的方法在多大程度上优于现有方法?
  • RQ4所提出的方法是否能在不依赖额外干净标注数据或预先估计的噪声转移矩阵的情况下实现鲁棒性能?

主要发现

  • 在5%噪声标签基准上,所提方法达到84.5%的准确率,比最先进方法[4]高出1.3个百分点。
  • 在10%噪声下,该方法达到83.6%的准确率,比[4]高出2.3个百分点,展现出对噪声增加的强鲁棒性。
  • 消融实验确认,在线不确定性挖掘和个体重加权均对性能提升有显著贡献,其中重加权对困难样本和少数类样本尤为关键。
  • 仅使用交叉熵损失在噪声数据上训练的模型在10%噪声下准确率降至79.1%,凸显了所提组件的必要性。
  • 在40%噪声下,该方法达到75.7%的测试准确率,显著优于[4]的68.4%,表现出对高噪声水平的强韧性。
  • 结果验证了DNNs会记忆噪声标签,但所提框架通过过滤高不确定性样本并保留有信息量的样本,有效缓解了该问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。