[论文解读] Pick-and-Learn: Automatic Quality Evaluation for Noisy-Labeled Image Segmentation
本文提出了一种用于图像分割的自监督标签质量评估框架,可自动识别并重新加权噪声标签数据集中高质量的标注。通过引入一个质量感知模块以评估相对标签可靠性,以及一个过拟合控制模块以保持泛化能力,该方法在高噪声水平下仍能在生物医学分割基准上实现最先进性能,甚至在某些情况下优于在干净数据上训练的基线模型。
Deep learning methods have achieved promising performance in many areas, but they are still struggling with noisy-labeled images during the training process. Considering that the annotation quality indispensably relies on great expertise, the problem is even more crucial in the medical image domain. How to eliminate the disturbance from noisy labels for segmentation tasks without further annotations is still a significant challenge. In this paper, we introduce our label quality evaluation strategy for deep neural networks automatically assessing the quality of each label, which is not explicitly provided, and training on clean-annotated ones. We propose a solution for network automatically evaluating the relative quality of the labels in the training set and using good ones to tune the network parameters. We also design an overfitting control module to let the network maximally learn from the precise annotations during the training process. Experiments on the public biomedical image segmentation dataset have proved the method outperforms baseline methods and retains both high accuracy and good generalization at different noise levels.
研究动机与目标
- 解决在医学影像中因专家标注成本高昂而存在噪声、低质量标注的图像分割数据集上训练深度神经网络的挑战。
- 开发一种自动、端到端的方法,评估标签的相对质量,而无需显式质量标注。
- 在分割任务中,于不同水平的标签噪声下提升模型泛化能力并保持高准确率。
- 设计一种机制,使网络能够聚焦于高质量标签,同时避免对噪声标签的过拟合。
提出的方法
- 该方法采用双分支网络架构,包含一个分割模块和一个并行的质量感知模块(QAM),用于处理输入图像及其对应标签的拼接输入。
- QAM 通过分析预测分割与标签一致性之间的冲突,利用损失动态作为标签可靠性的代理,为小批量中的每个样本计算相对质量得分。
- 基于 QAM 的输出,使用 softmax 归一化得分对损失值进行重加权,使网络在反向传播过程中优先学习高质量标签。
- 引入一个过拟合控制模块(OCM),通过动态调节可训练样本数量并稳定学习过程,防止网络对噪声标签过拟合。
- 整个网络端到端训练,通过分割模块和质量感知模块的联合反向传播,同时优化分割性能与标签质量估计。
- 该方法利用小批量中样本间损失下降速度的相对差异推断标签质量,无需外部监督或标签正确性的先验知识。
实验结果
研究问题
- RQ1深度学习模型能否在无需显式质量标注的情况下,自动评估图像分割中噪声标签的相对质量?
- RQ2网络如何在训练过程中优先学习高质量标签,同时最小化噪声标签的干扰?
- RQ3在高标签噪声水平下,过拟合控制机制对模型泛化能力有何影响?
- RQ4与基线方法相比,自监督质量评估策略在不同噪声水平下能多大程度上维持高分割准确率?
主要发现
- 即使 50% 的标签存在噪声(最多 13 像素的侵蚀或膨胀),该方法仍能达到与在干净标注数据上训练的模型相当的分割准确率。
- 在 JSRT 数据集上,当使用过拟合控制模块时,该方法在 75% 噪声水平下对锁骨的分割准确率达到 0.801,显著优于基线模型(0.366)。
- 质量感知模块成功提高了训练过程中干净标注样本的相对权重,且权重方差随时间减小,表明质量估计稳定且一致。
- 同时具备 QAM 和 OCM 模块的网络在训练损失上更低、测试准确率更高,尤其在对噪声最敏感的小型解剖结构(如锁骨)上表现更优。
- 过拟合控制模块至关重要:若无该模块,模型会出现严重过拟合,导致泛化能力差且性能不稳定,尤其在高噪声水平下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。