Skip to main content
QUICK REVIEW

[论文解读] Imperfect Segmentation Labels: How Much Do They Matter?

Nicholas Heller, Joshua Dean|arXiv (Cornell University)|Jun 12, 2018
Advanced Neural Network Applications参考文献 16被引用 5
一句话总结

本研究探讨了不完美分割标签——尤其是边界局部化错误——对医学图像分割中深度学习模型的影响。基于肝脏分割数据集,使用U-Net、SegNet和FCN32模型,研究发现性能随边界噪声的增加而持续下降,但U-Net在应对锯齿状边界扰动方面显著优于其他模型,而所有模型对随机标签错误均表现出高度鲁棒性。

ABSTRACT

Labeled datasets for semantic segmentation are imperfect, especially in medical imaging where borders are often subtle or ill-defined. Little work has been done to analyze the effect that label errors have on the performance of segmentation methodologies. Here we present a large-scale study of model performance in the presence of varying types and degrees of error in training data. We trained U-Net, SegNet, and FCN32 several times for liver segmentation with 10 different modes of ground-truth perturbation. Our results show that for each architecture, performance steadily declines with boundary-localized errors, however, U-Net was significantly more robust to jagged boundary errors than the other architectures. We also found that each architecture was very robust to non-boundary-localized errors, suggesting that boundary-localized errors are fundamentally different and more challenging problem than random label errors in a classification setting.

研究动机与目标

  • 评估不完美真实标签在医学图像语义分割任务中对基于深度学习的分割模型的影响。
  • 区分边界局部化错误(如锯齿状轮廓)与非边界局部化错误(如随机像素位移)的影响。
  • 在受控标签扰动下,评估不同网络架构(U-Net、SegNet、FCN32)的模型鲁棒性。
  • 探究边界错误是否在分割任务中比随机标签噪声更具根本性破坏性。
  • 探讨数据集构建过程中标签质量权衡对医学图像分析的影响。

提出的方法

  • 使用三种模式对肝脏分割数据集的真实掩码进行扰动:自然模式、锯齿状(锯齿边界)模式和随机(无结构像素位移)模式。
  • 在每种扰动版本的训练数据上分别训练U-Net、SegNet和FCN32模型,验证集和测试集保持原始状态。
  • 每个模型-扰动组合进行五次独立训练以确保统计可靠性,总计150次训练会话。
  • 使用Dice-Sorensen系数评估模型性能,该指标是分割准确性的标准度量。
  • 分析在不同扰动程度(0.85、0.90、0.95)下的性能趋势,以量化性能退化模式。
  • 利用3D CT数据验证不同解剖平面中的标签不一致性,以指导真实扰动模式的设计。

实验结果

研究问题

  • RQ1边界局部化标签错误的存在如何影响基于深度学习的分割模型性能?
  • RQ2不同分割架构(U-Net、SegNet、FCN32)在面对边界噪声时的鲁棒性如何比较?
  • RQ3模型在多大程度上受到非边界局部化错误(如随机像素扰动)的影响?
  • RQ4标签错误程度与模型性能退化之间是否存在系统性关系?
  • RQ5U-Net中的跳跃连接等架构组件是否能缓解锯齿状边界标签的影响?

主要发现

  • 所有模型的性能随着边界局部化扰动的增加而持续下降,表明边界错误是性能退化的主要来源。
  • U-Net在面对大范围锯齿状边界扰动时表现出显著更高的鲁棒性,相较于SegNet和FCN32,其Dice分数在0.95扰动水平下仍保持较高。
  • 所有模型对随机标签扰动均表现出高度鲁棒性,部分模型甚至在随机噪声下Dice分数超过原始训练数据(例如,U-Net在0.90随机噪声下的Dice分数为0.9213,而对照组为0.9134)。
  • 在边界噪声下,各模型的性能退化趋势一致,表明错误发生率与模型性能之间存在可推广的关系。
  • U-Net的跳跃连接可能在锯齿状轮廓下仍能保留边缘信息,解释了其对锯齿状扰动的优越鲁棒性。
  • 模型在随机扰动下性能下降极小,表明此类错误相较于边界特异性错误,对学习过程的误导性显著较弱。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。