Skip to main content
QUICK REVIEW

[论文解读] Quantity beats quality for semantic segmentation of corrosion in images

Will Nash, Tom Drummond|arXiv (Cornell University)|Jun 30, 2018
Non-Destructive Testing Techniques参考文献 1被引用 3
一句话总结

本研究证明,尽管标注质量较低,但在由本科生标注的250张腐蚀图像的大型、嘈杂数据集上训练全卷积网络(FCN),其性能优于在仅10张图像的少量专家标注数据集上训练的结果。关键发现是,在腐蚀等复杂、专业性较强的视觉任务中,数据量的重要性超过数据质量;足够的训练样本可增强模型对噪声的鲁棒性,从而实现比使用有限专家标注数据更优的泛化能力与更低的过拟合风险。

ABSTRACT

Dataset creation is typically one of the first steps when applying Artificial Intelligence methods to a new task; and the real world performance of models hinges on the quality and quantity of data available. Producing an image dataset for semantic segmentation is resource intensive, particularly for specialist subjects where class segmentation is not able to be effectively farmed out. The benefit of producing a large, but poorly labelled, dataset versus a small, expertly segmented dataset for semantic segmentation is an open question. Here we show that a large, noisy dataset outperforms a small, expertly segmented dataset for training a Fully Convolutional Network model for semantic segmentation of corrosion in images. A large dataset of 250 images with segmentations labelled by undergraduates and a second dataset of just 10 images, with segmentations labelled by subject matter experts were produced. The mean Intersection over Union and micro F-score metrics were compared after training for 50,000 epochs. This work is illustrative for researchers setting out to develop deep learning models for detection and location of specialist features.

研究动机与目标

  • 探究在腐蚀图像语义分割任务中,大型嘈杂数据集与小型专家标注数据集哪一者能带来更优的性能表现。
  • 评估在深度学习模型训练中,数据质量与数据量之间的权衡关系,尤其是在专业视觉任务中的影响。
  • 确定非专家标注带来的标签噪声是否显著降低模型性能,相较于高质量的专家标注。
  • 评估在腐蚀检测等专业领域中,使用非专家标注构建大规模数据集的可行性。
  • 为资源有限、领域特定的语义分割任务提出一种实用的训练策略。

提出的方法

  • 构建了两个数据集:DS-A包含250张由本科生分割的图像(低质量标签),DS-B包含10张由腐蚀专家分割的图像(高质量、多类别标签)。
  • 使用像素级标注的强监督方式,在两个数据集上分别训练全卷积网络(FCN)。
  • 在两个数据集上均训练50,000个周期,使用平均交并比(mIoU)和微F-score作为性能评估指标。
  • 将DS-A训练的模型与DS-B训练的模型进行比较,以评估其泛化能力与对标签噪声的鲁棒性。
  • 在DS-B上训练多类别模型,以评估模型在轻微、中等和严重腐蚀类别上的性能表现。
  • 建议在大型嘈杂数据集上预训练后,再对小型专家标注数据集进行微调,作为后续优化策略,以提升分类判别力与准确性。

实验结果

研究问题

  • RQ1在腐蚀图像的语义分割任务中,大型、带有噪声的非专家标注数据集是否优于小型、专家标注数据集?
  • RQ2与高质量标注相比,非专家标注带来的标签噪声在多大程度上会降低模型性能?
  • RQ3当边界模糊时,深度学习模型是否仍能从大量不完美标注样本中有效泛化?
  • RQ4在小规模专家标注数据集上训练时,由于数据多样性有限,过拟合是否成为显著问题?
  • RQ5在专家资源稀缺的专业领域中,语义分割的最优训练策略是什么?

主要发现

  • 在大型嘈杂数据集(DS-A)上训练的模型,其平均交并比(mIoU)为0.29,微F-score为0.23,优于在小型专家数据集(DS-B)上训练的模型。
  • DS-B模型表现出显著的过拟合现象,尤其在图像3上性能急剧下降,表明由于训练数据量有限,泛化能力差。
  • DS-A模型对标签噪声表现出更好的鲁棒性,因为训练样本数量庞大,使模型即使在分割边界存在误差的情况下,仍能学习到可泛化的特征。
  • DS-B中的标注像素总数仅为2700万,不足以在拥有1.34亿参数的模型上训练而不产生过拟合。
  • DS-B模型在验证集上的mIoU为0.26,微F-score为0.27,显著低于DS-A模型的性能指标。
  • 本研究结论认为,在大型嘈杂数据集上进行预训练,随后在小型专家标注数据集上进行微调,是一种可行且高效的策略,可有效提升腐蚀分割任务中的准确率与类别判别能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。