Skip to main content
QUICK REVIEW

[论文解读] Analysis on DeepLabV3+ Performance for Automatic Steel Defects Detection

Zheng Nie, Jiachen Xu|arXiv (Cornell University)|Apr 9, 2020
Industrial Vision Systems and Defect Detection参考文献 12被引用 6
一句话总结

本论文在Severstal数据集上评估了以ResNet101、EfficientNet-B1和DenseNet201为骨干网络的DeepLabV3+模型在自动钢板缺陷分割中的表现。通过使用随机加权数据增强方法缓解类别不平衡问题,作者在ResNet101和EfficientNet-B1上实现了0.57的mIoU,优于DenseNet201(0.325),且ResNet101在训练时间上也最快。

ABSTRACT

Our works experimented DeepLabV3+ with different backbones on a large volume of steel images aiming to automatically detect different types of steel defects. Our methods applied random weighted augmentation to balance different defects types in the training set. And then applied DeeplabV3+ model three different backbones, ResNet, DenseNet and EfficientNet, on segmenting defection regions on the steel images. Based on experiments, we found that applying ResNet101 or EfficientNet as backbones could reach the best IoU scores on the test set, which is around 0.57, comparing with 0.325 for using DenseNet. Also, DeepLabV3+ model with ResNet101 as backbone has the fewest training time.

研究动机与目标

  • 研究DeepLabV3+在不同骨干网络(ResNet、DenseNet、EfficientNet)下于工业环境中自动钢板缺陷检测的性能。
  • 通过自定义的随机加权数据增强策略,缓解钢板缺陷数据集中严重的类别不平衡问题。
  • 从mIoU和在真实钢板表面图像上的训练效率两个方面评估模型性能。
  • 分析模型局限性,特别是对难以检测或人工标注的小型或碎片化缺陷的识别能力。

提出的方法

  • 在Severstal Kaggle竞赛提供的大规模钢板缺陷数据集上,应用了三种预训练骨干网络(ResNet101、DenseNet201、EfficientNet-B1)的DeepLabV3+模型。
  • 采用随机加权数据增强方法平衡缺陷类别的频率,其中增强概率与类别频率成反比。
  • 应用三种增强方式——随机裁剪、垂直翻转和随机旋转——并结合类别特定权重,以保持增强后图像与掩码的空间和语义一致性。
  • 训练时将图像尺寸从256×1700调整为256×256,同时在原始分辨率(256×1700)上测试推理性能以作对比。
  • 使用mIoU评估模型性能,其计算方式为所有测试样本IoU得分的平均值。
  • 通过消融实验比较基础版DeepLabV3+基线模型与完整编码器-解码器模型,评估编码器模块的影响。

实验结果

研究问题

  • RQ1不同骨干网络架构(ResNet101、DenseNet201、EfficientNet-B1)对DeepLabV3+在钢板缺陷分割中mIoU性能的影响如何?
  • RQ2随机加权数据增强在缓解类别不平衡的钢板缺陷数据集上,对模型泛化能力的提升程度如何?
  • RQ3哪种骨干网络在分割精度(mIoU)与训练效率之间提供了最佳平衡?
  • RQ4为何某些模型尽管平均mIoU较高,但IoU得分仍较低?数据不平衡或标注质量在此过程中起到何种作用?
  • RQ5模型能否检测到小于人工标注阈值的缺陷?这又如何影响mIoU评估结果?

主要发现

  • ResNet101和EfficientNet-B1骨干网络实现了约0.57的最高mIoU,显著优于基线模型(0.29)和DenseNet201(0.325)。
  • ResNet101在所有骨干网络中训练时间最短,是实时工业部署的最高效选择。
  • DenseNet201表现较差,仅达到0.325的mIoU,可能因其架构对常见于类别1和2中的小型或碎片化缺陷较为敏感。
  • 低IoU得分通常与小型或高度碎片化的缺陷(尤其是类别1)有关,这些缺陷在数量和面积上均代表性不足。
  • 模型检测到了部分小于人工标注阈值的缺陷,这些缺陷未被真实标签标注但被正确预测,表明未来标注可进一步优化。
  • 视觉分析显示,与基线模型相比,编码器-解码器结构显著提升了边缘定位和分割精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。