[论文解读] Rail-5k: a Real-World Dataset for Rail Surface Defects Detection
Rail-5k 是一个包含 5,000 张高质量铁路表面图像的真实世界数据集,其中 1,100 张图像对 13 种缺陷类型进行了完整标注,支持全监督与半监督目标检测的基准测试。由于存在细粒度缺陷类别、长尾类分布(不平衡比率高达 40.98),以及包含真实世界退化的未标注图像,该数据集为在真实条件下评估视觉模型提供了稳健的基准。
This paper presents the Rail-5k dataset for benchmarking the performance of visual algorithms in a real-world application scenario, namely the rail surface defects detection task. We collected over 5k high-quality images from railways across China, and annotated 1100 images with the help from railway experts to identify the most common 13 types of rail defects. The dataset can be used for two settings both with unique challenges, the first is the fully-supervised setting using the 1k+ labeled images for training, fine-grained nature and long-tailed distribution of defect classes makes it hard for visual algorithms to tackle. The second is the semi-supervised learning setting facilitated by the 4k unlabeled images, these 4k images are uncurated containing possible image corruptions and domain shift with the labeled images, which can not be easily tackle by previous semi-supervised learning methods. We believe our dataset could be a valuable benchmark for evaluating robustness and reliability of visual algorithms.
研究动机与目标
- 为计算机视觉领域中铁路表面缺陷检测缺乏大规模、高质量、真实世界的数据集提供解决方案。
- 在全监督与半监督学习设置下,为评估视觉算法提供基准。
- 通过真实世界的数据分布(包括长尾类不平衡和未标注数据中的图像退化)对现有方法提出挑战。
- 支持开发用于工业铁路维护应用的鲁棒、可靠模型。
- 推动细粒度缺陷检测与分割的研究,特别是针对类似纹理的缺陷(如裂纹)。
提出的方法
- 从中国各地的真实铁路线路中收集了 5,000 张高分辨率 RGB 铁路图像,其中 1,100 张图像在实例级别对 13 种缺陷类型进行了完整标注。
- 采用两阶段基准测试方法:(1) 使用 1,100 张标注图像进行全监督检测;(2) 使用额外的 4,000 张未标注图像进行半监督检测。
- 使用 YOLOv5-s 模型并进行 ImageNet 预训练,随后使用 YOLOv5 仓库中的标准超参数在标注数据集上进行微调。
- 针对裂纹检测(由于其类似纹理的特性,检测模型难以捕捉),采用 DeepLabv3 模型并以 ResNet50 作为主干网络进行语义分割。
- 在半监督学习中,使用全监督模型对 4,000 张未标注图像的预测结果进行置信度阈值筛选(s_thr ∈ {0.6, 0.7, 0.8, 0.9}),生成伪标签。
- 使用标准指标评估模型:mAP@0.5:0.95、AP@0.5、精确率、召回率以及分割的 IoU。
实验结果
研究问题
- RQ1最先进目标检测模型在具有细粒度、长尾分布和稀有缺陷类别的真实世界铁路缺陷检测数据集上的表现如何?
- RQ2与标注数据集相比,半监督学习方法能否有效利用包含真实世界退化和领域偏移的 4,000 张未标注铁路图像?
- RQ3检测模型在类似纹理的缺陷(如裂纹)上的性能如何下降?基于分割的方法是否能在此类缺陷上优于检测方法?
- RQ4未标注数据集中图像退化在多大程度上对半监督学习流程的性能产生负面影响?
- RQ5置信度阈值对伪标签质量及半监督铁路缺陷检测中下游模型准确率的影响如何?
主要发现
- 基线 YOLOv5-s 模型在全监督设置下实现了 90.6 的平均精度(mAP@0.5:0.95),在常见缺陷(如轨道表面,mAP 98.6;接触带,mAP 96.3)上表现优异。
- 在稀有缺陷(如剥落,mAP 58.9;磨损,mAP 24.1)上的表现显著较低,凸显了长尾分布带来的挑战。
- 通过 YOLOv5 进行裂纹检测的性能接近于零(mAP -,AP@0.5:0.95 -),证实检测模型无法识别类似纹理的缺陷。
- 使用 ResNet50 主干网络的 DeepLabv3 在裂纹分割任务上实现了 67.8% 的 IoU,显著优于检测方法,证明了分割方法在基于纹理的缺陷检测中的优越性。
- 使用伪标签进行半监督微调后,mAP@0.5 从 s_thr=0.6 时的 63.29 降至 s_thr=0.9 时的 61.55,表明未标注数据集中噪声和退化导致性能下降。
- 尽管存在性能下降,半监督基准仍然具有重要价值,因为它揭示了模型在真实世界数据分布偏移和退化条件下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。