Skip to main content
QUICK REVIEW

[论文解读] CrackSeg9k: A Collection and Benchmark for Crack Segmentation Datasets and Frameworks

Shreyas Kulkarni, Shreyas Singh|arXiv (Cornell University)|Aug 27, 2022
Infrastructure Maintenance and Monitoring被引用 8
一句话总结

本文提出 CrackSeg9k,一个包含 9,000 多张裂缝图像的统一基准数据集,覆盖多种表面,并配有标准化的语义分割标注。该研究提出了一种端到端的处理流程,结合图像处理与深度学习方法,在使用 DeepLab 搭载 ResNet 和 Xception 主干网络时,实现了最先进性能,尤其在融合 DINO 自监督注意力特征后表现更优。

ABSTRACT

The detection of cracks is a crucial task in monitoring structural health and ensuring structural safety. The manual process of crack detection is time-consuming and subjective to the inspectors. Several researchers have tried tackling this problem using traditional Image Processing or learning-based techniques. However, their scope of work is limited to detecting cracks on a single type of surface (walls, pavements, glass, etc.). The metrics used to evaluate these methods are also varied across the literature, making it challenging to compare techniques. This paper addresses these problems by combining previously available datasets and unifying the annotations by tackling the inherent problems within each dataset, such as noise and distortions. We also present a pipeline that combines Image Processing and Deep Learning models. Finally, we benchmark the results of proposed models on these metrics on our new dataset and compare them with state-of-the-art models in the literature.

研究动机与目标

  • 解决在不同表面和裂缝类型下,裂缝分割缺乏标准化、多样化且高质量数据集的问题。
  • 通过去噪以及统一分辨率和标注方式,整合多个现有数据集,实现标注不一致问题的统一并提升数据质量。
  • 开发一种稳健且可泛化的裂缝检测与分割流程,以应对光照、分辨率和背景变化的挑战。
  • 建立一个基准,用于在统一、大规模数据集上以一致指标评估最先进模型的性能。
  • 探索将自监督注意力机制(如 DINO)集成到卷积神经网络中,以提升裂缝分割性能,尤其针对复杂裂缝模式。

提出的方法

  • 从多个公开数据集(如 CFD、DeepCrack、Crack500、HTR)中汇集 9,000 多张图像,并利用图像处理技术统一标注,以减少噪声并标准化掩码质量。
  • 标准化图像分辨率并应用预处理,确保数据集间的一致性,从而实现模型间的公平比较。
  • 将裂缝分为三类空间形态:线性、分支状和网状,以评估模型在不同结构复杂度下的性能表现。
  • 设计了一种端到端处理流程,结合基于规则的图像处理(如阈值分割、边缘检测)与深度学习模型(如 U-Net、DeepLab、VGG16),实现裂缝定位与分割。
  • 将自监督注意力特征(DINO)与 CNN 主干网络(ResNet、XceptionNet)融合,以增强长距离特征学习能力,提升分割精度。
  • 采用标准指标(F1 分数与平均交并比 mIoU)评估模型性能,并通过消融实验分析注意力特征融合与数据多样性的影响。

实验结果

研究问题

  • RQ1一个具有标准化标注的统一大规模数据集,是否能提升在不同表面和裂缝类型下裂缝分割的可复现性与泛化能力?
  • RQ2将自监督注意力(DINO)与基于 CNN 的分割模型结合,是否能显著提升在复杂裂缝模式(如分支状和网状裂缝)上的性能表现?
  • RQ3模型性能与鲁棒性在不同裂缝形态(线性、分支状、网状)和表面类型(砖石、陶瓷、玻璃、沥青)之间差异有多大?
  • RQ4与基线模型相比,多尺度特征聚合与精细化真实标签掩码是否能显著提升分割精度?
  • RQ5现有 SOTA 模型在统一基准上的表现如何?其在检测细小或不连续裂缝时的主要失败模式是什么?

主要发现

  • 所提出的使用 ResNet 和 XceptionNet 主干网络的 DeepLab 模型在 CrackSeg9k 基准上取得了最高的 F1 分数(0.7238)与 mIoU(0.7712),优于所有先前模型。
  • 在图像数量较多的数据集(如 Volker、DeepCrack、Crack500)上训练的模型表现更优,表明数据量对泛化能力有显著影响。
  • 在砖石和陶瓷表面性能下降,原因在于背景纹理复杂,凸显了学习与背景无关特征的挑战。
  • 线性裂缝分割最准确,其次为分支状裂缝,而网状裂缝因结构复杂度高,预测质量最低。
  • 将 DINO 自监督注意力特征融入 CNN 模型可带来显著性能提升,且参数量增加极少,增强了对噪声和细节的鲁棒性。
  • 尽管性能有所提升,模型在透明背景(如玻璃)上仍表现不佳,表明需要更多领域特定数据以增强模型的不变性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。