Skip to main content
QUICK REVIEW

[论文解读] Window Detection In Facade Imagery: A Deep Learning Approach Using Mask R-CNN

Nils Nordmark, Mola Ayenew|arXiv (Cornell University)|Jul 21, 2021
Automated Road and Building Extraction参考文献 25被引用 6
一句话总结

本文提出了一种基于Mask R-CNN的深度学习方法,用于在街景立面图像中进行实例级窗户检测,利用迁移学习和数据增强技术在新标注的数据集上进行训练。该方法在eTRIMS数据集上实现了最先进的性能,mAP高达94.76%,像素准确率达到94.55%,无需后处理优化即优于先前方法,并引入了聚焦于窗户边框的精确窗户边界标注。

ABSTRACT

The parsing of windows in building facades is a long-desired but challenging task in computer vision. It is crucial to urban analysis, semantic reconstruction, lifecycle analysis, digital twins, and scene parsing amongst other building-related tasks that require high-quality semantic data. This article investigates the usage of the mask R-CNN framework to be used for window detection of facade imagery input. We utilize transfer learning to train our proposed method on COCO weights with our own collected dataset of street view images of facades to produce instance segmentations of our new window class. Experimental results show that our suggested approach with a relatively small dataset trains the network only with transfer learning and augmentation achieves results on par with prior state-of-the-art window detection approaches, even without post-optimization techniques.

研究动机与目标

  • 解决在复杂、真实世界立面图像中实现精确、实例级窗户检测的挑战。
  • 开发一种深度学习框架,能够为单个窗户生成边界框和分割掩码。
  • 仅使用相对较小但高质量的数据集,通过迁移学习和数据增强训练出鲁棒的模型。
  • 通过引入一致的、基于窗框的标注方案,建立窗户检测的新基准。
  • 提供一个免费、精确的数据集资源,以支持未来立面图像解析和数字孪生应用的研究。

提出的方法

  • 采用Mask R-CNN框架作为端到端实例分割模型,用于检测立面图像中的窗户。
  • 通过在自定义的街景立面图像数据集上使用COCO预训练权重进行微调,实现迁移学习。
  • 应用数据增强技术,包括水平翻转(fliplr),以在训练数据有限的情况下提升泛化能力。
  • 基于物理窗户边框而非窗户内容进行窗户边界标注,提升标注的一致性。
  • 在Google Colab上使用Tesla K80 GPU对超过60种模型配置进行训练与评估,以确定最优超参数。
  • 在保留的10张图像测试集上,以平均精度(mAP)和像素准确率作为主要评估指标。

实验结果

研究问题

  • RQ1仅通过迁移学习和数据增强,Mask R-CNN是否能在小规模、真实世界立面图像数据集上实现具有竞争力的窗户检测性能?
  • RQ2与传统的基于窗户内容的分割相比,基于窗框的窗户标注对模型性能有何影响?
  • RQ3在立面图像解析任务中,结合边界框和分割掩码的实例分割在多大程度上优于语义分割?
  • RQ4所提出的方法是否在无需后处理优化技术的情况下,优于先前的SOTA方法?
  • RQ5一个精确标注的小规模数据集是否能在窗户检测任务中取得与更大、更复杂数据集相当的结果?

主要发现

  • 所提方法在测试集上实现了94.76%的平均精度(mAP),在无需后处理优化的情况下优于先前的SOTA方法。
  • 在测试集上,窗户类别的像素准确率达到94.55%,表明像素级检测具有高度可靠性。
  • 单一配置下模型达到91.93%的像素准确率,最佳模型配置达到94.76%,表明具有强大的泛化能力。
  • 通过迁移学习和数据增强,即使训练数据集相对较小,仍实现了高性能。
  • 基于窗框的标注方案有助于实现一致且精确的模型学习,减少了窗户边界定义的模糊性。
  • 模型在复杂、非矩形化的街景图像中仍能成功检测出单个窗户实例,并生成准确的边界框和分割掩码。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。