Skip to main content
QUICK REVIEW

[论文解读] Semantic Segmentation on Swiss3DCities: A Benchmark Study on Aerial Photogrammetric 3D Pointcloud Dataset

Gülcan Can, Dario Mantegazza|arXiv (Cornell University)|Dec 23, 2020
Remote Sensing and LiDAR Applications参考文献 29被引用 7
一句话总结

该论文提出了Swiss3DCities,一个全新的基准数据集,包含来自瑞士三个城市(苏黎世、卢塞恩、达沃斯)的高分辨率、基于摄影测量法重建的3D点云,其点云经人工标注为五个语义类别。以PointNet++为基线模型,研究发现:在同个城市数据上进行训练的性能显著优于跨城市训练(84.9%的平均加权准确率 vs. 82.3%),而通过跨城市模型集成进一步将准确率提升至88.1%,凸显了数据多样性与训练策略在模型泛化中的关键作用。

ABSTRACT

We introduce a new outdoor urban 3D pointcloud dataset, covering a total area of 2.7 $km^2$, sampled from three Swiss cities with different characteristics. The dataset is manually annotated for semantic segmentation with per-point labels, and is built using photogrammetry from images acquired by multirotors equipped with high-resolution cameras. In contrast to datasets acquired with ground LiDAR sensors, the resulting point clouds are uniformly dense and complete, and are useful to disparate applications, including autonomous driving, gaming and smart city planning. As a benchmark, we report quantitative results of PointNet++, an established point-based deep 3D semantic segmentation model; on this model, we additionally study the impact of using different cities for model generalization.

研究动机与目标

  • 为解决当前缺乏适用于自动驾驶以外应用的密集、高分辨率且完整的3D城市点云数据集的问题。
  • 提供一个带有逐点语义标注的基准数据集,用于训练和评估3D语义分割模型。
  • 探究训练数据分布及在不同城市环境间模型泛化的影响。
  • 通过提供一个丰富、基于摄影测量法生成、包含多种点云密度变体的数据集,支持智慧城市规划、AR/VR和机器人学的研究。

提出的方法

  • 使用多旋翼无人机以网格飞行模式在瑞士三个城市上空获取高分辨率航空影像。
  • 采用基于运动的结构(SfM)和多视角立体视觉(MVS)摄影测量技术重建密集3D点云。
  • 生成数据集的三个版本:稀疏版本(750万点)、常规密度版本(2.26亿点)和高密度版本(31.47亿点),均包含RGB信息和语义标签。
  • 人工将每个点标注为五种类别之一:地形、建筑、植被、车辆和城市设施。
  • 在多种数据划分上训练并评估PointNet++,包括城市特定训练和跨城市训练,并应用模型集成以提升性能。
  • 通过比较不同城市组合的训练与测试设置下的性能,量化模型泛化能力。

实验结果

研究问题

  • RQ1当在同个城市的数据上进行训练和测试时,模型在语义分割上的性能如何变化?与在不同城市间训练和测试相比有何差异?
  • RQ2通过整合多个城市的多源数据来增加训练数据规模,对模型准确率和泛化能力有何影响?
  • RQ3与在全部数据上训练单一模型相比,通过集成不同城市特定模型的预测结果能否提升性能?
  • RQ4点云密度的选择如何影响3D语义分割模型的性能?
  • RQ5城市环境在几何与语义上的多样性在多大程度上影响3D语义分割模型的泛化能力?

主要发现

  • 在与测试集同城市的数据上进行训练的模型,其平均加权准确率达到84.9%,显著优于在不同城市数据上训练的模型(82.3%)。
  • 将所有三个城市的联合数据用于单一模型训练,使平均加权准确率提升至87.6%,证明了增加训练数据规模的益处。
  • 通过集成三个单一城市模型的预测结果(即模型集成)实现了最高性能,达到88.1%的平均加权准确率,优于单一模型训练和跨城市训练。
  • 在集成中增加第三个模型所带来的性能增益,小于前两个模型的增益,表明集成存在收益递减现象。
  • 结果证实,数据多样性以及训练与测试数据之间的领域对齐,是3D语义分割中模型泛化能力的关键因素。
  • 该数据集支持对基于LiDAR与摄影测量法生成的3D数据集之间领域差异的深入分析,为未来领域泛化与自监督学习研究提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。