Skip to main content
QUICK REVIEW

[论文解读] Efficient Urban-scale Point Clouds Segmentation with BEV Projection

Zhenhong Zou, Yizhe Li|arXiv (Cornell University)|Sep 19, 2021
3D Shape Modeling and Analysis参考文献 30被引用 9
一句话总结

该论文提出了一种基于鸟瞰图(BEV)投影的方法,用于高效地对城市尺度点云进行3D语义分割,通过将稀疏的3D数据转换为密集的鸟瞰图图像,以利用2D卷积神经网络(CNN)和基于注意力机制的多模态融合网络。该方法在SensatUrban数据集上实现了61.17%的mIoU和91.37%的整体准确率,展示了在大规模城市点云上的先进效率与性能。

ABSTRACT

Point clouds analysis has grasped researchers' eyes in recent years, while 3D semantic segmentation remains a problem. Most deep point clouds models directly conduct learning on 3D point clouds, which will suffer from the severe sparsity and extreme data processing load in urban-scale data. To tackle the challenge, we propose to transfer the 3D point clouds to dense bird's-eye-view projection. In this case, the segmentation task is simplified because of class unbalance reduction and the feasibility of leveraging various 2D segmentation methods. We further design an attention-based fusion network that can conduct multi-modal learning on the projected images. Finally, the 2D out are remapped to generate 3D semantic segmentation results. To demonstrate the benefits of our method, we conduct various experiments on the SensatUrban dataset, in which our model presents competitive evaluation results (61.17% mIoU and 91.37% OverallAccuracy). We hope our work can inspire further exploration in point cloud analysis.

研究动机与目标

  • 解决在城市尺度3D点云分割中数据稀疏性和高计算负载的挑战。
  • 通过将稀疏的3D点云转换为密集的2D BEV投影,提升语义分割性能。
  • 通过基于注意力机制的融合网络,利用多模态特征(RGB与几何特征)实现分割性能增强。
  • 通过在投影图像上应用成熟的2D分割架构,实现在训练和推理上的高效性。
  • 在大规模SensatUrban数据集上验证该方法,展示其在真实世界城市数据上的竞争力。

提出的方法

  • 使用自定义的投影算法,以25×25m²的网格分辨率和20×放大倍数,将3D点云投影为密集的鸟瞰图(BEV)图像。
  • 应用基于注意力机制的多模态融合网络,结合来自投影BEV图像的RGB和几何(高度)特征。
  • 在投影图像上使用2D语义分割模型(如UNet、Deeplabv3、OCRNet),并采用ResNet-34、ResNet-101和HRNet作为主干网络。
  • 通过x/y坐标将2D分割预测结果重新映射回3D空间,生成3D语义标签。
  • 采用类别平衡的交叉熵损失函数,并结合对数逆权重,以处理数据集中长尾类别的分布问题。
  • 在两块RTX 3090 GPU上进行训练,输入分辨率为500×500,批量大小为8,使用PyTorch并启用CUDA加速。

实验结果

研究问题

  • RQ1BEV投影是否能有效减少城市尺度3D点云分割中的数据稀疏性和计算负担?
  • RQ2当应用于具有多模态特征的BEV投影点云时,2D语义分割模型的性能表现如何?
  • RQ3基于注意力机制的RGB与几何特征融合,在大规模城市数据集上的分割精度提升程度如何?
  • RQ4与现有的基于3D点云和体素的模型相比,该方法在SensatUrban基准上的性能与效率如何?
  • RQ5在分割小型或稀疏物体(如自行车和栏杆)方面,BEV方法存在哪些局限性?

主要发现

  • 所提出的BEV投影方法在SensatUrban数据集上实现了61.17%的mIoU和91.37%的整体准确率,展示了在大规模城市点云上的强大性能。
  • OCRNet-HRNet主干网络取得了最佳的mIoU(61.17%),优于其他主干网络(如UNet-ResNet34和Deeplabv3-ResNet101)。
  • 该方法有效缓解了类别不平衡问题,并实现了2D分割模型的高效利用,与直接处理3D数据相比显著降低了计算开销。
  • 由于在BEV投影中自行车和栏杆等小物体的像素占比如极小,导致其仍具挑战性,表明该方法在分辨率敏感性方面存在局限。
  • 模型在多样化城市场景中表现出良好的泛化能力,对主要类别(如建筑:91.37% OA,道路:94.40% OA,水体:74.46% OA)具有优异性能。
  • 可视化结果证实,该方法能够保留细粒度细节,并正确分割复杂结构(如屋顶和人行道)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。