[论文解读] Multi-Resolution Graph Neural Network for Large-Scale Pointcloud Segmentation
本文提出 MuGNet,一种内存高效、端到端的多分辨率图神经网络,用于大规模点云语义分割。通过将密集点云聚类为几何相似的组,并使用双向图卷积网络在不同分辨率间融合特征,MuGNet 可在单张 11GB 显卡上同时处理高达 45 个房间扫描,S3DIS 数据集上达到 88.5% 的总体准确率和 69.8% 的 mIOU,分别较以往基于图的方法提升 3% 和 7.7%。
In this paper, we propose a multi-resolution deep-learning architecture to semantically segment dense large-scale pointclouds. Dense pointcloud data require a computationally expensive feature encoding process before semantic segmentation. Previous work has used different approaches to drastically downsample from the original pointcloud so common computing hardware can be utilized. While these approaches can relieve the computation burden to some extent, they are still limited in their processing capability for multiple scans. We present MuGNet, a memory-efficient, end-to-end graph neural network framework to perform semantic segmentation on large-scale pointclouds. We reduce the computation demand by utilizing a graph neural network on the preformed pointcloud graphs and retain the precision of the segmentation with a bidirectional network that fuses feature embedding at different resolutions. Our framework has been validated on benchmark datasets including Stanford Large-Scale 3D Indoor Spaces Dataset(S3DIS) and Virtual KITTI Dataset. We demonstrate that our framework can process up to 45 room scans at once on a single 11 GB GPU while still surpassing other graph-based solutions for segmentation on S3DIS with an 88.5\% (+3\%) overall accuracy and 69.8\% (+7.7\%) mIOU accuracy.
研究动机与目标
- 解决处理包含数十亿个点的密集、大规模点云时所面临的高内存与高计算需求问题。
- 克服因大幅下采样或滑动窗口方法导致的语义分割精度下降问题,避免丢失精细几何细节。
- 开发一种排列不变的框架,避免将点云人为地划分为体素或网格结构。
- 实现在标准 GPU 硬件上对多个大规模扫描进行端到端、实时处理。
- 通过多分辨率聚类与特征融合,在降低内存使用的同时保留细粒度几何细节。
提出的方法
- 将密集点云转换为语义相似的聚类组,以大幅降低 GPU 显存使用量。
- 从聚类后的点构建点云图,并应用对点顺序不变的图卷积网络(GCNs)。
- 实现一种双向多分辨率融合网络,通过前向与后向路径结合不同分辨率层级的特征。
- 在主干网络中使用残差连接,以稳定训练过程并提升多层 GCN 层之间的特征表示能力。
- 采用多尺度聚类策略,生成分层的点聚类表征,以增强几何上下文建模能力。
- 在 S3DIS 和 Virtual KITTI 数据集上采用六折交叉验证设置,使用交叉熵损失进行端到端网络训练。
实验结果
研究问题
- RQ1多分辨率图神经网络是否能在最小化 GPU 显存使用的同时,实现对密集、大规模点云的高精度语义分割?
- RQ2与单分辨率或单向融合相比,跨多个图分辨率的双向特征融合在多大程度上提升了分割性能?
- RQ3所提出的框架在不牺牲精度的前提下,最多可同时处理多少个大规模扫描?
- RQ4使用几何聚类是否能在降低内存消耗的同时,保留因下采样而丢失的细粒度细节?
- RQ5在图卷积设置中,主干网络的深度如何影响特征质量与模型性能?
主要发现
- MuGNet 可在单张 11GB 显卡上同时处理最多 45 个房间扫描(平均每张扫描约 260 万个点),展现出极高的推理效率。
- 在 S3DIS 数据集上,模型达到 88.5% 的总体准确率和 69.8% 的 mIOU,较 SPG 提升 3 个百分点(准确率)和 7.7 个百分点(mIOU)。
- 消融实验表明,尽管显存使用量增加,但当主干网络深度超过 14 层时,性能反而下降,原因在于信息同化现象。
- 堆叠两个双向图卷积层可将 mIOU 提升至 66.3%,但完整配置的 MuGNet 通过优化深度,实现了最佳性能(69.8% mIOU)。
- 若移除双向融合机制,性能显著下降,证实其在丰富特征表示中的关键作用。
- 通过预聚类降低内存需求,该框架在保持高精度的同时,实现了消费级硬件上的大规模批量推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。