[论文解读] PCSCNet: Fast 3D Semantic Segmentation of LiDAR Point Cloud for Autonomous Car using Point Convolution and Sparse Convolution Network
PCSCNet 是一种用于自动驾驶中 LiDAR 点云的快速、实时 3D 语义分割模型,通过点卷积实现高效特征提取,并利用 3D 稀疏卷积实现快速特征传播。它在低体素分辨率下于 SemanticKITTI 和 nuScenes 数据集上实现了最先进性能,使用联合交叉熵与位置感知损失,mIoU 达到 64.6%,有效缓解了离散化误差。
The autonomous car must recognize the driving environment quickly for safe driving. As the Light Detection And Range (LiDAR) sensor is widely used in the autonomous car, fast semantic segmentation of LiDAR point cloud, which is the point-wise classification of the point cloud within the sensor framerate, has attracted attention in recognition of the driving environment. Although the voxel and fusion-based semantic segmentation models are the state-of-the-art model in point cloud semantic segmentation recently, their real-time performance suffer from high computational load due to high voxel resolution. In this paper, we propose the fast voxel-based semantic segmentation model using Point Convolution and 3D Sparse Convolution (PCSCNet). The proposed model is designed to outperform at both high and low voxel resolution using point convolution-based feature extraction. Moreover, the proposed model accelerates the feature propagation using 3D sparse convolution after the feature extraction. The experimental results demonstrate that the proposed model outperforms the state-of-the-art real-time models in semantic segmentation of SemanticKITTI and nuScenes, and achieves the real-time performance in LiDAR point cloud inference.
研究动机与目标
- 解决自动驾驶中基于体素的 3D 语义分割在高体素分辨率下的高计算成本问题。
- 在不牺牲分割精度的前提下,提升不同体素分辨率下的推理速度与鲁棒性。
- 通过一种新型损失函数(结合交叉熵与位置感知损失),减少大体素导致的离散化误差。
- 在标准基准(SemanticKITTI 和 nuScenes)上实现实时性能,同时保持高 mIoU。
- 在密集与稀疏 LiDAR 点云(包括 32 层 LiDAR 系统)上均表现出有效性。
提出的方法
- 使用较大的体素尺寸(例如 0.3m)对输入 LiDAR 点云进行体素化,以降低计算负载。
- 应用点卷积(PC)从每个体素中提取鲁棒的点级特征,相比 PointNet 提升了长距离上下文建模能力。
- 使用 3D 稀疏卷积(3D-SC)高效传播相邻体素之间的特征,以最小计算量扩展感受野。
- 采用混合损失函数,结合交叉熵损失与位置感知(PA)损失,以增强边界分割并减少离散化误差。
- 利用点卷积与稀疏卷积融合后的最终特征进行点级分类,实现逐点语义标注。
- 在 SemanticKITTI 和 nuScenes 数据集上使用 mIoU 与定性可视化进行模型训练与评估,以衡量性能。
实验结果
研究问题
- RQ1基于体素的语义分割模型是否能在低体素分辨率下保持高精度,同时实现实时推理?
- RQ2在大体素尺寸下,点卷积与 PointNet 相比,在稀疏 LiDAR 点云特征提取方面表现如何?
- RQ33D 稀疏卷积在不降低分割质量的前提下,能在多大程度上加速特征传播?
- RQ4结合交叉熵与位置感知损失是否能改善边界分割并减少离散化伪影?
- RQ5PCSCNet 在密集(SemanticKITTI)与稀疏(nuScenes)LiDAR 点云上,相较于最先进实时模型表现如何?
主要发现
- 在 0.05m 体素分辨率下,PCSCNet 在 SemanticKITTI 上达到 64.8% 的 mIoU,比点-体素融合模型高出 0.4%。
- 在 0.1m 体素分辨率下,PCSCNet 保持 64.6% 的 mIoU,而点-体素融合模型下降至 63.6%,显示出更强的鲁棒性。
- 当体素尺寸从 0.05m 增加到 0.1m 时,模型的 mIoU 仅下降 0.2%,表明对分辨率变化具有极强的适应能力。
- 与仅使用交叉熵损失相比,联合使用交叉熵与 PA 损失使 mIoU 提升 0.8%(从 63.8% 提升至 64.6%)。
- 定性结果表明,PA 损失显著改善了边界分割效果,尤其在人行道与植被等类别之间。
- PCSCNet 在 SemanticKITTI 与 nuScenes 上均达到最先进性能,即使在 32 层传感器获取的稀疏 LiDAR 数据上也表现出色。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。