[论文解读] VolMap: A Real-time Model for Semantic Segmentation of a LiDAR surrounding view
VolMap 提出了一种实时 2D 卷积神经网络,使用 LiDARD 高度层作为输入通道,对 360° LiDAR 点云进行语义分割,在 CPU 上实现 25.7ms 的推理时间,速度超过 PointNet++(500ms)和 SqueezeSeg-Mod(45.5ms),同时在 KITTI 基准测试中,大多数类别上的平均 IoU 得分也有所提升。
This paper introduces VolMap, a real-time approach for the semantic segmentation of a 3D LiDAR surrounding view system in autonomous vehicles. We designed an optimized deep convolution neural network that can accurately segment the point cloud produced by a 360\degree{} LiDAR setup, where the input consists of a volumetric bird-eye view with LiDAR height layers used as input channels. We further investigated the usage of multi-LiDAR setup and its effect on the performance of the semantic segmentation task. Our evaluations are carried out on a large scale 3D object detection benchmark containing a LiDAR cocoon setup, along with KITTI dataset, where the per-point segmentation labels are derived from 3D bounding boxes. We show that VolMap achieved an excellent balance between high accuracy and real-time running on CPU.
研究动机与目标
- 在自主驾驶感知中实现在 CPU 上对 360° LiDAR 点云进行实时语义分割。
- 通过利用 LiDAR 高度层作为输入通道,提升 3D 语义分割的精度与效率。
- 评估多 LiDAR 配置对场景理解与分割性能的影响。
- 开发一种轻量化、可扩展的模型,避免使用昂贵的 3D 卷积,同时保持高空间与语义保真度。
提出的方法
- 输入为基于 360° LiDAR 数据生成的体积分辨率鸟瞰图表示,包含 10 个高度层,每层代表点云中 0.4m 的垂直切片。
- 模型采用改进的 SqueezeSeg 架构,以距离和强度作为输入通道,并通过深度可分离卷积高效处理 2D 特征图。
- 网络在 KITTI 和 SCALA 基准数据集上端到端训练,使用 3D 框标注生成每个点的语义标签。
- 通过组合多个传感器的点云模拟多 LiDAR 配置,每个传感器的反射点用不同颜色编码以保留空间上下文。
- 模型针对 CPU 推理进行优化,避免使用 3D 卷积,通过在 3D 数据的 2D 投影上操作降低计算量。
- 消融研究评估了从单个前向 LiDAR 到完整 360° 全向视图配置等不同传感器配置下的性能表现。
实验结果
研究问题
- RQ1基于 LiDAR 高度层的 2D CNN 是否能在 CPU 上实现对 360° LiDAR 点云的实时语义分割?
- RQ2与单传感器配置相比,360° 配置下的多 LiDAR 传感器设置如何影响语义分割精度?
- RQ3与 3D 体积分辨率网络相比,使用 3D LiDAR 数据的 2D 投影在推理速度与分割精度之间存在何种权衡?
- RQ4与标准 2D 投影(如距离和强度)相比,将高度层作为输入通道在特征表示方面能带来多大程度的提升?
- RQ5轻量级 2D 模型是否能在 3D 语义分割任务中同时实现比 3D CNN 和 PointNet++ 更快的速度与更高的精度?
主要发现
- VolMap 在 CPU 上实现 25.7ms 的推理时间,比 PointNet++(500ms)快 20 倍,比 SqueezeSeg-Mod(45.5ms)快 50%。
- 在 KITTI 基准测试中,VolMap 对车辆类别的平均 IoU 达到 79.71%,优于 SqueezeSeg-Mod(84.0%)和 PointNet++(64.3%)。
- 对行人类别,VolMap 实现 33.62% 的 IoU,较 PointNet++(15.33%)提升 12.3%,较 SqueezeSeg-Mod(26.0%)提升 7.6%。
- 360° 多 LiDAR 配置使车辆分割的 IoU 提升至 85.37%,卡车类别提升至 64.9%,显著优于单传感器配置。
- 消融研究证实,增加 LiDAR 传感器可提升点云密度与几何完整性,从而改善场景理解与分割精度。
- 与基于球面投影的 SqueezeSeg-Mod 相比,VolMap 在 60% 的类别上表现更优,且推理速度快 50%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。