[论文解读] KPRNet: Improving projection-based LiDAR semantic segmentation
KPRNet 将基于投影的二维 CNN 与可学习的三维 KPConv 模块结合,用以替代后处理,在 SemanticKITTI 上实现最先进的平均IoU(63.1)。
Semantic segmentation is an important component in the perception systems of autonomous vehicles. In this work, we adopt recent advances in both image and point cloud segmentation to achieve a better accuracy in the task of segmenting LiDAR scans. KPRNet improves the convolutional neural network architecture of 2D projection methods and utilizes KPConv to replace the commonly used post-processing techniques with a learnable point-wise component which allows us to obtain more accurate 3D labels. With these improvements our model outperforms the current best method on the SemanticKITTI benchmark, reaching an mIoU of 63.1.
研究动机与目标
- 通过利用在城市数据集上预训练的强大二维投影型 CNN 来提升 LiDAR 语义分割。
- 通过引入可学习的三维 KPConv 模块进行标签细化,消除手工设计的后处理。
- 通过从投影的二维特征到三维点标签的端到端学习实现更高的三维标注精度。
- 相较于现有的二维和逐点方法,在 SemanticKITTI 基准测试上展现出最先进的性能。
提出的方法
- 使用带有 ResNeXt-101 编码器和类似 Panoptic-DeepLab 的解码器的二维语义分割网络,在 Cityscapes 上进行预训练。
- 将 LiDAR 扫描投影到二维距离图像并提取 CNN 特征,然后反投影回三维点。
- 附加基于 KPConv 的三维模块来在最终分类前细化每个点的标签。
- 将二维 CNN 与三维 KPConv 统一为端到端可训练的流水线。
- 使用 SGD、余弦学习率调度和标准数据增强进行训练;在 SemanticKITTI 上评估。
实验结果
研究问题
- RQ1一个强化的二维投影型 CNN 在与可学习的三维组件结合时,是否能够提升 LiDAR 语义分割性能?
- RQ2用 KPConv 层替代传统后处理(如 CRF、KNN)是否能带来更准确的三维标签?
- RQ3与现有方法相比,KPRNet 在 SemanticKITTI 上的平均 IoU 表现如何?
主要发现
- 在 SemanticKITTI 上,KPRNet 的平均 IoU 为 63.1,超过之前最好的二维方法 SalsaNext 3.6 mIoU、以及基于 KPConv 的方法 4.3 mIoU。
- 用 KPConv 层替代后处理,相较于基线的 2D+KNN 方法,带来显著的准确性提升。
- 该模型利用带有 ASPP 的 ResNeXt-101 特征和三维 KPConv 精炼来提升每个点的标注。
- 端到端的可学习性使得二维投影在三维空间中得到有效的细化。
- 与若干同期方法(RangeNet++、RandLa-Net、SqueezeSegV3 等)相比,KPRNet 在逐类性能与整体 mIoU 方面具有竞争力或优越。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。