[论文解读] Sparse Single Sweep LiDAR Point Cloud Segmentation via Learning Contextual Shape Priors from Scene Completion
该论文提出JS3C-Net,一种新颖的稀疏单次扫描LiDAR点云语义分割框架,通过端到端训练从语义场景补全(SSC)中学习上下文形状先验。通过联合训练语义分割(SS)与SSC,并引入点-体素交互(PVI)模块,该方法增强了特征融合,实现了最先进性能,在SemanticKITTI上mIoU提升4%,在SemanticPOSS上提升3%。
LiDAR point cloud analysis is a core task for 3D computer vision, especially for autonomous driving. However, due to the severe sparsity and noise interference in the single sweep LiDAR point cloud, the accurate semantic segmentation is non-trivial to achieve. In this paper, we propose a novel sparse LiDAR point cloud semantic segmentation framework assisted by learned contextual shape priors. In practice, an initial semantic segmentation (SS) of a single sweep point cloud can be achieved by any appealing network and then flows into the semantic scene completion (SSC) module as the input. By merging multiple frames in the LiDAR sequence as supervision, the optimized SSC module has learned the contextual shape priors from sequential LiDAR data, completing the sparse single sweep point cloud to the dense one. Thus, it inherently improves SS optimization through fully end-to-end training. Besides, a Point-Voxel Interaction (PVI) module is proposed to further enhance the knowledge fusion between SS and SSC tasks, i.e., promoting the interaction of incomplete local geometry of point cloud and complete voxel-wise global structure. Furthermore, the auxiliary SSC and PVI modules can be discarded during inference without extra burden for SS. Extensive experiments confirm that our JS3C-Net achieves superior performance on both SemanticKITTI and SemanticPOSS benchmarks, i.e., 4% and 3% improvement correspondingly.
研究动机与目标
- 解决自动驾驶中常见的稀疏单次扫描LiDAR点云准确语义分割挑战。
- 克服现有方法仅依赖历史帧导致的高计算成本等局限性。
- 利用连续LiDAR数据学习鲁棒的上下文形状先验,以改善不完整且稀疏点云的分割效果。
- 设计轻量化、模块化的框架,使辅助的SSC与PVI组件可在推理阶段移除,保持实时效率。
- 通过端到端联合训练与交互式特征融合,实现语义分割与场景补全的相互提升。
提出的方法
- 使用预训练的语义分割(SS)主干网络在稀疏单次扫描点云上生成初始预测结果。
- 利用合并的连续帧作为密集监督信号,训练语义场景补全(SSC)模块,以学习上下文形状先验。
- 引入点-体素交互(PVI)模块,实现在点级局部几何与体素级全局结构之间的双向知识迁移。
- 采用不确定性多任务损失(UMTL)进行联合学习,自动平衡SS与SSC任务的优化。
- 以级联方式构建网络结构,使SSC与PVI模块可在推理阶段被移除,而不影响SS主干网络的推理速度。
- 使用大规模未标注LiDAR序列合成SSC的密集真实标签,避免人工标注需求。
实验结果
研究问题
- RQ1从多帧场景补全中学习到的上下文形状先验是否能提升稀疏单次扫描LiDAR点云的语义分割性能?
- RQ2如何在轻量化、端到端的框架中联合优化语义分割与场景补全,使其相互促进?
- RQ3PVI模块是否能有效融合局部点级几何与全局体素级结构,以增强特征表示?
- RQ4与形状先验联合训练在多大程度上能缩小稀疏区域及自行车、卡车等小物体的性能差距?
- RQ5辅助的SSC与PVI模块是否可在推理阶段被移除而不影响主分割头的速度?
主要发现
- JS3C-Net在SemanticKITTI基准上相比先前最先进方法mIoU提升4%。
- 在SemanticPOSS基准上,该方法相比现有方法mIoU提升3%,展现出强大的泛化能力。
- 消融实验表明,联合学习(JL)使SS mIoU从63.1%提升至66.1%,SC mIoU从51.1%提升至55.0%。
- 引入不确定性多任务损失(UMTL)后,SS与SC的mIoU分别进一步提升0.4%与1.1%,表明损失平衡更优。
- PVI模块对性能贡献显著,完整模型在SS上达到67.5% mIoU,在SC上达到57.0% mIoU,优于所有消融变体。
- JS3C-Net保持与主干模型相同的推理速度,PVI模块仅引入107ms延迟,适合实时部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。