[论文解读] LaserMix for Semi-Supervised LiDAR Semantic Segmentation
LaserMix 提出了一种新颖的半监督学习框架,用于 LiDARD 语义分割,通过混合来自不同扫描的激光束来利用空间先验,从而提升模型泛化能力。该方法在仅使用 2× 至 5× 少量标注的情况下实现了最先进性能,在 nuScenes 上 mIoU 提升最高达 5.7%,在 SemanticKITTI 上提升 3.5%,且对表示形式无依赖性,具有坚实的统计基础。
Densely annotating LiDAR point clouds is costly, which restrains the scalability of fully-supervised learning methods. In this work, we study the underexplored semi-supervised learning (SSL) in LiDAR segmentation. Our core idea is to leverage the strong spatial cues of LiDAR point clouds to better exploit unlabeled data. We propose LaserMix to mix laser beams from different LiDAR scans, and then encourage the model to make consistent and confident predictions before and after mixing. Our framework has three appealing properties: 1) Generic: LaserMix is agnostic to LiDAR representations (e.g., range view and voxel), and hence our SSL framework can be universally applied. 2) Statistically grounded: We provide a detailed analysis to theoretically explain the applicability of the proposed framework. 3) Effective: Comprehensive experimental analysis on popular LiDAR segmentation datasets (nuScenes, SemanticKITTI, and ScribbleKITTI) demonstrates our effectiveness and superiority. Notably, we achieve competitive results over fully-supervised counterparts with 2x to 5x fewer labels and improve the supervised-only baseline significantly by 10.8% on average. We hope this concise yet high-performing framework could facilitate future research in semi-supervised LiDAR segmentation. Code is publicly available.
研究动机与目标
- 通过在有限标注数据下实现半监督学习,解决密集 LiDAR 标注的高昂成本问题。
- 利用 LiDAR 点云中固有的强空间结构——特别是激光束在距离上的模式化分布。
- 开发一种对表示形式无依赖的半监督学习方法,适用于范围视图、体素和基于点的 LiDAR 表示形式。
- 通过在束混合前后强制模型对同一空间区域做出一致且置信的预测,提升模型鲁棒性与性能。
- 在基准数据集上,于低数据量(10–50% 标注)和高数据量(全量标注)场景下均验证方法的有效性。
提出的方法
- 基于激光束在空间上的分布模式,将 LiDAR 扫描划分为低变化的空间区域,利用激光束分布的空间先验。
- 提出 LaserMix:一种束级别的混合策略,以交错方式将来自两个不同 LiDAR 扫描的对应空间区域进行组合。
- 采用教师-学生训练范式,鼓励模型在混合前后对同一空间区域做出一致且置信的预测。
- 使用一致性正则化损失,强制原始输入与混合输入之间的预测保持一致,从而提升泛化能力。
- 直接在原始点云上操作,无需对网络架构进行修改,即可兼容各种 LiDAR 表示形式(如范围视图、体素、基于点的表示)。
- 理论分析表明,在假设 LiDAR 扫描具有空间连续性和局部同质性的前提下,该混合策略具有统计有效性。
实验结果
研究问题
- RQ1LiDAR 点云中的空间先验能否被有效利用以提升半监督学习性能?
- RQ2在 LiDAR 分割任务中,跨扫描的束级别混合是否优于标准数据增强或对比学习方法,带来更好的泛化能力?
- RQ3LaserMix 在标准 LiDAR 基准数据集上,于不同标注预算(如 10%、20%、50%、100%)下的表现如何?
- RQ4该方法能否在显著减少标注数量的前提下,实现与全监督最先进模型相当的性能?
- RQ5该框架是否无需微调即可在不同 LiDAR 表示形式(如范围视图、体素、点云)上保持鲁棒性和泛化能力?
主要发现
- 在仅使用 20% 训练标签的情况下,LaserMix 在 nuScenes 上相比仅使用监督学习的基线模型,mIoU 提升达 5.7%。
- 在 SemanticKITTI 上,LaserMix 在相同训练设置下相比先前最先进方法,mIoU 最高提升 3.5%。
- 仅使用 0.8% 的标注数据,LaserMix 在 SemanticKITTI 上即达到 54.4% 的 mIoU,与在 100% 标注数据上训练的全监督模型(如 PolarNet 和 RandLA-Net)性能相当。
- 该方法在仅使用全监督最先进模型 2× 至 5× 少量标注的情况下,仍能取得具有竞争力的结果,展现出强大的数据效率。
- 消融实验证实,空间先验至关重要:若移除束划分或混合策略,性能将出现显著下降。
- 该框架具备良好的跨表示泛化能力:无需修改即可有效应用于范围视图、体素和基于点的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。