Skip to main content
QUICK REVIEW

[论文解读] MaskRange: A Mask-classification Model for Range-view based LiDAR Segmentation

Yi Gu, Yuming Huang|arXiv (Cornell University)|Jun 24, 2022
Advanced Neural Network Applications被引用 6
一句话总结

MaskRange 提出了一种用于范围视图激光雷达分割的新型掩码分类范式,通过为语义和实例分割任务统一架构,超越了现有的逐像素方法。它在 25 FPS 的速度下实现了 SOTA 性能:在 SemanticKITTI 语义分割任务中达到 66.10 mIoU,在实例分割任务中达到 53.10 PQ,其性能得益于一种新颖的数据增强方法——加权粘贴丢弃(WPD),该方法有效缓解了过拟合、对上下文的依赖性以及类别不平衡问题。

ABSTRACT

Range-view based LiDAR segmentation methods are attractive for practical applications due to their direct inheritance from efficient 2D CNN architectures. In literature, most range-view based methods follow the per-pixel classification paradigm. Recently, in the image segmentation domain, another paradigm formulates segmentation as a mask-classification problem and has achieved remarkable performance. This raises an interesting question: can the mask-classification paradigm benefit the range-view based LiDAR segmentation and achieve better performance than the counterpart per-pixel paradigm? To answer this question, we propose a unified mask-classification model, MaskRange, for the range-view based LiDAR semantic and panoptic segmentation. Along with the new paradigm, we also propose a novel data augmentation method to deal with overfitting, context-reliance, and class-imbalance problems. Extensive experiments are conducted on the SemanticKITTI benchmark. Among all published range-view based methods, our MaskRange achieves state-of-the-art performance with $66.10$ mIoU on semantic segmentation and promising results with $53.10$ PQ on panoptic segmentation with high efficiency. Our code will be released.

研究动机与目标

  • 探究在图像分割中已取得成功的掩码分类范式,是否能有效迁移至范围视图激光雷达分割任务中,以超越逐像素分类方法。
  • 通过一种新颖的数据增强策略,解决在激光雷达分割中常见的过拟合、对上下文的依赖性以及类别不平衡问题。
  • 构建一个统一的框架,无需额外监督或超参数调优,即可同时支持语义分割与实例分割任务。
  • 展示掩码分类范式在不同激光雷达数据表示形式中的泛化能力,以范围视图为主要示例。

提出的方法

  • 将 MaskFormer 的元架构适配至激光雷达范围视图数据,将分割任务重新定义为一组掩码分类预测,而非传统的逐像素分类。
  • 提出一种新颖的数据增强方法——加权粘贴丢弃(WPD),通过基于类别和上下文感知的加权方式,将不同扫描数据中的图像块粘贴至目标图像中,以降低过拟合与类别不平衡问题。
  • 采用统一的加权焦点损失来重新平衡训练样本,提升优化稳定性,并增强对长尾类别的性能表现。
  • 引入深度监督(DeepB)与依赖数据的上采样(DU),以增强特征细化与预测精度,改善训练动态。
  • 利用 Transformer 解码器聚合全局上下文信息,减少主干网络对局部上下文聚合的依赖。
  • 通过利用 2D CNN 的高效性,保持较低的额外 FLOPs(2.2 GFlops)与延迟(40 ms,即 25 FPS),在单张 RTX 2080Ti 上实现高效的推理速度。

实验结果

研究问题

  • RQ1在图像分割中表现优异的掩码分类范式,能否被有效迁移至范围视图激光雷达分割任务中,以超越逐像素分类方法?
  • RQ2在稀疏激光雷达数据中常见的过拟合、对上下文的依赖性以及类别不平衡问题,如何在掩码分类框架中得到有效缓解?
  • RQ3是否能够通过统一的模型架构,在无需任务特定头调优或边界框监督的前提下,同时在语义分割与实例分割任务中实现高性能?
  • RQ4像 WPD 这类新颖的数据增强策略,在稀疏且长尾分布的激光雷达分割任务中,能在多大程度上提升泛化能力与性能表现?

主要发现

  • MaskRange 在 SemanticKITTI 语义分割基准上实现了 SOTA 性能,mIoU 达到 66.10,是所有已发表的基于范围视图的方法中排名第一。
  • 在实例分割基准上,其 PQ 达到 53.10,展现出强大的泛化能力与鲁棒性,且无需额外监督信号。
  • 所提出的加权粘贴丢弃(WPD)增强方法,在应用于 MaskRange 时,相较基线模型使 mIoU 提升了 7.70%,显著优于 Mix3D 与 Instance Paste。
  • 该模型在单张 NVIDIA RTX 2080Ti 上实现 25 FPS 的推理速度(40 ms 延迟),展现出适用于实时应用的高效性。
  • 消融实验证实,WPD、加权焦点损失与改进的深度监督(DeepB)三者结合是性能提升的关键,其中 WPD 贡献最大。
  • 模型性能对 WPD 的敏感度高于对逐像素基线模型的敏感度,表明掩码分类架构更能有效利用数据增强带来的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。