Skip to main content
QUICK REVIEW

[论文解读] LidarMultiNet: Unifying LiDAR Semantic Segmentation, 3D Object Detection, and Panoptic Segmentation in a Single Multi-task Network

Dongqiangzi Ye, Weijia Chen|arXiv (Cornell University)|Jun 23, 2022
Advanced Neural Network Applications被引用 7
一句话总结

LidarMultiNet 提出了一种统一的3D LiDAR感知框架,通过一个端到端可训练的神经网络联合执行语义分割、3D目标检测和全景分割。该方法采用基于3D稀疏卷积的编码器-解码器结构,并引入一种新型全局上下文聚合(GCP)模块以增强全局特征学习能力,同时结合两阶段优化策略进一步提升精度,在Waymo Open Dataset 3D语义分割排行榜上取得了71.13 mIoU的性能,位居所有方法之首。

ABSTRACT

This technical report presents the 1st place winning solution for the Waymo Open Dataset 3D semantic segmentation challenge 2022. Our network, termed LidarMultiNet, unifies the major LiDAR perception tasks such as 3D semantic segmentation, object detection, and panoptic segmentation in a single framework. At the core of LidarMultiNet is a strong 3D voxel-based encoder-decoder network with a novel Global Context Pooling (GCP) module extracting global contextual features from a LiDAR frame to complement its local features. An optional second stage is proposed to refine the first-stage segmentation or generate accurate panoptic segmentation results. Our solution achieves a mIoU of 71.13 and is the best for most of the 22 classes on the Waymo 3D semantic segmentation test set, outperforming all the other 3D semantic segmentation methods on the official leaderboard. We demonstrate for the first time that major LiDAR perception tasks can be unified in a single strong network that can be trained end-to-end.

研究动机与目标

  • 将主要的LiDAR感知任务——3D语义分割、3D目标检测与全景分割——统一于一个联合多任务网络中。
  • 提升基于3D体素的神经网络中全局特征表示能力,此类网络常因稀疏卷积而难以建模长距离上下文信息。
  • 实现多个感知任务的端到端训练,共享特征表示,利用任务间的协同效应以提升整体性能。
  • 证明单一强大网络在LiDAR感知任务中可超越为单一任务设计的专用模型。

提出的方法

  • 基于3D稀疏卷积的编码器-解码器主干网络,将LiDAR点云转换为0.1m × 0.1m × 0.15m分辨率的体素网格进行处理。
  • 全局上下文聚合(GCP)模块通过将稀疏体素特征转换为密集鸟瞰图(BEV)表示,并应用多尺度2D卷积来提取全局上下文信息,从而增强特征学习能力。
  • 在BEV特征图上附加用于鸟瞰图(BEV)分割与3D目标检测的辅助头,提供多任务监督信号。
  • 可选的两阶段优化模块通过细化第一阶段预测结果或生成全景分割输出,进一步提升分割质量。
  • 使用来自过去LiDAR帧的多帧输入,以增强点云密度并改善特征表示。
  • 数据增强包括随机翻转、缩放、旋转与平移,同时利用车辆位姿信息对最多三帧LiDAR数据进行时间融合。

实验结果

研究问题

  • RQ1单一深度学习模型能否有效统一LiDAR点云的3D语义分割、3D目标检测与全景分割任务?
  • RQ2在稀疏3D体素网络中,如何在不牺牲效率的前提下有效学习全局上下文特征?
  • RQ3与独立训练相比,多个感知任务的联合训练是否能提升整体性能?
  • RQ4在多任务设置下,两阶段优化机制是否能进一步提升分割精度?

主要发现

  • LidarMultiNet在Waymo Open Dataset 3D语义分割测试集上取得了71.13 mIoU的平均交并比(mIoU),在官方排行榜中排名第一。
  • 在22个语义类别中的15个类别上,该模型优于所有其他方法,展现出卓越的泛化能力与类别特定精度。
  • 消融实验表明,多帧输入、GCP模块、辅助损失与两阶段优化模块均对性能有逐步贡献,其中两阶段模块带来了0.34 mIoU的提升。
  • 推理时采用数据增强与7个模型的集成策略,使验证集上的mIoU进一步提升至73.78,最终提交结果在测试集上达到71.13 mIoU。
  • 所提出的全局上下文聚合(GCP)模块相比基线模型提升了0.94 mIoU,证明其在捕捉长距离依赖关系方面的有效性。
  • 采用共享特征与辅助监督的端到端多任务训练策略,在所有任务上均实现了稳定性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。