Skip to main content
QUICK REVIEW

[论文解读] VIN: Voxel-based Implicit Network for Joint 3D Object Detection and Segmentation for Lidars

Yuanxin Zhong, Minghan Zhu|arXiv (Cornell University)|Jul 7, 2021
Remote Sensing and LiDAR Applications参考文献 52被引用 4
一句话总结

该论文提出VIN(Voxel-based Implicit Network),一种统一的3D目标检测与语义分割框架,用于LiDAR点云,通过在基于体素的检测器上附加一个轻量级语义分支,生成隐式语义表征。该方法在nuScenes-lidarseg上实现了最先进性能,计算开销极低,并展示了仅使用0.1%标注语义点的强弱监督学习能力。

ABSTRACT

A unified neural network structure is presented for joint 3D object detection and point cloud segmentation in this paper. We leverage rich supervision from both detection and segmentation labels rather than using just one of them. In addition, an extension based on single-stage object detectors is proposed based on the implicit function widely used in 3D scene and object understanding. The extension branch takes the final feature map from the object detection module as input, and produces an implicit function that generates semantic distribution for each point for its corresponding voxel center. We demonstrated the performance of our structure on nuScenes-lidarseg, a large-scale outdoor dataset. Our solution achieves competitive results against state-of-the-art methods in both 3D object detection and point cloud segmentation with little additional computation load compared with object detection solutions. The capability of efficient weakly supervision semantic segmentation of the proposed method is also validated by experiments.

研究动机与目标

  • 开发一种统一的深度学习框架,联合执行LiDAR点云上的3D目标检测与语义分割。
  • 通过复用单阶段3D检测器的特征实现语义分割,以最小化计算开销。
  • 仅使用极小比例(0.1%)的标注语义标签,实现有效的弱监督语义分割。
  • 通过一种新型训练策略,解决3D边界框预测与点级语义标签之间的不一致性。
  • 展示隐式函数在密集语义地图生成与下采样点云推理中的实用性。

提出的方法

  • 通过在主干网络最终特征图上增加一个语义分支,扩展单阶段3D目标检测器,以学习从该特征图出发的隐式函数。
  • 通过查询特征图,隐式函数可预测任意3D坐标处的语义分布,从而实现在任意空间位置的语义推理。
  • 语义分支通过边界框标签和稀疏语义标注进行弱监督训练,减少对密集点级标签的依赖。
  • 引入一致性损失,使预测的语义标签与3D边界框预测对齐,降低检测与分割输出之间的错位。
  • 通过在未测量位置查询隐式函数,实现在下采样点云上的高效推理,同时保持语义准确性。
  • 通过在规则网格上查询隐式函数生成密集语义图,实现鸟瞰图语义表征。

实验结果

研究问题

  • RQ1统一的网络架构能否在极低计算成本下,有效实现LiDAR点云上的3D目标检测与语义分割?
  • RQ2在仅使用边界框标注和极小比例点级标签的情况下,语义分割在多大程度上可被有效监督?
  • RQ3在联合训练过程中,如何最小化3D检测框与点级语义标签之间的不一致性?
  • RQ4语义分支学习到的隐式函数能否在下采样或不完整点云上泛化,同时保持分割准确性?
  • RQ5隐式函数能否实现高效生成密集语义图,以支持场景理解或制图等下游任务?

主要发现

  • VIN在nuScenes-lidarseg基准上,于3D目标检测与语义分割任务中均实现了最先进性能,优于现有方法。
  • 仅使用0.1%的语义标签,模型在完整观测点云上达到73.7的mIoU,即使在仅使用16束(原始点云密度的32%)时,mIoU仍为73.7。
  • 在16束下采样输入上进行推理时,模型保持高分割精度(70.2 mIoU),优于最近邻基线方法(55.9 mIoU)。
  • 推理速度几乎与基础检测器一致(单张2080Ti上分别为5.9 FPS与6.0 FPS),表明联合分割的计算开销极低。
  • 当输入下采样时,隐式函数可在无LiDAR测量的区域实现准确的语义预测,表现出对稀疏输入的鲁棒性。
  • 通过隐式函数查询生成的密集语义图展现出连贯的语义边界,对视觉解释与下游任务具有实用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。