Skip to main content
QUICK REVIEW

[论文解读] PillarNeXt: Rethinking Network Designs for 3D Object Detection in LiDAR Point Clouds

Jinyu Li, Chenxu Luo|arXiv (Cornell University)|May 8, 2023
Advanced Neural Network Applications被引用 7
一句话总结

PillarNeXt 通过重新思考网络设计,提出了一种简化但高效的 LiDAR 点云 3D 目标检测框架:它采用基于柱状体的特征编码,并结合现代化的 2D 检测实践——尤其是扩大感受野和优化训练——在 Waymo Open Dataset 和 nuScenes 上实现了最先进性能,优于复杂的、专用于几何建模的模型,同时保持了低延迟。

ABSTRACT

In order to deal with the sparse and unstructured raw point clouds, LiDAR based 3D object detection research mostly focuses on designing dedicated local point aggregators for fine-grained geometrical modeling. In this paper, we revisit the local point aggregators from the perspective of allocating computational resources. We find that the simplest pillar based models perform surprisingly well considering both accuracy and latency. Additionally, we show that minimal adaptions from the success of 2D object detection, such as enlarging receptive field, significantly boost the performance. Extensive experiments reveal that our pillar based networks with modernized designs in terms of architecture and training render the state-of-the-art performance on the two popular benchmarks: Waymo Open Dataset and nuScenes. Our results challenge the common intuition that the detailed geometry modeling is essential to achieve high performance for 3D object detection.

研究动机与目标

  • 挑战当前主流假设,即细粒度的局部几何建模对高精度 LiDAR 点云 3D 目标检测至关重要。
  • 探究计算资源是更应分配给局部点聚合器,还是更应分配给现代化的网络架构。
  • 评估在 3D 检测框架中采用 2D 目标检测进展(如更大的感受野和改进的训练策略)的有效性。
  • 为未来基于 LiDAR 的 3D 目标检测研究建立一个强大、可扩展且高效的基线。

提出的方法

  • 该方法使用基于柱状体的特征编码器,将稀疏点云转换为规则网格,从而支持高效的 2D 卷积操作。
  • 应用现代化的 2D 检测组件,如基于 Swin Transformer 的主干网络和 BiFPN 颈部结构,以增强特征表示能力。
  • 一个关键设计选择是在最终检测头阶段扩大感受野,取代多尺度特征融合,以提升性能。
  • 通过采用先进的训练技术,包括 CBGS 重采样和淡化解耦复制粘贴数据增强,提升模型泛化能力。
  • 通过调整网络深度和宽度,对模型进行优化,兼顾准确率和推理速度,使其适用于车载和非车载系统部署。
  • 该方法避免使用复杂的、专用于点云的模块,转而依赖经验证的 2D 检测实践,并将其适配至鸟瞰图(BEV)空间。

实验结果

研究问题

  • RQ1当计算资源分配相等时,基于柱状体的简化局部点聚合器是否优于更复杂的体素化方法或多视角特征融合方法?
  • RQ22D 目标检测的进展(如更大的感受野和改进的训练策略)在多大程度上能提升 LiDAR 点云中的 3D 检测性能?
  • RQ3单阶段、基于柱状体的检测器是否能在不使用专门的 3D 几何建模组件的情况下实现最先进性能?
  • RQ4在 Waymo 和 nuScenes 等标准基准上,基于柱状体的模型性能与领先的体素化模型和多视角融合模型相比如何?

主要发现

  • 在 Waymo Open Dataset 测试集上,PillarNeXt-B 达到 84.40% 的 3D mAP 和 81.44% 的 BEV mAP,优于所有最先进方法,且无需测试时增强。
  • 在 nuScenes 上,PillarNeXt-B 达到 68.8% 的 NDS 和 62.5% 的 mAP,mAP 超过所有领先的体素化和多视角融合模型,同时保持了高效率。
  • 基于柱状体的模型在小目标(如行人和交通锥)上的表现与体素化模型相当或更优,挑战了‘细粒度几何建模必不可少’的既有认知。
  • 在最终检测头阶段扩大感受野显著提升了性能,优于先前工作中采用的多尺度特征融合策略。
  • 通过极少的架构修改即实现最先进结果,证明现代化的 2D 检测实践在 3D LiDAR 检测中具有极强的可迁移性。
  • 即使仅使用单帧的 PillarNeXt 版本,也优于使用 200 帧序列进行优化的多帧方法(如 3DAL),验证了模型强大的特征学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。