Skip to main content
QUICK REVIEW

[论文解读] Focal Sparse Convolutional Networks for 3D Object Detection

Yukang Chen, Yanwei Li|arXiv (Cornell University)|Apr 26, 2022
Advanced Neural Network Applications被引用 15
一句话总结

该论文提出Focal Sparse Convolution(Focals Conv)及其多模态变体Focals Conv-F,通过预测重要性图来引导特征膨胀,动态学习3D稀疏卷积网络中的空间稀疏性。该方法在计算开销极小的情况下提升了3D目标检测的特征表示能力,在nuScenes数据集上无需模型集成或测试时增强即可达到最先进性能,包括在测试集上取得71.8%的NDS和67.8%的mAP。

ABSTRACT

Non-uniformed 3D sparse data, e.g., point clouds or voxels in different spatial positions, make contribution to the task of 3D object detection in different ways. Existing basic components in sparse convolutional networks (Sparse CNNs) process all sparse data, regardless of regular or submanifold sparse convolution. In this paper, we introduce two new modules to enhance the capability of Sparse CNNs, both are based on making feature sparsity learnable with position-wise importance prediction. They are focal sparse convolution (Focals Conv) and its multi-modal variant of focal sparse convolution with fusion, or Focals Conv-F for short. The new modules can readily substitute their plain counterparts in existing Sparse CNNs and be jointly trained in an end-to-end fashion. For the first time, we show that spatially learnable sparsity in sparse convolution is essential for sophisticated 3D object detection. Extensive experiments on the KITTI, nuScenes and Waymo benchmarks validate the effectiveness of our approach. Without bells and whistles, our results outperform all existing single-model entries on the nuScenes test benchmark at the paper submission time. Code and models are at https://github.com/dvlab-research/FocalsConv.

研究动机与目标

  • 解决现有稀疏卷积网络中对稀疏3D特征统一处理的局限性,即所有特征无论空间重要性如何都被同等处理。
  • 克服常规稀疏卷积的低效性与特征模糊问题,以及子流形稀疏卷积在3D目标检测中信息流受限的缺陷。
  • 通过引入动态、逐位置的重要程度预测,实现端到端可学习的稀疏性,聚焦于有价值的前景特征。
  • 通过Focals Conv-F中轻量级、基于注意力的融合机制,将RGB图像特征与稀疏LiDAR特征融合,提升多模态3D检测性能。
  • 证明空间可学习稀疏性对高性能3D目标检测至关重要,尤其在nuScenes等复杂、大规模基准上。

提出的方法

  • 提出Focal Sparse Convolution(Focals Conv),通过使用预测的立方体重要性图学习空间自适应输出模式,替代标准稀疏卷积。
  • 引入可学习的重要程度预测头,为每个空间位置生成二值或连续的重要程度图,仅对高重要性体素的输入特征进行膨胀。
  • 设计输出特征图根据重要性图动态调整形状,仅扩展有价值特征,从而保持稀疏性并减少计算量。
  • 通过在Focals Conv输出处融合RGB图像特征与LiDAR特征,将Focals Conv扩展为Focals Conv-F,采用轻量级特征融合模块以增强外观与上下文信息。
  • 端到端训练整个网络,重要性预测与特征学习联合优化,使模型在特征提取过程中聚焦于显著区域。
  • 重要性预测与融合仅引入少量额外参数与FLOPs,确保模型复杂度开销最小化。

实验结果

研究问题

  • RQ1与对所有稀疏特征统一处理相比,稀疏卷积中可学习的空间自适应稀疏性是否能提升3D目标检测性能?
  • RQ2仅对高重要性特征进行动态膨胀是否能降低计算成本,同时提升稀疏3D检测中的特征判别能力?
  • RQ3在Focals Conv-F中通过轻量级融合机制整合RGB特征,是否能进一步提升多模态基准上的检测精度?
  • RQ4融合阶段与融合范围的选择如何影响使用Focals Conv-F的多模态3D检测器性能?
  • RQ5所提方法对不同重要性阈值是否具有鲁棒性,是否在不同数据集与设置下保持性能稳定性?

主要发现

  • Focals Conv将基线Voxel R-CNN在KITTI验证集上的AP 3D提升至85.22%,超越包括Pyramid-PV与VoTr-TSD在内的先前最先进方法。
  • 在KITTI测试集上,Focals Conv-F在多模态设置下达到82.28% AP 3D,优于现有单模型方法。
  • 在nuScenes测试基准上,Focals Conv-F在无需模型集成或测试时增强的情况下,实现67.8% mAP与71.8% NDS,创下单模型性能新纪录。
  • 在测试时增强下,Focals Conv-F进一步达到70.1% mAP与73.6% NDS,超越包括CenterPoint v2 with PointPainting与Cascade R-CNN在内的集成方法。
  • 消融实验表明,性能在不同重要性阈值(τ从0.1到0.9)下保持稳定,表明对超参数选择具有鲁棒性。
  • 在网络早期阶段融合,尤其是仅在重要特征上进行融合,性能优于全特征融合,其中仅在重要体素上进行早期阶段融合为最优方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。