Skip to main content
QUICK REVIEW

[论文解读] PVT-SSD: Single-Stage 3D Object Detector with Point-Voxel Transformer

Honghui Yang, Wenxiao Wang|arXiv (Cornell University)|May 11, 2023
Robotics and Sensor-Based Localization被引用 4
一句话总结

PVT-SSD 是一种单阶段 3D 目标检测器,通过 Point-Voxel Transformer (PVT) 统一点和体素表示,以克服体素化过程中的量化误差以及基于点的方法中的采样开销。它采用基于输入的查询初始化机制,从稀疏体素中生成查询,并利用虚拟范围图像实现快速邻域搜索,在 KITTI、Waymo 和 nuScenes 上实现最先进性能,KITTI 上达到 65.01 APH 的指标。

ABSTRACT

Recent Transformer-based 3D object detectors learn point cloud features either from point- or voxel-based representations. However, the former requires time-consuming sampling while the latter introduces quantization errors. In this paper, we present a novel Point-Voxel Transformer for single-stage 3D detection (PVT-SSD) that takes advantage of these two representations. Specifically, we first use voxel-based sparse convolutions for efficient feature encoding. Then, we propose a Point-Voxel Transformer (PVT) module that obtains long-range contexts in a cheap manner from voxels while attaining accurate positions from points. The key to associating the two different representations is our introduced input-dependent Query Initialization module, which could efficiently generate reference points and content queries. Then, PVT adaptively fuses long-range contextual and local geometric information around reference points into content queries. Further, to quickly find the neighboring points of reference points, we design the Virtual Range Image module, which generalizes the native range image to multi-sensor and multi-frame. The experiments on several autonomous driving benchmarks verify the effectiveness and efficiency of the proposed method. Code will be available at https://github.com/Nightmare-n/PVT-SSD.

研究动机与目标

  • 解决基于点和基于体素的 3D 检测器的局限性:点方法存在高采样成本,体素方法存在量化误差。
  • 通过融合体素提供的长程上下文与点提供的精确几何细节,统一点与体素表示的优势。
  • 通过引入广义的虚拟范围图像模块,在多传感器和多帧场景下加速邻域搜索,降低推理延迟。
  • 通过可学习的、基于输入的查询初始化机制,学习更优的初始查询位置与内容查询,提升检测精度。
  • 在保持计算效率的同时,在主流 3D 检测基准上实现最先进性能。

提出的方法

  • 提出一种基于输入的查询初始化模块,通过稀疏卷积采样非空 3D 体素,将其压缩为 2D 体素,并重新提升至 3D,以生成参考点。
  • 通过将参考点投影到鸟瞰图(BEV)特征图上,并在投影位置索引特征,生成内容查询。
  • 设计 Point-Voxel Transformer (PVT) 模块,利用交叉注意力机制,根据与内容查询的相似性,自适应地融合体素标记(用于长程上下文)与点标记(用于细粒度几何)。
  • 引入虚拟范围图像模块,将原生 LiDAR 范围图像推广至支持多传感器与多帧融合,通过范围图像坐标实现快速高效的邻域查找。
  • 采用基于半径的球形查询,并结合顺序采样与随机采样策略,其中随机采样通过避免点分布不均提升性能。
  • 在 Transformer 块中应用上下文相关的相对位置编码,以增强特征表示,优于绝对编码与偏置模式编码。

实验结果

研究问题

  • RQ1单阶段 3D 检测器能否有效结合基于体素处理的效率与基于点表示的准确性?
  • RQ2从非空体素中进行查询初始化,是否能在保持或提升检测质量的同时减少采样时间,相比基于点的采样?
  • RQ3通过交叉注意力机制融合体素与点特征,在长程与细粒度几何特征上的检测性能提升程度如何?
  • RQ4广义的虚拟范围图像模块是否能加速多样化传感器配置与多帧设置下的邻域搜索?
  • RQ5在所提框架中,不同的采样策略与位置编码方案对最终检测性能的影响如何?

主要发现

  • PVT-SSD 在 KITTI 基准上达到 65.01 APH,优于先前方法,展现出最先进性能。
  • 查询初始化中的 S-FPS 采样策略相比 FPS 提升 11.25 APH,相比 F-FPS 提升 0.48 APH,因其优先选择可能位于物体内的体素。
  • Point-Voxel Transformer 模块通过点标记贡献 1.58 APH,通过体素标记贡献 0.45 APH,特征对齐进一步带来 0.87 APH 的增益。
  • 基于虚拟范围图像的球形查询在 20 万点云上相比原始球形查询实现 29.7 倍加速,显著提升推理效率。
  • 上下文相关的相对位置编码相比绝对编码提升 1.72 APH,相比偏置模式编码提升 1.00 APH,凸显其在表征学习中的重要性。
  • 消融研究显示,当感受野超过最优值(如 $r_v = 8.0$,$r_p = 3.2$)时,性能趋于饱和或下降,原因在于噪声增加与无关点的采样。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。