[论文解读] Voxel Set Transformer: A Set-to-Set Approach to 3D Object Detection from Point Clouds
本文提出了一种新型的集合到集合3D目标检测框架——体素集合变换器(VoxSeT),该框架采用基于体素的集合注意力(VSA)模块,实现了对不规则分布点云的高效、并行且高容量的自注意力计算。通过使用可学习的潜在代码压缩体素特征,并将自注意力分解为两个交叉注意力模块,VoxSeT在KITTI和Waymo基准上实现了线性复杂度与优异性能,其泛化能力和效率优于以往的CNN与基于点的方法。
Transformer has demonstrated promising performance in many 2D vision tasks. However, it is cumbersome to compute the self-attention on large-scale point cloud data because point cloud is a long sequence and unevenly distributed in 3D space. To solve this issue, existing methods usually compute self-attention locally by grouping the points into clusters of the same size, or perform convolutional self-attention on a discretized representation. However, the former results in stochastic point dropout, while the latter typically has narrow attention fields. In this paper, we propose a novel voxel-based architecture, namely Voxel Set Transformer (VoxSeT), to detect 3D objects from point clouds by means of set-to-set translation. VoxSeT is built upon a voxel-based set attention (VSA) module, which reduces the self-attention in each voxel by two cross-attentions and models features in a hidden space induced by a group of latent codes. With the VSA module, VoxSeT can manage voxelized point clusters with arbitrary size in a wide range, and process them in parallel with linear complexity. The proposed VoxSeT integrates the high performance of transformer with the efficiency of voxel-based model, which can be used as a good alternative to the convolutional and point-based backbones. VoxSeT reports competitive results on the KITTI and Waymo detection benchmarks. The source codes can be found at \url{https://github.com/skyhehe123/VoxSeT}.
研究动机与目标
- 解决标准自注意力在大规模稀疏3D点云上存在的二次方复杂度与低效问题。
- 克服基于分组的方法在点云分组中因随机点丢失以及体素化表示中卷积注意力感受野狭窄的局限性。
- 通过将点云处理建模为集合到集合的映射,实现在3D目标检测中全分辨率特征学习。
- 提升在KITTI和Waymo等多样化3D检测基准上的建模容量与泛化能力。
- 为稀疏CNN与基于点的变换器提供一种高效、可并行化的实时3D检测替代方案。
提出的方法
- 体素集合注意力(VSA)模块使用非重叠3D体素对点云进行分组,并通过可学习的潜在代码实现两阶段交叉注意力机制,以替代完整的自注意力计算。
- 每个体素的特征通过潜在代码压缩到固定大小的隐空间,潜在代码作为查询,用于关注输入点特征的键值投影。
- 隐特征通过卷积前馈网络(ConvFFN)进行优化,实现具有局部连接性的体素间空间特征交换。
- 最终输出通过融合优化后的隐特征与原始输入特征生成,以保留分辨率与上下文信息。
- 整个VSA模块实现O(nkd)的复杂度,其中n为输入点数,k为潜在代码数量,d为特征维度,支持向量化与并行计算。
- VoxSeT框架将多个VSA模块与MLP及浅层CNN结合,形成一个端到端处理原始点云的单阶段检测器。
实验结果
研究问题
- RQ1集合到集合的映射框架是否能在稀疏3D点云上实现高效注意力计算的同时,保留全分辨率特征?
- RQ2基于体素并使用可学习潜在代码的注意力机制是否能在3D目标检测中同时实现高建模容量与线性复杂度?
- RQ3所提出的VSA模块在准确率与跨多样化数据集的泛化能力方面,是否优于基于分组与卷积注意力的机制?
- RQ4潜在代码的数量如何影响VSA模块的性能与表达能力?
- RQ5VoxSeT框架是否能在内存与延迟方面实现比现有3D检测器更低的实时推理性能?
主要发现
- 在KITTI数据集上,VoxSeT实现了最先进性能,'Easy'级别mAP达到89.61,'Moderate'为80.14,'Hard'为78.69,优于使用PointNet++主干网络的PointRCNN。
- 在Waymo数据集上,VoxSeT实现了具有竞争力的mAP分数,展现出在不同点云分布下的强大泛化能力。
- 消融实验表明,将ConvFFN替换为标准FFN会使'Hard'集上的mAP下降超过10分,证明了局部连接性的重要性。
- 将潜在代码数量从4增加到16,KITTI上的mAP从76.63提升至78.74,表明更多代码可实现更好的上下文建模。
- 在2080Ti GPU上,VoxSeT在KITTI上的推理时间为34ms,显存占用2381MB,优于SECOND(48ms,6093MB),且速度与PointPillars(22ms)相当,但精度更高。
- 可视化结果表明,不同的潜在代码关注不同的物体区域,证明了模型的表达能力与注意力多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。