Skip to main content
QUICK REVIEW

[论文解读] PTTR: Relational 3D Point Cloud Object Tracking with Transformer

Changqing Zhou, Zhipeng Luo|arXiv (Cornell University)|Dec 6, 2021
3D Shape Modeling and Analysis被引用 7
一句话总结

PTTR 是一种新颖的 3D 点云单目标跟踪方法,采用基于 Transformer 的架构,结合关系感知采样与点关系 Transformer(PRT),实现高精度与高效率的粗到精跟踪。该方法在 KITTI 和新提出的大型 Waymo SOT 基准上均达到新的 SOTA 水平,显著优于先前方法,同时保持较低的推理成本。

ABSTRACT

In a point cloud sequence, 3D object tracking aims to predict the location and orientation of an object in the current search point cloud given a template point cloud. Motivated by the success of transformers, we propose Point Tracking TRansformer (PTTR), which efficiently predicts high-quality 3D tracking results in a coarse-to-fine manner with the help of transformer operations. PTTR consists of three novel designs. 1) Instead of random sampling, we design Relation-Aware Sampling to preserve relevant points to given templates during subsampling. 2) Furthermore, we propose a Point Relation Transformer (PRT) consisting of a self-attention and a cross-attention module. The global self-attention operation captures long-range dependencies to enhance encoded point features for the search area and the template, respectively. Subsequently, we generate the coarse tracking results by matching the two sets of point features via cross-attention. 3) Based on the coarse tracking results, we employ a novel Prediction Refinement Module to obtain the final refined prediction. In addition, we create a large-scale point cloud single object tracking benchmark based on the Waymo Open Dataset. Extensive experiments show that PTTR achieves superior point cloud tracking in both accuracy and efficiency.

研究动机与目标

  • 为解决单目标跟踪(SOT)中 3D 点云稀疏性、遮挡以及缺乏纹理等挑战,设计一种更鲁棒且高效的跟踪框架。
  • 通过一种新型注意力机制提升模板点云与搜索点云之间的特征匹配,以捕捉长距离依赖关系与上下文关联。
  • 构建一种粗到精的跟踪流水线,通过渐进式优化提升跟踪精度,同时不牺牲推理速度。
  • 基于 Waymo 开放数据集构建一个新型大规模、平衡且全面的 SOT 基准,以支持对 3D 跟踪方法的更全面评估。

提出的方法

  • 提出关系感知采样(Relation-Aware Sampling),一种非随机采样策略,通过利用特征相似性保留搜索点云中与模板最相关的点。
  • 提出点关系 Transformer(PRT),采用双注意力机制:自注意力用于增强模板与搜索点云中的局部与全局特征,交叉注意力用于跨点云匹配特征。
  • 采用轻量级预测优化模块(PRM),通过局部特征池化对粗预测进行优化,在计算开销极小的情况下提升定位精度。
  • 使用 PointNet++ 主干网络在 PRT 处理前提取初始点特征,从而从稀疏 3D 点云中实现有效的表征学习。
  • 在关系注意力模块中应用 L2 归一化与偏移注意力,通过强调余弦相似性与空间偏移感知,提升特征匹配性能。
  • 采用端到端方式进行模型训练与评估,实现采样、特征学习与跟踪预测的联合优化。

实验结果

研究问题

  • RQ1与传统的基于相关性的方法相比,基于 Transformer 的架构结合关系注意力是否能提升 3D 点云跟踪的精度?
  • RQ2在稀疏点云中,关系感知采样是否相比随机采样或均匀采样能带来更优的特征表征与跟踪性能?
  • RQ3结合优化模块的粗到精跟踪流水线在不降低推理速度的前提下,能在多大程度上提升定位精度?
  • RQ4在真实场景中,该方法在多样化目标类别与长时序跟踪序列中的泛化能力如何?

主要发现

  • 在 KITTI 跟踪基准上,PTTR 实现了新的 SOTA 性能,成功率达到 58.4%,精度达到 77.8%,显著优于先前的 SOTA 方法。
  • 在新引入的 Waymo SOT 数据集上,PTTR 实现了 50.3% 的平均成功率与 64.9% 的平均精度,分别较 SC3D 和 P2B 提升了 17.2 和 11.0 个百分点的平均成功率。
  • 消融实验表明,点关系 Transformer(PRT)与预测优化模块(PRM)均至关重要,仅使用 PRT 即可在平均成功率上较余弦相似性基线提升 8.8%。
  • 关系注意力模块中的 L2 归一化与偏移注意力组件均对性能有显著贡献,其中归一化在通过余弦距离增强特征匹配方面尤为有效。
  • 即使不使用 PRM,PTTR 在 KITTI 上仍能达到 56.7% 的平均成功率,表明其具备强大的粗预测能力。
  • 失败案例主要源于极端的点云稀疏性,提示多帧时序建模可能进一步提升低信噪比场景下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。