Skip to main content
QUICK REVIEW

[论文解读] Graph Neural Networks for 3D Multi-Object Tracking

Xinshuo Weng, Yongxin Wang|arXiv (Cornell University)|Aug 20, 2020
Video Surveillance and Tracking Methods参考文献 11被引用 4
一句话总结

本文提出了一种新颖的3D多目标跟踪(MOT)方法,利用图神经网络(GNNs)实现特征交互,并采用联合2D/3D特征提取器以提升判别性特征学习。通过使用GNNs建模对象间依赖关系,并融合来自2D与3D空间的外观和运动特征,该方法在KITTI数据集上实现了最先进性能,sAMOTA达到93.92,MOTA达到86.03。

ABSTRACT

3D Multi-object tracking (MOT) is crucial to autonomous systems. Recent work often uses a tracking-by-detection pipeline, where the feature of each object is extracted independently to compute an affinity matrix. Then, the affinity matrix is passed to the Hungarian algorithm for data association. A key process of this pipeline is to learn discriminative features for different objects in order to reduce confusion during data association. To that end, we propose two innovative techniques: (1) instead of obtaining the features for each object independently, we propose a novel feature interaction mechanism by introducing Graph Neural Networks; (2) instead of obtaining the features from either 2D or 3D space as in prior work, we propose a novel joint feature extractor to learn appearance and motion features from 2D and 3D space. Through experiments on the KITTI dataset, our proposed method achieves state-of-the-art 3D MOT performance. Our project website is at http://www.xinshuoweng.com/projects/GNN3DMOT.

研究动机与目标

  • 通过建模对象之间的依赖关系,提升3D多目标跟踪中的判别性特征学习。
  • 解决先前基于检测的跟踪流水线中独立特征提取的局限性。
  • 利用2D与3D空间中的互补信息,获得更鲁棒的运动与外观特征。
  • 开发一种联合特征提取器,融合2D与3D的外观和运动特征,以提升数据关联性能。
  • 应用图神经网络,通过对象间交互实现上下文感知的特征更新。

提出的方法

  • 构建一个图结构,其中每个节点代表来自2D与3D空间融合后的对象特征,边表示潜在的关联关系。
  • 应用多层GNN,通过聚合邻近节点的信息来更新每个节点的特征,实现上下文感知的特征学习。
  • 采用四分支特征提取器,独立学习2D外观、2D运动、3D外观和3D运动特征,之后进行融合。
  • 将四个分支的特征融合为单一表征,再输入GNN以实现特征交互与相似性计算。
  • 使用批量三元组损失对节点特征进行优化,并对预测的相似性矩阵施加亲和损失,实现端到端训练。
  • 通过GNN中的边回归执行数据关联,预测最终的亲和矩阵以完成匹配。

实验结果

研究问题

  • RQ1图神经网络是否能通过建模对象间依赖关系,提升3D多目标跟踪中的判别性特征学习?
  • RQ2联合学习2D与3D的外观和运动特征,是否能产生比单独使用任一模态更鲁棒、更具判别性的特征?
  • RQ3与独立特征提取相比,所提出的基于GNN的特征交互机制在数据关联准确性方面表现如何?
  • RQ42D与3D特征的融合是否能减少相似对象之间的混淆,并提升复杂场景下的跟踪鲁棒性?
  • RQ5上下文感知的特征学习对MOTA和AMOTA等标准MOT指标在3D跟踪中的影响是什么?

主要发现

  • 所提方法在KITTI 3D MOT基准上实现了93.92的最先进sAMOTA得分,超越了先前方法。
  • 该方法实现了86.03的MOTA,显著优于相同评估设置下的mmMOT(74.07)、FANTrack(74.30)和AB3DMOT(86.24)。
  • 身份切换(IDS)减少至0,表明身份一致性完美,相较mmMOT的10和FANTrack的35有显著提升。
  • 该方法仅产生10次碎片化事件(FRAG),在所有对比方法中最低,表明跟踪连续性更优。
  • AMOTA得分为45.83,AMOTP得分为78.10,表明在整体跟踪准确率和定位精度方面均表现强劲。
  • 消融实验证实,联合2D/3D特征提取器与基于GNN的交互机制对性能提升均至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。