[论文解读] Joint Object Detection and Multi-Object Tracking with Graph Neural Networks
该论文提出了一种基于图神经网络(GNNs)的联合多目标跟踪(MOT)框架,用于建模时空对象关系,以同时优化目标检测与数据关联。通过利用GNN捕捉帧间对象间的依赖关系,该方法在MOT15/16/17/20基准上实现了最先进性能,优于以往的联合与分离方法,在检测与跟踪指标上均表现更优。
Object detection and data association are critical components in multi-object tracking (MOT) systems. Despite the fact that the two components are dependent on each other, prior works often design detection and data association modules separately which are trained with separate objectives. As a result, one cannot back-propagate the gradients and optimize the entire MOT system, which leads to sub-optimal performance. To address this issue, recent works simultaneously optimize detection and data association modules under a joint MOT framework, which has shown improved performance in both modules. In this work, we propose a new instance of joint MOT approach based on Graph Neural Networks (GNNs). The key idea is that GNNs can model relations between variable-sized objects in both the spatial and temporal domains, which is essential for learning discriminative features for detection and data association. Through extensive experiments on the MOT15/16/17/20 datasets, we demonstrate the effectiveness of our GNN-based joint MOT approach and show state-of-the-art performance for both detection and MOT tasks. Our code is available at: https://github.com/yongxinw/GSDT
研究动机与目标
- 解决先前MOT系统中检测与数据关联模块分别训练、缺乏端到端优化的问题。
- 克服先前联合MOT方法在检测阶段忽略对象间关系的局限性,即使在数据关联中使用了关系信息。
- 通过建模空间与时间中可变大小的对象交互,提升检测与数据关联的特征判别能力。
- 证明通过GNN联合优化检测与数据关联,相比独立训练或忽略关系的联合训练,能获得更优的整体MOT性能。
- 通过将GNN整合到统一、可微分的MOT框架中,建立新的SOTA基线。
提出的方法
- 构建一个图结构,其中节点代表跨帧检测到的对象(边界框),边编码对象间的空间与时间接近程度。
- 应用图神经网络(GNN),特别是AGNNConv层,实现节点间特征的传播与聚合,使每个对象的表征能基于其时空邻近对象进行更新。
- 将GNN处理后的特征同时输入检测头(用于边界框与类别预测)和数据关联头(用于Re-ID与轨迹匹配)。
- 使用联合损失函数端到端训练整个网络,损失函数包含检测损失(如分类与框回归)和跟踪损失(如三元组或对比损失用于Re-ID)。
- 将GNN集成到基于检测的跟踪流水线中,实现检测与关联模块之间的梯度反传。
- 采用现成的目标检测器(如Faster R-CNN)作为主干网络,随后通过GNN增强特征,以建模对象间依赖关系,再输入最终的预测头。
实验结果
研究问题
- RQ1通过GNN建模时空对象关系,是否能同时提升联合MOT框架中的目标检测与数据关联性能?
- RQ2使用捕捉对象间依赖关系的GNN进行端到端训练,是否能带来优于独立训练或忽略关系的联合训练的检测与跟踪性能?
- RQ3GNN架构的深度如何影响检测准确率与跟踪一致性之间的权衡?
- RQ4与仅在数据关联中使用关系或完全不使用关系的先前方法相比,基于GNN的关系建模是否更具有效性?
- RQ5通过利用共现或同向移动对象之间的上下文关系,GNN是否能有效减少误报与ID切换?
主要发现
- 所提出的基于GNN的联合MOT框架在MOTChallenge的全部四个基准上均实现了最先进性能:MOT15、MOT16、MOT17与MOT20。
- 在MOT17上,该方法实现了87.8%的精确率与90.7%的召回率,优于先前方法如F_ViPeD_B与ZIZOM的检测指标。
- 在MOT15上,模型实现了82.1%的MOTA与76.4%的IDF1,表现出优异的跟踪一致性,且ID切换数(IDS)从无GNN基线的139降至71。
- 消融实验表明,即使仅添加一层GNN,MOTA也较无GNN基线提升2.1个百分点,证实了关系建模的有效性。
- 三层GNN模型达到最高MOTA(82.1%),但IDF1(76.4%)略低于两层模型,表明检测与跟踪优化之间存在权衡。
- 与先前联合方法[22, 30]及分离方法[34]相比,该方法在所有数据集上均持续表现更优,证明联合优化结合关系建模对实现SOTA性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。