[论文解读] Can Deep Learning be Applied to Model-Based Multi-Object Tracking?
本文提出 MT3v2,一种面向基于模型的多目标跟踪(MOT)的基于 Transformer 的深度学习追踪器,表明其在简单任务中与最先进贝叶斯方法性能相当,而在涉及高数据关联复杂性或强非线性的复杂场景中表现更优。该方法实现了显著更快的推理速度——相比 PMBM 和 δ-GLMB 快几个数量级,同时在低维测量设置下保持了具有竞争力的追踪精度。
Multi-object tracking (MOT) is the problem of tracking the state of an unknown and time-varying number of objects using noisy measurements, with important applications such as autonomous driving, tracking animal behavior, defense systems, and others. In recent years, deep learning (DL) has been increasingly used in MOT for improving tracking performance, but mostly in settings where the measurements are high-dimensional and there are no available models of the measurement likelihood and the object dynamics. The model-based setting instead has not attracted as much attention, and it is still unclear if DL methods can outperform traditional model-based Bayesian methods, which are the state of the art (SOTA) in this context. In this paper, we propose a Transformer-based DL tracker and evaluate its performance in the model-based setting, comparing it to SOTA model-based Bayesian methods in a variety of different tasks. Our results show that the proposed DL method can match the performance of the model-based methods in simple tasks, while outperforming them when the task gets more complicated, either due to an increase in the data association complexity, or to stronger nonlinearities of the models of the environment.
研究动机与目标
- 探究在当前基于贝叶斯方法处于最先进水平的基于模型的多目标跟踪中,深度学习是否能有效提升性能。
- 在多样化、逐步复杂的 MOT 任务中,评估深度学习追踪器(MT3v2)与既有的贝叶斯滤波器(PMBM 和 δ-GLMB)的性能表现。
- 评估在基于模型的 MOT 中深度学习的可扩展性与效率,特别是推理速度以及对非线性和数据关联复杂性的鲁棒性。
- 证明即使在具备准确的对象动力学模型和测量似然模型的情况下,深度学习也可成功应用于基于模型的 MOT。
提出的方法
- 提出 MT3v2,一种专为低维测量的基于模型 MOT 设计的基于 Transformer 的深度学习架构。
- 将 Transformer 编码器-解码器结构适配用于预测多目标状态,包括目标存在性、位置及不确定性,采用序列到序列的学习方法。
- 使用基于预测伯努利分量与真实目标之间关联的负对数似然(NLL)的可微分损失函数进行端到端训练。
- 采用可学习的目标查询机制表示潜在目标,并关注测量序列以预测状态估计和轨迹身份。
- 采用结构化输出预测头生成多目标状态估计,包括存在概率和空间状态,并实现不确定性量化。
- 在 Transformer 框架内实现可微分的数据关联机制,避免显式枚举所有可能的关联组合。
实验结果
研究问题
- RQ1当具备准确的动力学和测量模型时,基于深度学习的追踪器是否能在多目标跟踪中超越最先进的基于模型的贝叶斯滤波器?
- RQ2在数据关联复杂性逐步增加的任务中,基于 Transformer 的深度学习追踪器(MT3v2)与 PMBM 和 δ-GLMB 的性能表现如何比较?
- RQ3与传统贝叶斯滤波器相比,该深度学习方法在测量或运动模型中存在强非线性时,性能是否保持或提升?
- RQ4在复杂追踪任务中,深度学习追踪器相比传统贝叶斯滤波器的推理速度优势是多少?
主要发现
- 在数据关联复杂性较低的简单任务中,MT3v2 的追踪性能与最先进的 PMBM 和 δ-GLMB 滤波器相当。
- 在数据关联复杂性较高或非线性更强的任务中(例如 OFDM 雷达测量),MT3v2 在追踪精度方面优于 PMBM 和 δ-GLMB。
- MT3v2 每帧的推理时间为 0.03–0.06 秒,比最复杂任务中的 δ-GLMB 快超过 5000 倍(781.00 秒 vs. 0.06 秒)。
- 随着任务复杂度的增加,MT3v2 与贝叶斯滤波器之间的性能差距进一步扩大,表明深度学习在具有挑战性、非线性或高关联复杂度的追踪问题中更具优势。
- 尽管存在硬件差异(GPU 与 CPU),MT3v2 的推理速度优势极为显著,即使在贝叶斯滤波器经过高度优化的实现下,其性能仍预计保持领先。
- 结果验证了深度学习可有效应用于基于模型的 MOT 场景,为传统贝叶斯滤波提供了一种极具前景的替代方案,具备更优的可扩展性与速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。