Skip to main content
QUICK REVIEW

[论文解读] Simultaneous Detection and Tracking with Motion Modelling for Multiple Object Tracking

Shijie Sun, Naveed Akhtar|arXiv (Cornell University)|Aug 20, 2020
Video Surveillance and Tracking Methods参考文献 8被引用 6
一句话总结

本文提出 DMM-Net,一种通过建模视频序列中的运动参数、物体类别和可见性状态,实现端到端的多目标跟踪与目标检测的深度学习框架。其在 UA-DETRAC 数据集上实现了超过 120 fps 的 12.80 PR-MOTA,无需依赖预训练检测器,并提出了包含 1400 万帧以上的 Omni-MOT 数据集,用于无偏评估。

ABSTRACT

Deep learning-based Multiple Object Tracking (MOT) currently relies on off-the-shelf detectors for tracking-by-detection.This results in deep models that are detector biased and evaluations that are detector influenced. To resolve this issue, we introduce Deep Motion Modeling Network (DMM-Net) that can estimate multiple objects' motion parameters to perform joint detection and association in an end-to-end manner. DMM-Net models object features over multiple frames and simultaneously infers object classes, visibility, and their motion parameters. These outputs are readily used to update the tracklets for efficient MOT. DMM-Net achieves PR-MOTA score of 12.80 @ 120+ fps for the popular UA-DETRAC challenge, which is better performance and orders of magnitude faster. We also contribute a synthetic large-scale public dataset Omni-MOT for vehicle tracking that provides precise ground-truth annotations to eliminate the detector influence in MOT evaluation. This 14M+ frames dataset is extendable with our public script (Code at Dataset , Dataset Recorder , Omni-MOT Source ). We demonstrate the suitability of Omni-MOT for deep learning with DMMNet and also make the source code of our network public.

研究动机与目标

  • 通过将检测与跟踪整合到单一端到端网络中,消除基于深度学习的多目标跟踪中检测器偏差的影响。
  • 解决基于检测的跟踪流水线中因依赖预训练检测器而导致的效率低下与性能下降问题。
  • 构建一个大规模、真实且无偏的车辆跟踪基准数据集,具备精确的标注信息。
  • 实现对物体运动、类别和可见性的联合推理,以高效生成跨视频帧的轨迹片段。
  • 提供公开可扩展的数据集(Omni-MOT)与代码库,支持可复现且透明的 MOT 评估。

提出的方法

  • DMM-Net 使用类似 3D ResNet 的特征提取器处理连续 16 帧视频,学习时空表征。
  • 其采用三个子网络——运动子网络、分类子网络和可见性子网络,均使用 3D 卷积来预测运动参数、物体类别和可见性状态。
  • 网络使用锚定管(anchor tubes),将二维锚定框扩展至时间维度,以表示跨帧的潜在物体轨迹。
  • 运动参数作为相对于时空空间中预定义锚定管的偏移量与缩放因子进行预测。
  • 设计了一种专用损失函数,联合优化所有子网络的运动、分类与可见性预测。
  • 通过过滤预测的锚定管,并利用运动与外观一致性在帧间合并,生成轨迹片段。

实验结果

研究问题

  • RQ1是否可以通过端到端深度学习,联合优化多目标跟踪中的目标检测与数据关联,而无需依赖外部检测器?
  • RQ2在复杂动态场景中,显式建模运动参数在多目标跟踪中的准确率与效率方面有何提升作用?
  • RQ3具有精确标注的合成大规模数据集在多目标跟踪评估中,能在多大程度上减少偏差并提升模型泛化能力?
  • RQ4运动建模与可见性估计的融合是否能增强模型在遮挡与外观变化下的跟踪鲁棒性?
  • RQ5所提出的 Omni-MOT 数据集在支持端到端 MOT 模型训练与评估方面效果如何?

主要发现

  • DMM-Net 在 UA-DETRAC 基准测试中取得 12.80 的 PR-MOTA 分数,性能优于现有方法,且推理速度超过 120 fps。
  • 模型展现出强大的泛化能力,能正确跟踪罕见车型及部分遮挡物体。
  • 将 UA-DETRAC 训练集与 Omni-MOT 的一个子集联合训练后,PR-MOTA 从 11.80% 提升至 12.20%。
  • 所提出的 Omni-MOT 数据集包含超过 1400 万帧,1.1 亿个边界框,以及 25 万个轨迹,覆盖多种天气、人群密度与摄像机视角。
  • 运动建模的集成使网络能够隐式检测与跟踪物体,无需外部检测器。
  • 源代码与数据集已公开发布,支持可复现研究与无偏 MOT 评估的进一步发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。