Skip to main content
QUICK REVIEW

[论文解读] Frame-wise Motion and Appearance for Real-time Multiple Object Tracking

Jimuyang Zhang, Sanping Zhou|arXiv (Cornell University)|May 6, 2019
Video Surveillance and Tracking Methods参考文献 32被引用 11
一句话总结

本文提出帧级运动与外观(FMA),一种实时多目标跟踪方法,通过像素级位移估计高效地在帧间关联目标,利用帧级运动场(FMF)实现,同时通过帧级外观特征(FAF)解决模糊匹配问题。FMA在MOT17上实现25 FPS的推理速度,准确率具有竞争力,且推理速度与目标数量无关,实现真正实时推理。

ABSTRACT

The main challenge of Multiple Object Tracking (MOT) is the efficiency in associating indefinite number of objects between video frames. Standard motion estimators used in tracking, e.g., Long Short Term Memory (LSTM), only deal with single object, while Re-IDentification (Re-ID) based approaches exhaustively compare object appearances. Both approaches are computationally costly when they are scaled to a large number of objects, making it very difficult for real-time MOT. To address these problems, we propose a highly efficient Deep Neural Network (DNN) that simultaneously models association among indefinite number of objects. The inference computation of the DNN does not increase with the number of objects. Our approach, Frame-wise Motion and Appearance (FMA), computes the Frame-wise Motion Fields (FMF) between two frames, which leads to very fast and reliable matching among a large number of object bounding boxes. As auxiliary information is used to fix uncertain matches, Frame-wise Appearance Features (FAF) are learned in parallel with FMFs. Extensive experiments on the MOT17 benchmark show that our method achieved real-time MOT with competitive results as the state-of-the-art approaches.

研究动机与目标

  • 解决现有MOT方法在目标数量增多时计算效率低下的问题。
  • 克服基于LSTM的运动模型和基于Re-ID的匹配方法在目标数量增加时扩展性差的局限。
  • 通过帧级表示将关联计算与目标数量解耦,实现推理速度与目标数量无关,从而支持实时推理。
  • 在不牺牲速度的前提下,利用辅助外观特征提升对遮挡和外观变化的鲁棒性。
  • 构建一种可泛化的端到端深度学习框架,无需固定网络架构约束,可处理任意数量的目标。

提出的方法

  • 提出帧级运动场(FMF),一种像素级位移图,用于估计连续两帧中目标边界框之间的坐标偏移。
  • 利用FMF通过简单的空间变形预测下一帧中的目标位置,从而实现无需二分图匹配的快速一对一匹配,仅依赖IOU计算。
  • 并行学习帧级外观特征(FAF),采用Re-ID损失,捕捉一帧中所有目标的整体外观表征。
  • 仅在FMF识别出的不确定匹配中应用FAF,从而在推理过程中最小化计算开销。
  • 设计轻量级推理算法:首先使用FMF进行快速匹配,仅在必要时应用FAF以优化模糊关联。
  • 在MOT17数据上从零开始端到端训练网络,避免依赖外部Re-ID数据集。

实验结果

研究问题

  • RQ1深度学习模型能否实现推理成本与目标数量无关的实时多目标跟踪?
  • RQ2帧级运动场(FMF)能否在不依赖二分图匹配或循环结构的情况下,有效表征帧间的目标关联?
  • RQ3在推理过程中仅选择性使用时,帧级外观特征(FAF)在解决模糊匹配方面的有效性如何?
  • RQ4仅在MOT17数据上训练的方法能否在不使用外部Re-ID数据的情况下实现具有竞争力的性能?
  • RQ5基于FMF的跟踪方法在遮挡、视角变化和检测噪声等挑战性条件下,其鲁棒性如何?

主要发现

  • FMA在单张Titan XP GPU上使用未优化的PyTorch(Float32)在MOT17基准上实现25 FPS,证明了其具备实时推理能力。
  • 该方法在MOT17测试集上达到具有竞争力的MOT准确率:HOTA为57.5%,MOTA为24.1%,IDF1为30.2%,使用SDP检测器。
  • FMF实现了与目标数量无关的快速可扩展匹配,因为推理复杂度不随跟踪目标数量增长而增加。
  • 仅在不确定匹配中使用FAF,既保持了高速度,又在存在遮挡和外观变化的挑战性序列中提升了准确率。
  • 当使用相同检测器(如FRCNN、SDP)时,FMA在速度和准确率上优于或匹配SOTA在线方法(如MOTDT和MTDF)。
  • 定性结果表明,该方法在光照变化、视角变化和相互遮挡等复杂情况下具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。