Skip to main content
QUICK REVIEW

[论文解读] Tracking The Untrackable: Learning To Track Multiple Cues with Long-Term Dependencies

Amir Sadeghian, Alexandre Alahi|arXiv (Cornell University)|Jan 8, 2017
Video Surveillance and Tracking Methods参考文献 53被引用 15
一句话总结

本文提出了一种端到端的在线多目标跟踪方法,利用循环神经网络(RNN)架构在长时间窗口内联合建模外观、运动和交互线索,显著提升了在遮挡和密集场景下的跟踪鲁棒性。该方法在多个基准测试中达到最先进性能,相较于先前方法实现了20%的MOTA提升。

ABSTRACT

The majority of existing solutions to the Multi-Target Tracking (MTT) problem do not combine cues in a coherent end-to-end fashion over a long period of time. However, we present an online method that encodes long-term temporal dependencies across multiple cues. One key challenge of tracking methods is to accurately track occluded targets or those which share similar appearance properties with surrounding objects. To address this challenge, we present a structure of Recurrent Neural Networks (RNN) that jointly reasons on multiple cues over a temporal window. We are able to correct many data association errors and recover observations from an occluded state. We demonstrate the robustness of our data-driven approach by tracking multiple targets using their appearance, motion, and even interactions. Our method outperforms previous works on multiple publicly available datasets including the challenging MOT benchmark.

研究动机与目标

  • 解决现有多目标跟踪(MTT)方法在建模长期时间依赖关系以及协同整合多种线索方面存在的局限性。
  • 在长时遮挡和外观模糊等复杂场景下,提升数据关联与重识别性能。
  • 开发一种端到端的在线学习框架,无需手工设计特征,即可联合推理外观、运动和交互线索。
  • 在真实跟踪条件下,于MOT和Stanford Drone数据集等标准基准测试中超越现有方法。

提出的方法

  • 该方法采用循环神经网络(RNN)结构,包括基于LSTM的外观模型、运动模型和交互模型,分别处理一种线索的时间序列。
  • 每个RNN组件学习时间表示:外观RNN使用预训练的CNN提取特征,并通过对比损失学习相似性度量。
  • 运动模型和交互模型分别使用独立的LSTM,对目标轨迹和社会交互在长时间窗口内进行编码。
  • 一个中心目标LSTM融合来自所有三种线索(外观、运动、交互)的表示,生成联合的、上下文感知的嵌入向量,用于相似性评分。
  • 整个框架通过外观的对比损失和数据关联的跟踪损失进行端到端训练,支持无需未来帧访问的在线推理。
  • 基于联合表示生成的相似性分数被用于检测跟踪流水线中,实现跨帧的检测关联。

实验结果

研究问题

  • RQ1深度学习框架能否有效建模多线索(外观、运动、交互)在长时间范围内的依赖关系,以实现多目标跟踪?
  • RQ2对多种线索进行联合推理是否能提升在遮挡或密集场景下的数据关联准确性?
  • RQ3端到端的在线RNN架构是否在MTT基准测试中优于手工设计的相似性函数?
  • RQ4外观、运动和交互线索在单独及联合使用时,对跟踪性能的贡献程度如何?

主要发现

  • 所提方法在2D MOT2015测试集(使用公开检测结果)上达到37.6%的MOTA,优于所有先前的在线跟踪器。
  • 在MOT16基准测试中,该方法实现47.2%的MOTA,在在线跟踪器中排名第一,较之前最先进方法提升20个百分点。
  • 消融实验表明,结合全部三种线索(外观、运动、交互)可获得最高MOTA(37.6%),其中运动和交互线索在遮挡场景中对性能提升贡献显著。
  • 外观特征提取器在CUHK03重识别基准测试中达到55.9%的Rank-1准确率,与最先进方法相当。
  • 在Stanford Drone数据集上的定性结果表明,相比先前方法(如MDP+SF-mc),ID切换更少,跟踪更一致,尤其在遮挡情况下表现更优。
  • 该模型展现出强大的泛化能力,目标LSTM能有效推理所有线索,显著提升在复杂动态环境中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。