Skip to main content
QUICK REVIEW

[论文解读] Recurrent Autoregressive Networks for Online Multi-Object Tracking

Kuan Fang, Xiang Yu|arXiv (Cornell University)|Nov 7, 2017
Video Surveillance and Tracking Methods参考文献 37被引用 15
一句话总结

该论文提出了一种新型的时序生成建模框架——循环自回归网络(RANs),用于在线多目标跟踪。该方法结合了外部记忆(用于短期特征存储)和循环单元中的内部记忆(用于建模长期轨迹动态),通过在记忆特征上进行自回归概率估计,显著提升了在拥挤和遮挡场景下的数据关联性能,在MOT15和MOT16基准上实现了最先进(SOTA)的性能表现。

ABSTRACT

The main challenge of online multi-object tracking is to reliably associate object trajectories with detections in each video frame based on their tracking history. In this work, we propose the Recurrent Autoregressive Network (RAN), a temporal generative modeling framework to characterize the appearance and motion dynamics of multiple objects over time. The RAN couples an external memory and an internal memory. The external memory explicitly stores previous inputs of each trajectory in a time window, while the internal memory learns to summarize long-term tracking history and associate detections by processing the external memory. We conduct experiments on the MOT 2015 and 2016 datasets to demonstrate the robustness of our tracking method in highly crowded and occluded scenes. Our method achieves top-ranked results on the two benchmarks.

研究动机与目标

  • 为解决在遮挡和拥挤场景下在线多目标跟踪中可靠的数据关联挑战。
  • 通过捕捉时间依赖关系的生成式框架,建模多个目标的长期外观和运动动态。
  • 通过引入双记忆架构,克服基于RNN的跟踪方法中固定窗口模板和过拟合的局限性。
  • 通过改进轨迹建模,实现实时应用(如自动驾驶和机器人)中的鲁棒跟踪。

提出的方法

  • RAN框架使用外部记忆存储最近一段时间的对象特征(外观和运动)以实现短期保留。
  • 内部记忆通过循环网络的隐藏状态实现,用于总结长期历史并处理来自外部记忆的输入。
  • 模型采用自回归生成方法,基于内部和外部记忆估计新检测的条件概率分布。
  • 每个目标均配备一个专用的RAN,通过集成建模实现可扩展的多目标跟踪。
  • 网络端到端训练,根据跟踪决策同时更新内部隐藏状态和外部记忆模板。
  • 数据关联算法利用RAN生成的参数计算似然值,实现在噪声和遮挡情况下的鲁棒匹配。

实验结果

研究问题

  • RQ1深度学习模型如何在保持对短期遮挡和外观变化鲁棒性的同时,有效建模在线多目标跟踪中的长期轨迹动态?
  • RQ2将显式外部记忆与内部循环记忆相结合,对跟踪精度和泛化能力有何影响?
  • RQ3在在线多目标跟踪的数据关联任务中,具有自回归预测能力的生成式建模方法是否能超越判别式基线方法?
  • RQ4外部记忆的时间跨度如何影响复杂序列中的跟踪性能和模型稳定性?
  • RQ5RAN框架在高密度目标和频繁遮挡的真实世界场景中,其泛化能力在多大程度上得以体现?

主要发现

  • RAN模型在2DMOT2015测试集上实现了68.3%的最先进MOTA指标,优于所有其他在线方法。
  • 在MOT16上,RAN在所有在线方法中表现最佳,MOTA达到68.5%,同时在IDS和FN指标上也领先。
  • 该模型在所有测试视频中显著降低了IDS(身份切换次数),表明其数据关联具有更高的稳定性。
  • 实验表明,将外部记忆时间跨度从1步增加到12步可提升MOTA并减少IDS,性能在9步后趋于稳定。
  • 定性分析表明,RAN在遮挡期间会调整其参数估计策略——更依赖记忆中的历史特征,并在目标重新出现后切换回近期特征。
  • RAN框架在ETH-Linthescher和TUD-Crossing等高度拥挤的场景中表现出鲁棒性,这些场景因外观相似性和运动模糊性而对传统跟踪器构成挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。