Skip to main content
QUICK REVIEW

[论文解读] ReST: A Reconfigurable Spatial-Temporal Graph Model for Multi-Camera Multi-Object Tracking

Cheng-Che Cheng, Min-Xuan Qiu|arXiv (Cornell University)|Aug 25, 2023
Video Surveillance and Tracking Methods被引用 4
一句话总结

本文提出 ReST,一种用于多摄像头多目标跟踪的可重构时空图模型,通过将关联过程解耦为空间和时间两个阶段,提升对遮挡和ID切换的鲁棒性。通过迭代重构图以合并跨视角和跨帧的一致检测,ReST 在 Wildtrack 上实现最先进性能,并在其他基准上取得优异结果,且无需依赖单摄像头跟踪器的输出。

ABSTRACT

Multi-Camera Multi-Object Tracking (MC-MOT) utilizes information from multiple views to better handle problems with occlusion and crowded scenes. Recently, the use of graph-based approaches to solve tracking problems has become very popular. However, many current graph-based methods do not effectively utilize information regarding spatial and temporal consistency. Instead, they rely on single-camera trackers as input, which are prone to fragmentation and ID switch errors. In this paper, we propose a novel reconfigurable graph model that first associates all detected objects across cameras spatially before reconfiguring it into a temporal graph for Temporal Association. This two-stage association approach enables us to extract robust spatial and temporal-aware features and address the problem with fragmented tracklets. Furthermore, our model is designed for online tracking, making it suitable for real-world applications. Experimental results show that the proposed graph model is able to extract more discriminating features for object tracking, and our model achieves state-of-the-art performance on several public datasets.

研究动机与目标

  • 解决单摄像头跟踪器在拥挤场景中处理遮挡和ID切换的局限性。
  • 克服现有基于图的多摄像头多目标跟踪方法对单摄像头跟踪器生成的轨迹段的依赖。
  • 通过在两阶段图框架中显式建模空间和时间一致性,改进特征表示。
  • 通过迭代图重构避免对后续帧的依赖,实现在线跟踪。
  • 通过减少对光照和运动条件变化下外观特征的依赖,提升在不同数据集间的泛化能力。

提出的方法

  • 将多摄像头多目标跟踪建模为两个子任务:空间关联(同一时间步的跨摄像头匹配)和时间关联(跨帧匹配)。
  • 利用同一帧中跨摄像头的检测结果构建空间图,边特征基于外观一致性和几何一致性。
  • 应用图重构模块,将同一对象的节点合并为连通分量,简化图结构以支持时间关联。
  • 通过连接跨帧的节点,将图重构为时间图,以支持时间特征学习与优化。
  • 分别对空间图和时间图进行训练,施加任务特定约束,以提升特征判别性与优化稳定性。
  • 在推理过程中迭代重构图,以优化关联结果并增强动态场景下的特征表示。

实验结果

研究问题

  • RQ1基于两阶段图的方法,通过分离空间与时间关联,是否能提升多摄像头设置下的跟踪鲁棒性?
  • RQ2图重构在多目标跟踪中如何增强特征表示并减少碎片化?
  • RQ3该模型在多大程度上能实现跨数据集泛化,而无需严重依赖外观特征?
  • RQ4将空间与时间学习解耦是否能带来优于统一时空图模型的优化与性能?
  • RQ5所提方法是否能在无未来帧依赖的前提下,实现在线多摄像头多目标跟踪的最先进性能?

主要发现

  • ReST 在 Wildtrack 数据集上实现最先进性能,IDF1 达 91.6,MOTA 达 97.0,优于现有方法。
  • 在 Wildtrack 上,使用外观、投影和速度特征时,模型取得 91.6 IDF1 和 97.0 MOTA,表明对外观变化具有强鲁棒性。
  • 移除外观特征后,性能下降至 89.2 IDF1 和 95.0 MOTA,表明 ReST 即使在缺乏强外观线索时仍具备良好泛化能力。
  • 统一时空图模型的表现劣于分离的空间-时间图模型,t-SNE 可视化显示正负边之间的分离效果较差。
  • ReST 展现出强大的跨数据集泛化能力:在 Wildtrack 上微调并在 CAMPUS 上测试,MOTA 提升最高达 15.5 个百分点。
  • t-SNE 可视化证实,与标准 ReID 特征相比,ReST 学习到的节点特征更具判别性,类间分离更好,类内聚类更紧密。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。