Skip to main content
QUICK REVIEW

[论文解读] Multiple Target Tracking by Learning Feature Representation and Distance Metric Jointly

Jun Xiang, Guoshuai Zhang|arXiv (Cornell University)|Feb 9, 2018
Video Surveillance and Tracking Methods参考文献 10被引用 12
一句话总结

该论文提出了一种统一的深度学习框架,通过三元组损失联合学习外观和运动特征表示,实现端到端的度量学习,用于多目标跟踪(MTT)。通过结合用于行人重识别风格的外观特征的CNN与用于运动预测的LSTM,该模型仅使用线性分配策略即在MOT16基准上实现了最先进性能。

ABSTRACT

Designing a robust affinity model is the key issue in multiple target tracking (MTT). This paper proposes a novel affinity model by learning feature representation and distance metric jointly in a unified deep architecture. Specifically, we design a CNN network to obtain appearance cue tailored towards person Re-ID, and an LSTM network for motion cue to predict target position, respectively. Both cues are combined with a triplet loss function, which performs end-to-end learning of the fused features in a desired embedding space. Experiments in the challenging MOT benchmark demonstrate, that even by a simple Linear Assignment strategy fed with affinity scores of our method, very competitive results are achieved when compared with the most recent state-of-theart approaches.

研究动机与目标

  • 解决在遮挡、光照变化和外观变化等复杂跟踪场景下,传统手工设计特征的局限性。
  • 通过引入度量学习,克服直接使用深度CNN特征在MTT中判别能力不足的问题。
  • 设计一种统一的深度神经网络架构,联合优化特征表示与距离度量,以提升数据关联性能。
  • 证明端到端的三元组损失学习在亲和度建模中优于验证损失,从而提升跟踪性能。
  • 仅使用简单的线性分配策略即取得具有竞争力的结果,证明所提出的嵌入空间的有效性。

提出的方法

  • 采用专为行人重识别设计的CNN,从检测框中提取鲁棒的外观特征。
  • 使用LSTM网络建模时间运动模式,并预测目标位置,以提取运动线索。
  • 通过共享的深度网络架构,将外观和运动特征融合到联合嵌入空间中。
  • 使用三元组损失函数进行网络训练,以最小化同类目标间的距离,最大化不同目标间的距离。
  • 进行端到端优化,使嵌入空间天然地针对基于度量的关联任务进行优化。
  • 在数据关联中使用嵌入向量之间的欧氏距离作为亲和度得分,进行线性分配。

实验结果

研究问题

  • RQ1在复杂MTT场景下,联合学习特征表示与距离度量是否能提升跟踪性能?
  • RQ2基于三元组损失的度量学习与验证损失相比,在跟踪精度和鲁棒性方面表现如何?
  • RQ3在遮挡和外观变化条件下,外观和运动线索对跟踪性能的贡献程度如何?
  • RQ4当与深度度量学习结合时,简单的线性分配策略能否实现具有竞争力的结果?
  • RQ5在标准基准上,该方法在MOTA和MOTP指标上与最先进MTT方法相比表现如何?

主要发现

  • 所提方法在MOT16测试集上实现了44.3%的MOTA,尽管仅使用线性分配策略,仍位列顶尖跟踪器之列。
  • 三元组损失在跟踪性能上比验证损失高出17–23%,证明其在MTT度量学习中的优越性。
  • 外观特征对性能贡献最大,而运动线索在拥挤和遮挡场景中提供了互补优势。
  • 消融实验表明,外观、运动与三元组损失的组合表现最佳(23.00% MOTA),优于使用验证损失的模型。
  • 采用A+M+T配置时,模型达到23.00% MOTA,而A+V配置仅达16.2%,凸显三元组损失的关键作用。
  • 该方法在Quad-CNN上实现0.2%的MOTA提升,且在IDS和FP等关键指标上优于其他SOTA方法如LMP和AMIR。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。