Skip to main content
QUICK REVIEW

[论文解读] Online Multi-Object Tracking with Historical Appearance Matching and Scene Adaptive Detection Filtering

Young-Chul Yoon, Abhijeet Boragule|arXiv (Cornell University)|May 28, 2018
Video Surveillance and Tracking Methods参考文献 12被引用 6
一句话总结

本文提出了一种在线多目标跟踪框架,通过整合历史外观匹配与场景自适应检测过滤,提升了身份一致性。该方法采用两步训练的孪生网络以实现鲁棒的外观相似度度量,并根据场景复杂度动态调整检测阈值,显著减少了ID切换,提升了MOT16、MOT17和2DMOT2015基准上的MOTA与IDF1得分。

ABSTRACT

In this paper, we propose the methods to handle temporal errors during multi-object tracking. Temporal error occurs when objects are occluded or noisy detections appear near the object. In those situations, tracking may fail and various errors like drift or ID-switching occur. It is hard to overcome temporal errors only by using motion and shape information. So, we propose the historical appearance matching method and joint-input siamese network which was trained by 2-step process. It can prevent tracking failures although objects are temporally occluded or last matching information is unreliable. We also provide useful technique to remove noisy detections effectively according to scene condition. Tracking performance, especially identity consistency, is highly improved by attaching our methods.

研究动机与目标

  • 解决由遮挡和噪声检测引起的多目标跟踪中的时间误差。
  • 通过利用可靠的过去外观特征,减少ID切换与跟踪漂移。
  • 通过根据场景特定条件自适应调整置信度阈值,改进检测过滤。
  • 通过两步训练的孪生网络增强基于外观的数据关联。
  • 在不依赖固定检测阈值的前提下,实现更优的身份一致性。

提出的方法

  • 引入一种历史外观匹配机制,存储并检索可靠的过去外观特征,以在遮挡期间解决歧义。
  • 采用联合输入的孪生网络,通过两步训练流程:首先在CUHK02上预训练,然后在2015年训练数据上微调,以提升外观特征学习能力。
  • 应用一种场景自适应检测过滤策略,根据局部场景复杂度动态设置置信度阈值,替代固定阈值。
  • 使用指数加权方法将运动、形状和外观线索整合为统一的亲和度分数:$\Lambda(i,j) = \Lambda^A \Lambda^S \Lambda^M$。
  • 采用卡尔曼滤波同时预测运动(位置)和形状(宽、高)状态,提升对检测噪声的鲁棒性。
  • 使用匈牙利算法对复合亲和度矩阵进行二分图匹配,实现数据关联。

实验结果

研究问题

  • RQ1历史外观匹配是否能减少物体遮挡期间的ID切换?
  • RQ2孪生网络的两步训练策略是否能提升多目标跟踪中外观特征的泛化能力?
  • RQ3在复杂场景中,场景自适应检测过滤是否优于固定阈值的检测过滤?
  • RQ4外观、运动与形状线索的融合如何影响跟踪的鲁棒性与身份一致性?
  • RQ5与最先进跟踪器相比,所提方法在MOTA与IDF1指标上的提升程度如何?

主要发现

  • 历史外观匹配方法显著提升了跟踪性能,尤其在遮挡场景中表现突出,如图7(a)所示。
  • 两步训练方法在MOT16训练集上取得了最高的MOTA,优于仅在单一数据集上训练的模型。
  • 采用$p_d = 0.3$的场景自适应检测过滤(SADF)相比固定阈值基线,有效减少了误报,并提升了IDF1与IDSw指标。
  • 在2DMOT2015上,Ours(VisBest)实现了最高的IDF1(41.4)与第二好的IDSw(460),尽管FP/FN数量与[10]和[1]相近,仍表现更优。
  • 在MOT17上,Ours(SADF)实现了MOTA 48.3与IDF1 51.1,IDSw(1871)优于基于LSTM的MHT_bLSTM(2069),并达到最先进水平。
  • 消融实验确认,历史外观、两步训练与自适应过滤三个组件均独立地对性能提升有贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。