Skip to main content
QUICK REVIEW

[论文解读] Strong-TransCenter: Improved Multi-Object Tracking based on Transformers with Dense Representations

Amit Galor, Roy Orfaig|arXiv (Cornell University)|Oct 24, 2022
Video Surveillance and Tracking Methods被引用 4
一句话总结

该论文提出 Strong-TransCenter,一种改进的基于 Transformer 的多目标跟踪框架,通过使用卡尔曼滤波进行运动建模和深度嵌入网络进行重识别,对 TransCenter 进行后处理增强。该方法在 MOT17 和 MOT20 基准测试中达到最先进性能,在 HOTA 和 IDF1 指标上位居所有基于 Transformer 的跟踪器首位,MOT17 上取得 70.9% IDF1、59.8% HOTA 和 75.8% MOTA,MOT20 上取得 67.5% IDF1、56.3% HOTA 和 73.0% MOTA。

ABSTRACT

Transformer networks have been a focus of research in many fields in recent years, being able to surpass the state-of-the-art performance in different computer vision tasks. However, in the task of Multiple Object Tracking (MOT), leveraging the power of Transformers remains relatively unexplored. Among the pioneering efforts in this domain, TransCenter, a Transformer-based MOT architecture with dense object queries, demonstrated exceptional tracking capabilities while maintaining reasonable runtime. Nonetheless, one critical aspect in MOT, track displacement estimation, presents room for enhancement to further reduce association errors. In response to this challenge, our paper introduces a novel improvement to TransCenter. We propose a post-processing mechanism grounded in the Track-by-Detection paradigm, aiming to refine the track displacement estimation. Our approach involves the integration of a carefully designed Kalman filter, which incorporates Transformer outputs into measurement error estimation, and the use of an embedding network for target re-identification. This combined strategy yields substantial improvement in the accuracy and robustness of the tracking process. We validate our contributions through comprehensive experiments on the MOTChallenge datasets MOT17 and MOT20, where our proposed approach outperforms other Transformer-based trackers. The code is publicly available at: https://github.com/amitgalor18/STC_Tracker

研究动机与目标

  • 通过将后处理组件集成到 TransCenter 框架中,提升基于 Transformer 的多目标跟踪性能。
  • 在遮挡和运动模糊等复杂跟踪场景中,减少 ID 切换和误检。
  • 通过运动建模和基于外观的重识别增强跟踪鲁棒性,且不修改主干 Transformer 架构。
  • 在 MOTChallenge 基准测试中实现最先进结果,尤其在对跟踪精度和一致性更敏感的 HOTA 和 IDF1 指标上。

提出的方法

  • 跟踪器使用预训练的 TransCenter 主干网络,为特征图上的中心点生成密集的目标查询,实现基于中心点的跟踪。
  • 后处理包括使用卡尔曼滤波器估计运动轨迹,提升帧间预测精度。
  • 基于外观的重识别通过学习的嵌入网络实现,根据视觉相似性将检测结果与现有轨迹匹配。
  • 轨迹关联结合 IoU 匹配与外观嵌入距离,经高 IoU 阈值过滤后取最小值,以确保空间一致性。
  • 系统利用匈牙利算法实现检测与轨迹之间的最优分配,整合运动与外观线索。
  • 该框架在检测头和跟踪头端到端训练,后处理仅在推理阶段应用。

实验结果

研究问题

  • RQ1通过卡尔曼滤波后处理与外观重识别,能否显著提升最先进基于 Transformer 的多目标跟踪器性能?
  • RQ2在遮挡或模糊等复杂场景中,运动建模与外观特征的融合如何影响 ID 切换与误报率?
  • RQ3在基于 Transformer 的跟踪器中,结合运动预测与基于嵌入的重识别后,HOTA 和 IDF1 指标能提升到何种程度?
  • RQ4所提方法是否在标准 MOT 基准测试(如 MOT17 和 MOT20)中优于现有基于 Transformer 的跟踪器?

主要发现

  • Strong-TransCenter 在 MOT17 测试集上取得 70.9% IDF1、59.8% HOTA 和 75.8% MOTA,作为基于 Transformer 的跟踪器在 IDF1 和 HOTA 指标上排名第一。
  • 在 MOT20 测试集上,该跟踪器取得 67.5% IDF1、56.3% HOTA 和 73.0% MOTA,所有三项指标均创下基于 Transformer 跟踪器的新最先进水平。
  • 定性分析显示,由于卡尔曼滤波器提供了更优的运动预测,ID 切换错误显著减少,尤其在物体出现或遮挡场景中。
  • 卡尔曼滤波器实现更精确的轨迹预测,降低对噪声光学流的依赖,提升轨迹连续性的一致性。
  • 外观嵌入与基于位置的匹配相结合,显著减少误报与漏检,尤其在部分遮挡情况下,帧级可视化结果已证实该效果。
  • 该跟踪器在保持 MOTA 高水平的同时,显著提升了 HOTA 和 IDF1,表明整体跟踪质量与身份一致性更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。