[论文解读] Multiple People Tracking Using Hierarchical Deep Tracklet Re-identification
该论文提出了一种用于多人跟踪的分层深度轨迹片段重识别框架,通过多阶段深度网络联合建模视觉外观和时空线索,提升了长期遮挡情况下的处理能力。该方法利用约束最小费用多路切割公式对轨迹片段进行分层聚类,实现了在MOT16和MOT17数据集上的最先进性能,MOTA达到54.1%,分别优于之前方法4.8%和2.7%。
The task of multiple people tracking in monocular videos is challenging because of the numerous difficulties involved: occlusions, varying environments, crowded scenes, camera parameters and motion. In the tracking-by-detection paradigm, most approaches adopt person re-identification techniques based on computing the pairwise similarity between detections. However, these techniques are less effective in handling long-term occlusions. By contrast, tracklet (a sequence of detections) re-identification can improve association accuracy since tracklets offer a richer set of visual appearance and spatio-temporal cues. In this paper, we propose a tracking framework that employs a hierarchical clustering mechanism for merging tracklets. To this end, tracklet re-identification is performed by utilizing a novel multi-stage deep network that can jointly reason about the visual appearance and spatio-temporal properties of a pair of tracklets, thereby providing a robust measure of affinity. Experimental results on the challenging MOT16 and MOT17 benchmarks show that our method significantly outperforms state-of-the-arts.
研究动机与目标
- 通过利用轨迹片段级别的重识别而非检测级别的关联,解决多人跟踪中的长期遮挡问题。
- 克服基于成对检测相似度方法在长时间遮挡和复杂场景下失效的局限性。
- 通过联合建模视觉外观和时空动态特性,减少在拥挤、动态环境中的关联错误。
- 通过分层聚类策略提升在不同相机运动和环境条件下跟踪的鲁棒性。
提出的方法
- 训练一个多阶段深度神经网络,联合推理轨迹片段的视觉外观和时空特征,从而无需手工设计特征。
- 利用深度网络计算轨迹片段相似度,生成用于数据关联的鲁棒亲和度度量。
- 该框架采用分层聚类策略,通过逐步增加帧间距阈值(从1、2、4开始,随后扩展至轨迹片段长度的四倍)迭代合并轨迹片段。
- 聚类过程被建模为约束最小费用多路切割问题,通过Kernighan-Lin带连接算法的扩展版本求解。
- 该方法在迭代过程中动态放松帧间距约束,以在收敛速度和遮挡鲁棒性之间取得平衡。
- 最终的轨迹片段分配通过图优化公式进行优化,以最小化轨迹碎片化和误报。
实验结果
研究问题
- RQ1在轨迹片段中联合建模视觉外观和时空线索,是否能显著提升在遮挡情况下的长期跟踪性能?
- RQ2在复杂拥挤场景中,分层轨迹片段聚类是否优于一步式检测或轨迹片段关联?
- RQ3端到端的深度网络能否替代手工设计的时空特征,同时在不同相机参数和运动条件下实现良好泛化?
- RQ4具有自适应帧间距松弛的聚类方案如何影响跟踪精度和鲁棒性?
- RQ5与最先进跟踪器相比,该方法在多大程度上减少了ID切换和轨迹碎片化?
主要发现
- 所提出的跟踪器在MOT17基准上实现了54.1%的MOTA,相比之前最先进方法提升了2.7%。
- 在MOT16基准上,该方法实现了54.1%的MOTA,相比先前最佳方法绝对提升4.8%。
- 在MOT17上,该跟踪器记录了最少的误报(18,002例)和漏报(238,818例),表明检测关联性能更优。
- 在MOT17上,该方法实现了最高的大部分跟踪目标比例(MT,23.3%)和最低的大部分丢失率(ML,34.8%),展现出强大的遮挡处理能力。
- 在MOT17上,ID切换数量减少至2,693次,表明身份一致性得到改善,尽管在高相机运动下ID切换问题仍具挑战性。
- 消融实验表明,外观与时空特征的联合学习显著优于独立特征工程与融合策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。