[论文解读] Deep Similarity Metric Learning for Real-Time Pedestrian Tracking
本文提出了一种基于孪生网络的深度度量追踪器,利用预训练的深度相似性度量来提升实时行人追踪性能,通过改进检测分配、增强低置信度检测以及实现基于外观的轨迹段关联。该方法在MOT16数据集上实现了具有竞争力的MOTA(34.6),且在线实时追踪器中ID切换数最低(317),表明深度外观建模能显著减少遮挡期间的追踪错误,并提升鲁棒性。
Tracking by detection is a common approach to solving the Multiple Object Tracking problem. In this paper we show how learning a deep similarity metric can improve three key aspects of pedestrian tracking on a multiple object tracking benchmark. We train a convolutional neural network to learn an embedding function in a Siamese configuration on a large person re-identification dataset. The offline-trained embedding network is integrated in to the tracking formulation to improve performance while retaining real-time performance. The proposed tracker stores appearance metrics while detections are strong, using this appearance information to: prevent ID switches, associate tracklets through occlusion, and propose new detections where detector confidence is low. This method achieves competitive results in evaluation, especially among online, real-time approaches. We present an ablative study showing the impact of each of the three uses of our deep appearance metric.
研究动机与目标
- 通过深度外观建模,提升在线实时多目标追踪(MOT)在行人追踪中的性能。
- 利用学习到的深度相似性度量,解决MOT中的关键挑战——ID切换、漏检和轨迹段碎片化问题。
- 在保持实时性能(≥25 FPS)的同时,通过基于外观的关联与检测增强,提升追踪精度。
- 通过消融分析,评估三个组件(检测分配、检测增强、轨迹段关联)的独立影响。
提出的方法
- 在大规模行人重识别数据集上训练一个孪生卷积神经网络,以学习行人外观的判别性嵌入空间。
- 离线训练的嵌入网络为检测结果和轨迹段计算深度外观特征,实现无需每帧重新训练的相似性计算。
- 检测分配利用学习到的度量方法,基于外观相似性将检测结果与现有轨迹关联,减少误报。
- 检测增强利用该度量方法重新识别并重新包含部分可见或短暂丢失目标的低置信度检测结果。
- 轨迹段关联通过迭代方式利用外观相似性合并轨迹段,尤其在遮挡期间表现优异,可形成更长且连贯的轨迹。
- 该追踪器为在线运行,仅需数秒的回放延迟,保持实时性能(在MOT16上达到29.8 FPS)。
实验结果
研究问题
- RQ1能否从行人重识别数据中学习到的深度相似性度量,改善在线MOT中的检测分配?
- RQ2基于外观的检测增强是否能在不增加误报的情况下减少行人追踪中的漏检?
- RQ3基于外观的轨迹段关联在遮挡期间能多大程度上减少ID切换?
- RQ4三个组件(分配、增强、关联)对整体追踪性能的独立贡献程度如何?
主要发现
- 所提出的追踪器在MOT16测试集上实现了34.6的MOTA,与在线实时方法相比具有竞争力。
- 该方法记录了最低的ID切换数(317),表明在遮挡期间维持一致轨迹身份的能力更优。
- 消融分析显示,轨迹段关联对减少ID切换的贡献最大,其次为检测分配。
- 检测增强虽减少了漏检,但导致误报增加(从6,014增至6,743),表明其与低精度DPM检测之间存在权衡。
- 完全移除外观建模后,帧率提升至96.8 FPS,但MOTA下降至32.9,证实了深度外观特征的价值。
- 深度度量网络在Market-1501数据集上达到0.98的AUC,验证了其学习判别性外观表征的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。