Skip to main content
QUICK REVIEW

[论文解读] A unified neural network for object detection, multiple object tracking and vehicle re-identification

Yuhao Xu, Jiakui Wang|arXiv (Cornell University)|Jul 8, 2019
Video Surveillance and Tracking Methods参考文献 19被引用 6
一句话总结

本文提出了一种统一的端到端深度学习框架,通过在Faster R-CNN基础上增加专用的轨迹分支,联合执行目标检测、多目标跟踪和车辆重识别。通过利用RoI特征并基于时序拼接的视频帧进行三元组损失训练,该模型在AIC19数据集上实现了57.79%的mAP和高精度的跟踪性能,降低了计算开销,并实现了多任务优化。

ABSTRACT

Deep SORT\cite{wojke2017simple} is a tracking-by-detetion approach to multiple object tracking with a detector and a RE-ID model. Both separately training and inference with the two model is time-comsuming. In this paper, we unify the detector and RE-ID model into an end-to-end network, by adding an additional track branch for tracking in Faster RCNN architecture. With a unified network, we are able to train the whole model end-to-end with multi loss, which has shown much benefit in other recent works. The RE-ID model in Deep SORT needs to use deep CNNs to extract feature map from detected object images, However, track branch in our proposed network straight make use of the RoI feature vector in Faster RCNN baseline, which reduced the amount of calculation. Since the single image lacks the same object which is necessary when we use the triplet loss to optimizer the track branch, we concatenate the neighbouring frames in a video to construct our training dataset. We have trained and evaluated our model on AIC19 vehicle tracking dataset, experiment shows that our model with resnet101 backbone can achieve 57.79 \% mAP and track vehicle well.

研究动机与目标

  • 为解决多目标跟踪中检测器和重识别模型分别训练时效率低下且性能欠佳的问题。
  • 将目标检测、跟踪和重识别统一为一个可端到端训练的单一神经网络。
  • 通过检测和跟踪分支之间的特征共享,降低计算成本并提升特征学习效果。
  • 通过利用相邻视频帧构建训练数据,克服单幅图像中三元组样本不足的问题。
  • 在AIC19车辆跟踪基准上评估模型,采用mAP、MOTA和配对准确率等指标。

提出的方法

  • 在Faster R-CNN基础上增加一个额外的并行轨迹分支,以RoI特征向量作为输入,避免重复的特征提取。
  • 通过结合检测和跟踪目标的多任务损失,端到端训练整个网络。
  • 通过拼接视频序列中的相邻帧来构建训练三元组,为三元组损失提供正样本和负样本。
  • 在轨迹分支上应用三元组损失,以学习具有判别性的外观嵌入用于重识别。
  • 推理阶段采用基于IoU的匹配和匈牙利算法进行数据关联,距离阈值根据具体场景进行调优。
  • 采用多摄像头评估协议,使用配对准确率来评估不同摄像头视角下的重识别性能。

实验结果

研究问题

  • RQ1一个统一的端到端网络是否能够通过共享特征,联合优化目标检测、跟踪和重识别?
  • RQ2当单幅图像缺乏足够正负样本时,为何在拼接的视频帧上使用三元组损失能提升重识别性能?
  • RQ3与分别训练检测器和重识别模型相比,端到端的多任务学习对mAP和跟踪准确率有何影响?
  • RQ4在部分标注场景下(如AIC19数据集中仅标注行驶中的车辆),模型表现如何?
  • RQ5单摄像头与多摄像头重识别性能之间的权衡是什么?阈值设置如何影响准确率?

主要发现

  • 所提出的统一网络在AIC19车辆跟踪数据集上实现了57.79%的mAP,尽管存在部分标注,仍表现出强大的检测性能。
  • 在单摄像头场景下,跟踪器的MOTA为8.10%,配对准确率为99.84%,距离阈值为0.343。
  • 在多摄像头场景下,模型实现了78.54%的配对准确率,距离阈值为8.72,表明其在不同摄像头视角间具有鲁棒性。
  • 消融实验表明,若移除‘拉近’损失组件,MOTA降至-1.80%,但配对准确率升至99.99%,表明优化过程中存在权衡。
  • 冻结检测器权重后,MOTA为10.94%,配对准确率为99.43%,表明微调检测器可提升跟踪鲁棒性。
  • 错误分析显示,部分标注和缺乏运动建模是导致误报和跟踪错误的主要原因,尤其在多摄像头设置中更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。