Skip to main content
QUICK REVIEW

[论文解读] Real-time 3D Deep Multi-Camera Tracking

Quanzeng You, Hao Jiang|arXiv (Cornell University)|Mar 26, 2020
Video Surveillance and Tracking Methods参考文献 30被引用 15
一句话总结

本文提出 Deep Multi-Camera Tracking (DMCT),一种基于视角感知的深度地面点网络、融合的地面平面占用热图、用于检测的深度凝视网络以及在线跟踪器的端到端实时 3D 多摄像头跟踪系统。该方法在 WILDTRACK 和两个新收集的数据集上实现了最先进水平的跟踪性能,优于以往的离线方法,同时在八台摄像头下保持 15 FPS 的实时推理速度。

ABSTRACT

Tracking a crowd in 3D using multiple RGB cameras is a challenging task. Most previous multi-camera tracking algorithms are designed for offline setting and have high computational complexity. Robust real-time multi-camera 3D tracking is still an unsolved problem. In this work, we propose a novel end-to-end tracking pipeline, Deep Multi-Camera Tracking (DMCT), which achieves reliable real-time multi-camera people tracking. Our DMCT consists of 1) a fast and novel perspective-aware Deep GroudPoint Network, 2) a fusion procedure for ground-plane occupancy heatmap estimation, 3) a novel Deep Glimpse Network for person detection and 4) a fast and accurate online tracker. Our design fully unleashes the power of deep neural network to estimate the "ground point" of each person in each color image, which can be optimized to run efficiently and robustly. Our fusion procedure, glimpse network and tracker merge the results from different views, find people candidates using multiple video frames and then track people on the fused heatmap. Our system achieves the state-of-the-art tracking results while maintaining real-time performance. Apart from evaluation on the challenging WILDTRACK dataset, we also collect two more tracking datasets with high-quality labels from two different environments and camera settings. Our experimental results confirm that our proposed real-time pipeline gives superior results to previous approaches.

研究动机与目标

  • 解决在拥挤、遮挡环境中实时、准确的 3D 多摄像头人体跟踪挑战。
  • 克服以往多摄像头跟踪方法计算复杂度高且为离线处理的局限。
  • 开发一个完全端到端的流水线,实现实时跨多摄像头视图的身份一致性跟踪。
  • 收集并发布两个新的高质量多摄像头跟踪数据集以供基准测试。
  • 通过使用现有数据集中的噪声或弱监督标签,实现在真实场景中的部署。

提出的方法

  • 一种视角感知的深度地面点网络在每个摄像头视图中估计每个人质心在虚拟地面平面上的二维投影,显式建模透视失真。
  • 利用几何约束和相机标定,将所有摄像头的投影地面点热图融合为共享的 3D 地面平面占用图。
  • 一种新颖且轻量级的深度凝视网络通过凝视层和时间卷积处理融合后的占用图时序序列,以鲁棒地检测移动人员。
  • 一种高效的在线跟踪器利用融合后的热图在帧间关联人员检测,维持一致的轨迹。
  • 整个流水线端到端训练与部署,实现低延迟的实时推理。
  • 系统使用 CrowdHuman 的伪真实标签进行训练,展示了对真实世界网络摄像头的强大泛化能力。

实验结果

研究问题

  • RQ1基于深度学习的系统能否在复杂环境中实现高精度与鲁棒性的实时、端到端 3D 多摄像头人体跟踪?
  • RQ2视角感知的地面点估计在提升多摄像头视图间跟踪一致性方面有多有效?
  • RQ3轻量级的时间建模网络(深度凝视网络)能否在融合后的占用图上超越标准检测器,实现实时跟踪?
  • RQ4与单视图或非几何融合方法相比,多视角地面点热图融合是否显著提升跟踪性能?
  • RQ5在弱监督伪标签上训练的模型能否在极少微调的情况下良好泛化至真实世界部署?

主要发现

  • 在 WILDTRACK 数据集上,DMCT 实现了 93.4% 的 MOTA 和 85.3% 的 IDF1,优于所有先前的离线方法。
  • 在 Env 1 上,DMCT 实现了 93.2% 的 MOTA 和 80.9% 的 IDF1(无颜色直方图),显著优于 YOLO(75.6% MOTA)和 ResNet(82.9% MOTA)。
  • 在更具挑战性的 Env 2 上(背景杂乱且训练样本更少),DMCT 实现了 97.1% 的 MOTA 和 90.4% 的 IDF1,远超 YOLO(−67.4% MOTA)和 FCN7(13.4% MOTA)。
  • 系统在单张 GeForce RTX 2080 Ti 上以八台摄像头运行,达到 15 FPS,证明了其实时性能。
  • 当在 CrowdHuman 的伪标签上训练后,模型在真实世界网络摄像头中表现出良好泛化能力,无需微调即可实现准确跟踪。
  • 所提出的流水线在实现最先进结果的同时,具备真实世界应用的可部署性,经由三台网络摄像头的实时系统验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。