Skip to main content
QUICK REVIEW

[論文レビュー] Real-time 3D Deep Multi-Camera Tracking

Quanzeng You, Hao Jiang|arXiv (Cornell University)|Mar 26, 2020
Video Surveillance and Tracking Methods参考文献 30被引用数 15
ひとこと要約

本稿では、視覚的歪みを考慮したディープグランドポイントネットワーク、統合された地面平面占有ヒートマップ、検出用のディープグリムスネットワーク、およびオンライントラッカーを組み合わせたエンドツーエンドのリアルタイム3DマルチカメラトラッキングシステムであるDeep Multi-Camera Tracking(DMCT)を提案する。この手法は、WILDTRACKおよび2つの新規に収集されたデータセットにおいて最先端のトラッキング性能を達成し、オフライン手法を上回りながら、8台のカメラで15 FPSのリアルタイム推論を維持している。

ABSTRACT

Tracking a crowd in 3D using multiple RGB cameras is a challenging task. Most previous multi-camera tracking algorithms are designed for offline setting and have high computational complexity. Robust real-time multi-camera 3D tracking is still an unsolved problem. In this work, we propose a novel end-to-end tracking pipeline, Deep Multi-Camera Tracking (DMCT), which achieves reliable real-time multi-camera people tracking. Our DMCT consists of 1) a fast and novel perspective-aware Deep GroudPoint Network, 2) a fusion procedure for ground-plane occupancy heatmap estimation, 3) a novel Deep Glimpse Network for person detection and 4) a fast and accurate online tracker. Our design fully unleashes the power of deep neural network to estimate the "ground point" of each person in each color image, which can be optimized to run efficiently and robustly. Our fusion procedure, glimpse network and tracker merge the results from different views, find people candidates using multiple video frames and then track people on the fused heatmap. Our system achieves the state-of-the-art tracking results while maintaining real-time performance. Apart from evaluation on the challenging WILDTRACK dataset, we also collect two more tracking datasets with high-quality labels from two different environments and camera settings. Our experimental results confirm that our proposed real-time pipeline gives superior results to previous approaches.

研究の動機と目的

  • 混雑し、遮蔽が生じる環境におけるリアルタイムで高精度な3Dマルチカメラ人物トラッキングの課題に対処すること。
  • 従来のマルチカメラトラッキング手法が抱える高い計算複雑性とオフライン処理の性質を克服すること。
  • 複数のカメラ視点間で一貫性を保ちながら、リアルタイムで完全にエンドツーエンドのパイプラインを実現すること。
  • ベンチマーク用に2つの新規で高品質なマルチカメラトラッキングデータセットを収集・公開すること。
  • 既存データセットからのノイズありまたは弱教師付きラベルを用いて、実世界の環境への展開を可能にすること。

提案手法

  • 視覚的歪みを明示的にモデル化する、視覚的歪みに配慮したディープグランドポイントネットワークが、各カメラ視点における人物の重心の2次元投影を仮想の地面平面上に推定する。
  • 全カメラからの投影されたグランドポイントヒートマップが、カメラキャリブレーションと幾何的制約を用いて統合され、共有された3D地面平面占有マップに統合される。
  • グリムス層と時系列畳み込みを用いて、統合された占有マップの時系列シーケンスを処理する、新規で軽量なディープグリムスネットワークが、動きのある人物を頑健に検出する。
  • 統合されたヒートマップを用いて、効率的なオンライントラッカーがフレーム間の人物検出をリンクし、一貫した軌道を維持する。
  • パイプライン全体がエンドツーエンドで訓練・デプロイされ、最小限の遅延でリアルタイム推論が可能になる。
  • Crowドマンから得られる疑似教師信号を用いてモデルを訓練することで、実世界のネットワークカメラへの一般化性能が顕著に向上することが示された。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングベースのシステムは、ごみだらけの環境において、高精度かつ頑健にリアルタイムでエンドツーエンドの3Dマルチカメラ人物トラッキングを達成できるか?
  • RQ2視覚的歪みに配慮したグランドポイント推定は、複数のカメラ視点間でのトラッキングの一貫性を向上させるのにどの程度効果的か?
  • RQ3軽量で時系列モデリングを実装したネットワーク(ディープグリムス)は、統合された占有マップ上で標準的な検出器を上回る性能を示せるか?
  • RQ4マルチビューのグランドポイントヒートマップを統合することは、単一視点または非幾何的統合手法と比較して、トラッキング性能を顕著に向上させるか?
  • RQ5弱教師付きの疑似ラベルで学習したモデルは、最小限のファインチューニングで実世界の展開に十分に一般化できるか?

主な発見

  • WILDTRACKデータセットでは、DMCTは93.4%のMOTAと85.3%のIDF1を達成し、すべての従来のオフライン手法を上回った。
  • Env 1では、色ヒストグラムを用いない状態で93.2%のMOTAと80.9%のIDF1を達成し、YOLO(75.6% MOTA)やResNet(82.9% MOTA)を顕著に上回った。
  • 背景がごみだらけで学習サンプルが少ないより困難なEnv 2では、DMCTは97.1%のMOTAと90.4%のIDF1を達成し、YOLO(−67.4% MOTA)やFCN7(13.4% MOTA)を大きく上回った。
  • 1台のGeForce RTX 2080 Tiを用いて8台のカメラで15 FPSで実行可能であり、リアルタイム性能を実証した。
  • CrowdHumanからの疑似教師信号で学習したモデルは、再訓練なしで実世界のネットワークカメラに対しても正確なトラッキングを達成し、良好な一般化性能を示した。
  • 提案されたパイプラインは、実世界の応用に展開可能であり、3台のネットワークカメラを用いたライブシステムによる検証を通じて、最先端の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。