Skip to main content
QUICK REVIEW

[論文レビュー] Global Correlation Network: End-to-End Joint Multi-Object Detection and Tracking

Xuewu Lin, Yu-ang Guo|arXiv (Cornell University)|Mar 23, 2021
Video Surveillance and Tracking Methods参考文献 9被引用数 10
ひとこと要約

本稿では、非最大抑制、データアソシエーション、または複雑な後処理を必要とせず、絶対的なバウンディングボックス座標とサイズを回帰するグローバル相関層を用いた、エンドツーエンドのマルチオブジェクト検出とトラッキングのフレームワーク、Global Correlation Network (GCNet) を提案する。UA-DETRACベンチマークにおいて、検出で74.04% AP、トラッキングで19.10% PR-MOTAを達成し、1フレームあたり34 FPSで連合推論が可能である。

ABSTRACT

Multi-object tracking (MOT) has made great progress in recent years, but there are still some problems. Most MOT algorithms follow tracking-by-detection framework, which separates detection and tracking into two independent parts. Early tracking-by-detection algorithms need to do two feature extractions for detection and tracking. Recently, some algorithms make the feature extraction into one network, but the tracking part still relies on data association and needs complex post-processing for life cycle management. Those methods do not combine detection and tracking well. In this paper, we present a novel network to realize joint multi-object detection and tracking in an end-to-end way, called Global Correlation Network (GCNet). Different from most object detection methods, GCNet introduces the global correlation layer for regression of absolute size and coordinates of bounding boxes instead of offsets prediction. The pipeline of detection and tracking by GCNet is conceptually simple, which does not need non-maximum suppression, data association, and other complicated tracking strategies. GCNet was evaluated on a multi-vehicle tracking dataset, UA-DETRAC, and demonstrates promising performance compared to the state-of-the-art detectors and trackers.

研究の動機と目的

  • 検出とトラッキングを独立したモジュールに分離し、複雑な後処理を要するトラッキング・バイ・検出フレームワークの限界を解消すること。
  • グローバル特徴相関を用いて絶対的なオブジェクト座標とサイズを回帰することで、検出とトラッキングを1つのエンドツーエンドネットワークに統合すること。
  • トラッキングパイプラインにおける非最大抑制、データアソシエーション、ライフサイクル管理への依存を排除すること。
  • 自動運転や交通監視などの応用に適したリアルタイム性能を達成すること。
  • 検出とトラッキングの間で共有される特徴が、追加の計算を伴わずにトラッキング性能を顕著に向上させることを示すこと。

提案手法

  • GCNetは、現在フレームのクエリ特徴と前フレームのキー特徴の間のコサイン類似度を計算することで、グローバルな文脈を符号化するグローバル相関層を導入する。
  • 各空間位置において、クエリ特徴とキー特徴の学習された線形変換を経て、最終的な線形層による重み付き集約によって相関ベクトルが計算される。
  • 相関マップは、オフセットベースの回帰に代わる1×1畳み込みヘッドを通じて、絶対的なバウンディングボックス座標とサイズを予測するために使用される。
  • 検出とトラッキングは、共有バックボーン特徴を用いて同時に実行され、検出の信頼度とトラッキングの信頼度のための別々のheatmapヘッドが使用される。
  • 推論では非最大抑制の代わりにマックスプーリングが用いられ、冗長な検出の抑制が簡素化される。
  • 分類と回帰にはCenterNetスタイルのアーキテクチャが用いられ、バックボーンにはResNet-50が使用される。

実験結果

リサーチクエスチョン

  • RQ1オフセット予測に依存せずに、検出とトラッキングの両方において絶対的なオブジェクト座標とサイズを統合的なエンドツーエンドネットワークで回帰できるか?
  • RQ2フレーム間のグローバル相関が、従来のデータアソシエーションを置き換え、パイプラインの複雑さを低減できるか?
  • RQ3非最大抑制と明示的なトラッキング戦略の排除が、推論効率とトラッキングのロバストネスを向上させられるか?
  • RQ4検出とトラッキングの間で共有される特徴空間が、マルチオブジェクトトラッキングベンチマークでSOTAのパフォーマンスを達成できるか?
  • RQ5グローバル相関層は、従来のトラッキング・バイ・検出手法と比較して、どの程度トラッキング精度を向上させるか?

主な発見

  • GCNetはUA-DETRACの検出ベンチマークで74.04%の平均精度(AP)を達成し、Faster R-CNN や CenterNet-Res50 など、多数の既存検出器を上回った。
  • UA-DETRACのトラッキングベンチマークでは、GCNetは19.10%のPR-MOTAを達成し、EB+KIOUベースライン(21.1%)を大きく上回り、DPM や ACF などの他の手法と比較してほぼ2倍のPR-MOTAを記録した。
  • 1台のNVIDIA 2080Tiで、検出は36 FPS、連合検出とトラッキングは34 FPSを達成し、リアルタイム性能を実現した。
  • 57.3%のPR-MOTPを達成し、低ロケーションエラーで高品質な軌道推定が可能であることを示した。
  • PR-ML(9.6)とPR-FN(148,517.5)で最高スコアを記録し、誤検出と見逃しの少ない性能を示した。
  • アブレーションスタディにより、グローバル相関層が正確な絶対座標回帰および連合検出・トラッキング性能にとって不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。