Skip to main content
QUICK REVIEW

[論文レビュー] TGCN: Time Domain Graph Convolutional Network for Multiple Objects Tracking

Jie Zhang|arXiv (Cornell University)|Jan 6, 2021
Video Surveillance and Tracking Methods参考文献 12被引用数 6
ひとこと要約

本論文では、複数対象追跡のための時間領域グラフ畳み込みネットワークTGCNを提案する。TGCNは、過去のフレームと現在のフレームの特徴間の時間的関係をモデル化し、データ駆動型相関行列とGCNを活用して外観特徴をフレーム間で伝搬させることで、ポーズ特徴表現を向上させる。MOT16ベンチマークでは1.3%のMOTA向上を達成しながら、高い推論速度を維持した。

ABSTRACT

Multiple object tracking is to give each object an id in the video. The difficulty is how to match the predicted objects and detected objects in same frames. Matching features include appearance features, location features, etc. These features of the predicted object are basically based on some previous frames. However, few papers describe the relationship in the time domain between the previous frame features and the current frame features.In this paper, we proposed a time domain graph convolutional network for multiple objects tracking.The model is mainly divided into two parts, we first use convolutional neural network (CNN) to extract pedestrian appearance feature, which is a normal operation processing image in deep learning, then we use GCN to model some past frames' appearance feature to get the prediction appearance feature of the current frame. Due to this extension, we can get the pose features of the current frame according to the relationship between some frames in the past. Experimental evaluation shows that our extensions improve the MOTA by 1.3 on the MOT16, achieving overall competitive performance at high frame rates.

研究の動機と目的

  • 運動の曖昧さや隠蔽によるIDスイッチを解消すること。
  • 過去のフレームからの時間的依存関係を活用して、予測対象の外観特徴表現を向上させること。
  • 単なるt-1フレーム接続を超えて、フレーム間の対象特徴の時間的関係をモデル化すること。
  • 学習された時間的ダイナミクスを、新しいグラフベースの特徴伝搬メカニズムを用いて追跡関連プロセスに統合すること。

提案手法

  • YOLOv5ベースの検出器が各フレームから対象検出と外観特徴を抽出する。
  • 事前知識に基づく一方向接続(t-1からtへ)と、フレーム間の類似確率を用いて時間領域グラフを構築する。
  • グラフ隣接行列AはA = Q + Pとして定義され、Qは時間的順序を符号化し、Pは学習された特徴類似度を符号化する。
  • 多層GCNが時間領域グラフを介して特徴を伝搬させ、層間更新式X^(l+1) = σ(AX^(l)W)を用いて時間的依存関係を学習する。
  • 過去のフレームの時間窓Cからの特徴を用いて、現在のフレームのポーズ特徴を予測する。
  • 最終的な関連付けは、ハンガリアン割り当てを用いて、運動(マハラノビス距離)、速度(コサイン類似度)、外観(d3)の重み付き組み合わせで行う。

実験結果

リサーチクエスチョン

  • RQ1直前のフレームを越えた時間的関係をモデル化することで、複数対象追跡における外観特徴表現が向上するか?
  • RQ2データ駆動型グラフ畳み込みネットワークは、追跡における時間的特徴伝搬をどのように向上させるか?
  • RQ3GCNベースの時間的モデリングは、標準のカルマンフィルターや外観のみの手法と比較して、IDスイッチを低減できるか?
  • RQ4時間領域構造を統合することで、推論速度を犠牲にせずに追跡精度がどの程度向上するか?

主な発見

  • TGCNはMOT16ベンチマークで62.7%のMOTAを達成し、ベースラインのDeepSORTと比較して1.3%の向上を示した。
  • IDスイッチの数は781から751に減少し、追跡の一貫性が向上した。
  • 誤検出(FP)と誤未検出(FN)はそれぞれ7101と55581に減少し、検出関連の精度が向上した。
  • モデルは高い推論速度を維持しており、V100 GPU上でYOLOv5により1フレームあたり20ms未満の処理が可能だった。
  • 速度とポーズ特徴の統合は、外観のみまたは運動のみのベースラインと比較して、IDスイッチを顕著に低減した。
  • 隣接行列Aにおける学習された相関行列Pの使用により、単なる時間的順序を超えた特徴伝搬が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。