Skip to main content
QUICK REVIEW

[論文レビュー] Frame-wise Motion and Appearance for Real-time Multiple Object Tracking

Jimuyang Zhang, Sanping Zhou|arXiv (Cornell University)|May 6, 2019
Video Surveillance and Tracking Methods参考文献 32被引用数 11
ひとこと要約

本論文では、フレーム単位の動き(FMF)とフレーム単位の外見特徴(FAF)を用いて、ピクセル単位の変位推定によりフレーム間を効率的にオブジェクトを関連付けるリアルタイムな複数オブジェクト追跡手法FMAを提案する。FMAはMOT17で25 FPSを達成し、オブジェクト数に依存しない優れた精度を発揮し、オブジェクト数に関わらずリアルタイム推論を実現する。

ABSTRACT

The main challenge of Multiple Object Tracking (MOT) is the efficiency in associating indefinite number of objects between video frames. Standard motion estimators used in tracking, e.g., Long Short Term Memory (LSTM), only deal with single object, while Re-IDentification (Re-ID) based approaches exhaustively compare object appearances. Both approaches are computationally costly when they are scaled to a large number of objects, making it very difficult for real-time MOT. To address these problems, we propose a highly efficient Deep Neural Network (DNN) that simultaneously models association among indefinite number of objects. The inference computation of the DNN does not increase with the number of objects. Our approach, Frame-wise Motion and Appearance (FMA), computes the Frame-wise Motion Fields (FMF) between two frames, which leads to very fast and reliable matching among a large number of object bounding boxes. As auxiliary information is used to fix uncertain matches, Frame-wise Appearance Features (FAF) are learned in parallel with FMFs. Extensive experiments on the MOT17 benchmark show that our method achieved real-time MOT with competitive results as the state-of-the-art approaches.

研究の動機と目的

  • オブジェクト数の増加に伴い計算効率が著しく低下する既存のMOT手法の問題を解決すること。
  • LSTMベースの動きモデルやRe-IDベースのマッチング手法の限界を克服し、オブジェクト数に伴うスケーリングの悪さを解消すること。
  • フレーム単位の表現を用いて関連付け計算をオブジェクト数から分離することで、リアルタイム推論を実現すること。
  • 外見変化や遮蔽に強い性能を発揮するため、計算コストを増やさずに補助的な外見特徴を活用すること。
  • 固定されたネットワークアーキテクチャ制約なしに、不定な数のオブジェクトを扱える汎用的でエンドツーエンドの深層学習フレームワークを開発すること。

提案手法

  • 連続する2フレーム間のオブジェクトバウンディングボックスの座標シフトをピクセル単位で推定する、フレーム単位の動きフィールド(FMF)を導入する。
  • FMFを用いて単純な空間ワープにより次フレームのオブジェクト位置を予測し、バイパライトマッチングを必要としないIOUベースの高速1対1マッチングを実現する。
  • 同時にRe-ID損失を用いて、フレーム全体のオブジェクトを網羅する包括的な外見表現を捉えるフレーム単位の外見特徴(FAF)を学習する。
  • FAFはFMFが特定した不確実なマッチングにのみ適用し、推論時の計算コストを最小限に抑える。
  • まずFMFを用いて高速マッチングを行い、その後必要に応じてFAFを適用して曖昧な関連付けを精緻化する、軽量な推論アルゴリズムを設計する。
  • 外部Re-IDデータセットに依存せず、MOT17データ上でエンドツーエンドのネットワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、オブジェクト数に依存しない推論コストを実現し、リアルタイムな複数オブジェクト追跡を達成できるか?
  • RQ2バイパライトマッチングや再帰構造を必要としないフレーム単位の動きフィールド(FMF)は、フレーム間のオブジェクト関連付けを効果的に表現できるか?
  • RQ3推論時に限定的に適用されるフレーム単位の外見特徴(FAF)は、曖昧なマッチングの解消にどの程度効果的か?
  • RQ4外部Re-IDデータなしでMOT17データのみで学習した手法が、競争力のある性能を達成できるか?
  • RQ5FMFベースの追跡は、遮蔽、視点変化、検出ノイズといった困難な状況下でもどの程度頑健性を保てるか?

主な発見

  • FMAは、最適化されていないPyTorch(Float32)を用い、単一のTitan XP GPUでMOT17ベンチマークで25 FPSを達成し、リアルタイム推論の可能性を実証した。
  • 本手法は競争力あるMOT精度を達成した:SDP検出器を用いたMOT17テストセットでは、HOTAが57.5%、MOTAが24.1%、IDF1が30.2%を記録した。
  • FMFにより、オブジェクト数に依存しない高速でスケーラブルなマッチングが可能であり、推論の計算複雑度が追跡オブジェクト数の増加に伴って増大しない。
  • 不確実なマッチングにのみFAFを適用することで、高速性を維持しながらも、遮蔽や外見変化が顕著な難易度の高いシーケンスでの精度向上が達成された。
  • FRCNNやSDPなどの同じ検出器を用いた場合、FMAはMOTDT や MTDF といった最先端のオンライン手法と同等またはそれ以上の速度と精度を達成した。
  • 照明の変化、視点の変化、相互遮蔽に対しても、定性的な追跡例を通じてその頑健性が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。