Skip to main content
QUICK REVIEW

[論文レビュー] MOTR: End-to-End Multiple-Object Tracking with Transformer

Fangao Zeng, Bin Dong|arXiv (Cornell University)|May 7, 2021
Video Surveillance and Tracking Methods参考文献 54被引用数 16
ひとこと要約

MOTRは、学習可能な「トラッククエリ」を備えたTransformerベースのアーキテクチャを用いて、複数対象追跡のエンドツーエンドフレームワークを提案する。これらのクエリはフレーム間で繰り返し更新され、物体の軌跡をモデル化する。トラックレットに配慮したラベル割り当て、動的トラック管理のためのインポートおよびエグジット機構、および集団平均損失や時間的集約ネットワークといった時間的モデリングコンponentsを導入することで、MOTRは最先端の性能を達成し、DanceTrackではHOTAでByteTrackを6.5%上回り、MOT17でも顕著な向上を示した。

ABSTRACT

Temporal modeling of objects is a key challenge in multiple object tracking (MOT). Existing methods track by associating detections through motion-based and appearance-based similarity heuristics. The post-processing nature of association prevents end-to-end exploitation of temporal variations in video sequence. In this paper, we propose MOTR, which extends DETR and introduces track query to model the tracked instances in the entire video. Track query is transferred and updated frame-by-frame to perform iterative prediction over time. We propose tracklet-aware label assignment to train track queries and newborn object queries. We further propose temporal aggregation network and collective average loss to enhance temporal relation modeling. Experimental results on DanceTrack show that MOTR significantly outperforms state-of-the-art method, ByteTrack by 6.5% on HOTA metric. On MOT17, MOTR outperforms our concurrent works, TrackFormer and TransTrack, on association performance. MOTR can serve as a stronger baseline for future research on temporal modeling and Transformer-based trackers. Code is available at https://github.com/megvii-research/MOTR.

研究の動機と目的

  • 既存のMOT手法における後処理による関連付けの制限を解消し、物体の軌跡を完全にエンドツーエンドで学習すること。
  • 動画フレーム全体にわたる反復的クエリ更新を通じて、外見的および運動的変化を統合的にモデル化すること。
  • IoU や Re-ID などのヒューリスティックなマッチングを排除し、Transformerフレームワーク内での直接的なトラック関連付けを学習すること。
  • オクルージョンやIDスイッチが発生する困難なシーケンスにおける一般化性能を向上させるために、強化された時間的モデリングを実現すること。

提案手法

  • DETRを拡張し、物体トラックの隠れ状態として機能する「トラッククエリ」を導入。これらはフレーム間で自己注意およびクロス注意を介して更新される。
  • 同一IDのボクセル境界ボックスシーケンスを用いてトラッククエリを監視するためのトラックレットに配慮したラベル割り当て(TALA)を採用。
  • 新しいオブジェクトは挿入により追加され、終了したトラックは削除される動的トラック管理のためのインポートおよびエグジット機構を導入。
  • トラッククエリが自身の歴史的状態にキーベースのクエリメカニズムを用いて注目できるようにする時間的集約ネットワーク(TAN)を提案。これにより長距離モデリングが向上。
  • 複数フレームにわたる損失を集約することで時間的整合性を向上させる、集団平均損失(CAL)を導入。これは動画クリップ全体で学習される。
  • 訓練中に確率 $p_{drop}$ と $p_{insert}$ を用いてクエリの消去および挿入を実施し、オブジェクトのインポートおよびエグジットシナリオをシミュレート。

実験結果

リサーチクエスチョン

  • RQ1後処理による関連付けが不要なエンドツーエンドのTransformerベースのフレームワークは、複数対象追跡において外見的および運動的変化を統合的にモデル化できるか?
  • RQ2トラッククエリはどのようにフレーム間で効果的に更新・割り当てされ、完全な物体の軌跡をモデル化できるか?
  • RQ3長距離時間的依存性およびオクルージョンシナリオにおける一般化性能を向上させるために、どの訓練戦略が最も効果的か?
  • RQ4CALを用いて動画クリップ全体で最適化することで、フレーム単位の訓練に比べて追跡のロバスト性がどの程度向上するか?
  • RQ5クエリレベルのメカニズム(インポート/エグジット、消去/挿入)は、新生および終了したオブジェクトの追跡をどの程度向上できるか?

主な発見

  • DanceTrackデータセットでは、MOTRはHOTA指標で最先端手法のByteTrackを6.5%上回り、AssA指標でも8.1%の向上を示した。
  • MOT17では、TrackFormer や TransTrack といった同時期の手法と比較して、優れた関連付け性能を達成した。
  • TANをベースラインに統合することで、MOTAが7.8%向上し、IDF1が13.6%向上した。これは時間的ダイナミクスのモデリングにおける有効性を示している。
  • 長さ5の動画クリップを用いた集団平均損失(CAL)の適用により、MOTAが8.3%向上、IDF1が7.1%向上した。これはオクルージョンや困難なケースへの対処における顕著な向上を示している。
  • 最適な訓練ハイパーパrameterは、$p_{drop} = 0.1$(クエリの消去)と $p_{insert} = 0.3$(クエリの挿入)であり、MOTAを最大化しながらも高いIDF1を維持した。
  • 訓練中のサンプリング間隔は強く影響を与える:10を超えると性能が低下するが、2〜10の間ではIDSが209から155に低下し、追跡性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。