[論文レビュー] TrackFormer: Multi-Object Tracking with Transformers
TrackFormer は、エンドツーエンドのトランスフォーマー基盤のエンコーダデコーダアーキテクチャを用いて、マルチオブジェクトトラッキングのための新しいアテンションベースのトラッキングパラダイムを導入する。アテンションメカニズムを用いて検出とデータ関連付けを同時に実行する自己回帰的トラッククエリを用い、グラフ最適化や明示的な運動・外観モデリングに依存せずに、MOT17、MOT20、MOTS20ベンチマークで最先端の性能を達成する。
The challenging task of multi-object tracking (MOT) requires simultaneous reasoning about track initialization, identity, and spatio-temporal trajectories. We formulate this task as a frame-to-frame set prediction problem and introduce TrackFormer, an end-to-end trainable MOT approach based on an encoder-decoder Transformer architecture. Our model achieves data association between frames via attention by evolving a set of track predictions through a video sequence. The Transformer decoder initializes new tracks from static object queries and autoregressively follows existing tracks in space and time with the conceptually new and identity preserving track queries. Both query types benefit from self- and encoder-decoder attention on global frame-level features, thereby omitting any additional graph optimization or modeling of motion and/or appearance. TrackFormer introduces a new tracking-by-attention paradigm and while simple in its design is able to achieve state-of-the-art performance on the task of multi-object tracking (MOT17 and MOT20) and segmentation (MOTS20). The code is available at https://github.com/timmeinhardt/trackformer .
研究の動機と目的
- 従来の2段階の検出ベーストラッキングに代わるエンドツーエンドのアテンションベースのアプローチを用いて、マルチオブジェクトトラッキング(MOT)における検出とデータ関連付けの統合的処理に挑戦すること。
- トランスフォーマーの自己注意およびクロス注意を活用することで、別個のデータ関連付けモジュール、グラフ最適化、明示的な運動・外観モデリングの必要性を排除すること。
- アイデンティティを保持するトラッククエリがフレーム間で自己回帰的に更新されることで、空間的・時間的トラジェクトリを形成する、トラッキング・バイ・アテンションという新しいパラダイムを提唱すること。
- 標準的な MOT ベンチマーク(MOT17、MOT20)で最先端の性能を達成するとともに、マスク予測ヘッドを用いてインスタンスセグメンテーション(MOTS20)への拡張を実現すること。
提案手法
- エンコーダデコーダ型トランスフォーマー構造を用いて、フレーム間のセット予測問題として MOT を定式化する。
- 初期検出には静的オブジェクトクエリを、フレーム間のアイデンティティ保持トラッキングには自己回帰的トラッククエリを用いる。
- トラッククエリ内の自己注意と、クエリとフレーム全体の特徴間のクロス注意を用いて、空間的・時間的推論を実現する。
- アテンションメカニズムを介して検出とデータ関連付けを統合的に実行することで、後処理のマッチングやグラフ最適化の必要性を排除する。
- 時間経過に伴い進化するアイデンティティ保持型トラッククエリを導入し、アテンション駆動の最適化によってオブジェクトのアイデンティティを維持する。
- インスタンスセグメンテーションに対応するため、マスク予測ヘッドをモデルに拡張し、MOTS20ベンチマークでの性能を実現する。

実験結果
リサーチクエスチョン
- RQ1純粋なアテンションベースのトランスフォーマー構造が、外部のデータ関連付けモジュールに依存せずにエンドツーエンドのマルチオブジェクトトラッキングを達成できるか?
- RQ2自己回帰的トラッククエリの使用が、フレーム間でのオブジェクトアイデンティティとトラジェクトリの一貫性を維持する上でどれほど有効であるか?
- RQ3トラッキング・バイ・アテンションパラダイムが、標準的なベンチマークにおいて、従来の検出ベースや回帰ベースの手法を上回る性能を示せるか?
- RQ4単一のトランスフォーマー基盤アーキテクチャが、統合的なフレームワーク内で検出、トラッキング、セグメンテーションを同時に実行できる範囲はどの程度か?
主な発見
- TrackFormer は、公開の検出結果を用いて、MOT17ベンチマークで MOTA 62.3%、IDF1 57.6% を達成し、最先端の性能を示した。
- MOT20ベンチマークでは、非公開の検出結果を用いて MOTA 68.6%、IDF1 65.7% を達成し、新たな最先端を樹立した。
- MOTS20インスタンスセグメンテーションベンチマークでは、sMOTSA 54.9%、IDF1 63.6%、MOTSA 69.9% を達成し、セグメンテーションへの汎用性が顕著に示された。
- MOT17 および MOT20 のすべてのシーケンスにおいて、オブジェクト数が多く複雑な運動を示すシーケンスを含め、先行手法を上回る性能を示した。
- アブレーションスタディの結果、自己回帰的トラッククエリ機構がアイデンティティ保持とトラジェクトリの一貫性に不可欠であることが確認された。
- 明示的な運動または外観モデリングが存在しないにもかかわらず優れた性能を示しており、これはグローバルアテンションが空間的・時間的推論において有効であることを裏付けている。
![Figure 2 : TrackFormer casts multi-object tracking as a set prediction problem performing joint detection and tracking-by-attention . The architecture consists of a CNN for image feature extraction, a Transformer [ 51 ] encoder for image feature encoding and a Transformer decoder which applies self-](https://ar5iv.labs.arxiv.org/html/2101.02702/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。