[論文レビュー] End-to-end Recurrent Multi-Object Tracking and Trajectory Prediction with Relational Reasoning
本稿では、関係的推論を用いて物体間の相互作用をモデル化する、エンド・ツー・エンドで、クラスに依存せず、再帰的なマルチオブジェクトトラッキングおよび軌道予測モデルであるMohartを提案する。空間的アテンション、再帰的ネットワーク、および置換不変な関係的推論に適したマルチヘッド自己アテンションモジュールを統合することで、MohartはMOTChallenge、UA-DETRAC、Stanford Droneデータセットにおいてベースライントラッカーを上回る一貫した性能向上を達成した。特に遮蔽、自己運動、センサ障害の条件下で顕著な改善が見られた。
The majority of contemporary object-tracking approaches do not model interactions between objects. This contrasts with the fact that objects' paths are not independent: a cyclist might abruptly deviate from a previously planned trajectory in order to avoid colliding with a car. Building upon HART, a neural class-agnostic single-object tracker, we introduce a multi-object tracking method MOHART capable of relational reasoning. Importantly, the entire system, including the understanding of interactions and relations between objects, is class-agnostic and learned simultaneously in an end-to-end fashion. We explore a number of relational reasoning architectures and show that permutation-invariant models outperform non-permutation-invariant alternatives. We also find that architectures using a single permutation invariant operation like DeepSets, despite, in theory, being universal function approximators, are nonetheless outperformed by a more complex architecture based on multi-headed attention. The latter better accounts for complex physical interactions in a challenging toy experiment. Further, we find that modelling interactions leads to consistent performance gains in tracking as well as future trajectory prediction on three real-world datasets (MOTChallenge, UA-DETRAC, and Stanford Drone dataset), particularly in the presence of ego-motion, occlusions, crowded scenes, and faulty sensor inputs.
研究の動機と目的
- トラッキング中に物体間の相互作用をモデル化できない既存のトラッカーの限界を解消すること。
- クラスに依存せず、エンド・ツー・エンドで学習可能なシステムを構築し、トラッキングと将来の軌道予測を同時に最適化すること。
- 特に置換不変なモデルを含む、さまざまな関係的推論アーキテクチャの有効性を調査すること。
- トラッキングと予測の共同学習により、遮蔽、自己運動、センサノイズに対するより高いロバスト性を実現すること。
- 混雑したシーンや部分的観測を含む多様な課題を有する実世界のデータセット上で、モデルの性能を評価すること。
提案手法
- 空間的アテンションを用いてオブジェクトのグリムスを並列処理することで、単一オブジェクトトラッカーHARTをマルチオブジェクトトラッキングに拡張する。
- オブジェクト特徴をCNNで処理し、置換不変な相互作用モデリングに適したマルチヘッド自己アテンションを用いて関係的推論モジュールに供給する。
- 再帰的モジュールを用いて時系列にわたるオブジェクト状態を保持・更新し、長期的な運動パターンの学習を可能にする。
- 共有表現を用いて、トラッキング(IoU)と将来の軌道予測(例:ADE/FDE)の両方をエンド・ツー・エンドで学習する。
- 視覚的特徴と関係的推論を統合することで、欠落または故障したセンサ入力に対してもロバスト性を向上させる。
- 領域提案ネットワークを回避するため、各オブジェクトごとに1つの微分可能な空間的アテンション機構を用いて関連する画像領域を抽出する。
実験結果
リサーチクエスチョン
- RQ1関係的推論は、遮蔽や自己運動を含む複雑な現実世界のシナリオにおけるマルチオブジェクトトラッキング性能を向上させ得るか?
- RQ2特に置換不変なモデルを含む、さまざまな関係的推論アーキテクチャは、トラッキングおよび予測タスクにおいてどのように比較されるか?
- RQ3トラッキングと軌道予測の共同エンド・ツー・エンド学習は、分離学習よりも優れた一般化性能をもたらすか?
- RQ4カメラの黒ずみや欠落検出が生じるようなセンサ劣化条件下で、モデルの性能はどの程度か?
- RQ5関係的推論は、独立したオブジェクトトラッキングと比較して、どのようなシナリオで最も顕著な性能向上をもたらすか?
主な発見
- Mohartは、MOTChallenge、UA-DETRAC、Stanford Droneデータセットにおいて、関係的推論を用いないベースラインと比較して一貫した性能向上を達成した。特に遮蔽や自己運動の条件下で顕著な改善が見られた。
- 線形運動量ベースラインを上回る軌道予測性能を示しており、単なる外挿を超えた複雑な運動パターンを学習していることが確認された。
- マルチヘッド自己アテンションは、汎用関数近似器であるDeepSetsのような単純な置換不変モデルよりも優れた性能を示した。
- カメラの黒ずみに対してもMohartは強くロバストであり、特にStanford Droneデータセットにおける自転車乗りの軌道で顕著な改善が見られた。
- SOTA検出器の約230万フレームと比較して約8,000フレームの学習データしか使用しなくても、MohartはMOTChallengeでSOTA検出器と同等の性能を達成しており、高いデータ効率性を示した。
- HARTと比較して、トラッキングおよび予測の両面でMohartの性能が顕著に優れており、マルチオブジェクト環境における関係的推論の有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。