Skip to main content
QUICK REVIEW

[論文レビュー] Can Deep Learning be Applied to Model-Based Multi-Object Tracking?

Juliano Pinto, Georg Hess|arXiv (Cornell University)|Feb 16, 2022
Target Tracking and Data Fusion in Sensor Networks被引用数 10
ひとこと要約

本稿では、モデルベースのマルチオブジェクトトラッキング(MOT)に特化した、Transformerに基づく深層学習トラッカーMT3v2を提案する。単純なタスクでは最先端のベイジアン手法と同等の性能を示し、高次元のデータアソシエーションの複雑さや強い非線形性を伴う複雑なシナリオではそれを上回ることを示している。MT3v2はPMBMやδ-GLMBと比較して、インファレンスが桁違いに高速でありながら、低次元の測定設定においても競争力のあるトラッキング精度を維持している。

ABSTRACT

Multi-object tracking (MOT) is the problem of tracking the state of an unknown and time-varying number of objects using noisy measurements, with important applications such as autonomous driving, tracking animal behavior, defense systems, and others. In recent years, deep learning (DL) has been increasingly used in MOT for improving tracking performance, but mostly in settings where the measurements are high-dimensional and there are no available models of the measurement likelihood and the object dynamics. The model-based setting instead has not attracted as much attention, and it is still unclear if DL methods can outperform traditional model-based Bayesian methods, which are the state of the art (SOTA) in this context. In this paper, we propose a Transformer-based DL tracker and evaluate its performance in the model-based setting, comparing it to SOTA model-based Bayesian methods in a variety of different tasks. Our results show that the proposed DL method can match the performance of the model-based methods in simple tasks, while outperforming them when the task gets more complicated, either due to an increase in the data association complexity, or to stronger nonlinearities of the models of the environment.

研究の動機と目的

  • 従来、ベイジアン手法が最先端であるモデルベースのマルチオブジェクトトラッキングにおいて、深層学習が性能向上に効果的であるかどうかを調査すること。
  • PMBMおよびδ-GLMBといった確立されたベイジアンフィルタと比較して、MT3v2という深層学習トラッカーの性能を、多様で段階的に複雑化するMOTタスクにおいて評価すること。
  • 特にインファレンス速度と非線形性、データアソシエーションの複雑さに対するロバストネスの観点から、モデルベースMOTにおける深層学習のスケーラビリティと効率性を評価すること。
  • 正確なオブジェクトの運動モデルと測定尤度モデルが利用可能な状況でも、深層学習がモデルベースMOTにうまく適用可能であることを示すこと。

提案手法

  • 低次元測定を想定したモデルベースMOTに特化した、Transformerに基づく深層学習アーキテクチャであるMT3v2を提案する。
  • シーケンス・ツー・シーケンス学習アプローチを用いて、オブジェクトの存在、位置、不確実性を含むマルチオブジェクト状態を予測するため、Transformerエンコーダ・デコーダ構造を改変する。
  • 予測されたベルヌーイ成分と真値オブジェクト間の関連付けの負の対数尤度(NLL)に基づく微分可能損失関数を用いて、エンド・ツー・エンドでモデルを訓練する。
  • 潜在的なターゲットを表す学習可能なオブジェクトクエリメカニズムを導入し、測定シーケンスに注目することで、状態推定値とトラックIDを予測する。
  • 存在確率と空間的状態を含む、不確実性を伴うマルチオブジェクト状態推定値を生成するための構造化出力予測ヘッドを採用する。
  • 組み合わせ的枚挙を避けるために、Transformerフレームワーク内に微分可能データアソシエーション機構を実装する。

実験結果

リサーチクエスチョン

  • RQ1正確な運動モデルと測定モデルが利用可能な状況でも、深層学習ベースのトラッカーは、最先端のモデルベースベイジアンフィルタを上回ることができるか?
  • RQ2データアソシエーションの複雑さが増すタスクにおいて、Transformerベースの深層学習トラッカー(MT3v2)はPMBMおよびδ-GLMBと比較してどのように性能を発揮するか?
  • RQ3測定モデルや運動モデルに強い非線形性が存在する状況でも、従来のベイジアンフィルタと比較して、深層学習アプローチは性能を維持または向上させるか?
  • RQ4複雑なトラッキングタスクにおいて、従来のベイジアンフィルタと比較して、深層学習トラッカーのインファレンス速度にどの程度の利点があるか?

主な発見

  • MT3v2は、データアソシエーションの複雑さが低い単純なタスクにおいて、最先端のPMBMおよびδ-GLMBフィルタと同等のトラッキング性能を達成している。
  • データアソシエーションの複雑さが高く、または非線形性が強いタスク(例:OFDMレーダ測定)では、MT3v2はPMBMおよびδ-GLMBの両者をトラッキング精度の面で上回っている。
  • MT3v2のインファレンス時間は1フレームあたり0.03〜0.06秒であり、最も複雑なタスク(781.00秒 vs. 0.06秒)ではδ-GLMBの5000倍以上も高速である。
  • タスクの複雑さが増すにつれて、MT3v2とベイジアンフィルタとの性能差が広がる傾向にあり、深層学習が困難で非線形的、または高アソシエーション複雑性を伴うトラッキング問題に適していることが示唆される。
  • ハードウェアの差(GPU対CPU)があるにもかかわらず、MT3v2のインファレンス速度の優位性は極めて顕著であり、ベイジアンフィルタの最適化実装が行われた場合でも、依然として優位性を保つと予想される。
  • 結果から、深層学習がモデルベースMOT設定に効果的に適用可能であることが裏付けられ、スケーラビリティと速度に優れた、従来のベイジアンフィルタの代替手段としての可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。