Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Learning Deep CRF models for Multi-Object Tracking

Jun Xiang, Chao Ma|arXiv (Cornell University)|Jul 29, 2019
Video Surveillance and Tracking Methods参考文献 44被引用数 15
ひとこと要約

本論文では、長期間の依存関係を符号化するために双方向LSTMを用いて、unaryおよびpairwiseの潜在変数を同時に最適化するエンドツーエンドのディープCRFモデルを提案する。CRF推論を再帰的ニューラルネットワーク学習プロセスとして定式化することで、遮蔽がある混雑したシーンにおいても、IDの入れ替えを顕著に低減し、MOT-2015およびMOT-2016で最先端の性能を達成した。

ABSTRACT

Existing deep multi-object tracking (MOT) approaches first learn a deep representation to describe target objects and then associate detection results by optimizing a linear assignment problem. Despite demonstrated successes, it is challenging to discriminate target objects under mutual occlusion or to reduce identity switches in crowded scenes. In this paper, we propose learning deep conditional random field (CRF) networks, aiming to model the assignment costs as unary potentials and the long-term dependencies among detection results as pairwise potentials. Specifically, we use a bidirectional long short-term memory (LSTM) network to encode the long-term dependencies. We pose the CRF inference as a recurrent neural network learning process using the standard gradient descent algorithm, where unary and pairwise potentials are jointly optimized in an end-to-end manner. Extensive experimental results on the challenging MOT datasets including MOT-2015 and MOT-2016, demonstrate that our approach achieves the state of the art performances in comparison with published works on both benchmarks.

研究の動機と目的

  • 遮蔽下でのIDの入れ替えや識別能の低下という、ディープマルチオブジェクトトラッキングの課題に取り組む。
  • 構造的グラフィカルモデルを用いて、ターゲット間の長期間にわたる空間的・時間的依存関係をモデル化する。
  • エンドツーエンドのディープCRFフレームワークにおいて、unaryおよびpairwiseの潜在変数の学習を可能にする。
  • ターゲット間の物理的制約を明示的にモデル化することで、混雑したシーンにおけるデータアソシエーションのロバスト性を向上させる。
  • MOTにおけるターゲット数が変動する状況下で、CRF推論の非可解性を克服する。

提案手法

  • unary潜在変数は、検出結果とトラック間の割り当てコストを計算するマッチングネットワークによって学習される。
  • pairwise潜在変数は、特に困難なペアに対して、長期間の依存関係を捉えるために双方向LSTMを用いてモデル化される。
  • 標準的な勾配降下法を用いて、CRF推論を再帰的ニューラルネットワーク学習プロセスとして再定式化する。
  • 全フレームワークがエンドツーエンドの方法でunaryおよびpairwise潜在変数を同時に最適化する。
  • モデルは、重複不可および同時占有不可といった構造的制約を暗黙的にモデル化する。
  • 標準的なトラッキング指標を用いて、MOT-2015およびMOT-2016でエンドツーエンドに訓練される。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドの学習によるディープCRFモデルは、遮蔽下のマルチオブジェクトトラッキングにおけるデータアソシエーションを改善できるか?
  • RQ2双方向LSTMは、MOTにおける検出結果間の長期間の依存関係をどの程度効果的にモデル化できるか?
  • RQ3unaryおよびpairwise潜在変数の共同最適化は、混雑したシーンにおけるIDの入れ替えを低減できるか?
  • RQ4CRF推論をRNN学習プロセスとして定式化することで、サイズが可変なトラッキンググラフに対するスケーラブルで微分可能な推論が可能になるか?
  • RQ5提案手法は、標準的なMOTベンチマークにおいて、最先端のベースラインと比較してどのように性能を発揮するか?

主な発見

  • 提案手法は、MOT-2016で50.3%のMOTAを達成し、テストセットにおいて、発表済みのすべての手法を上回った。
  • MOT-2015では、MOTAが40.0%、IDF1が49.6%を達成し、新たな最先端の結果を樹立した。
  • MOT-2016では、IDの入れ替え(IDS)を702にまで低減し、競合手法と比較して顕著に低い水準に抑えた。
  • MOT-2016では、MT(18.3%)およびML(35.7%)といった困難な指標においても、優れた性能を示した。
  • 可視化結果から、本手法はターゲット5および6について、フレーム間で一貫したIDを維持できているのに対し、先行の最先端手法とは対照的であった。
  • アブレーションスタディにより、双方向LSTMおよびエンドツーエンドの訓練が性能向上に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。