Skip to main content
QUICK REVIEW

[論文レビュー] Learning to associate detections for real-time multiple object tracking

Michel Meneses, Leonardo Nogueira Matos|arXiv (Cornell University)|Jul 12, 2020
Video Surveillance and Tracking Methods参考文献 33被引用数 4
ひとこと要約

本論文では、リアルタイムでの複数対象追跡手法であるSmartSORTを提案する。この手法は、検出結果を複数の動画フレーム間で関連付けるための類似度関数を学習する、軽量な多層パーセプトロン(MLP)ニューラルネットワークを用いる。スライディングウィンドウを用いて深層の外見特徴と手作業で設計された運動特徴を統合することで、効率的な関連付けコストの予測が可能となり、最先端の精度を達成すると同時に、類似したベースラインより58%高速に動作する。このため、オンラインおよび組み込み応用に非常に効果的である。

ABSTRACT

With the recent advances in the object detection research field, tracking-by-detection has become the leading paradigm adopted by multi-object tracking algorithms. By extracting different features from detected objects, those algorithms can estimate the objects' similarities and association patterns along successive frames. However, since similarity functions applied by tracking algorithms are handcrafted, it is difficult to employ them in new contexts. In this study, it is investigated the use of artificial neural networks to learning a similarity function that can be used among detections. During training, the networks were introduced to correct and incorrect association patterns, sampled from a pedestrian tracking data set. For such, different motion and appearance features combinations have been explored. Finally, a trained network has been inserted into a multiple-object tracking framework, which has been assessed on the MOT Challenge benchmark. Throughout the experiments, the proposed tracker matched the results obtained by state-of-the-art methods, it has run 58\% faster than a recent and similar method, used as baseline.

研究の動機と目的

  • 検出ベースの追跡におけるヒューリスティックに基づく類似度関数の限界、すなわち文脈依存性と新しい状況への適応困難性を解消すること。
  • 異なるデータセットや特徴タイプに一般化可能な、スケーラブルで柔軟な類似度関数を機械学習を用いて開発すること。
  • 計算オーバーヘッドを最小限に抑えつつ高精度を維持するため、リアルタイムでのオンラインマルチオブジェクト追跡を実現すること。
  • コスト効率の高い追跡を実現するため、複雑なディープラーニングモデルではなく、単純でコンactなニューラルネットワークを用いること。
  • フィルタリングベースの運動モデリングを、スライディングウィンドウ戦略と学習された回帰モデルに置き換えることで、オンライン追跡フレームワークの効率を向上させること。

提案手法

  • 多層パーセプトロン(MLP)ニューラルネットワークを訓練し、高レベルの外見特徴と運動特徴を用いて検出間の関連付けコストを予測する。
  • 特徴には、事前学習済みの畳み込みニューラルネットワーク(CNN)からの深層外見埋め込みと、カルマンフィルタから得られる手作業で設計された運動特徴(例:位置、速度)を含む。
  • スライディングウィンドウ機構により、過去の検出を統合することで時間的文脈を捉え、明示的な再帰層を用いずに系列モデリングを実現する。
  • MLPは、歩行者追跡データセットからサンプリングされた正例および負例の関連付けペアを用いて、教師あり学習による誤差逆伝播で訓練される。
  • 予測されたコストは、二部グラフを構築するために使用され、線形計画法により解かれて、検出をトラックに割り当てる。
  • トラッカーはオンラインで動作し、すべてのペアワイズコストを一度の行列演算で処理することで、各フレームをリアルタイムに処理する。

実験結果

リサーチクエスチョン

  • RQ1軽量なニューラルネットワークは、異なるデータセットに一般化可能な、マルチオブジェクト追跡における検出関連付けのための頑健な類似度関数を学習できるか?
  • RQ2ヒューリスティックベースの手法と比較して、学習された類似度関数の精度と速度はどのように異なるか?
  • RQ3シンプルなMLPベースの回帰モデルは、より複雑なディープラーニングアーキテクチャを上回る性能をリアルタイム追跡アプリケーションで示せるか?
  • RQ4非再帰的モデルを用いたスライディングウィンドウ戦略は、追跡の安定性とIDの一貫性にどの程度影響を与えるか?
  • RQ5高次元の深層特徴を用いた場合、提案手法の計算コストはどの程度スケーリングされるか?

主な発見

  • SmartSORTは、MOT Challenge 2016ベンチマークで68.5%のIDPと15.7%のFMを達成し、最先端の手法と同等の追跡精度を示した。
  • 類似した深層特徴を用いた最近のベースライン手法よりも58%高速に動作し、顕著な速度向上を示した。
  • 単純な構造にもかかわらず、MLPベースのモデルは低めの回帰誤差を達成しており、関連付けコストの効果的な学習が可能であることが示された。
  • 深層視覚特徴を用いた他のトラッカー、特にLSTMベースの手法よりも少なくとも59%高速に動作したが、精度は3%未満の低下に抑えられた。
  • 主な限界として、スライディングウィンドウの誤った関連付けへの感受性から、IDスイッチ(ID)と断片化(FM)が増加した。
  • 結果から、コンパクトで学習された回帰モデルが、特に組み込みシステムに適したオンライン追跡において、高いコスト効率を達成できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。