Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Pedestrians and Vehicles Tracking in Aerial Imagery: A Comprehensive Study

Seyed Majid Azimi, Maximilian Kraus|arXiv (Cornell University)|Oct 19, 2020
Video Surveillance and Tracking Methods参考文献 4被引用数 5
ひとこと要約

本論文では、アスペクト(シアン方程式)、時間的(LSTM)、空間的グラフ(GCN)特徴を統合することで、歩行者および車両の追跡を向上させる、深層学習ベースの空中画像用マルチオブジェクト追跡フレームワーク、AerialMPTNetを提案する。歩行者データセットでは最先端の性能を達成し、車両データセットでも競争力のある結果を示す。L1損失はHuber損失を上回り、LSTM/GCNモジュールは安定性を向上させる。SEブロックとOHEMは文脈依存的な利点を示す。

ABSTRACT

In this paper, we address various challenges in multi-pedestrian and vehicle tracking in high-resolution aerial imagery by intensive evaluation of a number of traditional and Deep Learning based Single- and Multi-Object Tracking methods. We also describe our proposed Deep Learning based Multi-Object Tracking method AerialMPTNet that fuses appearance, temporal, and graphical information using a Siamese Neural Network, a Long Short-Term Memory, and a Graph Convolutional Neural Network module for a more accurate and stable tracking. Moreover, we investigate the influence of the Squeeze-and-Excitation layers and Online Hard Example Mining on the performance of AerialMPTNet. To the best of our knowledge, we are the first in using these two for a regression-based Multi-Object Tracking. Additionally, we studied and compared the L1 and Huber loss functions. In our experiments, we extensively evaluate AerialMPTNet on three aerial Multi-Object Tracking datasets, namely AerialMPT and KIT AIS pedestrian and vehicle datasets. Qualitative and quantitative results show that AerialMPTNet outperforms all previous methods for the pedestrian datasets and achieves competitive results for the vehicle dataset. In addition, Long Short-Term Memory and Graph Convolutional Neural Network modules enhance the tracking performance. Moreover, using Squeeze-and-Excitation and Online Hard Example Mining significantly helps for some cases while degrades the results for other cases. In addition, according to the results, L1 yields better results with respect to Huber loss for most of the scenarios. The presented results provide a deep insight into challenges and opportunities of the aerial Multi-Object Tracking domain, paving the way for future research.

研究の動機と目的

  • 高解像度の空中画像におけるマルチオブジェクト追跡の課題に対処すること。特に、小さなオブジェクト、隠蔽、高密度が性能を低下させる要因となる。
  • 空中画像に特化した深層学習ベースのマルチオブジェクト追跡(MOT)手法を開発すること。外観、時間的、空間的グラフ的特徴を統合する。
  • Squeeze-and-Excitation(SE)層やオンラインハード例マイニング(OHEM)といったアーキテクチャ的要素が、空中環境における回帰ベースのMOTに与える影響を評価すること。
  • 損失関数(L1対Huber)を比較し、空中MOTにおける追跡精度と耐性に与える影響を評価すること。
  • 3つの空中MOTデータセットにおいて、既存のSOTAおよびMOT手法の包括的ベンチマークと分析を提供し、性能のギャップと研究の機会を同定すること。

提案手法

  • AerialMPTNetは、フレーム間でのオブジェクト再識別に耐性のある外観特徴を抽出するために、シアン方程式ニューラルネットワーク(SNN)を採用する。
  • 長期短期記憶(LSTM)ネットワークは、時間的依存関係をモデル化し、オブジェクトの運動を予測することで、時間的安定性を向上させる。
  • グラフ畳み込みニューラルネットワーク(GCN)は、追跡中のオブジェクト間の空間的関係を捉え、相互作用をモデル化し、隠蔽の処理を改善する。
  • SNN、LSTM、GCNブランチからの特徴をラテントフェージュネーションにより統合し、正確なバウンディングボックス予測を生成する。
  • Squeeze-and-Excitation(SE)モジュールを統合し、チャネルごとの重要度に基づいて特徴マップを再キャリブレーションすることで、表現学習を強化する。
  • トレーニング中にオンラインハード例マイニング(OHEM)を適用し、誤分類や追跡が難しいサンプルに焦点を当てることで、一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1外観、時間的、グラフィカルモデリングの各モジュールが、空中画像におけるマルチオブジェクト追跡に個別および統合的にどのように寄与するか?
  • RQ2Squeeze-and-Excitation(SE)層は、空中追跡における回帰ベースのMOTモデルの性能にどのような影響を与えるか?
  • RQ3オンラインハード例マイニング(OHEM)は、複雑な空中シーンにおけるAerialMPTNetの耐性と精度にどのように影響するか?
  • RQ4L1損失とHuber損失のどちらが、空中MOTにおいてより優れた追跡性能をもたらし、どのような条件下で優位か?
  • RQ5AerialMPTNetは、空中MOTベンチマークにおいて、最先端の従来手法および深層学習ベースの手法と比較してどのように差をつけるか?

主な発見

  • AerialMPTNetは、KIT AISおよびAerialMPT歩行者データセットの両方で最高のMOTAを達成し、前回の最良手法であるSMSOT-CNNよりもそれぞれ16.2および23.4パーセンテージポイント高い。
  • KIT AISおよびAerialMPTデータセットでは、AerialMPTNetは歩行者を5.9%および4.6%多く追跡し、失敗率をそれぞれ5.2%および6.8%低減した。
  • LSTMおよびGCNモジュールは追跡性能を顕著に向上させ、LSTMは運動予測を改善し、GCNは空間モデリングにより隠蔽の処理を向上させる。
  • Squeeze-and-Excitation(SE)およびオンラインハード例マイニング(OHEM)は一部のシナリオでは性能を向上させるが、他のシナリオでは結果を劣化させるため、文脈依存的な有効性を示している。
  • L1損失は、MOTAおよびMOTPの観点から、ほとんどのシナリオでHuber損失を上回り、このタスクの好ましい損失関数である。
  • 車両追跡においては、AerialMPTNetは競争力のある結果を示したが、Stacked-DCFNetおよびCSRTはMOTAおよびMOTPでAerialMPTNetを上回り、CSRTは最高のMOTA51.1を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。