Skip to main content
QUICK REVIEW

[論文レビュー] COMET: Context-Aware IoU-Guided Network for Small Object Tracking

Seyed Mojtaba Marvasti-Zadeh, Javad Khaghani|arXiv (Cornell University)|Jun 4, 2020
Video Surveillance and Tracking Methods参考文献 58被引用数 4
ひとこと要約

COMETは、中高度から高高度の航空動画における小規模オブジェクト追跡のための文脈に配慮したIoU誘導型二重ストリームトラッカーを提案する。オフラインでのプロポーザル生成戦略を用いて文脈学習を強化し、マルチスケール特徴とアテンションモジュールを備えたマルチタスクネットワークにより、遮蔽や視点変化に対する耐性を向上させ、UAVDT、VisDrone-2019、Small-90ベンチマークでATOMに比べて平均精度が6.2%向上、成功スコアが7%向上を達成した。

ABSTRACT

We consider the problem of tracking an unknown small target from aerial videos of medium to high altitudes. This is a challenging problem, which is even more pronounced in unavoidable scenarios of drastic camera motion and high density. To address this problem, we introduce a context-aware IoU-guided tracker (COMET) that exploits a multitask two-stream network and an offline reference proposal generation strategy. The proposed network fully exploits target-related information by multi-scale feature learning and attention modules. The proposed strategy introduces an efficient sampling strategy to generalize the network on the target and its parts without imposing extra computational complexity during online tracking. These strategies contribute considerably in handling significant occlusions and viewpoint changes. Empirically, COMET outperforms the state-of-the-arts in a range of aerial view datasets that focusing on tracking small objects. Specifically, COMET outperforms the celebrated ATOM tracker by an average margin of 6.2% (and 7%) in precision (and success) score on challenging benchmarks of UAVDT, VisDrone-2019, and Small-90.

研究の動機と目的

  • ターゲットが数ピクセルにしか占めない高高度航空動画における小規模オブジェクト追跡の課題に対処すること。
  • 不足したターゲット表現と文脈モデリングの欠如により、既存のトラッカーが小規模オブジェクト追跡に失敗するという制限を克服すること。
  • 密集した広視野の航空シーンにおける大規模な遮蔽、視点変化、背景のごみに対して耐性を高めること。
  • オンライン計算を増加させずに、複雑な文脈学習をオフライン学習に移譲することで、効率的なオンライン推論メカニズムを構築すること。
  • 顕著なターゲット部分に焦点を当てたマルチスケール特徴集約とアテンション機構により、特徴表現を強化すること。

提案手法

  • トレーニング中に参照フレームから高品質なプロポーザルを抽出するオフラインリファレンスプロポーザル生成戦略を導入し、文脈およびターゲット部分表現を強化する。
  • 外観と動きの特徴を別々に処理する二重ストリームマルチタスクネットワークを採用し、融合後に局所化精度を向上させる。
  • 異なる受容野をカバーする空間的および意味的表現を捉えるためにマルチスケール特徴集約を適用する。
  • 関連する特徴を強調し、背景の干渉要因を抑制するために軽量な空間的およびチャネルアテンションモジュールを統合する。
  • 交差領域(IoU)と正規化中心位置誤差(CLE)を組み合わせたマルチタスク損失関数を最適化し、境界ボックス回帰の精度と耐性を向上させる。
  • 予測されたIoUとCLEを用いてリアルタイムで境界ボックス予測を精緻化し、動きや外観変化に動的に適応可能にする。

実験結果

リサーチクエスチョン

  • RQ1オンライン推論コストを増加させずに、オフラインプロポーザル生成が小規模オブジェクト追跡性能を向上させることができるか?
  • RQ2アテンションとマルチスケール特徴を備えたマルチタスク二重ストリームネットワークは、航空追跡における遮蔽および視点変化に対処するためにどれほど有効か?
  • RQ3IoU誘導型回帰は、高高度動画における極小ターゲットの局所化精度をどの程度向上させるか?
  • RQ4COMETは、遮蔽、アスペクト比変化、照明変動といった多様な属性に対して、最先端のトラッカーと比較してどの程度の性能を示すか?
  • RQ5ターゲット部分と周囲領域からの文脈に配慮した学習は、複雑な航空追跡シナリオにおける一般化性能を顕著に向上させることができるか?

主な発見

  • COMETはUAVDT、VisDrone-2019、Small-90ベンチマークでATOMに比べて平均精度が6.2%向上、成功スコアが7%向上した。
  • VisDrone-2019データセットでは、AUCスコアが64.5を達成し、ATOM(57.1)とDiMP-50(60.8)をすべての属性で上回った。
  • DiMP-50と比較して、小規模オブジェクト属性では最大9.5%、視点変化属性では4.4%の向上を達成した。
  • 遮蔽関連属性(FOC、POC、LO)では、SiamMaskに比べ12.1%の改善を示し、部分的および完全な遮蔽に対しても強い耐性を示した。
  • 長期追跡属性では、ATOMに比べ4.3%の向上を示し、長時間視界外となった後も再識別および追跡持続性に優れた性能を示した。
  • 定性的な結果では、COMETは顕著なアスペクト比変化や複雑な背景のごみに対しても追跡精度を維持しており、SiamRPN++およびSiamMaskを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。