Skip to main content
QUICK REVIEW

[論文レビュー] SiamMan: Siamese Motion-aware Network for Visual Tracking

Wenzhang Zhou, Longyin Wen|arXiv (Cornell University)|Dec 11, 2019
Video Surveillance and Tracking Methods参考文献 39被引用数 9
ひとこと要約

SiamManは、アノテーションボックスへの依存を軽減し、運動の変化や遮蔽に強いローカライゼーションブランチを統合した、視覚追跡のためのシアンプス運動感知ネットワークを提案する。グローバルコンテキストモジュールとマルチスケール学習可能アテンションを組み合わせることで、4つのベンチマークで最先端の性能を達成し、45 FPSの推論速度を実現した。

ABSTRACT

In this paper, we present a novel siamese motion-aware network (SiamMan) for visual tracking, which consists of the siamese feature extraction subnetwork, followed by the classification, regression, and localization branches in parallel. The classification branch is used to distinguish the foreground from background, and the regression branch is adopt to regress the bounding box of target. To reduce the impact of manually designed anchor boxes to adapt to different target motion patterns, we design the localization branch, which aims to coarsely localize the target to help the regression branch to generate accurate results. Meanwhile, we introduce the global context module into the localization branch to capture long-range dependency for more robustness in large displacement of target. In addition, we design a multi-scale learnable attention module to guide these three branches to exploit discriminative features for better performance. The whole network is trained offline in an end-to-end fashion with large-scale image pairs using the standard SGD algorithm with back-propagation. Extensive experiments on five challenging benchmarks, i.e., VOT2016, VOT2018, OTB100, UAV123 and LTB35, demonstrate that SiamMan achieves leading accuracy with high efficiency. Code can be found at https://isrc.iscas.ac.cn/gitlab/research/siamman.

研究の動機と目的

  • 高速な運動、遮蔽、スケール変化の下で、アノテーションボックスに基づく回帰の限界を解消すること。
  • 粗いターゲットローカライゼーションをガイドとして回帰を支援するローカライゼーションブランチを導入することで、手動で設計されたアノテーションボックスへの依存を低減すること。
  • ターゲットの大きな位置ずれに強い耐性を付けるために、ローカライゼーションブランチにグローバルコンテキストモジュールを統合し、長距離依存関係を捉えること。
  • 分類、回帰、ローカライゼーションブランチをすべてガイドするマルチスケール学習可能アテンションモジュールを設計し、複数スケールでの特徴の識別能を向上させること。
  • 大規模データセット(MS COCO、ImageNet、YouTube-BoundingBoxes)を用いたオフライン特徴学習で、SGDとバックプロパゲーションを用いてエンドツーエンドの学習を実現し、高い効率性とリアルタイム推論を維持しながら、複数のベンチマークで最先端の精度を達成すること。

提案手法

  • エクジンプレとサーチ領域ペアを共有バックボーンで処理するためのシアンプス特徴抽出サブネットワークを採用する。
  • 分類(前景/背景)、回帰(ボクセルボックス予測)、ローカライゼーション(粗いターゲットローカライゼーション)の3つの並列ブランチを導入する。
  • ローカライゼーションブランチにグローバルコンテキストモジュールを統合し、長距離空間的依存関係をモデル化することで、大きな位置ずれに対する耐性を向上させる。
  • 異なるスケールの特徴を動的に統合するマルチスケール学習可能アテンションモジュールを設計し、分類、回帰、ローカライゼーションブランチすべてを、識別的な表現へと導く。
  • 大規模データセット(MS COCO、ImageNet、YouTube-BoundingBoxes)を用いて、バックプロパゲーションを伴うSGDでエンドツーエンドの学習を実施し、オフライン特徴学習を実現する。
  • 推論時、1ショット検出を実行する。1フレーム目のボクセルボックスを唯一のエクジンプレとして使用し、オンラインモデル更新は行わない。

実験結果

リサーチクエスチョン

  • RQ1粗いターゲットローカライゼーションを実行するローカライゼーションブランチは、アノテーションボックスへの依存を軽減し、困難な運動パターン下での追跡精度を向上させることができるか?
  • RQ2グローバルコンテキストモジュールは、視覚追跡における大きなターゲット位置ずれに対する耐性を高めるのにどの程度効果的か?
  • RQ3マルチスケール学習可能アテンションモジュールは、多様な視覚追跡シナリオにおいて、特徴の識別能とトラッカー性能をどの程度向上させるか?
  • RQ4提案されたSiamManフレームワークは、複数の標準ベンチマークで最先端の性能を達成し、リアルタイム推論速度を維持できるか?
  • RQ5個々のモジュール(ローカライゼーション、グローバルコンテキスト、アテンション)は、全体の追跡性能にどの程度定量的に寄与しているか?

主な発見

  • VOT2016では、EAOスコアが0.513という新たな最先端を記録し、2位のトラッカー比で相対的に8.9%の向上を達成した。
  • VOT2018では、EAOが0.462を達成し、2位のトラッカー比で相対的に3.6%の向上を示し、困難な条件下でも優れた性能を発揮した。
  • アブレーションスタディの結果、ローカライゼーションブランチを削除すると、VOT2016でEAOが0.024低下し、VOT2018で0.017低下し、その重要性が確認された。
  • グローバルコンテキストモジュールを削除すると、VOT2016でEAOが0.009低下し、VOT2018で0.015低下し、その貢献が顕著であった。
  • マルチスケールアテンションモジュールを削除すると、VOT2016でEAOが0.019向上し、VOT2018で0.016向上し、特徴選択における有効性が示された。
  • UAV123では最先端の手法と同等の性能を発揮し、45 FPSのリアルタイム推論を維持しており、実用的導入の可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。