Skip to main content
QUICK REVIEW

[論文レビュー] Siamese Keypoint Prediction Network for Visual Object Tracking

Qiang Li, Zekui Qin|arXiv (Cornell University)|Jun 7, 2020
Video Surveillance and Tracking Methods参考文献 57被引用数 11
ひとこと要約

本論文は、粗くから細かくに段階的に精度を向上させるために、次第にきつい監視を施すヒートマップヘッドのスタックを用いる、視覚的オブジェクト追跡のためのシアン・キーポイント予測ネットワーク、SiamKPNを提案する。緩い監視からきつい監視への段階的監視を適用することで、モデルは高い精度と、干渉要因や隠蔽に対するロバスト性を達成し、OTB-100、VOT2018、LaSOT、GOT-10kのすべてのSOTAシアン・トラッカーを上回る性能を発揮するとともに、リアルタイム速度(24 FPS)で動作する。

ABSTRACT

Visual object tracking aims to estimate the location of an arbitrary target in a video sequence given its initial bounding box. By utilizing offline feature learning, the siamese paradigm has recently been the leading framework for high performance tracking. However, current existing siamese trackers either heavily rely on complicated anchor-based detection networks or lack the ability to resist to distractors. In this paper, we propose the Siamese keypoint prediction network (SiamKPN) to address these challenges. Upon a Siamese backbone for feature embedding, SiamKPN benefits from a cascade heatmap strategy for coarse-to-fine prediction modeling. In particular, the strategy is implemented by sequentially shrinking the coverage of the label heatmap along the cascade to apply loose-to-strict intermediate supervisions. During inference, we find the predicted heatmaps of successive stages to be gradually concentrated to the target and reduced to the distractors. SiamKPN performs well against state-of-the-art trackers for visual object tracking on four benchmark datasets including OTB-100, VOT2018, LaSOT and GOT-10k, while running at real-time speed.

研究の動機と目的

  • 既存のシアン・トラッカーが複雑なアンカーベースの設計に大きく依存していることや、干渉要因を効果的に処理できないという限界を是正すること。
  • オンラインモデル更新を一切行わない状態で、構造化された監視を用いたエンドツーエンドのオフライン学習により、トラッキングのロバスト性と精度を向上させること。
  • アンカーフリーで、段階的な予測戦略を採用し、階層的なヒートマップ監視によって段階的にオブジェクトの局所化を精緻化する戦略を検討すること。
  • 高い性能を維持しつつ、隠蔽やスケール変動といった困難な条件を伴う多様なトラッキングベンチマークでリアルタイムの推論速度を達成すること。

提案手法

  • テンプレート領域とサーチ領域からの共有特徴を抽出するために、ResNet-50に基づくシアンバックボーンを採用する。
  • コンパクトなキーポイント予測(KPN)ヘッドのスタックを導入し、各ヘッドは標準的な畳み込みとディープワイズ相互相関を用いて応答マップを生成する。
  • ヒートマップ監視における可変性の縮小戦略を適用:初期段階では広がりのある(緩い)ラベルを使用し、段階を経るごとに、最終段階ではターゲットに局在化されたきついラベルへと段階的にタイトにする。
  • 複数段階にわたる監視を適用することで、局所化の正確性とロバスト性を同時に最適化するためのマルチタスク損失を訓練中に使用する。
  • バックボーンの複数のレイヤーからの特徴を活用し、スケールにわたる表現学習を豊かにする。
  • 推論時において、連続する段階からの予測ヒートマップは、次第にターゲットに集中し、干渉要因では抑制されるようになり、正確な局所化が可能になる。

実験結果

リサーチクエスチョン

  • RQ1段階的にきつい監視を施すヒートマップヘッドのスタックは、シアンベースの追跡において精度とロバスト性を向上させることができるか?
  • RQ2アンカーフリーなキーポイント予測戦略は、一般化性能と効率性の観点でアンカーベースの手法を上回ることができるか?
  • RQ3緩い監視からきつい監視への段階的監視は、段階を経てオブジェクトの局所化を効果的に精緻化できるか?
  • RQ4完全にオフライン学習されたシアンモデルは、オンライン更新を行うトラッカーと同等かそれ以上の性能を達成できるか、その程度はどの程度か?
  • RQ5本手法は、隠蔽、背景の雑多さ、スケール変動といった困難な条件下でも、どのように性能を発揮するか?

主な発見

  • SiamKPN-3sはOTB-100で成功率0.712、精度0.927を達成し、SiamRPN++より精度スコアで相対的に4.7%高い。
  • VOT2018ではEAOスコア0.440を達成し、SiamRPN++を上回り、オンライン学習を備えたATOMでさえも上回った。
  • GOT-10kでは、オンライン更新を行わないトラッカーの中で最高のSR_{0.75}(0.362)とAO(0.529)を記録し、SiamRPN++に対してそれぞれ10%および2.3%の相対的向上を達成した。
  • アブレーションスタディにより、可変性を段階的に縮小する戦略は、固定可変性と比較してOTB-100で成功率0.007、精度0.011の向上を確認した。
  • SiamKPN-3sはVOT2018で24 FPSで動作し、マルチステージの精緻化にもかかわらずリアルタイム推論能力を示した。
  • SiamKPNの一ステージ版は、すでにSiamRPN++と同等の性能を達成しており、強力なベースライン能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。