Skip to main content
QUICK REVIEW

[論文レビュー] ProContEXT: Exploring Progressive Context Transformer for Tracking

Jin-Peng Lan, Zhi-Qi Cheng|arXiv (Cornell University)|Oct 27, 2022
Video Surveillance and Tracking Methods被引用数 6
ひとこと要約

ProContEXTは、マルチスケールの静的および動的テンプレートを用いて空間的・時間的文脈を段階的に符号化する、トランスフォーマーに基づく新しい視覚オブジェクトトラッカーを提案する。文脈に配慮した自己注意機構と適応的トークン削除により強化され、GOT-10kおよびTrackingNetで最先端の性能を達成し、86.8% AOおよび96.8% SR@0.5の精度を実現するとともに、54.3 FPSの推論速度を達成した。

ABSTRACT

Existing Visual Object Tracking (VOT) only takes the target area in the first frame as a template. This causes tracking to inevitably fail in fast-changing and crowded scenes, as it cannot account for changes in object appearance between frames. To this end, we revamped the tracking framework with Progressive Context Encoding Transformer Tracker (ProContEXT), which coherently exploits spatial and temporal contexts to predict object motion trajectories. Specifically, ProContEXT leverages a context-aware self-attention module to encode the spatial and temporal context, refining and updating the multi-scale static and dynamic templates to progressively perform accurately tracking. It explores the complementary between spatial and temporal context, raising a new pathway to multi-context modeling for transformer-based trackers. In addition, ProContEXT revised the token pruning technique to reduce computational complexity. Extensive experiments on popular benchmark datasets such as GOT-10k and TrackingNet demonstrate that the proposed ProContEXT achieves state-of-the-art performance.

研究の動機と目的

  • 最初のフレームからの単一の静的テンプレートに依存する従来の視覚オブジェクトトラッカーの限界、特に急激に変化するおよび混雑したシーンにおける性能を改善すること。
  • 外観の変化や隠蔽によるトラッキング性能の低下を、空間的および時間的文脈の統合によって克服すること。
  • 変化するオブジェクト外観をモデル化するため、マルチスケールの静的および動的テンプレートを活用したリアルタイムで効率的なトラッキングフレームワークの開発。
  • トランスフォーマーバックボーンにおける見直されたトークン削除戦略により、計算効率を向上させつつ精度を損なわないこと。
  • トランスフォーマーに基づくトラッキングにおける文脈に配慮した段階的特徴符号化の新しいパラダイムを確立し、古典的な文脈トラッキングと文脈フリーな手法の橋渡しをすること。

提案手法

  • 初期フレームからの静的テンプレートと、過去のトラッキング結果から更新される動的テンプレートを用いたデュアルテンプレート機構を導入し、外観の変化をモデル化する。
  • マルチスケールのテンプレートおよびサーチ領域における空間的・時間的文脈を統合的に符号化する文脈に配慮した自己注意モジュールを採用する。
  • すべてのテンプレートおよびサーチ領域をリスケーリングモジュールで再形状し、その後、パッチ埋め込みと位置符号化を実行してViT風の入力を得る。
  • 注意マップのスパarsityに基づいて動的に調整される保持率$\rho$を用いたトークン削除技術を適用し、FLOPsを削減しながら重要な特徴を保持する。
  • バウンディングボックスを予測し、フレーム間で段階的な最適化ループを通じて動的テンプレートを更新するトラッキングヘッドを用いる。
  • 大規模ベンチマークでの特徴表現の質の向上と一般化性能の向上を図るため、MAE事前学習を採用する。

実験結果

リサーチクエスチョン

  • RQ1空間的および時間的文脈の段階的符号化は、急激に変化するおよび混雑した動画シーケンスにおけるトラッキングのロバスト性を向上させることができるか?
  • RQ2マルチスケールの静的および動的テンプレートの統合は、単一テンプレートベースラインと比較して、トラッキング精度にどのような影響を与えるか?
  • RQ3文脈に配慮した自己注意機構は、トランスフォーマーに基づくトラッカーにおける特徴表現をどの程度向上させるか?
  • RQ4リアルタイムトラッキングにおいてトークン削除を適用する際の、計算効率とトラッキング精度の最適なトレードオフは何か?
  • RQ5段階的文脈符号化を統合した統合フレームワークは、追加のブランチや複雑なモジュールを追加せずに、既存のSOTA手法を上回ることができるか?

主な発見

  • MAE事前学習を用いたProContEXTは、GOT-10kで86.8% AOおよび96.8% SR@0.5を達成し、以前のSOTA手法OStrackをAOで0.9%、SR@0.5で1.5%、SR@0.75で2.1%上回った。
  • 動的テンプレートの導入により、静的テンプレートのみのケースと比較してAOが1.2%向上し、SR@0.5が1.4%向上した。これは時間的文脈の価値を示している。
  • 複数の静的テンプレート(例:スケール[2.0, 4.0])の使用により、AOが+1.7%、SR@0.5が+2.2%向上した。これは空間的文脈モデリングの有効性を確認している。
  • アブレーションスタディの結果、トークン削除における保持率$\rho = 0.7$を採用することで、GFLOPsが16.5%削減(38.0 GFLOPsに)され、AOが1.1%向上し、SR@0.5が1.3%向上した。
  • ProContEXTは、標準的なハードウェア上でも54.3 FPSの推論速度を達成し、拡張された文脈モデリングにもかかわらずリアルタイム性能を実現した。
  • TrackingNetにおいても、SOTA手法と比較して優れた性能を示し、一般化性能とスケーラビリティの高さを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。