Skip to main content
QUICK REVIEW

[論文レビュー] Context-aware Visual Tracking with Joint Meta-updating

Qiuhong Shen, Xin Li|arXiv (Cornell University)|Apr 4, 2022
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

本稿では、文脈集約モジュールとアフィニティベクトルを用いてグローバルおよびローカル特徴の補完性を活用することで、表現空間において局所化とボックス推定ブランチの両方を共同でメタアップデートする文脈に配慮した視覚追跡フレームワークを提案する。この手法は、40 FPSでVOT2018でEAOスコア0.514を達成し、ベースライントラッカーを著しく上回る性能を発揮するとともに、勾配ベースのメタラーニングにより過学習を軽減する。

ABSTRACT

Visual object tracking acts as a pivotal component in various emerging video applications. Despite the numerous developments in visual tracking, existing deep trackers are still likely to fail when tracking against objects with dramatic variation. These deep trackers usually do not perform online update or update single sub-branch of the tracking model, for which they cannot adapt to the appearance variation of objects. Efficient updating methods are therefore crucial for tracking while previous meta-updater optimizes trackers directly over parameter space, which is prone to over-fit even collapse on longer sequences. To address these issues, we propose a context-aware tracking model to optimize the tracker over the representation space, which jointly meta-update both branches by exploiting information along the whole sequence, such that it can avoid the over-fitting problem. First, we note that the embedded features of the localization branch and the box-estimation branch, focusing on the local and global information of the target, are effective complements to each other. Based on this insight, we devise a context-aggregation module to fuse information in historical frames, followed by a context-aware module to learn affinity vectors for both branches of the tracker. Besides, we develop a dedicated meta-learning scheme, on account of fast and stable updating with limited training samples. The proposed tracking method achieves an EAO score of 0.514 on VOT2018 with the speed of 40FPS, demonstrating its capability of improving the accuracy and robustness of the underlying tracker with little speed drop.

研究の動機と目的

  • 単一ブランチのオンラインアップデートや固定されたオフラインテンプレートによる制限により、顔貌の変化が著しい状況で失敗する既存のディーブトラッカーの課題に対処すること。
  • 長期間のシーケンスにおける過学習を回避するため、パrameter空間のメタアップデートから表現空間への最適化の移行を図ることで、シーケンス全体の文脈を活用すること。
  • 補完的なローカルおよびグローバル特徴を用いて、局所化とボックス推定ブランチの両方を共同でアップデートすることで、追跡性能を向上させること。
  • 限られたトレーニングサンプルで動作する専用のメタ初期化スキームを用いて、安定的で高速なオンライン適応メカニズムを開発すること。
  • 顕著な速度低下を伴わずに、長期間の追跡シーケンスにおけるロバスト性と精度を向上させること。

提案手法

  • 歴史的なフレーム特徴を統合することで、トラッカーの両ブランチの表現を豊かにする文脈集約モジュールを導入する。
  • タスク固有のアフィニティベクトルを学習することで、局所化ブランチと回帰ブランチの両方の共同適応を支援する文脈に配慮したモジュールを設計する。
  • 勾配ベースのメタラーニングスキームを採用して、共同アップデータの初期化とアップデートを実施し、少数のサンプルで高速かつ安定した適応を実現する。
  • パrameter空間ではなく表現空間でトラッカーを最適化することで、長期間のシーケンスにおける過学習リスクを低減する。
  • 分類(ローカル特徴)とボックス境界回帰(グローバル特徴)のための別々のブランチを持つシアンズネットワークアーキテクチャを採用し、アフィニティベクトルを介したブランチ間アテンションで強化する。
  • 未学習の追跡シーケンスにおける一般化性能の向上と初期適応の安定化を図るため、共同アップデータに対してメタ初期化を適用する。

実験結果

リサーチクエスチョン

  • RQ1局所化とボックス推定ブランチの共同メタアップデートが、顔貌の変化が著しい状況下での追跡のロバスト性を向上させることができるか?
  • RQ2パrameter空間ではなく表現空間で最適化することで、長期間の追跡における過学習が軽減されるか?
  • RQ3補完的なローカルおよびグローバル特徴を効果的に統合することで、トラッカーの適応性が向上するか?
  • RQ4メタ初期化スキームが、データが少ない環境下でのオンライン適応の安定性と速度をどのように向上させるか?
  • RQ5提案手法が、多様なベンチマークで最先端のトラッカーをどの程度上回るか?

主な発見

  • 提案手法は、VOT2018でEAOスコア0.514を達成し、DiMPベースラインと比較して相対的に16.8%の向上を示した。
  • LaSOTではAUCスコア0.573を達成し、成功、精度、正規化精度の各指標で、比較したすべての最先端トラッカーを上回った。
  • アブレーションスタディの結果、両ブランチの共同アップデートによりVOT2018でEAO0.506が達成され、単一ブランチアップデート(0.455~0.473)を著しく上回った。
  • メタ初期化の導入により、OTB100ではAUCスコアが0.697に上昇し、VOT2018ではEAOが0.514に上昇し、その安定化効果が裏付けられた。
  • 40 FPSの推論速度を維持しており、強化された適応能力にもかかわらず、性能の低下が最小限に抑えられ、高い効率性を示した。
  • アフィニティベクトルを備えた文脈に配慮したモジュールは、顔貌の変化が著しい状況でも、局所化の正確性とボックス推定の両方を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。