[論文レビュー] GlobalTrack: A Simple and Strong Baseline for Long-term Tracking
GlobalTrackは、時間的整合性の仮定に依存しない純粋なグローバルインスタンス検索に基づく、シンプルでありながら強力な長期視覚追跡フレームワークを提案する。クエリガイドドの2段階検出器(QG-RPNおよびQG-RCNN)とクロスクエリ損失を活用することで、オンライン学習、トラジェクトリーファイニング、スケールスムージングを一切用いずに、4つの主要ベンチマークで最先端の性能を達成した。これは、一時的なターゲット不在後でもロバスト性を維持する。
A key capability of a long-term tracker is to search for targets in very large areas (typically the entire image) to handle possible target absences or tracking failures. However, currently there is a lack of such a strong baseline for global instance search. In this work, we aim to bridge this gap. Specifically, we propose GlobalTrack, a pure global instance search based tracker that makes no assumption on the temporal consistency of the target's positions and scales. GlobalTrack is developed based on two-stage object detectors, and it is able to perform full-image and multi-scale search of arbitrary instances with only a single query as the guide. We further propose a cross-query loss to improve the robustness of our approach against distractors. With no online learning, no punishment on position or scale changes, no scale smoothing and no trajectory refinement, our pure global instance search based tracker achieves comparable, sometimes much better performance on four large-scale tracking benchmarks (i.e., 52.1% AUC on LaSOT, 63.8% success rate on TLP, 60.3% MaxGM on OxUvA and 75.4% normalized precision on TrackingNet), compared to state-of-the-art approaches that typically require complex post-processing. More importantly, our tracker runs without cumulative errors, i.e., any type of temporary tracking failures will not affect its performance on future frames, making it ideal for long-term tracking. We hope this work will be a strong baseline for long-term tracking and will stimulate future works in this area. Code is available at https://github.com/huanglianghua/GlobalTrack.
研究の動機と目的
- ターゲット不在や急激な運動に対処できる、長期視覚追跡のための強力でシンプルなベースラインの欠如に対処すること。
- 大多数の既存のトラッカーが制限を受ける時間的整合性仮定に依存しないこと。
- オンライン適応や後処理を一切用いずに、1つのクエリフレームのみを用いて、フル画像のマルチスケール検索を実行するトラッカーを開発すること。
- 新規のクロスクエリ損失機構により、干渉要因に対するロバスト性を向上させること。
- 累積誤差を回避することで、一時的な追跡失敗によって性能が低下しないトラッカーを構築すること。
提案手法
- Faster R-CNNの2段階オブジェクト検出を基盤とし、クエリガイドドモジュール(QG-RPNとQG-RCNN)を導入することで、提案領域の生成と分類・回帰を実現する。
- バックボーンおよびROIレベルの特徴マップにおいて、クエリと検索の相関を符号化することで、検出をクエリ固有のインスタンスに導く。
- 複数のクエリを同じ画像上で平均化するクロスクエリ損失を用い、インスタンスレベルの干渉要因に対するロバスト性を向上させる。
- 推論では、最初のフレームをクエリとして用い、各フレームでフル画像を独立して検索し、トップ1予測を選択する。
- 追加の正則化やトラジェクトリーの最適化を用いずに、標準のFaster R-CNN分類および局所化損失を訓練時に使用する。
- OxUvAベンチマークで、トップ1スコアのしきい値(τ=0.84)による存在/不在予測メカニズムを導入する。
実験結果
リサーチクエスチョン
- RQ1時間的整合性仮定に依存する既存手法と比較して、純粋なグローバルインスタンス検索に基づくトラッカーが長期追跡で優れた性能を発揮できるか?
- RQ2オンライン学習を一切行わないシンプルなトラッカーは、頻繁なターゲット不在や急激な運動を伴う長時間動画で、どのように性能を発揮するか?
- RQ3クロスクエリ損失が、視覚追跡における干渉要因へのロバスト性をどの程度向上できるか?
- RQ4フル画像検索により累積誤差を排除することで、より信頼性の高い長期追跡性能が得られるか?
- RQ5トラジェクトリーの最適化やスケールスムージングを一切行わない最小限のエンドツーエンドフレームワークが、複数のベンチマークで最先端の結果を達成できるか?
主な発見
- LaSOTでは52.1%のAUCを達成し、ATOM(64.8%の精度)とSiamRPN++(69.4%の精度)を上回り、それぞれ2.2%と3.6%の絶対的精度向上を達成した。
- 非常に長いTLPベンチマーク(平均13,529フレーム)では、63.8%の成功率を達成し、次に優れた手法SPLTと比較して約11.1%の絶対的向上を示した。
- OxUvAでは、テストセットで60.3%のMaxGM、開発セットで63.9%のMaxGMを達成し、SiamFC+Rと比較してそれぞれ14.9%、24.2%の向上を示した。
- TrackingNetでは、75.4%の正規化精度と70.4%の成功率を達成し、SiamRPN++(73.3%の成功率)やATOM(70.3%の成功率)といったトップレベルの手法と同等の性能を示した。
- 約400フレームのターゲット不在が発生する長期追跡失敗ケースにおいて、ターゲットが再出現すると直ちに再検出でき、高いIoUを維持したが、すべてのベースラインは失敗した。
- トップ1スコアのしきい値(τ=0.84)による不在予測モジュールにより、ターゲットの存在/不在を正確に検出でき、OxUvAでの高いMaxGMスコアに貢献した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。