[論文レビュー] EgoTracks: A Long-term Egocentric Visual Object Tracking Dataset
EgoTracksは、Ego4Dベンチマークから得た最初の大規模で長期的なエゴセントリックな視覚的オブジェクト追跡データセットを紹介し、第一人称動画における再検出、隠蔽、スケール変動といった重要な課題に対処する。本論文では、スケール拡張と改良されたサーチ領域設計を施したSTARKトラッカーの変種、EgoSTARKを提案し、EgoTracks上でAOに10%の向上、Fスコアに8%以上の向上を達成し、エゴセントリックデータにおける標準的なトラッカーを著しく上回る性能を発揮した。
Visual object tracking is a key component to many egocentric vision problems. However, the full spectrum of challenges of egocentric tracking faced by an embodied AI is underrepresented in many existing datasets; these tend to focus on relatively short, third-person videos. Egocentric video has several distinguishing characteristics from those commonly found in past datasets: frequent large camera motions and hand interactions with objects commonly lead to occlusions or objects exiting the frame, and object appearance can change rapidly due to widely different points of view, scale, or object states. Embodied tracking is also naturally long-term, and being able to consistently (re-)associate objects to their appearances and disappearances over as long as a lifetime is critical. Previous datasets under-emphasize this re-detection problem, and their "framed" nature has led to adoption of various spatiotemporal priors that we find do not necessarily generalize to egocentric video. We thus introduce EgoTracks, a new dataset for long-term egocentric visual object tracking. Sourced from the Ego4D dataset, this new dataset presents a significant challenge to recent state-of-the-art single-object tracking models, which we find score poorly on traditional tracking metrics for our new dataset, compared to popular benchmarks. We further show improvements that can be made to a STARK tracker to significantly increase its performance on egocentric data, resulting in a baseline model we call EgoSTARK. We publicly release our annotations and benchmark, hoping our dataset leads to further advancements in tracking.
研究の動機と目的
- 頻繁な隠蔽、再出現、視点変化といった現実世界の課題を反映する大規模で長期的なエゴセントリックな視覚的オブジェクト追跡データセットが不足しているという問題に対処する。
- 短期間トラッキングの最先端技術が、エゴセントリック動画ではなぜ失敗するのかを特定する。その理由は、エゴセントリックのダイナミクスに一般化できない、空間的・時間的事前知識に依存しているためである。
- スケール変動や長期的な再検出に対応できるように、トレーニングおよび推論戦略を調整した、エゴセントリック追跡に特化した堅牢なベースラインモデル、EgoSTARKを開発する。
- アノテーション、ベンチマーク、および計画中のコンテストの公開を通じて、今後の研究を促進する。
提案手法
- 日常的な活動を記録した非脚本的で現実世界のエゴセントリック動画からなる大規模なデータセット、Ego4Dから動画を取得する。
- 5,708本の動画にわたり、平均6分間の長さで22,028個のオブジェクトトラックをアノテートし、長期的追跡、再検出、隠蔽イベントに特に注目する。
- トレーニング中にスケール拡張を導入し、検索画像をランダムに$ s ∈ [0.5, 1.5] $の割合でリサイズすることで、急激なスケール変化に対する耐性を向上させる。
- サーチ領域比(SRR)と検索画像サイズ(SIS)を最適化し、より大きなサーチ領域が再検出性能を顕著に向上させることを確認する。
- 固定テンプレートサイズ$ 128 \times 128 $を採用し、コンテキスト比(CR)の影響を評価。Fスコアの結果に基づき、CR = 2を最適と判断する。
- EgoSTARKでマルチテンプレート統合戦略を提案・評価し、よりグローバルでビュー変動に強いオブジェクト表現を学習することで、追跡の耐性を向上させる。

実験結果
リサーチクエスチョン
- RQ1最先端の単一オブジェクトトラッカーは、従来のベンチマークでは優れた性能を示すが、なぜエゴセントリック動画では著しく性能が低いのか?
- RQ2空間的・時間的事前知識(例:徐々に変化する運動、一貫したスケール)は、エゴセントリック追跡のシナリオにどの程度一般化できないのか?
- RQ3トレーニングおよび推論戦略をどのように調整すれば、エゴセントリック動画における大規模な視点変化や隠蔽に対しても再検出性能と耐性を向上させられるか?
- RQ4スケール拡張と拡大されたサーチ領域は、長期的なエゴセントリック追跡におけるトラッカー性能にどのような影響を及ぼすのか?
- RQ5マルチテンプレート統合により、エゴセントリック環境下でよりグローバルでビュー変動に強いオブジェクト表現を学習できるようになることで、長期的追跡性能が向上するのか?
主な発見
- 最先端のトラッカー、包括的にSOTAモデルでさえも、EgoTracksでは従来のベンチマークよりも著しく低いスコアを記録しており、エゴセントリック固有の課題に起因する大きな性能ギャップが存在することが示された。
- トレーニング時にスケール拡張を導入することで、STARKのAOがほぼ10%向上し、Fスコアも8%以上向上した。これは、スケール変動がエゴセントリック追跡失敗の主要因であることを裏付けた。
- SRRおよびSISによるより大きなサーチ領域サイズは、コンテキスト比よりもFスコアに大きな影響を与えることが確認され、再検出には広い空間的探索能力が不可欠であることが示された。
- コンテキスト比は性能に混合効果を及ぼすため、一般的な実装としてCR = 2を安定したベースラインとして採用した。
- EgoSTARKにおけるマルチテンプレート統合は、測定可能な性能向上をもたらし、グローバルでビュー変動に強い表現がエゴセントリック追跡に有益であることを示唆した。
- 提案されたEgoSTARKベースラインは、EgoTracks上での標準STARKを著しく上回り、長期的エゴセントリック追跡の新しいベンチマークを確立した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。