[論文レビュー] VastTrack: Vast Category Visual Object Tracking
VastTrackは、2,115のオブジェクトカテゴリと50,610の動画シーケンスを備えた大規模な視覚的オブジェクト追跡ベンチマークを導入し、既存のデータセットの範囲を顕著に拡大した。豊富なアノテーション(バウンディングボックスと言語的記述を含む)により、汎用トラッカーのトレーニングと評価を可能にし、現在のトラッカーがこの多様で大規模なベンチマークで性能を発揮しないことから、視覚的追跡における一般化性能の向上の必要性が浮き彫りになった。
In this paper, we introduce a novel benchmark, dubbed VastTrack, towards facilitating the development of more general visual tracking via encompassing abundant classes and videos. VastTrack possesses several attractive properties: (1) Vast Object Category. In particular, it covers target objects from 2,115 classes, largely surpassing object categories of existing popular benchmarks (e.g., GOT-10k with 563 classes and LaSOT with 70 categories). With such vast object classes, we expect to learn more general object tracking. (2) Larger scale. Compared with current benchmarks, VastTrack offers 50,610 sequences with 4.2 million frames, which makes it to date the largest benchmark regarding the number of videos, and thus could benefit training even more powerful visual trackers in the deep learning era. (3) Rich Annotation. Besides conventional bounding box annotations, VastTrack also provides linguistic descriptions for the videos. The rich annotations of VastTrack enables development of both the vision-only and the vision-language tracking. To ensure precise annotation, all videos are manually labeled with multiple rounds of careful inspection and refinement. To understand performance of existing trackers and to provide baselines for future comparison, we extensively assess 25 representative trackers. The results, not surprisingly, show significant drops compared to those on current datasets due to lack of abundant categories and videos from diverse scenarios for training, and more efforts are required to improve general tracking. Our VastTrack and all the evaluation results will be made publicly available https://github.com/HengLan/VastTrack.
研究の動機と目的
- 既存の視覚的トラッカーの一般化性能が、オブジェクトカテゴリとトレーニングシーケンスの多様性に不足していることによる制限を是正すること。
- 動画に言語的記述を含めることで、視覚のみならず視覚言語トラッキングをサポートするベンチマークを構築すること。
- 従来のデータセットよりもはるかに広範なオブジェクトカテゴリをカバーすることで、一般追跡性能のより忠実な評価を可能にすること。
- 大規模モデルの時代にふさわしい、スケーラブルで高品質なデータセットを提供し、頑健で一般化可能なディープラーニングベースのトラッカーのトレーニングを可能にすること。
- 多様で大規模なベンチマークで評価された際の現在のトラッカーの性能ギャップを特定することで、将来的な一般化に関する研究を促進すること。
提案手法
- VastTrackベンチマークは、多様な実世界のシナリオから抽出した50,610の動画シーケンスをキュレートすることで構築された。これにより2,115の異なるオブジェクトカテゴリをカバーした。
- すべての動画は、高品質なアノテーションを確保するための複数回の点検を経て、正確なバウンディングボックスで手動でアノテートされた。
- 視覚言語トラッキングを支援するため、各動画に言語的記述が追加され、マルチモーダル学習におけるデータセットの有用性が向上した。
- 平均83フレームの短時間追跡を強調しているが、長期追跡研究に対しても適用可能である。
- 追跡の課題を特徴付けるために、オブジェクトの運動、サイズ変動、隣接フレーム間のIoUに関する包括的な統計がベンチマークに含まれている。
- 精度、正規化精度、成功度の指標を用いて、10の属性で25の最先端トラッカーを評価するための評価プロトコルが確立された。
実験結果
リサーチクエスチョン
- RQ1現在の標準よりもはるかに多くのオブジェクトカテゴリとシーケンスを含むベンチマークで評価された際、既存の視覚的トラッカーの性能はどの程度低下するか?
- RQ2視覚言語アノテーションは、多様で現実世界の動画シーケンスにおいて、視覚的追跡モデルのロバスト性と一般化性能をどの程度向上させるか?
- RQ32,115のオブジェクトカテゴリと50K以上のシーケンスを有するデータセットでテストした際、従来の小さなベンチマークと比較して、追跡における主要な課題は何か?
- RQ4レアなオブジェクトカテゴリ(主なベンチマークで以前に未確認)はトラッカーの性能にどのように影響するか。また、それらの難易度に影響を与える要因は何か?
- RQ5大規模な追跡ベンチマークに言語的記述を組み込むことで、よりロバストで一般化可能な追跡モデルが得られるか?
主な発見
- 現在の最先端トラッカーは、既存のベンチマークと比較してVastTrackで顕著な性能低下を示しており、未確認のカテゴリや多様なシナリオへの一般化性能が低いことが示された。
- Aardwolfのようなレアクラスの平均成功度(SUC)は0.689であり、一部の一般的なクラス(たとえばActor:0.691)よりも高いことが判明し、難易度がカテゴリ頻度にのみ依存するわけではないことが示された。
- Air Hockey などのレアクラスでは性能が極めて低く(平均SUC = 0.052)、まれなまたは視覚的に複雑なオブジェクトへの一般化の難しさが浮き彫りになった。
- オブジェクトの運動、サイズ変動、フレーム間のIoUの急激な変化に富むデータセットの多様性が、追跡の難易度を高めていることが、高速移動や大規模なスケール変動の属性で低性能が観察されたことから裏付けられた。
- 言語的記述の組み込みにより、視覚言語追跡分野における新たな研究分野が開かれたが、現在のモデルはこの豊富なアノテーションが施されたベンチマークで限定的な性能にとどまっている。
- 50,610のシーケンスと2,115のカテゴリを有するベンチマークの規模は、GOT-10k(563カテゴリ) や TrackingNet(27カテゴリ)といった既存のデータセットを大きく上回り、現在知られている最大の視覚追跡ベンチマークとなった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。