Skip to main content
QUICK REVIEW

[論文レビュー] Towards More Flexible and Accurate Object Tracking with Natural Language: Algorithms and Benchmark

Xiao Wang, Xiujun Shu|arXiv (Cornell University)|Mar 31, 2021
Video Surveillance and Tracking Methods参考文献 76被引用数 16
ひとこと要約

本稿では、2,000本の動画シーケンスを含み、対象物体の高密度な言語記述とバウンディングボックスアノテーションを備えた、自然言語誘導型オブジェクト追跡のための大規模ベンチマーク、TNL2Kを紹介する。本稿では、視覚的、言語的、歴史的ヒントを統合する、適応的ローカル・グローバル探索アルゴリズム(AdaSwitcher)を提案し、ベンチマーク上で最先端の性能を達成した。特に、BBoxと言語の両方を用いた追跡設定下で、スイープレートは0.370、精度は0.355を達成した。

ABSTRACT

Tracking by natural language specification is a new rising research topic that aims at locating the target object in the video sequence based on its language description. Compared with traditional bounding box (BBox) based tracking, this setting guides object tracking with high-level semantic information, addresses the ambiguity of BBox, and links local and global search organically together. Those benefits may bring more flexible, robust and accurate tracking performance in practical scenarios. However, existing natural language initialized trackers are developed and compared on benchmark datasets proposed for tracking-by-BBox, which can't reflect the true power of tracking-by-language. In this work, we propose a new benchmark specifically dedicated to the tracking-by-language, including a large scale dataset, strong and diverse baseline methods. Specifically, we collect 2k video sequences (contains a total of 1,244,340 frames, 663 words) and split 1300/700 for the train/testing respectively. We densely annotate one sentence in English and corresponding bounding boxes of the target object for each video. We also introduce two new challenges into TNL2K for the object tracking task, i.e., adversarial samples and modality switch. A strong baseline method based on an adaptive local-global-search scheme is proposed for future works to compare. We believe this benchmark will greatly boost related researches on natural language guided tracking.

研究の動機と目的

  • 従来のBBoxベースのオブジェクト追跡の限界、例えば初期化の曖昧さや外観変動への対処の悪さを是正すること。
  • 対象の初期化にバウンディングボックスの代わりに自然言語記述を活用することで、より柔軟で正確な追跡を可能にすること。
  • 言語誘導型追跡のための専用ベンチマークを確立すること。既存のベンチマークは言語誘導型追跡の性能評価に不適切である。
  • 視覚的、言語的、歴史的ヒントを用いて、ローカルおよびグローバル探索戦略を統合する、柔軟で適応可能なベースライン手法を提供すること。
  • 敵対的サンプル、モダリティスイッチ(RGB/赤外)および外観変動といった困難な条件下での追跡の頑健性を評価すること。

提案手法

  • 2,000本の動画シーケンス(学習用1,300本、テスト用700本)を含む、新しいベンチマークTNL2Kを提案。各シーケンスは、1つの英語文と、対象オブジェクトの高密度なバウンディングボックスアノテーションで構成される。
  • 信頼度スコアと視覚的グランドイングの質に基づき、動的にローカル探索とグローバル探索の間を切り替える、適応的ローカル・グローバル探索メカニズム(AdaSwitcher)を設計。
  • 複数の入力モダリティを統合:特徴マップからの視覚的特徴、言語埋め込み、予測されたバウンディングボックス、異常検出用の残差画像。
  • AdaSwitcherでフレームレベルのアテンションを採用し、追跡シーケンス内の各フレームの重要性を重みづけ、外観変化に対する頑健性を向上。
  • 視覚的グランドイングにおいて空間座標を重要な構成要素として採用し、アブレーションスタディにより、追跡精度の顕著な向上が示された。
  • 応答スコアに基づき、ローカル探索モードとグローバル探索モードの切り替えを判断する、しきい値ベースのスイッチング機構を適用(最適値は0.7)。

実験結果

リサーチクエスチョン

  • RQ1自然言語記述を用いることで、従来のBBox初期化と比較して、追跡の正確性と柔軟性が向上するか?
  • RQ2言語的特徴と視覚的特徴を統合することで、外観変動や隠蔽に対する頑健性がどのように向上するか?
  • RQ3空間座標と歴史的情報が、視覚的グランドイングおよび追跡性能に与える影響は何か?
  • RQ4敵対的サンプルやモダリティスイッチが、言語誘導型設定下での追跡性能に与える影響は何か?
  • RQ5言語誘導型追跡に最適な適応的ローカル・グローバル探索メカニズムの構成は何か?

主な発見

  • AdaSwitcherベースラインは、BBoxと言語の両方を用いた追跡設定下で、スイープレート0.370、精度0.355を達成し、BBoxまたは言語のみを用いる手法を上回った。
  • 視覚的グランドイングに空間座標を組み込むことで、スイープレートは0.344から0.353に、精度は0.355から0.362に向上し、その重要性が明確になった。
  • 予測されたバウンディングボックスや残差画像特徴を除去すると、性能が0.01~0.015低下し、故障検出と安定性への寄与が示された。
  • AdaSwitcherの最適スイッチしきい値は0.7であり、これにより最高のスイープレート(0.370)と精度(0.355)が達成された。
  • SiamRCNNは、敵対的サンプルや完全な隠蔽といった困難な属性に対して最も優れた性能を示した。一方、攻撃に特化したRTAAは敵対的サンプルに対して性能が悪く、障害検出の重要性が浮き彫りになった。
  • アブレーションスタディにより、すべての構成要素(BBox、スコア、ResImg、ResMap、言語)が追跡の頑健性に顕著な貢献をしていることが確認され、フルモデルが最高の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。