Skip to main content
QUICK REVIEW

[論文レビュー] Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New Baseline

Pengyu Zhang, Jie Zhao|arXiv (Cornell University)|Apr 8, 2022
Video Surveillance and Tracking Methods被引用数 9
ひとこと要約

本稿では、500本の高解像度(1920×1080)RGB-Tシーケンス(合計170万フレーム)を含む大規模な可視・赤外線UAV追跡ベンチマーク「VTUAV」を紹介する。このベンチマークは、短期追跡、長期追跡、インスタンスセグメンテーションをサポートする。また、画像、特徴、意思決定レベルの統合を含む階層的マルチモーダル統合トラッカー(HMFT)を提案し、複数のベンチマークで新たな最先端性能を達成した。特に長期追跡では、MSRが46.1%、MPRが53.6%を記録した。

ABSTRACT

With the popularity of multi-modal sensors, visible-thermal (RGB-T) object tracking is to achieve robust performance and wider application scenarios with the guidance of objects' temperature information. However, the lack of paired training samples is the main bottleneck for unlocking the power of RGB-T tracking. Since it is laborious to collect high-quality RGB-T sequences, recent benchmarks only provide test sequences. In this paper, we construct a large-scale benchmark with high diversity for visible-thermal UAV tracking (VTUAV), including 500 sequences with 1.7 million high-resolution (1920 $ imes$ 1080 pixels) frame pairs. In addition, comprehensive applications (short-term tracking, long-term tracking and segmentation mask prediction) with diverse categories and scenes are considered for exhaustive evaluation. Moreover, we provide a coarse-to-fine attribute annotation, where frame-level attributes are provided to exploit the potential of challenge-specific trackers. In addition, we design a new RGB-T baseline, named Hierarchical Multi-modal Fusion Tracker (HMFT), which fuses RGB-T data in various levels. Numerous experiments on several datasets are conducted to reveal the effectiveness of HMFT and the complement of different fusion types. The project is available at here.

研究の動機と目的

  • RGB-T追跡におけるペaired学習データの著しい不足に応えるために、大規模で多様性に富み、高解像度のベンチマークを構築すること。
  • 短期追跡、長期追跡、インスタンスセグメンテーションの3分野にわたるRGB-Tトラッカーの包括的評価を可能にすること。
  • フレームレベルおよびシーケンスレベルでの粗くから細かくまでの属性アノテーションを提供し、課題特化型トラッカー開発を支援すること。
  • 複数のレベルでマルチモーダル情報を効果的に統合する新しい、強力なRGB-T追跡ベースライン(HMFT)を設計すること。

提案手法

  • 500本の多様なUAVシーケンス、170万フレームの高解像度(1920×1080)RGB-Tフレームペア、多様なシーンと課題を含む大規模ベンチマーク「VTUAV」を構築する。
  • 画像統合、特徴統合、意思決定統合を統合的に扱う階層的マルチモーダル統合フレームワーク(HMFT)を導入し、RGB-T追跡に適用する。
  • 粗くから細かくまでの属性アノテーションスキームを採用し、13種類の課題タイプ(例:隠蔽、照明変化、運動歪み)をフレームレベルおよびシーケンスレベルでラベル付けする。
  • 短期追跡(HMFT)と長期追跡(HMFT_LT)のそれぞれに特化したHMFTの変種を設計し、再検出機構とメモリ機構を統合する。
  • 段階的な統合戦略を採用:初期統合(画像レベル)、ミドルレベル特徴統合、および最終統合(意思決定レベル)に適応的統合モジュールを用いる。
  • 標準化された指標(MSR、MPR、EAO)を用いて、GTOT、RGBT210、RGBT234、VTUAVの複数のベンチマークでHMFTを評価する。

実験結果

リサーチクエスチョン

  • RQ1提案されたHMFTトラッカーは、多様な追跡シナリオにおいて、最先端のRGB-Tトラッカーと比較して、精度と頑健性の面でどのように優れているか?
  • RQ2画像、特徴、意思決定レベルの異なる統合戦略が、RGB-T追跡性能にどの程度寄与しているか?
  • RQ3提案されたVTUAVベンチマークは、短期追跡、長期追跡、セグメンテーションタスクの3分野にわたるRGB-Tトラッカーの包括的評価を可能にしているか?
  • RQ4粗くから細かくまでの属性アノテーションは、課題特化型トラッカー開発をどの程度効果的に可能にしているか?

主な発見

  • HMFT_LTは、長期追跡で46.1%のMSRと53.6%のMPRを達成し、以前の最高性能を記録したFSRPNと比較して、MSRで14.7%、MPRで17.0%の向上を示し、新たな最先端性能を達成した。
  • 提案されたHMFTベースラインは、長期サブセットで35.5%のMSRと41.4%のMPRを達成し、複数レベルでの階層的統合の有効性を示した。
  • 画像レベル統合(CIF)と特徴レベル統合(DFF)は、単一モーダルなDiMPと比較して、それぞれMSRで3.2%、4.4%の向上を示した。さらに、適応的意思決定統合(ADF)を組み合わせた統合では、MSRで2.6%、MPRで2.7%のさらなる向上を達成した。
  • VTUAV-Vサブセット(可視画像のみ)では、トランスフォーマーに基づくトラッカー(例:STARK)が64.9%のSRと75.3%のPRを達成し、注釈メカニズムが視覚追跡において強力であることを示した。
  • 長期追跡用トラッカー(LTMU、GlobalTrack、SPLT)は、再検出およびメモリ機構のおかげで他のトラッカーを大きく上回り、こうした構成要因の重要性を裏付けた。
  • アブレーションスタディの結果、適応的重み付けを伴う意思決定統合(ADF)が不可欠であることが確認された。補完的で識別力のあるブランチからの応答を単純に平均化すると、性能が低下する傾向にあった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。