[論文レビュー] Temporal Aggregation for Adaptive RGBT Tracking
本論文は、時間的相互作用集約モジュール(TIAM)を用いて時間的情報を統合し、軽量なDFMネットワークによる適応的決定段階融合を実装することで、耐障害性を向上させる新しいRGBT追跡フレームワークTAATを提案する。空間的・時間的外見モデリングとモダリティ固有の応答重み付けを活用することで、VOT-RGBT2019、GTOT、RGBT210で最先端の性能を達成し、VOT-RGBT2019では0.4164のEAOスコアを記録。ベースラインより2.84%の向上を達成した。
Visual object tracking with RGB and thermal infrared (TIR) spectra available, shorted in RGBT tracking, is a novel and challenging research topic which draws increasing attention nowadays. In this paper, we propose an RGBT tracker which takes spatio-temporal clues into account for robust appearance model learning, and simultaneously, constructs an adaptive fusion sub-network for cross-modal interactions. Unlike most existing RGBT trackers that implement object tracking tasks with only spatial information included, temporal information is further considered in this method. Specifically, different from traditional Siamese trackers, which only obtain one search image during the process of picking up template-search image pairs, an extra search sample adjacent to the original one is selected to predict the temporal transformation, resulting in improved robustness of tracking performance.As for multi-modal tracking, constrained to the limited RGBT datasets, the adaptive fusion sub-network is appended to our method at the decision level to reflect the complementary characteristics contained in two modalities. To design a thermal infrared assisted RGB tracker, the outputs of the classification head from the TIR modality are taken into consideration before the residual connection from the RGB modality. Extensive experimental results on three challenging datasets, i.e. VOT-RGBT2019, GTOT and RGBT210, verify the effectiveness of our method. Code will be shared at extcolor{blue}{\emph{https://github.com/Zhangyong-Tang/TAAT}}.
研究の動機と目的
- 静的空間的外見モデリングを超えて、時間的文脈を統合することでRGBT追跡の耐障害性を向上させること。
- RGBTデータセットの限界を考慮し、深く複雑な統合ネットワークを避けて、軽量で適応的な決定段階統合を採用すること。
- ピクセルまたは特徴量レベルの統合が歪みやノイズを引き起こす問題を回避するため、決定段階でモダリティに適応した統合機構を設計すること。
- 時間的モデリングが長期的かつ困難なシーケンスにおいて追跡性能を顕著に向上させることを検証すること。
提案手法
- 連続する検索画像間の時間的変換を学習する時間的相互作用集約モジュール(TIAM)を導入し、単一フレームの空間的特徴を超えた外見モデリングを強化する。
- 分類スコアをRGBおよびTIRブランチから得る決定段階で、モダリティの信頼性に基づいて動的に重み付けされる軽量な意思決定統合モジュール(DFM)を採用する。
- RGBおよびTIR入力のための二重ストリーム特徴抽出を実行するシアンプソン型の追跡バックボーンを採用し、ネックモジュールによる特徴の精練を施す。
- 二段階の追跡ヘッドを適用する:第一段階ではモダリティ固有の分類ヘッドが応答マップを生成し、第二段階ではDFMがこれらのマップを学習可能なアテンションを用いて統合し、最終予測を出力する。
- DFMは、両モダリティのスコアを入力とし、重み付き組み合わせを出力する多層パーセプトロン構造を採用し、動的統合を可能にする。
- 分類ヘッドにおける交差エントロピー損失を用いて、ネットワーク全体をエンドツーエンドで学習させ、複数モダリティおよび時間的文脈における正確で耐障害性の高い物体局在を最適化する。
実験結果
リサーチクエスチョン
- RQ1連続フレーム間の時間的文脈を統合することで、静的外見モデリングを超えてRGBT追跡の耐障害性が向上するか?
- RQ2データ量が限られたRGBT追跡環境において、従来の特徴量レベルやピクセルレベルの統合に比べ、適応的決定段階統合が優れているか?
- RQ3複雑なネットワーク深さを必要とせず、RGBおよびTIRモダリティの補完的特徴を有効に活用できる軽量で学習可能な統合モジュール(DFM)の有効性はいかほどか?
- RQ4時間的モデリングは、困難な追跡シーケンスにおける遮蔽や背景の雑多さへの感受性をどの程度低減するか?
- RQ5決定段階で単純だが効果的な統合戦略が、標準的なRGBTベンチマークで最先端の性能を達成できるか?
主な発見
- VOT-RGBT2019では、TAATがEAOスコア0.4164を達成し、ベースラインの2.84%向上を示し、時間的モデリングの有効性を裏付けた。
- DFMモジュール単体でもVOT-RGBT2019でEAOが1.22%向上し、単純平均化よりも適応的かつモダリティに適応した統合の利点を確認した。
- TIAMとDFMの組み合わせが最良のパフォーマンスを発揮し、GTOTではベースライン比1.8%の向上を記録。時間的統合と適応的統合の相乗効果を検証した。
- 定性的な結果から、DFMは遮蔽や雑多な背景シーンにおいて、補完的熱画像とRGBの特徴を活用して誤検出を効果的に抑制していることが示された。
- アブレーションスタディにより、TIAMとDFMの両方が不可欠であることが確認された。両者の除去は、特に長期追跡や複雑なシナリオで顕著な性能低下を引き起こした。
- 分類損失の可視化から、DFMは片方のモダリティが劣化した場合(例:低照度下のRGBや遮蔽時)に、より鋭く識別力の高い応答マップを生成することが分かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。