Skip to main content
QUICK REVIEW

[論文レビュー] FANet: Quality-Aware Feature Aggregation Network for Robust RGB-T Tracking

Yabin Zhu, Chenglong Li|arXiv (Cornell University)|Nov 24, 2018
Video Surveillance and Tracking Methods参考文献 50被引用数 6
ひとこと要約

本稿では、RGB-T追跡のための品質認識特徴集約ネットワークFANetを提案する。本手法は、各モダリティ内での階層的マルチリソリューション特徴の融合と、それらの信頼性に基づくRGBおよび赤外特徴の適応的結合により、特徴表現を向上させる。大規模ベンチマーク上での実験では、最先端性能を達成しており、精度面で既存手法を最大5.5%上回り、19 FPSのリアルタイム推論を維持している。

ABSTRACT

This paper investigates how to perform robust visual tracking in adverse and challenging conditions using complementary visual and thermal infrared data (RGBT tracking). We propose a novel deep network architecture called qualityaware Feature Aggregation Network (FANet) for robust RGBT tracking. Unlike existing RGBT trackers, our FANet aggregates hierarchical deep features within each modality to handle the challenge of significant appearance changes caused by deformation, low illumination, background clutter and occlusion. In particular, we employ the operations of max pooling to transform these hierarchical and multi-resolution features into uniform space with the same resolution, and use 1x1 convolution operation to compress feature dimensions to achieve more effective hierarchical feature aggregation. To model the interactions between RGB and thermal modalities, we elaborately design an adaptive aggregation subnetwork to integrate features from different modalities based on their reliabilities and thus are able to alleviate noise effects introduced by low-quality sources. The whole FANet is trained in an end-to-end manner. Extensive experiments on large-scale benchmark datasets demonstrate the high-accurate performance against other state-of-the-art RGBT tracking methods.

研究の動機と目的

  • 低照度、遮蔽、変形といった悪条件下でのRGBおよび赤外赤外データを用いたロバストなビジョントラッキングの課題に対処すること。
  • 既存のRGB-Tトラッカーが手作業で設計された特徴や高レベルの意味的特徴に依存するため、局所化の精度と意味的識別力のバランスを崩す問題を克服すること。
  • エンドツーエンドで学習可能な信頼性認識重みを用いて、RGBおよび赤外特徴の統合における不確実性を低減すること。
  • 複数のネットワーク層にわたる階層的特徴の集約により、特徴表現を向上させつつ、空間解像度を維持し、冗長性を低減すること。

提案手法

  • FANetは、各モダリティ内の複数の畳み込み層から得られる階層的特徴を、最大プーリングにより解像度を統一し、1×1畳み込みを用いて特徴次元を圧縮することで集約する。
  • モダリティ信頼性推定のため、空間情報をチャンネル記述子に圧縮するためのグローバル平均プーリング層を採用する。
  • 適応的集約サブネットワークは、全結合層とSoftMaxを用いて、学習された信頼性に基づきモダリティ重みを予測し、RGBおよび赤外特徴の動的統合を可能にする。
  • ネットワーク全体をエンドツーエンドで訓練することで、特徴学習とモダリティ統合の共同最適化が可能となり、トラッキング性能の向上が図られる。
  • トラッカーは、複数ドメイン学習フレームワーク内でのバイナリ分類を用いて、フレーム間のオブジェクト位置を予測する。

実験結果

リサーチクエスチョン

  • RQ1深層ネットワークからの階層的マルチリソリューション特徴を効果的に集約することで、RGB-Tトラッキングのロバスト性をどのように向上させられるか?
  • RQ2ノイズや低品質な状態下での統合性能向上に寄与する信頼性のエンドツーエンド推定は、どの程度達成可能か?
  • RQ3信頼性に基づくRGBおよび赤外特徴の適応的統合は、固定またはヒューリスティックな統合戦略を上回る性能を、困難なトラッキングシナリオで示せるか?
  • RQ4複数の層にわたる浅い特徴と深い特徴の統合は、トラッキング精度とロバスト性にどのように影響を与えるか?

主な発見

  • FANetはRGBT234ベンチマークで78.7%のPRおよび55.3%のSRを達成し、次に優れた手法と比較してPRで5.0%、SRで5.3%の上回りを記録した。
  • 提案された階層的特徴集約手法は、トラッキング性能の顕著な向上をもたらし、FANet-C13およびFANet-C23は単一層特徴の使用と比較して優れた結果を示した。
  • FANetは単一GPU上で19 FPSのリアルタイム推論速度を達成しており、高い精度と高い効率性を両立していることを示した。
  • アブレーションスタディの結果、適応的集約サブネットワークを含む完全なFANetアーキテクチャが最適性能を発揮することを確認した。FANet-FAおよびFANet-MAは性能が劣化した。
  • 本手法は、スケール変動が著しいやカメラジタリの発生する困難なシーケンスに対しても効果的に対処できたが、極端な運動やぼやけが発生する場面では失敗事例が観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。