[論文レビュー] Siamese Infrared and Visible Light Fusion Network for RGB-T Tracking
本論文では、赤外線と可視光の特徴を補完的特徴融合ネットワーク(CFFN)と寄与集約ネットワーク(CAN)を用いて統合するシアン型融合ネットワーク、SiamIVFNを提案する。この手法は、2つのベンチマークデータセットで147.6 FPSの推論速度を達成し、適応的特徴統合とずれの処理により、さまざまな照明条件下でも高い頑健性を示す。
Due to the different photosensitive properties of infrared and visible light, the registered RGB-T image pairs shot in the same scene exhibit quite different characteristics. This paper proposes a siamese infrared and visible light fusion Network (SiamIVFN) for RBG-T image-based tracking. SiamIVFN contains two main subnetworks: a complementary-feature-fusion network (CFFN) and a contribution-aggregation network (CAN). CFFN utilizes a two-stream multilayer convolutional structure whose filters for each layer are partially coupled to fuse the features extracted from infrared images and visible light images. CFFN is a feature-level fusion network, which can cope with the misalignment of the RGB-T image pairs. Through adaptively calculating the contributions of infrared and visible light features obtained from CFFN, CAN makes the tracker robust under various light conditions. Experiments on two RGB-T tracking benchmark datasets demonstrate that the proposed SiamIVFN has achieved state-of-the-art performance. The tracking speed of SiamIVFN is 147.6FPS, the current fastest RGB-T fusion tracker.
研究の動機と目的
- RGB-T追跡における、感度特性が異なる赤外線および可視光画像の統合の課題に対処すること。
- 両モodalの補完的特徴を適応的に統合することで、照明条件の変化に伴う追跡の頑健性を向上させること。
- 正確性を維持しつつ、リアルタイム推論を達成する軽量で高速な統合ネットワークを設計すること。
- 部分的に結合されたフィルタを用いた特徴レベル統合により、RGBと赤外画像ペア間の空間的ずれを処理すること。
提案手法
- ネットワークは、可視光および赤外線画像の処理にための2つの並列ストリームを持つシアン型アーキテクチャを採用する。
- 補完的特徴融合ネットワーク(CFFN)は、層間に部分的に結合されたフィルタを用い、複数のレベルで両モダリティの特徴を統合する。
- CFFNにより、RGBと赤外画像ペア間の空間的ずれに対して耐性を持つ特徴レベル統合が可能になる。
- 寄与集約ネットワーク(CAN)は、現在の環境状態に応じて赤外線および可視光特徴の重要度を適応的に計算する。
- 統合プロセスはモダリティ寄与を動的に調整し、低照度または強い眩しさの状況でも頑健性が向上する。
- 全ネットワークはエンド・ツー・エンドで学習可能であり、標準ベンチマークで147.6 FPSのリアルタイム推論を実現する。
実験結果
リサーチクエスチョン
- RQ1どのようにして、照明条件の変化に伴って追跡精度を向上させるために赤外線および可視光特徴を効果的に統合できるか?
- RQ2ディープラーニングベースの追跡フレームワークにおいて、RGBと赤外画像ペア間の空間的ずれを最適に処理する方法は何か?
- RQ3適応的モダリティ重み付けを備えたシアン型アーキテクチャは、困難な視覚追跡シナリオにおける頑健性を向上させられるか?
- RQ4どのようにして、最先端の性能を達成しつつ、高い推論速度を維持できるように特徴統合を設計できるか?
- RQ5異なる環境条件下で赤外線特徴と可視光特徴の寄与比は何か、そしてそれを適応的に学習する方法は何か?
主な発見
- SiamIVFNは、2つの主要なRGB-T追跡ベンチマークで最先端の性能を達成し、既存の統合ベースのトラッカーを上回った。
- トラッカーは147.6 FPSで動作し、報告されている中で最も高速なRGB-T統合トラッカーである。
- 寄与集約ネットワーク(CAN)により、赤外線および可視光特徴の動的重み付けが可能となり、低照度や強い眩しさの状況でも頑健性が向上した。
- CFFNにおける部分的に結合されたフィルタ設計により、RGBと赤外画像ペア間の空間的ずれを効果的に処理できた。
- アブレーションスタディの結果、CFFNとCANの両方が性能向上に顕著な貢献を示し、特に照明条件の変化に対してCANが顕著に効果的であった。
- 適応的統合メカニズムと頑健な特徴表現のおかげで、モデルは多様な環境にうまく一般化した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。