Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Modality Attentive Feature Fusion for Object Detection in Multispectral Remote Sensing Imagery

Qingyun Fang, Zhaokui Wang|arXiv (Cornell University)|Dec 6, 2021
Remote-Sensing Image Classification被引用数 4
ひとこと要約

本稿では、RGBおよび赤外熱画像に共通モード注意力(特徴選択)と差分モード注意力(特徴強化)を併用することで、マルチスペクトルオブジェクト検出を向上させる軽量モジュールであるクロスモダリティアテンション特徴統合(CMAFF)を提案する。本手法は、VEDAIデータセットにおいて、先行するマルチモダリティ手法よりもmAP0.5:0.95で4.52%向上する最先端の性能を達成している一方で、パラメータは0.55M増加、推論時間は0.1ms増加にとどまる。

ABSTRACT

Cross-modality fusing complementary information of multispectral remote sensing image pairs can improve the perception ability of detection algorithms, making them more robust and reliable for a wider range of applications, such as nighttime detection. Compared with prior methods, we think different features should be processed specifically, the modality-specific features should be retained and enhanced, while the modality-shared features should be cherry-picked from the RGB and thermal IR modalities. Following this idea, a novel and lightweight multispectral feature fusion approach with joint common-modality and differential-modality attentions are proposed, named Cross-Modality Attentive Feature Fusion (CMAFF). Given the intermediate feature maps of RGB and IR images, our module parallel infers attention maps from two separate modalities, common- and differential-modality, then the attention maps are multiplied to the input feature map respectively for adaptive feature enhancement or selection. Extensive experiments demonstrate that our proposed approach can achieve the state-of-the-art performance at a low computation cost.

研究の動機と目的

  • マルチスペクトルリモートセンシング画像(RGBおよび赤外熱画像)から補完的特徴を統合し、オブジェクト検出性能を向上させる課題に対処すること。
  • 連結や加算といった単純な操作を用いる従来の統合手法が、モダリティ固有の特徴と共有特徴を効果的に活用できないという限界を克服すること。
  • モダリティ固有の特徴を強化しながら、共有特徴を効率的に統合する軽量で効率的な統合メカニズムを設計すること。
  • 実世界のデータセットを用いた広範な除去研究と比較を通じて、提案されたCMAFFモジュールの有効性を検証すること。
  • CMAFFを統合した二ストリームYOLOベースの検出器、YOLOFusionを構築し、マルチスペクトルオブジェクト検出の耐障害性を高めること。

提案手法

  • CMAFFは、共通選択モジュール(モダリティ共有特徴選択用)と差分強化モジュール(モダリティ固有特徴強化用)の2つの並列サブモジュールから構成される。
  • 共通選択モジュールは、グローバル平均プーリングとグローバルマックスプーリングを用いて、両モダリティ間で共有される特徴を強調するアテンションマップを生成する。
  • 差分強化モジュールは、学習可能なアテンションマップを各ストリームごとに適用し、モダリティ固有の特徴を強化する。
  • 両モジュールのアテンションマップは、入力特徴マップに対して要素ごとの乗算を適用することで、適応的特徴選択と強化を実現する。
  • 2つのサブモジュールは並列に配置されており、計算複雑度を増加させることなく、共同最適化と表現学習の向上を可能にする。
  • CMAFFモジュールは、RGBとIR入力を別々に処理する二ストリームYOLOFusionネットワークに統合されている。

実験結果

リサーチクエスチョン

  • RQ1共通モダリティおよび差分モダリティアテンションを併用することで、マルチスペクトルオブジェクト検出における特徴統合が向上するか?
  • RQ2CMAFFは、連結や要素ごとの加算といった従来の統合手法と比較して、検出精度と効率性において優れているか?
  • RQ3CMAFFの2つのアテンションサブモジュールの最適なアーキテクチャ構成(並列対直列)は何か?
  • RQ4CMAFFのような軽量な統合モジュールが、モデルパラメータや推論時間の大幅な増加を伴わずに最先端の性能を達成できるか?
  • RQ5提案されたYOLOFusionネットワークは、既存の単一モダリティおよびマルチモダリティ検出器を、マルチスペクトルリモートセンシングベンチマークで上回るか?

主な発見

  • CMAFFを搭載したYOLOFusionは、VEDAIデータセットでmAP0.5:0.95が0.4914に達し、以前の最良マルチモダリティ手法(YOLOv3とミッドレベル統合)よりも4.52%向上した。
  • モデルはmAP0.5が0.786を達成し、同じ指標で最良のモノモダリティYOLO-fineよりも2.86%優れていた。
  • 性能向上にもかかわらず、CMAFFはパラメータを0.55M増加、推論時間を0.1ms増加に抑え、モジュール1つあたり平均0.183Mパラメータにとどまった。
  • 除去研究の結果、共通選択モジュールと差分強化モジュールの両方が性能向上に顕著に寄与しており、並列配置が直列構成を上回ることが確認された。
  • 可視化結果から、CMAFFは物体の形状や熱的シグネチャといった関連特徴を効果的に強調し、ノイズや不要な詳細を抑制していることが示された。
  • CMAFFモジュールはモジュラーであり、計算オーバーヘッドを最小限に抑えつつ、任意の二ストリームCNNベースのオブジェクト検出フレームワークに容易に統合可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。