[論文レビュー] Fusion-Mamba for Cross-modality Object Detection
この論文は、SSCSとDSSFを用いて隠れ状態空間でRGBとIR特徴を融合するFusion-Mambaブロックを提案し、複数データセットでクロスモダリティ物体検出の最新手法となる。
Cross-modality fusing complementary information from different modalities effectively improves object detection performance, making it more useful and robust for a wider range of applications. Existing fusion strategies combine different types of images or merge different backbone features through elaborated neural network modules. However, these methods neglect that modality disparities affect cross-modality fusion performance, as different modalities with different camera focal lengths, placements, and angles are hardly fused. In this paper, we investigate cross-modality fusion by associating cross-modal features in a hidden state space based on an improved Mamba with a gating mechanism. We design a Fusion-Mamba block (FMB) to map cross-modal features into a hidden state space for interaction, thereby reducing disparities between cross-modal features and enhancing the representation consistency of fused features. FMB contains two modules: the State Space Channel Swapping (SSCS) module facilitates shallow feature fusion, and the Dual State Space Fusion (DSSF) enables deep fusion in a hidden state space. Through extensive experiments on public datasets, our proposed approach outperforms the state-of-the-art methods on $m$AP with 5.9% on $M^3FD$ and 4.9% on FLIR-Aligned datasets, demonstrating superior object detection performance. To the best of our knowledge, this is the first work to explore the potential of Mamba for cross-modal fusion and establish a new baseline for cross-modality object detection.
研究の動機と目的
- RGBとIRデータ間のモダリティ格差を解消し robustnessなクロスモダリティ物体検出を動機づける。
- 隠れ状態相互作用メカニズムを開発し、クロスモダリティ特徴の融合を改善する。
- 過度な計算を要さず表現の整合性を向上させる効率的な融合モジュールを設計する。
- 複数のバックボーンにわたる公開RGB-IRデータセットで最先端の性能を示す。
提案手法
- FMBは2つのモジュールから成り、浅層融合のためのState Space Channel Swapping (SSCS) と深層融合のためのDual State Space Fusion (DSSF) を隠れ状態空間で実現する。
- クロスモーダル特徴を隠れ状態空間に写像し、相互作用を可能にしモダリティ格差を低減する。
- SSCSはチャンネル交換を行い、浅いクロスモーダル相互作用のためのVisual State Space (VSS)ブロックを適用する。
- DSSFはゲーティング機構を備えた隠れ状態空間への特徴投影を行い、深いクロスモーダル融合を可能にし、続いてプロジェクションバックと残差接続。
- 強化されたRGBとIR特徴を加算して融合特徴を形成し、検出ヘッド内のYOLOv5/YOLOv8バックボーンで使用する。
実験結果
リサーチクエスチョン
- RQ1RGBとIR特徴間のクロスモーダル格差を融合中にどのように緩和し、物体検出精度を改善できるか?
- RQ2隠れ状態空間融合アプローチはRGB-IRデータに対して、空間的焦点型やトランスフォーマーに基づく融合を上回ることができるか?
- RQ3Fusion-Mambaをトランスフォーマー系の融合手法と比較した場合の精度と計算のトレードオフは?
主な発見
- RGB-IRデータを用いたFusion-Mambaは、M3FDで先行手法より5.9%のmAP向上、FLIR-Alignedで4.9%の向上を達成。
- LLVIPでは、YOLOv5バックボーンを用いたFusion-Mambaが62.8 mAPと96.8 mAP50を達成し、YOLOv8バックボーンでは64.3 mAPと97.0 mAP50に達する。
- Fusion-MambaはYOLOv8を用いた場合、LLVIP・M3FD・FLIR-Alignedデータセットのバックボーン間で競合ベースラインを一貫して上回る。
- アブレーション研究により、SSCSまたはDSSFを除去するとmAPが顕著に低下し、両モジュールが効果的なクロスモーダル融合に必要であることを示した。
- トランスフォーマー系の融合と比べて、Fusion-Mambaは計算量が低く、同一設定下で推論が7–19 ms速くなるなど顕著なスピードアップを実現。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。