[論文レビュー] FusionMamba: Dynamic Feature Enhancement for Multimodal Image Fusion with Mamba
FusionMambaは、動的特徴強化を組み込んだ改良型Mambaベースアーキテクチャを活用し、グローバルな文脈モデリングとローカルな詳細の保持のバランスを図る、画期的なマルチモodal画像融合フレームワークを提案する。動的畳み込み、チャネルアテンション、およびクロスモダリティ融合モジュールを統合することで、医療画像(CT-MRI、PET-MRI)、赤外線可視光、バイオメディカル(GFP-PC)など多様なデータセットにおいて最先端の性能を達成し、主要な指標で顕著な向上を示し、計算コストも低減した。
Multimodal image fusion aims to integrate information from different imaging techniques to produce a comprehensive, detail-rich single image for downstream vision tasks. Existing methods based on local convolutional neural networks (CNNs) struggle to capture global features efficiently, while Transformer-based models are computationally expensive, although they excel at global modeling. Mamba addresses these limitations by leveraging selective structured state space models (S4) to effectively handle long-range dependencies while maintaining linear complexity. In this paper, we propose FusionMamba, a novel dynamic feature enhancement framework that aims to overcome the challenges faced by CNNs and Vision Transformers (ViTs) in computer vision tasks. The framework improves the visual state-space model Mamba by integrating dynamic convolution and channel attention mechanisms, which not only retains its powerful global feature modeling capability, but also greatly reduces redundancy and enhances the expressiveness of local features. In addition, we have developed a new module called the dynamic feature fusion module (DFFM). It combines the dynamic feature enhancement module (DFEM) for texture enhancement and disparity perception with the cross-modal fusion Mamba module (CMFM), which focuses on enhancing the inter-modal correlation while suppressing redundant information. Experiments show that FusionMamba achieves state-of-the-art performance in a variety of multimodal image fusion tasks as well as downstream experiments, demonstrating its broad applicability and superiority.
研究の動機と目的
- 畳み込みニューラルネットワーク(CNNs)がグローバルな文脈を捉えるのを制限する点と、変換器(Transformers)が計算コストが高い点を是正するため。
- マルチモダリティ入力における空間的変動に適応できない静的畳み込み演算の欠点を克服するため。
- 相互モダリティ相関を強化するとともに冗長情報を抑制する、軽量で効率的なアーキテクチャを開発するため。
- 選択的状態空間モデリングと動的特徴強化を統合することで、テクスチャや差分の認識を向上させ、融合性能を向上させるため。
- 提案手法の汎用性を、多様なマルチモダリティ画像融合ベンチマークにおいて検証するため。
提案手法
- 動的畳み込みとチャネルアテンションを統合することで、局所的特徴抽出を強化し、チャネルの冗長性を低減した、改良型効率的Mambaモデルを提案する。
- 動的特徴強化モジュール(DFEM)を2つ備えた動的特徴融合モジュール(DFFM)を導入し、適応的なテクスチャおよび差分認識を実現する。
- 長距離依存関係をモデル化し、モダリティ間の相関を強化するため、クロスモダリティ融合Mambaモジュール(CMFM)を採用する。
- 構造的整合性、エッジ詳細、明るさの一貫性を維持するため、SSIM、テクスチャ、強度損失を組み合わせたハイブリッド損失関数を活用する。
- 線形計算量を実現する選択的構造的状態空間モデルを採用し、自己注意の2次コストを回避しながら長距離依存関係を効率的にモデル化する。
- 並列走査アルゴリズムと構造的再パラメータライゼーションを採用し、推論を高速化しながら高い性能を維持する。
実験結果
リサーチクエスチョン
- RQ1Mambaベースアーキテクチャは、線形計算量でマルチモダリティ画像融合における長距離依存関係を効果的にモデル化できるか?
- RQ2動的畳み込みとチャネルアテンションは、マルチモダリティ統合における局所的特徴強化をどのように向上させるか?
- RQ3提案されたDFFMモジュールは、冗長情報を抑制しつつ、相互モダリティ相関をどの程度向上させるか?
- RQ4CMFMの統合は、静的またはアテンションベースの融合モジュールと比較して、より優れた融合性能をもたらすか?
- RQ5FusionMambaは、医療、赤外線可視光、バイオメディカル画像を含む多様なマルチモダリティデータセットに一般化可能か?
主な発見
- FusionMambaは、CT-MRI、PET-MRI、SPECT-MRI、IR-VIS、GFP-PCデータセットで最先端の性能を達成し、IR-VISベンチマークではVIFスコア0.7717、SF17.0171を記録した。
- FLOPsを16.50Gまで低減し、従来の最先端手法と比較して顕著な計算効率の向上を示した。
- アブレーションスタディにより、CMFMまたはDFEMモジュールを削除するとMS-SSIMが4.36%低下、SFが3.2%低下することが確認され、これらのモジュールの重要性が裏付けられた。
- 完全な損失関数(SSIM + テクスチャ + 強度)は、MS-SSIM 0.9331およびSF 17.0171を達成し、アブレーションバージョンを上回った。
- Mambaバックボーンを変換器に置き換えると、VIFが1.5%低下、SFが1.5%低下し、Mambaの効率性と性能の優位性が確認された。
- GFP-PCデータセットでは、U2Fusionより13.5%、次に優れたSOTA手法より10.2%のQ^{AB/F}向上を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。