[논문 리뷰] FusionMamba: Dynamic Feature Enhancement for Multimodal Image Fusion with Mamba
FusionMamba는 동적 특징 증강을 통한 전역적 맥락 모델링과 국소적 세부 정보 유지 간의 균형을 이루는 개선된 Mamba 기반 아키텍처를 활용한 새로운 다중모态 이미지 융합 프레임워크를 제안한다. 동적 컨볼루션, 채널 주의 메커니즘, 그리고 크로스모달 융합 모듈을 통합함으로써 의료(CT-MRI, PET-MRI), 적외선-가시광선, 생물의학적(GFP-PC) 융합 작업을 포함한 다양한 데이터셋에서 최신 기술 수준의 성능을 달성하며, 주요 지표에서 뚜렷한 향상과 함께 계산 비용도 감소시킨다.
Multimodal image fusion aims to integrate information from different imaging techniques to produce a comprehensive, detail-rich single image for downstream vision tasks. Existing methods based on local convolutional neural networks (CNNs) struggle to capture global features efficiently, while Transformer-based models are computationally expensive, although they excel at global modeling. Mamba addresses these limitations by leveraging selective structured state space models (S4) to effectively handle long-range dependencies while maintaining linear complexity. In this paper, we propose FusionMamba, a novel dynamic feature enhancement framework that aims to overcome the challenges faced by CNNs and Vision Transformers (ViTs) in computer vision tasks. The framework improves the visual state-space model Mamba by integrating dynamic convolution and channel attention mechanisms, which not only retains its powerful global feature modeling capability, but also greatly reduces redundancy and enhances the expressiveness of local features. In addition, we have developed a new module called the dynamic feature fusion module (DFFM). It combines the dynamic feature enhancement module (DFEM) for texture enhancement and disparity perception with the cross-modal fusion Mamba module (CMFM), which focuses on enhancing the inter-modal correlation while suppressing redundant information. Experiments show that FusionMamba achieves state-of-the-art performance in a variety of multimodal image fusion tasks as well as downstream experiments, demonstrating its broad applicability and superiority.
연구 동기 및 목표
- 다중모달 이미지 융합에서 CNN의 전역 맥락 캡처 능력 부족과 Transformer의 계산 복잡성 문제를 해결하기 위해.
- 다중모달 입력의 공간적 변동성에 적응하지 못하는 고정된 컨볼루션 연산의 정적 성질을 극복하기 위해.
- 상호모달 상관관계를 향상시키면서 중복 정보를 억제하는 경량이고 효율적인 아키텍처를 개발하기 위해.
- 선택적 상태공간 모델링과 동적 특징 증강을 융합하여 문턱과 차이 인식 능력을 향상시켜 융합 성능을 향상시키기 위해.
- 제안된 방법의 일반화 능력을 다양한 다중모달 이미지 융합 벤치마크에서 검증하기 위해.
제안 방법
- 동적 컨볼루션과 채널 주의 메커니즘을 통합하여 국소적 특징 추출 능력을 향상시키고 채널 중복을 감소시키는 개선된 효율적 Mamba 모델을 제안한다.
- 두 개의 동적 특징 증강 모듈(DFEM)을 포함하는 동적 특징 융합 모듈(DFFM)을 도입하여 적응적인 문턱 및 차이 인식을 가능하게 한다.
- 장거리 의존성 모델링과 모달 간 상관관계 향상을 위해 크로스모달 융합 Mamba 모듈(CMFM)을 활용한다.
- 구조적 통합성, 가장자리 세부 정보, 밝기 일관성을 유지하기 위해 SSIM, 텍스처, 강도 손실을 조합한 하이브리드 손실 함수를 사용한다.
- 자기주의성의 제곱 비용 없이 장거리 의존성을 효율적으로 모델링하기 위해 선형 복잡도를 갖는 선택적 구조적 상태공간 모델을 채택한다.
- 병렬 스캐닝 알고리즘과 구조적 재패러미터라이제이션을 활용하여 추론 속도를 가속화하면서도 높은 성능를 유지한다.
실험 결과
연구 질문
- RQ1Mamba 기반 아키텍처는 선형 복잡도로 다중모달 이미지 융합에서 장거리 의존성을 효과적으로 모델링할 수 있는가?
- RQ2동적 컨볼루션과 채널 주의 메커니즘이 다중모달 융합에서 국소적 특징 증강에 어떻게 기여하는가?
- RQ3제안된 DFFM 모듈이 상호모달 상관관계를 얼마나 향상시키며 동시에 중복 정보를 억제하는가?
- RQ4CMFM의 통합이 정적 또는 주의 기반 융합 모듈에 비해 더 나은 융합 성능을 이끌어내는가?
- RQ5FusionMamba는 의료, 적외선-가시광선, 생물의학 영상 포함 다양한 다중모달 데이터셋에 일반화 가능한가?
주요 결과
- FusionMamba는 CT-MRI, PET-MRI, SPECT-MRI, IR-VIS, GFP-PC 데이터셋에서 최신 기술 수준의 성능를 달성하였으며, IR-VIS 벤치마크에서 VIF 점수 0.7717과 SF 17.0171을 기록하였다.
- 이전 최신 기술 수준의 방법들보다 훨씬 낮은 16.50G의 FLOPs를 기록하여 높은 계산 효율성을 입증하였다.
- 제거 실험 결과, CMFM 또는 DFEM 모듈을 제거할 경우 MS-SSIM가 4.36% 감소하고 SF가 3.2% 감소함을 확인하여 이들의 핵심적 역할을 입증하였다.
- 전체 손실 함수(SSF + 텍스처 + 강도)가 MS-SSIM 0.9331과 SF 17.0171을 기록하며, 약화된 버전들보다 뛰어난 성능을 보였다.
- Mamba 백본을 Transformer로 대체할 경우 VIF가 1.5% 감소하고 SF도 1.5% 감소하여 Mamba의 효율성과 성능 우월성을 확인하였다.
- GFP-PC 데이터셋에서 U2Fusion 대비 Q^{AB/F}가 13.5% 향상되었고, 다음 최신 기술 수준 방법 대비 10.2% 향상되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.