[논문 리뷰] AdaFuse: Adaptive Medical Image Fusion Based on Spatial-Frequential Cross Attention
AdaFuse는 푸리에 변환을 통한 공간-주파수 교차 어텐션을 활용하여 다중 모odal 의료 영상의 동적 융합을 위한 새로운 적응형 의료 영상 융합 프레임워크를 제안한다. 공간 및 주파수 도메인에서 교차 어텐션 메커니즘을 통합하고, 내용 손실과 구조 손실을 조합한 하이브리드 손실을 적용함으로써, 더 나은 세부 정보 보존과 잡음 감소를 달성하여 벤치마크 데이터셋에서 최신 기술을 능가하는 융합 품질을 확보한다.
Multi-modal medical image fusion is essential for the precise clinical diagnosis and surgical navigation since it can merge the complementary information in multi-modalities into a single image. The quality of the fused image depends on the extracted single modality features as well as the fusion rules for multi-modal information. Existing deep learning-based fusion methods can fully exploit the semantic features of each modality, they cannot distinguish the effective low and high frequency information of each modality and fuse them adaptively. To address this issue, we propose AdaFuse, in which multimodal image information is fused adaptively through frequency-guided attention mechanism based on Fourier transform. Specifically, we propose the cross-attention fusion (CAF) block, which adaptively fuses features of two modalities in the spatial and frequency domains by exchanging key and query values, and then calculates the cross-attention scores between the spatial and frequency features to further guide the spatial-frequential information fusion. The CAF block enhances the high-frequency features of the different modalities so that the details in the fused images can be retained. Moreover, we design a novel loss function composed of structure loss and content loss to preserve both low and high frequency information. Extensive comparison experiments on several datasets demonstrate that the proposed method outperforms state-of-the-art methods in terms of both visual quality and quantitative metrics. The ablation experiments also validate the effectiveness of the proposed loss and fusion strategy.
연구 동기 및 목표
- 기존의 딥 러닝 기반 융합 방법이 다중 모달 의료 영상에서 저주파 및 고주파 성분을 적응적으로 구분하고 융합하는 데에 한계를 보이고 있는 문제를 해결하기 위해.
- 정확도와 적응성을 떨어뜨리는 수작업으로 설계된 융합 규칙 및 특징 추출 기법에 의존하는 문제를 해결하기 위해.
- 주파수 유도 어텐션 메커니즘을 통해 융합된 의료 영상에서 고주파 세부 정보와 구조적 통합성을 향상시키기 위해.
- 복잡한 수작업 설계를 피하면서도 높은 성능을 유지할 수 있는 학습 가능한 종단 간 융합 프레임워크를 개발하기 위해.
- 내용 손실과 구조 손실을 조합한 새로운 다중 손실 함수가 융합 품질 향상에 기여하는지 검증하기 위해.
제안 방법
- 공간 및 주파수 도메인 간에 쿼리 및 키 벡터를 교환함으로써 두 모달 간의 적응형 특징 융합을 가능하게 하는 교차 어텐션 융합(Cross-Attention Fusion, CAF) 블록을 제안한다.
- 주파수 도메인 표현을 추출하기 위해 푸리에 변환을 적용하여 고주파 세부 정보 보존을 위한 주파수 유도 어텐션을 가능하게 한다.
- 공간 및 주파수 특징 간의 교차 어텐션을 도입하여 도메인 간 정보 흐름을 유도함으로써 융합을 더욱 정교하게 개선한다.
- 다중 해상도에서 계층적 특징을 캡처하기 위해 네 단계의 스케일에서 스택된 트랜스포머 인코더를 사용하는 다중 스케일 아키텍처를 구현한다.
- 융합 출력에서 저주파 및 고주파 정보를 모두 보존하기 위해 구조 손실과 내용 손실을 조합한 하이브리드 손실 함수를 설계한다.
- CAF 블록 내부에서 자기 어텐션 메커니즘을 사용하여 각 패치별로 동적으로 적응형 융합 가중치를 계산함으로써 특징 중요도 모델링을 향상시킨다.

실험 결과
연구 질문
- RQ1주파수 유도 교차 어텐션 메커니즘이 다중 모달 의료 영상에서 저주파 및 고주파 성분의 적응형 융합에 기여하는가?
- RQ2공간 및 주파수 도메인 어텐션의 통합이 융합된 의료 영상의 세부 정보 보존 및 영상 품질에 어떤 영향을 미치는가?
- RQ3제안된 하이브리드 손실 함수가 소스 영상에서의 보완 정보 보존에 얼마나 기여하는가?
- RQ4CAF 블록이 시각적 품질과 정량적 지표 모두에서 기존 융합 전략을 능가하는가?
- RQ5제안된 방법이 수작업 융합 규칙 설계나 대규모 레이블링 데이터에 의존하지 않고도 뛰어난 성능을 달성할 수 있는가?
주요 결과
- AdaFuse는 EN, MI, CC, FMI 네 가지 정량적 지표에서 최신 기술을 초월하는 성능을 기록하여 소스 모달에서의 정보 보존 능력이 뛰어나다는 것을 입증한다.
- 강력한 구조적 통합성과 낮은 영상 왜곡을 보여주는 높은 PSNR 값을 기록하여 융합 결과의 품질이 높다는 것을 확인한다.
- 시각적 결과에서는 더 선명한 윤곽선과 줄어든 흐림 또는 대trast 잡음 아티팩트를 보여주며, 효과적인 세부 정보 보존을 확인한다.
- 제거 실험 결과, 제안된 손실 함수와 CAF 블록이 융합 품질 향상에 크게 기여하며, 모듈 제거 시 아티팩트 유도로 인해 EN 값이 감소함을 확인한다.
- 다양한 공개 데이터셋에서 기존 최신 기술을 능가하며, 이는 강건성과 일반화 능력의 유효성을 입증한다.
- 수작업 규칙 설계 없이 CT, MRI, PET, SPECT 모달 간의 보완 정보를 효과적으로 융합할 수 있는 뛰어난 적응성을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.