Skip to main content
QUICK REVIEW

[논문 리뷰] Cross Attention-guided Dense Network for Images Fusion

Zhengwen Shen, Jun Wang|arXiv (Cornell University)|2021. 09. 23.
Advanced Image Fusion Techniques참고 문헌 30인용 수 5
한 줄 요약

이 논문은 다중 모odal, 다중 노출, 다중 집중도 이미지 융합을 위한 통합된 비지도 딥 러닝 프레임워크인 이미지 융합을 위한 교차 어텐션 유도 밀집 네트워크(CADNIF)를 제안한다. 교차 어텐션 메커니즘을 활용하여 공간적 대응 관계를 모델링하고, 밀집 연결을 통해 특징 학습을 강화함으로써 CADNIF는 다양한 이미지 융합 작업에서 우수한 융합 성능를 달성하며, 정량적·정성적 측면에서 최신 기법들을 능가한다.

ABSTRACT

In recent years, various applications in computer vision have achieved substantial progress based on deep learning, which has been widely used for image fusion and shown to achieve adequate performance. However, suffering from limited ability in modeling the spatial correspondence of different source images, it still remains a great challenge for existing unsupervised image fusion models to extract appropriate feature and achieves adaptive and balanced fusion. In this paper, we propose a novel cross-attention-guided image fusion network, which is a unified and unsupervised framework for multi-modal image fusion, multi-exposure image fusion, and multi-focus image fusion. Different from the existing self-attention module, our cross-attention module focus on modeling the cross-correlation between different source images. Using the proposed cross attention module as a core block, a densely connected cross attention-guided network is built to dynamically learn the spatial correspondence to derive better alignment of important details from different input images. Meanwhile, an auxiliary branch is also designed to model the long-range information, and a merging network is attached to finally reconstruct the fusion image. Extensive experiments have been carried out on publicly available datasets, and the results demonstrate that the proposed model outperforms the state-of-the-art quantitatively and qualitatively.

연구 동기 및 목표

  • 비지도 딥 러닝 이미지 융합 네트워크에서 제한된 공간적 대응 관계 모델링 문제를 해결하기 위해.
  • 원본 이미지 간 상호 상관관계를 명시적으로 학습시켜 특징 추출 및 적응형 융합을 향상시키기 위해.
  • 다중 모달, 다중 노출, 다중 집중도 이미지 융합을 하나의 딥 러닝 프레임워크로 통합하기 위해.
  • 밀집 연결과 보조 글로벌 컨텍스트 모델링을 통해 특징 표현을 향상시키기 위해.
  • 감독 없이도 강력하고 균형 잡히며 고품질의 융합을 달성하기 위해.

제안 방법

  • 다른 원본 이미지 간 상호 상관관계를 모델링하고 공간적 대응 관계에 중점을 두는 교차 어텐션 모듈을 도입한다.
  • 특징 집합 및 기울기 흐름 향상, 특징 재사용을 개선하기 위해 밀집 연결 아키텍처를 활용한다.
  • 장거리 문맥적 의존성과 글로벌 이미지 구조를 캡처하기 위해 보조 브랜치를 통합한다.
  • 정렬된 특징에서 최종 융합 이미지를 재구성하기 위해 잔차 병합 네트워크를 사용한다.
  • 깊은 층을 넘어서도 필수 특징을 유지하고 전파하기 위해 글로벌 잔차 학습(GRL)을 적용한다.
  • 원본 이미지 특성에 기반한 교차 자기 어텐션 및 교차 공간 어텐션을 사용해 작업별 융합 모듈을 설계한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델은 비지도 이미지 융합에서 원본 이미지 간 공간적 대응 관계를 어떻게 더 잘 모델링할 수 있는가?
  • RQ2교차 어텐션 메커니즘은 다양한 이미지 융합 작업 간 특징 정렬 및 융합 품질 향상에 기여하는가?
  • RQ3보조 글로벌 컨텍스트 모델링은 복잡한 이미지 융합 시나리오에서 융합 성능 향상에 어느 정도 기여하는가?
  • RQ4밀집 연결과 어텐션 메커니즘의 통합은 특징 표현 및 재구성에 어떻게 기여하는가?
  • RQ5통합 프레임워크는 일관된 성능으로 다중 모달, 다중 노출, 다중 집중도 이미지 융합을 효과적으로 처리할 수 있는가?

주요 결과

  • 제안된 CADNIF 모델은 여러 이미지 융합 벤치마크에서 최신 기법을 능가하는 최상의 성능을 달성하였으며, 정량적·정성적 평가에서 모두 뛰어난 성능을 보였다.
  • 적외선 및 가시광선 이미지 융합에서 CADNIF는 Qabf 점수 0.4070, SD 103.5565, CC 14.8226를 기록하여 모든 아블레이션 변형을 압도했다.
  • 아블레이션 연구를 통해 보조 네트워크(AU)와 글로벌 잔차 학습(GRL) 구성 요소가 SD 및 Qabf 지표 향상에 크게 기여하는 것으로 확인되었다.
  • 어텐션 맵의 시각화 결과, 두 원본 이미지의 주목할 만한 특징 및 구조적 세부 정보에 효과적으로 어텐션을 집중하는 것으로 나타났다.
  • 모델은 다중 모달, 다중 노출, 다중 집중도, 그리고 의료 이미지 융합을 포함한 네 가지 융합 작업 전반에서 뛰어난 일반화 성능를 보였다.
  • 전체 모델(CA-DRDB-AU-GRL-Net)은 모든 지표에서 최고 점수를 기록하여 통합된 구성 요소의 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.