Skip to main content
QUICK REVIEW

[논문 리뷰] Infrared and Visible Image Fusion via Interactive Compensatory Attention Adversarial Learning

Zhishe Wang, Wenyu Shao|arXiv (Cornell University)|2022. 03. 29.
Advanced Image Fusion Techniques인용 수 5
한 줄 요약

이 논문은 적외선 및 가시광선 영상 융합을 위한 새로운 엔드 투 엔드 생성적 적대 신경망인 ICAFusion을 제안한다. 이는 상호작용적이고 보완적인 주의 모듈을 갖춘 삼중경로 인코더-디코더 아키텍처를 사용하여 장거리 의존성을 모델링하고 특징 표현을 향상시킨다. 이중 판별기와 특수 손실 함수를 통합함으로써 융합 균형을 향상시키고 적외선 목표물의 세부 정보와 가시광선 텍스처를 잘 유지하며, 여러 데이터셋에서 주관적 및 객관적 평가에서 9개의 최신 기법들을 능가한다.

ABSTRACT

The existing generative adversarial fusion methods generally concatenate source images and extract local features through convolution operation, without considering their global characteristics, which tends to produce an unbalanced result and is biased towards the infrared image or visible image. Toward this end, we propose a novel end-to-end mode based on generative adversarial training to achieve better fusion balance, termed as extit{interactive compensatory attention fusion network} (ICAFusion). In particular, in the generator, we construct a multi-level encoder-decoder network with a triple path, and adopt infrared and visible paths to provide additional intensity and gradient information. Moreover, we develop interactive and compensatory attention modules to communicate their pathwise information, and model their long-range dependencies to generate attention maps, which can more focus on infrared target perception and visible detail characterization, and further increase the representation power for feature extraction and feature reconstruction. In addition, dual discriminators are designed to identify the similar distribution between fused result and source images, and the generator is optimized to produce a more balanced result. Extensive experiments illustrate that our ICAFusion obtains superior fusion performance and better generalization ability, which precedes other advanced methods in the subjective visual description and objective metric evaluation. Our codes will be public at \url{https://github.com/Zhishe-Wang/ICAFusion}

연구 동기 및 목표

  • 기존 GAN 기반 방법이 입력을 연결하고 단일 판별기를 사용함으로써 발생하는 융합 결과의 균형 문제를 해결하기 위해.
  • 다중경로 인코더-디코더 프레임워크에서 상호작용적이고 보완적인 주의 기반 메커니즘을 통해 장거리 의존성을 모델링하여 특징 표현을 향상시키기 위해.
  • 융합 결과와 원본 이미지 간의 분포 유사성을 강제하는 이중 판별기를 사용하여 더 나은 융합 균형을 달성하기 위해.
  • 적외선 및 가시광선 경로를 전용으로 제공하여 강도 및 기울기 정보를 확보함으로써 목표물 인식 및 텍스처 보존 성능을 향상시키기 위해.
  • 다양한 벤치마크 데이터셋에서 강력한 일반화 능력과 계산 효율성을 입증하기 위해.

제안 방법

  • 적외선 및 가시광선 영상의 모odal 특성 정보를 유지하기 위해 주 경로와 두 개의 보조 경로를 갖는 삼중경로 구조를 가진 다수준 인코더-디코더 네트워크.
  • 경로 간 특징 맵을 교환하고 정제함으로써 장거리 의존성을 모델링하고 표현 능력을 향상시키는 상호작용적이고 보완적인 주의 모듈.
  • 융합 결과와 원본 이미지 간의 유사성을 평가하여 생성자에게 더 균형 잡히고 현실적인 출력을 생성하도록 이끄는 이중 판별기.
  • 생성자 최적화를 위해 적대적 손실, 재구성 손실, 주의 기반 손실을 조합한 특수 손실 함수.
  • 적대적 학습을 통한 엔드 투 엔드 훈련으로 특징 추출, 주의 조절, 융합 생성을 동시에 최적화.
  • 적외선 및 가시광선 경로로부터 얻은 강도 및 기울기 정보를 융합하여 목표물 및 세부 정보 보존을 향상시킴.

실험 결과

연구 질문

  • RQ1상호작용적이고 보완적인 주의 기반 메커니즘이 적외선-가시광선 영상 융합에서 특징 표현과 융합 균형을 향상시키는가?
  • RQ2단일 판별기 GAN과 비교해 이중 판별기를 사용할 경우 융합 결과와 원본 이미지 간의 분포 일치가 향상되는가?
  • RQ3모달 특성에 맞는 경로를 갖는 삼중경로 인코더-디코더 아키텍처가 목표물 및 텍스처 세부 정보 보존을 향상시키는가?
  • RQ4주관적 시각적 품질과 객관적 지표 모두에서 ICAFusion은 최신 기법들보다 우수한 성능을 보이는가?
  • RQ5ICAFusion은 다양한 데이터셋에서 계산 효율성과 일반화 능력이 뛰어나다고 할 수 있는가?

주요 결과

  • TNO 데이터셋에서 ICAFusion은 EN, SD, MI, NCIE, VIF의 다섯 객관적 지표에서 1위를 기록했으며, AG와 SF에서는 2위를 기록했다.
  • Roadscene 데이터셋에서 ICAFusion은 EN, SD, MI, NCIE, VIF에서 1위를 기록했고, AG, SF, Qabf에서도 2위를 기록하여 IFCNN를 제외한 모든 기법을 능가했다.
  • OTCBVS 데이터셋에서 ICAFusion은 EN, SD, MI, NCIE, VIF에서 1위를 기록했으며, AG, SF, Qabf에서도 2위를 기록하여 다양한 환경에서 강력한 일반화 능력을 입증했다.
  • 가장 높은 EN 값은 ICAFusion이 원본 이미지의 유용한 정보를 풍부하게 유지하고 있음을 나타내며, 이는 삼중경로 설계와 주의 모듈의 기여로 기인한다.
  • 가장 큰 MI 및 NCIE 값은 융합 결과와 원본 이미지 간 강한 상관관계와 유사성을 확인하며, 이는 이중 판별기 감시와 최적화된 손실 함수 덕분이다.
  • ICAFusion은 경쟁 가능한 계산 효율성을 확보했으며, DenseFuse와 IFCNN에 비해 略로 빠르고, CPU에서 실행되는 MDLatLRR에 비해 상당히 빠르다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.