Skip to main content
QUICK REVIEW

[논문 리뷰] A Dual-branch Network for Infrared and Visible Image Fusion

Yu Fu, Xiao‐Jun Wu|arXiv (Cornell University)|2021. 01. 24.
Advanced Image Fusion Techniques참고 문헌 32인용 수 7
한 줄 요약

이 논문은 적외선 및 가시광선 영상 융합을 위한 이중 분지 자동에코 네트워크를 제안하며, 밀도 연결을 사용하는 세부 정보 분지와 빠른 다운샘플링을 사용하는 의미론적 분지를 통해 상보적인 특징을 추출한다. 이 특징들은 채널 기반 전략을 통해 융합되고 디코더를 통해 재구성된다. 이 방법은 기준 데이터셋에서 최신 기술 수준의 성능을 달성하여 기존 방법들보다 구조 유사도, 에지 유지 및 노이즈 감소 측면에서 뛰어난 성능을 보였다.

ABSTRACT

Deep learning is a rapidly developing approach in the field of infrared and visible image fusion. In this context, the use of dense blocks in deep networks significantly improves the utilization of shallow information, and the combination of the Generative Adversarial Network (GAN) also improves the fusion performance of two source images. We propose a new method based on dense blocks and GANs , and we directly insert the input image-visible light image in each layer of the entire network. We use SSIM and gradient loss functions that are more consistent with perception instead of mean square error loss. After the adversarial training between the generator and the discriminator, we show that a trained end-to-end fusion network -- the generator network -- is finally obtained. Our experiments show that the fused images obtained by our approach achieve good score based on multiple evaluation indicators. Further, our fused images have better visual effects in multiple sets of contrasts, which are more satisfying to human visual perception.

연구 동기 및 목표

  • 다른 신호 원천으로부터의 상보적 정보를 활용하여 적외선 및 가시광선 영상 융합의 과제를 해결하고자 한다.
  • 세부 정보와 의미론적 특징을 별도로 캡처할 수 있도록 이중 분지 인코더를 설계하여 특징 추출을 향상시키고자 한다.
  • 정보가 풍부한 특징 채널을 우선시하는 새로운 손실 함수와 채널 기반 융합 전략을 통해 융합 성능을 향상시키고자 한다.
  • 주관적 및 객관적 영상 융합 평가 지표에서 최신 기술 수준의 성과를 달성하고자 한다.
  • 의료 영상 및 고분광 영상과 같은 적외선-가시광선 융합 이외의 영상 융합 작업에 적용 가능한 일반화 가능한 프레임워크를 제공하고자 한다.

제안 방법

  • 네트워크는 이중 분지 인코더를 갖춘 자동에코 아키텍처를 사용한다: 하나의 분지는 밀도 연결을 통해 얕은 에지 풍부한 세부 정보를 추출하고, 다른 하나는 스트라이드 컨볼루션을 사용하여 전반적인 의미론적 및 구조적 표현을 추출한다.
  • 적외선 및 가시광선 영상은 이중 분지 구조를 통해 독립적으로 인코딩되어 두 세트의 특징 맵을 생성한다.
  • 융합 레이어는 두 특징 세트를 연결하고 학습 가능한 채널 기반 주의 메커니즘을 적용하여 중요한 채널을 강조함으로써 융합한다.
  • 융합된 특징들은 전치 컨볼루션과 스킵 연결을 통해 사용되는 디코더를 통해 최종 융합 영상을 재구성한다.
  • 재구성 오차를 최소화하고 주관적 품질을 향상시키기 위해 새로운 손실 함수를 설계하였다. 이는 L1 손실과 주관적 손실 성분을 조합한 것이다.
  • 픽셀 기반 재구성 손실과 주관적 손실을 조합하여 네트워크를 엔드 투 엔드로 훈련시켜 구조적 및 질감의 충실도를 유지한다.
Figure 1: The backbone of our network in this paper. The orange blocks is the detail branch, and the green blocks is the semantic branch. Concatenate the encoding results of the two branches to get our latent layer.
Figure 1: The backbone of our network in this paper. The orange blocks is the detail branch, and the green blocks is the semantic branch. Concatenate the encoding results of the two branches to get our latent layer.

실험 결과

연구 질문

  • RQ1딥 네트워크는 어떻게 적외선 및 가시광선 영상에서 상보적인 특징을 효과적으로 추출하고 융합할 수 있는가?
  • RQ2어떤 네트워크 아키텍처가 융합 영상에서 세부 정보와 전반적인 구조를 동시에 잘 유지할 수 있는가?
  • RQ3채널 기반 융합 전략은 다중 스펙트럼 영상 융합에서 전통적인 원소 기반 융합 방법보다 우월한가?
  • RQ4제안된 손실 함수는 재구성 품질 향상과 잡음 제거에 어느 정도 기여하는가?
  • RQ5제안된 방법은 적외선-가시광선 융합 이외의 영상 융합 작업에 일반화 가능한가?

주요 결과

  • 제안된 방법은 EI, SF, EN, SSIM, Nabf, MI 등 여섯 개의 객관적 지표에서 최고 또는 2위 성과를 기록하여 뛰어난 융합 품질을 입증하였다.
  • 채널 기반 융합 전략는 최고의 EI(59.2286)와 SF(21.9070)를 기록하여 강력한 에지 및 대비 유지 능력을 보였다.
  • 덧셈 기반 전략는 최고의 SSIM(0.7593)과 최저의 Nabf(0.0010)를 기록하여 높은 구조적 유사도와 최소한의 노이즈를 나타내었다.
  • 주관적 평가 결과, 제안된 방법은 CBF, FusionGan, 또는 DenseFuse와 달리 잡음이나 아티팩트 없이 더 많은 질감 세부 정보와 열복사 정보를 유지하였다.
  • 정량적 지표와 시각적 품질 양 측면에서 DenseFuse, FusionGan, DeepFuse 등의 최신 기술 수준 모델들을 초월하는 성능을 보였다.
  • 네트워크 구조와 손실 함수는 일반화 가능하며, 의료 영상, 고분광 융합, 기타 영상 복원 작업에 응용 가능성이 있다.
Figure 2: The network during the test phase.
Figure 2: The network during the test phase.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.