Skip to main content
QUICK REVIEW

[논문 리뷰] HyperTransformer: A Textural and Spectral Feature Fusion Transformer for Pansharpening

Wele Gedara Chaminda Bandara, Vishal M. Patel|arXiv (Cornell University)|2022. 03. 04.
Advanced Image Fusion Techniques인용 수 14
한 줄 요약

HyperTransformer는 다중 헤드 소프트 어텐션 모듈을 사용하여 투명한 고해상도 무늬 특징을 투명한 고해상도 무늬 특징을 저해상도 고스펙트럼(HSI) 특징에 전달하는 새로운 자기주의 기반 융합 메커니즘을 제안한다. 다양한 척도에서 교차 특징 공간 상관관계와 장거리 공간-스펙트럼 관계를 모델링함으로써, 벤치마크 데이터셋에서 기존 방법 대비 최대 11.2% 향상된 RMSE와 2.1 dB 향상된 PSNR를 기록하며 스펙트럼 및 공간 품질 측면에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Pansharpening aims to fuse a registered high-resolution panchromatic image (PAN) with a low-resolution hyperspectral image (LR-HSI) to generate an enhanced HSI with high spectral and spatial resolution. Existing pansharpening approaches neglect using an attention mechanism to transfer HR texture features from PAN to LR-HSI features, resulting in spatial and spectral distortions. In this paper, we present a novel attention mechanism for pansharpening called HyperTransformer, in which features of LR-HSI and PAN are formulated as queries and keys in a transformer, respectively. HyperTransformer consists of three main modules, namely two separate feature extractors for PAN and HSI, a multi-head feature soft attention module, and a spatial-spectral feature fusion module. Such a network improves both spatial and spectral quality measures of the pansharpened HSI by learning cross-feature space dependencies and long-range details of PAN and LR-HSI. Furthermore, HyperTransformer can be utilized across multiple spatial scales at the backbone for obtaining improved performance. Extensive experiments conducted on three widely used datasets demonstrate that HyperTransformer achieves significant improvement over the state-of-the-art methods on both spatial and spectral quality measures. Implementation code and pre-trained weights can be accessed at https://github.com/wgcban/HyperTransformer.

연구 동기 및 목표

  • 기존 패닝샤피닝 방법이 PAN 및 저해상도 고스펙트럼(LR-HSI) 간의 교차 특징 상관관계를 효과적으로 모델링하지 못하는 한계를 해결한다.
  • 고해상도 무늬 특징과 저해상도 스펙트럼 특징을 단순히 연결하거나 지도 없이 융합함으로써 발생하는 공간적 및 스펙트럼 왜곡을 완화한다.
  • 전체 맥락과 스펙트럼 유사도를 바탕으로 주목적 기반으로 고해상도 무늬 특징을 저해상도 고스펙트럼에 선택적으로 전달하기 위해 주목적 메커니즘을 활용한다.
  • 백본 내에서 다중 척도 특징 융합을 가능하게 하여 다양한 공간 해상도에서 풍부한 무늬 표현을 캡처한다.
  • 주목적에 의해 이끌리는 전용 무늬-스펙트럼 특징 융합 모듈을 통해 패링샤피닝된 HSI의 스펙트럼 및 공간 정밀도를 향상시킨다.

제안 방법

  • PAN 및 LR-HSI를 깊은 특징 표현으로 인코딩하기 위해 두 개의 별도 특징 추출기(FE-PAN 및 FE-HSI)를 활용한다.
  • 다중 헤드 자기주의 기반으로 LR-HSI 특징을 쿼리(Q), PAN 특징을 키(K), PAN 특징을 밸류(V)로 설정하여 교차 특징 주목적 가중치를 계산한다.
  • 다중 헤드 특징 소프트 주목적 모듈을 사용하여, 각 저해상도 고스펙트럼의 공간 위치에 대해 가장 관련성이 높은 고해상도 무늬 특징을 동적으로 주목한다.
  • 주목적된 PAN 특징과 LR-HSI 특징을 융합하여 향상된 HSI 표현을 생성하기 위해 공간-스펙트럼 특징 융합 모듈을 통합한다.
  • 계층적인 무늬 세부 정보를 캡처하고 특징 표현 학습을 향상시키기 위해 다양한 공간 척도(×1, ×2, ×4)에 HyperTransformer 모듈을 삽입한다.
  • 픽셀 수준 정확도와 고수준 의미 일致성을 유지하기 위해 L1 손실, VGG 인지 손실, 전이 인지 손실의 조합을 사용하여 네트워크를 훈련시킨다.
Figure 1: How our HyperTransformer differs from existing pansharpening architectures. Traditional pansharpening methods simply concatenate PAN ( $\mathbf{p}$ ) and LR-HSI ( $\mathbf{y}$ ) in (a) image domain [ 58 , 22 ] or (b) feature domain [ 14 , 41 , 45 ] to learn the mapping function from LR-HSI
Figure 1: How our HyperTransformer differs from existing pansharpening architectures. Traditional pansharpening methods simply concatenate PAN ( $\mathbf{p}$ ) and LR-HSI ( $\mathbf{y}$ ) in (a) image domain [ 58 , 22 ] or (b) feature domain [ 14 , 41 , 45 ] to learn the mapping function from LR-HSI

실험 결과

연구 질문

  • RQ1자기주의 기반 메커니즘이 패링샤피닝에서 PAN 및 LR-HSI 특징 간의 장거리 상관관계와 교차 특징 공간 관계를 효과적으로 모델링할 수 있는가?
  • RQ2단일 척도 융합 대비 PAN 특징의 다중 척도 통합이 패링샤피닝된 HSI의 품질 향상에 기여하는가?
  • RQ3주목적 기반 특징 융합이 연결 기반 또는 컨볼루션 전용 융합 방법에 비해 스펙트럼 및 공간 왜곡을 감소시킬 수 있는가?
  • RQ4인지 손실(VGG 및 전이 기반)이 출력 HSI의 인지 품질과 스펙트럼 정밀도 향상에 기여하는 방식은 무엇인가?
  • RQ5제안된 HyperTransformer가 정량적 및 정성적 평가 모두에서 기존 최신 기술 수준 방법을 얼마나 뛰어나게 성능을 냈는가?

주요 결과

  • Pavia Center 데이터셋에서 HyperTransformer는 CC 0.989, SAM 3.85, RMSE 0.0087, ERGAS 2.01, PSNR 43.80을 기록하며 기존 SOTA 방법을 초월한다.
  • 모든 세 가지 척도(×1, ×2, ×4)에 HyperTransformer를 통합할 경우, 단지 ×4 척도만 사용할 때 대비 RMSE는 11.2% 향상되고 PSNR는 2.1 dB 향상된다.
  • 전이 인지 손실을 추가할 경우, 단지 L1 및 VGG 인지 손실만 사용할 때 대비 SAM은 4.0% 향상되고 RMSE는 3.3% 향상된다.
  • 제거 분석 결과, 다중 척도 특징 융합이 성능 향상에 크게 기여하며, 세 가지 척도를 모두 사용했을 때 최고의 성능를 기록함을 확인한다.
  • 시각적 분석 결과, 가시대역에서 MAE 감소와 함께 무늬 보존이 향상되었으나, UV 및 적외선 대역은 PAN 이미지의 한계로 인해 여전히 높은 오차를 보였다.
  • 세 가지 널리 사용되는 데이터셋에서의 성능을 통해 일반화 능력과 스펙트럼 및 공간 품질 지표에서의 우수성을 확인하였다.
Figure 2: Overall structure of the proposed HyperTransformer for textural-spectral feature fusion.
Figure 2: Overall structure of the proposed HyperTransformer for textural-spectral feature fusion.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.