Skip to main content
QUICK REVIEW

[논문 리뷰] Xformer: Hybrid X-Shaped Transformer for Image Denoising

Jiale Zhang, Yulun Zhang|arXiv (Cornell University)|2023. 03. 11.
Image and Signal Denoising Methods인용 수 6
한 줄 요약

Xformer는 공간적 및 채널 차원에서 별도의 공간적 및 채널적 트랜스포머 블록을 사용하여 동시에 전역적 의존성을 모델링하는 하이브리드 X자형 트랜스포머를 제안한다. 상호작용적 특징 융합을 위한 이중연결유닛(BCU)을 통해 합계 FLOPs와 모델 크기와 유사한 수준에서 합성 및 실세계 노이즈 제거 벤치마크에서 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

In this paper, we present a hybrid X-shaped vision Transformer, named Xformer, which performs notably on image denoising tasks. We explore strengthening the global representation of tokens from different scopes. In detail, we adopt two types of Transformer blocks. The spatial-wise Transformer block performs fine-grained local patches interactions across tokens defined by spatial dimension. The channel-wise Transformer block performs direct global context interactions across tokens defined by channel dimension. Based on the concurrent network structure, we design two branches to conduct these two interaction fashions. Within each branch, we employ an encoder-decoder architecture to capture multi-scale features. Besides, we propose the Bidirectional Connection Unit (BCU) to couple the learned representations from these two branches while providing enhanced information fusion. The joint designs make our Xformer powerful to conduct global information modeling in both spatial and channel dimensions. Extensive experiments show that Xformer, under the comparable model complexity, achieves state-of-the-art performance on the synthetic and real-world image denoising tasks. We also provide code and models at https://github.com/gladzhang/Xformer.

연구 동기 및 목표

  • 이미지 노이즈 제거에서 CNN과 표준 트랜스포머의 장거리 의존성 및 동적 콘텐츠 모델링 한계를 해결하기 위해.
  • 공동으로 공간적 및 채널적 토큰 상호작용을 모델링하여 전역 표현 학습을 향상시키기 위해.
  • 다양한 차원의 전역 특징을 추가적인 계산 비용 없이 동시에 융합하는 효율적인 네트워크 아키텍처를 설계하기 위해.
  • 단순 연결보다 더 높은 특징 표현을 가능하게 하는 이중연결 융합 메커니즘을 설계하기 위해.
  • 최소한의 계산 오버헤드로 합성 및 실세계 이미지 노이즈 제거 작업에서 최신 기술(SOTA) 성능을 달성하기 위해.

제안 방법

  • Xformer는 동시 이중브랜치 아키텍처를 사용한다: 한 브랜치는 공간 차원을 따라 국소 패치 상호작용을 모델링하기 위해 공간적 자기어텐션을 적용한다.
  • 다른 브랜치는 채널 차원을 따라 전역적 맥락을 캡처하기 위해 채널적 자기어텐션을 적용하여 장거리 의존성 모델링을 가능하게 한다.
  • 각 브랜치는 공간 및 채널 표현으로부터 다중 해상도 특징을 추출하기 위해 인코더-디코더 구조를 사용한다.
  • 이중연결유닛(BCU)은 3×3 컨볼루션을 통해 양 브랜치의 특징을 융합하고, 잔차 연결을 통해 표현 학습을 향상시킨다.
  • BCU는 양 브랜치 간의 상호작용적 정보 흐름을 가능하게 하여, 각 브랜치가 상호 보완적인 정보를 활용해 특징을 개선할 수 있도록 한다.
  • 표준 L1 및 지각적 손실 목표 함수를 사용하여 합성 및 실세계 노이즈 제거 데이터셋에서 엔드 투 엔드로 네트워크를 훈련시킨다.

실험 결과

연구 질문

  • RQ1공동으로 공간적 및 채널적 자기어텐션을 모델링하면 이미지 노이즈 제거에서 전역 표현을 향상시킬 수 있는가?
  • RQ2공간적 및 채널적 브랜치 간의 이중연결 융합은 단방향 또는 연결 기반 융합보다 노이즈 제거 성능을 어떻게 향상시키는가?
  • RQ3하이브리드 X자형 트랜스포머는 기존 SOTA 방법과 유사한 FLOPs 및 모델 크기로 최신 기술(SOTA) 성능을 달성할 수 있는가?
  • RQ4노이즈가 비독립적 동일분포(i.i.d.)이거나 복잡한 실세계 이미지에서 제안된 방법은 어떻게 성능을 내는가?
  • RQ5국소 패치 수준의 어텐션과 전역 채널 수준의 어텐션을 통합하면 세밀한 질감과 고주파 성분을 더 잘 보존할 수 있는가?

주요 결과

  • Xformer는 σ=50일 때 Urban100에서 PSNR 32.18 dB를 기록하여, 유사한 모델 복잡도에서 Restormer보다 0.34 dB 높은 성능을 달성한다.
  • SIDD 실세계 벤치마크에서 Xformer는 Uformer 및 Restormer을 포함한 모든 비교 방법들 중에서 최고의 PSNR 및 SSIM 점수를 기록한다.
  • Uformer 대비 FLOPs를 2.01배 감소시켰지만 더 높은 성능을 달성하여 뛰어난 효율성을 입증한다.
  • 시각적 결과에서 Xformer는 SwinIR, Restormer 및 기타 선도적 방법들보다 세밀한 질감과 고주파 성분을 더 잘 보존한다.
  • 이중연결유닛(BCU)은 특징 융합을 크게 향상시키며, 추론 실험을 통해 표현 학습 향상에 효과적임을 확인한다.
  • Xformer는 실세계 노이즈에 잘 일반화되며, DND 벤치마크에서 뛰어난 성능을 보이고, 도전적인 SIDD 예제에서도 매력적인 시각적 출력을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.