Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Frequency Domain-based Transformers for High-Quality Image Deblurring

Lingshun Kong, Jiangxin Dong|arXiv (Cornell University)|2022. 11. 22.
Advanced Image Processing Techniques인용 수 7
한 줄 요약

이 논문은 고성능 이미지 디블러핑을 위한 효율적인 주파수 도메인 기반 트랜스포머인 FFTformer을 제안한다. 컷오프 정리( convolution theorem)를 활용하여, 특성 맵 크기의 제곱에 비례하는 복잡도를 가지는 스케일드 도트프로덕트 어텐션을 주파수 도메인에서의 원소별 곱셈으로 대체함으로써 O(N log N)의 복잡도로 줄였다. 동시에 저주파 및 고주파 성분을 유지하는 JPEG 유사 게이팅을 갖춘 주파수 기반의 구분형 피드포워드 네트워크(DFFN)를 도입하였다. 이는 중요한 저주파 및 고주파 특징을 유지하는 데 기여한다. 제안된 방법은 FLOPs와 파라미터 수를 줄였음에도 불구하고 최신 기준 성능을 달성하였다.

ABSTRACT

We present an effective and efficient method that explores the properties of Transformers in the frequency domain for high-quality image deblurring. Our method is motivated by the convolution theorem that the correlation or convolution of two signals in the spatial domain is equivalent to an element-wise product of them in the frequency domain. This inspires us to develop an efficient frequency domain-based self-attention solver (FSAS) to estimate the scaled dot-product attention by an element-wise product operation instead of the matrix multiplication in the spatial domain. In addition, we note that simply using the naive feed-forward network (FFN) in Transformers does not generate good deblurred results. To overcome this problem, we propose a simple yet effective discriminative frequency domain-based FFN (DFFN), where we introduce a gated mechanism in the FFN based on the Joint Photographic Experts Group (JPEG) compression algorithm to discriminatively determine which low- and high-frequency information of the features should be preserved for latent clear image restoration. We formulate the proposed FSAS and DFFN into an asymmetrical network based on an encoder and decoder architecture, where the FSAS is only used in the decoder module for better image deblurring. Experimental results show that the proposed method performs favorably against the state-of-the-art approaches. Code will be available at \url{https://github.com/kkkls/FFTformer}.

연구 동기 및 목표

  • 이미지 디블러핑에 적용되는 표준 자기어텐션의 높은 계산 비용 문제를 해결하기 위해, 특성 맵 크기에 비례하여 제곱적으로 증가하는 복잡도를 감소시키기 위함.
  • 특성 표현에서 관련 있는 주파수 성분(저주파 및 고주파)을 보다 효과적으로 유지함으로써 디블러핑 품질을 향상시키기 위함.
  • 복잡도와 추론 비용을 줄이되, 복원 정확도를 유지하거나 향상시키기 위함.
  • 이미지 디블러핑에 대해 주파수 도메인에서 트랜스포머 메커니즘을 적용하는 것이 공간 도메인보다 유리한지 탐색하기 위함.
  • 주파수 기반 어텐션을 디코더에서만 적용함으로써 흐린 얕은 특징에서 발생하는 노이즈 증폭을 방지하기 위해 비대칭 인코더-디코더 아키텍처를 설계하기 위함.

제안 방법

  • 스케일드 도트프로덕트 어텐션을 주파수 도메인에서의 원소별 곱셈을 통해 계산하는 주파수 도메인 기반 자기어텐션 솔버(FSAS)를 제안하여 복잡도를 O(N²)에서 O(N log N)으로 감소시켰다.
  • 컨볼루션 정리 적용: 공간 도메인의 컨볼루션은 주파수 도메인에서 원소별 곱셈과 동치이며, 이는 효율적인 어텐션 계산을 가능하게 한다.
  • JPEG 압축에서 영감을 얻은 게이팅 메커니즘을 사용하는 주파수 기반의 구분형 피드포워드 네트워크(DFFN)를 도입하여 유용한 주파수 성분을 선택적으로 유지한다.
  • FSAS를 디코더에서만 적용하는 비대칭 인코더-디코더 네트워크 아키텍처를 설계하여 흐린 얕은 특징에서의 어텐션 계산을 피한다.
  • FSAS와 DFFN을 함께 최적화할 수 있는 엔드 투 엔드 훈련 가능한 프레임워크를 구현하였다.
  • FFT 기반 연산을 사용하여 특성 맵을 주파수 도메인으로 변환하고, 원소별 곱셈을 통해 어텐션을 적용한 후 다시 공간 도메인으로 복원한다.

실험 결과

연구 질문

  • RQ1주파수 도메인 연산을 통해 이미지 디블러핑에 적용되는 트랜스포머의 자기어텐션 복잡도를 성능 저하 없이 감소시킬 수 있는가?
  • RQ2디코더에서만 주파수 기반 어텐션을 적용할 경우 인코더와 디코더 양쪽에 적용하는 것보다 디블러핑 품질이 향상되는가?
  • RQ3FFN에 주파수 인식 게이팅 메커니즘을 도입하면 저주파 및 고주파 성분을 선택적으로 유지함으로써 특징 정련 성능을 향상시킬 수 있는가?
  • RQ4PSNR, SSIM, FLOPs, 모델 파라미터 수 측면에서 제안된 방법은 최신 기준 방법들과 비교해 어떻게 성능을 내는가?
  • RQ5자기어텐션을 주파수 도메인에서 재구성함으로써 공간 도메인 어텐션보다 더 나은 블러 제거 및 날카운 에지 복원 성능을 달성하는가?

주요 결과

  • 제안된 FSAS는 자기어텐션의 공간 및 시간 복잡도를 O(N²)에서 O(N log N)으로 감소시켜 효율성을 크게 향상시켰다.
  • GoPro 데이터셋에서 PSNR 33.73, SSIM 0.9663을 기록하여 정확도와 효율성 측면에서 최신 기준 방법들을 모두 초월하였다.
  • 제거 분석 결과, FSAS를 디코더에서만 사용할 경우 인코더와 디코더 양쪽에 적용한 경우보다 최소 0.17 dB 높은 PSNR를 달성하였다.
  • 표준 FFN을 사용한 경우 대비 DFFN를 적용함으로써 PSNR가 0.36 dB 향상되어 주파수 인식 특징 정련의 효과를 입증하였다.
  • 시각적 비교 결과, FSAS와 DFFN를 함께 사용할 경우 더 선명한 이미지와 개선된 에지 복원, 감소된 아티팩트를 제공함을 확인하였다.
  • 기존 방법들과 비교해 더 작은 모델 크기와 낮은 FLOPs를 기록함으로써 정확도와 효율성 간의 유리한 트레이드오프를 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.