[논문 리뷰] Transformer for Single Image Super-Resolution
이 논문은 단일 이미지 초해상도에서 상태의 성능을 달성하면서도 계산 비용을 크게 줄인 하이브리드 CNN-Transformer 아키텍처인 효율적인 초해상도 트랜스포머(ESRT)를 제안한다. 경량 CNN 백본(LCB)과 고해상도 블록을 통합하고, 효율적 다중헤드 어텐션(EMHA)을 사용하는 경량 트랜스포머 백본(LTB)을 적용하여 GPU 메모리 사용량을 4,191M로 줄였으며, 원래 트랜스포머의 26% 수준으로 줄였고, 기준 데이터셋에서 PSNR를 최대 0.32dB 향상시켰다.
Single image super-resolution (SISR) has witnessed great strides with the development of deep learning. However, most existing studies focus on building more complex networks with a massive number of layers. Recently, more and more researchers start to explore the application of Transformer in computer vision tasks. However, the heavy computational cost and high GPU memory occupation of the vision Transformer cannot be ignored. In this paper, we propose a novel Efficient Super-Resolution Transformer (ESRT) for SISR. ESRT is a hybrid model, which consists of a Lightweight CNN Backbone (LCB) and a Lightweight Transformer Backbone (LTB). Among them, LCB can dynamically adjust the size of the feature map to extract deep features with a low computational cost. LTB is composed of a series of Efficient Transformers (ET), which occupies a small GPU memory occupation, thanks to the specially designed Efficient Multi-Head Attention (EMHA). Extensive experiments show that ESRT achieves competitive results with low computational costs. Compared with the original Transformer which occupies 16,057M GPU memory, ESRT only occupies 4,191M GPU memory. All codes are available at https://github.com/luissen/ESRT.
연구 동기 및 목표
- 단일 이미지 초해상도(SISR)에서 비전 트랜스포머의 높은 계산 비용과 GPU 메모리 소비 문제를 해결하기 위해.
- 유사한 이미지 패치 간의 장거리 특징 의존성을 경량 트랜스포머 메커니즘을 통해 효과적으로 모델링하기 위해.
- 높은 성능를 유지하면서 모델 크기와 추론 비용을 크게 줄인 하이브리드 CNN-Transformer 모델을 개발하기 위해.
- 제한된 하드웨어 자원을 가진 실세계 응용 프로그램에서 트랜스포머 기반 SISR 모델의 실용적 구현을 가능하게 하기 위해.
제안 방법
- 특징 맵 크기를 동적으로 조정하여 계산량을 줄이고 고주파 세부 정보를 유지하기 위해 고주파 필터링 모듈(HFM)을 통합한 경량 CNN 백본(LCB)을 제안한다.
- 잔차 경로와 아이덴티티 경로를 적응적으로 융합하여 특징 표현을 향상시키는 적응형 잔차 특징 블록(ARFB)을 도입한다.
- 자기어텐션을 국소 영역으로 제한하여 GPU 메모리 사용량을 줄이는 새로운 효율적 다중헤드 어텐션(EMHA) 메커니즘을 갖춘 효율적 트랜스포머(ET)를 설계한다.
- EMHA에서 분할 요소를 활용하여 국소화된 이미지 블록에서 어텐션을 계산함으로써 전체 어텐션 계산 없이도 장거리 의존성을 효율적으로 모델링한다.
- CNN이 깊은 특징을 추출하고 트랜스포머가 유사 패치 간 장거리 맥락을 모델링하는 하이브리드 아키텍처에서 LCB와 LTB를 결합한다.
- 표준 SISR 벤치마크(Set5, Set14, Urban100)에서 48×48 패치 크기와 배치 크기 16로 모델을 엔드 투 엔드로 훈련한다.

실험 결과
연구 질문
- RQ1과도한 메모리 비용 없이 경량 트랜스포머 메커니즘이 SISR에서 유사한 이미지 패치 간의 장거리 의존성을 효과적으로 모델링할 수 있는가?
- RQ2하이브리드 CNN-Transformer 아키텍처는 계산 및 메모리 오버헤드를 최소화하면서 초해상도 성능을 어떻게 향상시킬 수 있는가?
- RQ3제안된 효율적 다중헤드 어텐션(EMHA)이 SISR에서 표준 트랜스포머에 비해 GPU 메모리 사용량을 얼마나 줄일 수 있는가?
- RQ4제안된 효율적 트랜스포머(ET)는 기존 SISR 모델인 RCAN에 최소한의 아키텍처 변경으로 적용되어 성능 향상을 이룰 수 있는가?
- RQ5ESRT 모델은 IMDN 및 LK-KPN과 같은 전용 경량 모델에 비해 실세계 이미지에서 더 뛰어난 성능을 발휘하는가?
주요 결과
- ESRT는 ×4 초해상도에서 Set5에서 PSNR 32.18 dB를 달성하여 원본 트랜스포머(32.14 dB)를 능가했으며, GPU 메모리 사용량은 74% 줄어든 4,191M(16,057M 대비)을 기록했다.
- 제안된 효율적 트랜스포머(ET)는 원본 트랜스포머 대비 GPU 메모리 소비량을 1/4으로 줄였고, Set5에서 성능을 0.04 dB 향상시켰다.
- RCAN에 통합된 ET 모듈(RCAN/2+ET)은 전체 RCAN 모델(16M 파라미터)과 비교해도 유사하거나 더 뛰어난 성능를 기록했으며, 파라미터 수는 46% 줄어든 8.7M였다.
- 실세계 이미지(RealSR 데이터셋)에서 ESRT는 ×4 초해상도에서 PSNR 28.78 dB를 기록했으며, IMDN(28.68 dB)과 LK-KPN(28.65 dB)을 모두 능가했다.
- SwinIR와 비교했을 때, ESRT는 BSD100에서 거의 동일한 성능(29.15 dB)을 기록했으며, 파라미터 수는 12% 줄어든 770K(886K 대비), GPU 메모리 사용량은 39% 줄어든 4,191M(6,966M 대비)을 기록했다.
- 제거 실험 결과, LCB에서 HFM와 ARFB의 조합이 특징 보존을 향상시키고 계산량을 줄이는 데 기여하며, LTB에서의 EMHA는 장거리 의존성의 효율적 모델링을 가능하게 한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.