Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Mixed Transformer for Single Image Super-Resolution

Ling Zheng, Jinchen Zhu|arXiv (Cornell University)|2023. 05. 19.
Advanced Image Processing Techniques인용 수 4
한 줄 요약

이 논문은 단일 이미지 초해상도(SISR)를 위한 경량 트랜스포머 기반 아키텍처인 효율적 혼합 트랜스포머(EMT)를 제안한다. EMT는 매개변수 없는 픽셀 믹서(PM)를 통해 국소적 특징 집합을 향상시키고, 줄무늬 창 자기주의(SWSA)를 사용하여 전역 모델링의 효율성을 높인다. EMT는 복잡도를 감소시키면서도 기존 방법들보다 Set5, Urban100, BSD100 등의 벤치마크 데이터셋에서 ×4 확대에서 최고 성능을 기록한다.

ABSTRACT

Recently, Transformer-based methods have achieved impressive results in single image super-resolution (SISR). However, the lack of locality mechanism and high complexity limit their application in the field of super-resolution (SR). To solve these problems, we propose a new method, Efficient Mixed Transformer (EMT) in this study. Specifically, we propose the Mixed Transformer Block (MTB), consisting of multiple consecutive transformer layers, in some of which the Pixel Mixer (PM) is used to replace the Self-Attention (SA). PM can enhance the local knowledge aggregation with pixel shifting operations. At the same time, no additional complexity is introduced as PM has no parameters and floating-point operations. Moreover, we employ striped window for SA (SWSA) to gain an efficient global dependency modelling by utilizing image anisotropy. Experimental results show that EMT outperforms the existing methods on benchmark dataset and achieved state-of-the-art performance. The Code is available at https://github.com/Fried-Rice-Lab/FriedRiceLab.

연구 동기 및 목표

  • 트랜스포머 기반 SISR 방법에서 국소성 모델링의 부족과 높은 계산 복잡도 문제를 해결하기 위해.
  • 매개변수나 FLOPs를 증가시키지 않고 국소적 특징 집합을 향상시키기 위해.
  • 이미지의 이방향성 구조를 활용하여 전역 의존성 모델링을 향상시키기 위해.
  • 경량 SISR를 위한 성능과 모델 복잡도 사이의 더 나은 트레이드오프를 달성하기 위해.
  • 모바일 및 임베디드 장치에서의 효율적 배포를 가능하게 하기 위해.

제안 방법

  • 전역(GTL)과 국소(LTL) 트랜스포머 레이어를 번갈아가며 사용하는 혼합 트랜스포머 블록(MTB)을 제안하여 전역 및 국소 모델링의 균형을 맞춘다.
  • 채널별 분리와 픽셀 이동을 활용한 매개변수 없고 FLOPs 없이 국소적 인지망을 구현하는 픽셀 믹서(PM)를 도입하여 국소적 특징 집합을 향상시킨다.
  • 이미지의 이방향성을 활용하여 장거리 의존성을 효율적으로 모델링하는 줄무늬 창 자기주의(SWSA)를 사용하여 계산량을 감소시킨다.
  • 얕은 특징 추출, 스택된 MTB를 통한 깊은 특징 추출, 스kip 연결을 사용한 복원 단계로 구성된 3단계 아키텍처를 사용한다.
  • PM에서 채널별 특징 혼합과 픽셀 이동을 적용하여 추가 매개변수 없이 국소 수용 영역을 확장한다.
  • 성능을 유지하면서도 특정 자기주의 레이어를 PM으로 교체하여 모델 복잡도를 제어한다.

실험 결과

연구 질문

  • RQ1선택적 자기주의와 국소 인지망을 갖춘 혼합 트랜스포머 블록은 SISR에서 국소적 특징 학습을 향상시킬 수 있는가?
  • RQ2매개변수 없는 픽셀 믹서는 FLOPs나 매개변수를 증가시키지 않고 국소 지식 집합을 향상시킬 수 있는가?
  • RQ3줄무늬 창 주의는 이미지의 이방향성을 활용하여 전역 의존성 모델링의 효율성을 향상시킬 수 있는가?
  • RQ4SISR 성능과 복잡도에 최적의 균형을 이루기 위해 MTB 내 전역 레이어와 국소 레이어의 비율은 어떻게 설정해야 하는가?
  • RQ5제안된 EMT는 기존의 경량 SISR 방법들보다 낮은 모델 복잡도로 최고 성능을 달성할 수 있는가?

주요 결과

  • EMT는 ×4 초해상도에서 Set5, Set14, Urban100, BSD100, Manga109에서 최고 성능을 기록하였으며, Set5에서 PSNR는 32.559, Urban100에서 26.741를 기록하였다.
  • 2GTL(전역 트랜스포머 레이어 2개)를 갖춘 MTB가 동일한 매개변수 수준에서 4GTL 및 6GTL 버전보다 성능-복잡도 트레이드오프에서 가장 우수한 성능을 보였다.
  • 픽셀 믹서(PM)는 매개변수나 FLOPs를 추가하지 않으면서도 평균 주의 거리(MAD)를 감소시키고 국소 주의 사용량을 증가시켰으며, 특히 깊은 레이어에서 두드러졌다.
  • PM을 포함한 EMT는 동일한 매개변수 제약 조건 하에서 31.329의 PSNR를 기록하여 신뢰성 기반 기준값(31.296)을 초월하였다.
  • 줄무늬 창을 사용한 SWSA가 정사각형 창 대비 전역 모델링 효율성과 성능을 향상시켰으며, 특히 네트워크의 깊은 단계에서 두드러졌다.
  • 제거 실험 결과, PM이 질적 결과에서 무늬와 세부 정보 복원 능력을 크게 향상시킨다는 것이 확인되었다. 이는 Urban100과 Manga109에서의 결과를 통해 명확히 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.