Skip to main content
QUICK REVIEW

[논문 리뷰] N-Gram in Swin Transformers for Efficient Lightweight Image Super-Resolution

Haram Choi, Jeongmin Lee|arXiv (Cornell University)|2022. 11. 21.
Advanced Image Processing Techniques인용 수 10
한 줄 요약

이 논문은 효율적인 경량 이미지 초해상도를 위한 스위니 트랜스포머에 N-그램 컨텍스트를 도입하여, 인접한 국소 윈도우 간의 슬라이딩 윈도우 자기주의를 통해 수용 필드를 확장한다. 채널 감소형 그룹 컨볼루션을 적용해 유니-그램 임베딩을 생성하고, 스케일드 코시너스 어텐션과 통합함으로써 제안된 NGswin 모델은 FLOPs를 감소시키면서도 최신 기준 성능을 달성한다. 또한 SwinIR-NG는 여러 데이터셋에서 경량 초해상도 벤치마크를 향상시킨다.

ABSTRACT

While some studies have proven that Swin Transformer (Swin) with window self-attention (WSA) is suitable for single image super-resolution (SR), the plain WSA ignores the broad regions when reconstructing high-resolution images due to a limited receptive field. In addition, many deep learning SR methods suffer from intensive computations. To address these problems, we introduce the N-Gram context to the low-level vision with Transformers for the first time. We define N-Gram as neighboring local windows in Swin, which differs from text analysis that views N-Gram as consecutive characters or words. N-Grams interact with each other by sliding-WSA, expanding the regions seen to restore degraded pixels. Using the N-Gram context, we propose NGswin, an efficient SR network with SCDP bottleneck taking multi-scale outputs of the hierarchical encoder. Experimental results show that NGswin achieves competitive performance while maintaining an efficient structure when compared with previous leading methods. Moreover, we also improve other Swin-based SR methods with the N-Gram context, thereby building an enhanced model: SwinIR-NG. Our improved SwinIR-NG outperforms the current best lightweight SR approaches and establishes state-of-the-art results. Codes are available at https://github.com/rami0205/NGramSwin.

연구 동기 및 목표

  • 스위니 트랜스포머의 표준 윈도우 자기주의(WSA)가 수용 필드가 제한되어 있어 고해상도 이미지 복원에 있어 컨텍스트 활용이 제한됨을 해결하기 위해.
  • 특히 제한된 파rameter 예산이 있는 실세계 환경에서의 구현을 고려할 때, 딥러닝 기반 초해상도 모델의 계산 복잡도를 줄이기 위해.
  • 새로운 N-그램 메커니즘을 통해 인접한 국소 윈도우의 공간적 컨텍스트를 활용하여 경량 초해상도 성능을 향상시키기 위해.
  • 기존의 스위니 기반 초해상도 모델인 SwinIR-light와 HNCT에서의 일반화 가능성을 입증하기 위해.

제안 방법

  • 스위니 트랜스포머에서 인접한 국소 윈도우 간의 상호작용을 N-그램으로 정의하며, 인접한 윈도우에서 생성된 유니-그램 임베딩을 슬라이딩-WSA를 통해 처리하여 효과적인 수용 필드를 확장한다.
  • N-그램 상호작용의 계산 비용을 줄이기 위해 채널 감소형 그룹 컨볼루션을 도입하여 저차원의 유니-그램 임베딩을 생성한다.
  • 계층적 인코더(패치 머징 포함), 비대칭 소형 디코더, 다중 스케일 특징을 융합하는 SCDP 블록을 포함한 효율적인 SR 네트워크인 NGswin을 제안한다.
  • N-그램 스위니 트랜스포머 블록(NSTBs) 내에서 스위니 V2의 스케일드 코시너스 어텐션을 활용하여 어텐션 효율성과 표현력을 향상시킨다.
  • 기존의 스위니 기반 모델에 N-그램 컨텍스트를 적용하여 모델 크기를 크게 늘리지 않고도 성능을 향상시킨 SwinIR-NG를 제안한다.
  • 패치 셔플, 연결, 디프 웨이즈 컨볼루션, 포인트 와이즈 프로젝션을 포함한 SCDP 블록을 사용하여 인코더에서 유래한 다중 스케일 특징을 효율적으로 융합함으로써 복원 성능을 향상시킨다.
Figure 1 : Two tracks of this paper using the N-Gram context. (Left) NGswin outperforms previous leading SR methods with an efficient structure. (Right) Our proposed N-Gram context improves different Swin Transformer-based SR models.
Figure 1 : Two tracks of this paper using the N-Gram context. (Left) NGswin outperforms previous leading SR methods with an efficient structure. (Right) Our proposed N-Gram context improves different Swin Transformer-based SR models.

실험 결과

연구 질문

  • RQ1스위니 트랜스포머의 윈도우 자기주의 수용 필드를 확장함으로써 계산 비용을 증가시키지 않고도 이미지 초해상도 성능을 향상시킬 수 있는가?
  • RQ2인접한 국소 윈도우에서 유도된 제안된 N-그램 컨텍스트는 이미지 복원을 위한 장거리 공간적 종속성을 얼마나 효과적으로 포착하는가?
  • RQ3N-그램 메커니즘은 존재하는 스위니 트랜스포머 기반 초해상도 모델에 일반화되어 성능 향상에 기여할 수 있는가?
  • RQ4SCDP 블록과 계층적 인코더-디코더 아키텍처의 영향은 경량 초해상도에서 모델의 효율성과 성능에 어떤 영향을 미치는가?
  • RQ5N-그램 컨텍스트는 다양한 벤치마크 데이터셋에서 시각적 품질 향상과 정량적 지표 향상에 뚜렷한 기여를 하는가?

주요 결과

  • NGswin는 ×2 초해상도에서 오직 82.39G FLOPs로 Set5, Set14, BSD100, Urban100, Manga109에서 경쟁력 있는 성능을 달성하며, 이는 이전 최고 성능 모델들보다 계산 효율성이 뛰어나다.
  • SwinIR-NG는 스위니 기반 경량 초해상도 모델인 SwinIR-light에 N-그램 컨텍스트를 통합한 개선된 모델로, ×2 초해상도에서 Set5에서 38.10/0.9610의 최신 기준 성능을 달성한다.
  • N-그램 컨텍스트는 Set5에서 ×2 초해상도에서 HNCT의 PSNR를 0.02 dB 향상시켰다 (38.10 대비 38.08) 및 ×3, ×4에서도 각각 0.01 dB 향상되었으며, FLOPs 증가 폭은 미미했다.
  • SCDP 블록은 성능 향상에 기여가 크며, 기본 아키텍처에 추가했을 때 Set5에서 ×2 초해상도에서 PSNR가 0.05 dB 향상되었다 (38.05 대비 38.08).
  • 시각적 비교 결과, NGswin과 SwinIR-NG는 텍스처나 시나리오 텍스트와 같은 복잡한 영역에서 기준 모델보다 더 선명한 텍스처와 명확한 윤곽선을 생성한다.
  • SwinIR-NG는 ST-VQA 테스트 세트에서 시나리오 텍스트 검출 성능을 향상시켜, 고해상도 입력이 필요한 후속 비전 작업에 잠재적인 이점을 제공함을 시사한다.
Figure 2 : The feature maps after window self-attention in each intermediary layer of NGswin with and without N-Gram.
Figure 2 : The feature maps after window self-attention in each intermediary layer of NGswin with and without N-Gram.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.