Skip to main content
QUICK REVIEW

[논문 리뷰] Swin2SR: SwinV2 Transformer for Compressed Image Super-Resolution and Restoration

Marcos V. Conde, Ui‐Jin Choi|arXiv (Cornell University)|2022. 09. 22.
Advanced Image Processing Techniques인용 수 10
한 줄 요약

Swin2SR는 압축 이미지 초해상도 복원을 위한 SwinV2 트랜스포머 기반 모델을 제안하며, SwinIR 대비 학습 안정성, 수렴성 및 성능 향상을 이룩한다. 단지 DIV2K 및 Flickr2K 데이터셋을 사용하여 더 빠른 학습과 경쟁 가능한 PSNR를 달성함으로써 AIM 2022 초해상도 복원 챌린지에서 상위 5위 성과를 기록한다.

ABSTRACT

Compression plays an important role on the efficient transmission and storage of images and videos through band-limited systems such as streaming services, virtual reality or videogames. However, compression unavoidably leads to artifacts and the loss of the original information, which may severely degrade the visual quality. For these reasons, quality enhancement of compressed images has become a popular research topic. While most state-of-the-art image restoration methods are based on convolutional neural networks, other transformers-based methods such as SwinIR, show impressive performance on these tasks. In this paper, we explore the novel Swin Transformer V2, to improve SwinIR for image super-resolution, and in particular, the compressed input scenario. Using this method we can tackle the major issues in training transformer vision models, such as training instability, resolution gaps between pre-training and fine-tuning, and hunger on data. We conduct experiments on three representative tasks: JPEG compression artifacts removal, image super-resolution (classical and lightweight), and compressed image super-resolution. Experimental results demonstrate that our method, Swin2SR, can improve the training convergence and performance of SwinIR, and is a top-5 solution at the "AIM 2022 Challenge on Super-Resolution of Compressed Image and Video".

연구 동기 및 목표

  • 트랜스포머 기반 이미지 복원 모델에서의 학습 불안정성과 해상도 갭 문제 해결.
  • SwinIR을 향상시키기 위해 SwinV2 트랜스포머 아키텍처를 활용하여 더 나은 성능과 효율성 확보.
  • JPEG 아티팩트 및 저품질 입력을 포함한 압축 이미지 초해상도 복원 과제 해결.
  • JPEG 아티팩트 제거, 고전적 및 경량 초해상도, 압축 이미지 복원 등 다양한 작업에서 최신 기술 수준의 성능 달성.
  • 거대한 외부 데이터셋을 최소화하고도 실세계 벤치마크(예: AIM 2022 챌린지)에서 경쟁 가능한 성능 확보 및 빠른 추론 구현.

제안 방법

  • Swin 트랜스포머 대비 더 높은 학습 안정성과 해상도 일반화 능력을 보이는 SwinV2 트랜스포머 아키텍처 채택.
  • 장거리 의존성 모델링 향상을 위해 개선된 정규화 및 게이팅 메커니즘을 갖춘 이동 윈도우 자기주의 적용.
  • 수렴 가속화 및 시각적 품질 향상을 위해 보조 손실 함수 (AuxLoss) 및 고주파 손실 (HFLoss) 도입.
  • 추론 오버헤드를 크게 증가시키지 않으면서도 PSNR를 약간 향상시키기 위해 입력을 뒤집고 돌리는 자기 앙상블 기법 적용.
  • 거대한 외부 데이터셋에 의존하지 않고 DIV2K 및 Flickr2K 데이터셋에서 엔드 투 엔드로 모델 학습.
  • 이중 단계 추론 설계: 먼저 압축된 저해상도 이미지의 노이즈 제거 및 복원(Swin2SR-DJPEG), 그 다음 Swin2SRx4를 사용해 최종 출력을 업스케일링.

실험 결과

연구 질문

  • RQ1Swin 트랜스포머에 비해 SwinV2 트랜스포머 아키텍처가 이미지 복원 작업에서 학습 수렴성과 안정성 향상에 기여하는가?
  • RQ2특히 높은 JPEG 압축 수준(q=10)에서 Swin2SR는 압축 이미지 초해상도 복원에서 어떻게 성능을 내는가?
  • RQ3보조 손실 및 고주파 손실 함수가 이미지 복원에서 모델 수렴성과 시각적 품질 향상에 얼마나 기여하는가?
  • RQ4SwinIR과 같은 기존 최신 기술 수준 모델에 비해 Swin2SR는 더 적은 데이터와 더 빠른 학습으로 경쟁 가능한 성능을 낼 수 있는가?
  • RQ5실세계 벤치마크, 예를 들어 AIM 2022 챌린지의 압축 이미지 및 영상 초해상도 복원에서 Swin2SR는 어떻게 비교되는가?

주요 결과

  • Swin2SR는 AIM 2022 챌린지 검증 세트에서 PSNR 23.590 dB를 기록하여 SwinIR(23.546 dB)를 초월하고 상위 5위 성과를 달성했다.
  • 자기 앙상블을 적용한 결과, PSNR 23.616 dB를 기록하여 비앙샘블 추론 대비 약간이지만 일관된 향상을 보였다.
  • 일부 상위 팀이 최대 100만 장의 이미지를 사용한 것에 비해, Swin2SR는 DIV2K 및 Flickr2K 데이터셋만으로도 경쟁 가능한 성능을 달성했다.
  • 일부 설정에서 SwinIR 대비 33% 더 빠른 학습 속도를 기록하여 학습 효율성 향상을 입증했다.
  • 낮은 품질(q=10)에서도 고주파 세부 정보를 성공적으로 복원하고 JPEG 아티팩트를 감소시켜, 뚜렷한 시각적 품질의 출력을 생성했다.
  • 다수의 최신 기술 수준 모델이 공통적으로 보이는 미세한 세부 정보의 흐림 현상에도 불구하고, Swin2SR는 비쿠빅 및 베이스라인 방법 대비 뚜렷한 시각적 우수성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.