Skip to main content
QUICK REVIEW

[논문 리뷰] SwiftSRGAN -- Rethinking Super-Resolution for Efficient and Real-time Inference

Koushik Sivarama Krishnan, Karthik Sivarama Krishnan|arXiv (Cornell University)|2021. 11. 28.
Advanced Image Processing Techniques참고 문헌 23인용 수 15
한 줄 요약

이 논문은 깊이 분리형 합성곱과 모바일넷 기반의 인지 손실을 활용하여 상태별로 빠른 추론 속도(74배 빠름)를 달성하면서도 경쟁 수준의 PSNR 및 SSIM 점수를 유지하는 경량 실시간 초해상도 모델인 SwiftSRGAN을 제안한다. 이는 저성능 장치에서 실시간 배포가 가능하게 한다.

ABSTRACT

In recent years, there have been several advancements in the task of image super-resolution using the state of the art Deep Learning-based architectures. Many super-resolution-based techniques previously published, require high-end and top-of-the-line Graphics Processing Unit (GPUs) to perform image super-resolution. With the increasing advancements in Deep Learning approaches, neural networks have become more and more compute hungry. We took a step back and, focused on creating a real-time efficient solution. We present an architecture that is faster and smaller in terms of its memory footprint. The proposed architecture uses Depth-wise Separable Convolutions to extract features and, it performs on-par with other super-resolution GANs (Generative Adversarial Networks) while maintaining real-time inference and a low memory footprint. A real-time super-resolution enables streaming high resolution media content even under poor bandwidth conditions. While maintaining an efficient trade-off between the accuracy and latency, we are able to produce a comparable performance model which is one-eighth (1/8) the size of super-resolution GANs and computes 74 times faster than super-resolution GANs.

연구 동기 및 목표

  • 제한된 계산 자원을 가진 모바일 및 임베디드 장치에 적합한 실시간이고 효율적인 초해상도 모델을 개발하기 위해.
  • 인지 품질이나 재구성 정확도를 희생시키지 않고 모델 크기와 추론 지연을 줄이기 위해.
  • 대역폭이 제한된 환경(예: 스트리밍 및 엣지 컴퓨팅)에서 고품질 이미지 업스케일링을 가능하게 하기 위해.
  • 효율적인 아키텍처가 더 큰 계산 자원을 요구하는 GAN 기반 초해상도 모델과 비교해도 경쟁 가능한 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 기본 합성곱에 비해 파rameter와 FLOPs를 크게 줄이기 위해 깊이 분리형 합성곱을 활용한다.
  • 계산 비용을 줄이기 위해 무거운 VGG 네트워크 대신 경량 모바일넷V2 백본을 특징 추출에 사용한다.
  • 고정밀도 이미지 생성을 안내하기 위해 모바일넷V2의 특징 맵을 기반으로 한 인지 손실을 통합한다.
  • 실재감 있는 품질과 세부 사항 보존을 향상시키기 위해 생성적 적대적 손실과 콘텐츠 손실을 조합한다.
  • 모바일넷V2 네트워크의 여러 레이어에서 얻은 특징 맵을 사용하는 다중 척도 손실 전략을 적용한다.
  • 개선된 수렴을 위해 혼합 정밀도 학습과 ReduceLROnPlateau 스케줄러를 사용하는 AdamW 옵timizer로 훈련한다.

실험 결과

연구 질문

  • RQ1깊이 분리형 합성곱을 사용하면 초해상도에서 이미지 품질에 손상이 가지 않고 모델 크기와 추론 지연을 크게 줄일 수 있는가?
  • RQ2인지 손실에서 VGG를 모바일넷으로 교체하면 훈련 속도와 성능에 어떤 영향을 미치는가?
  • RQ3경량 GAN 기반 아키텍처가 실시간 추론을 가능하게 하면서도 경쟁 수준의 PSNR 및 SSIM 점수를 달성할 수 있는가?
  • RQ4실제 스트리밍 및 모바일 애플리케이션 환경에서 모델 효율성과 초해상도 품질 사이의 상충 관계는 어떠한가?

주요 결과

  • SwiftSRGAN은 270p에서 1080p로의 업스케일링에 대해 1프레임당 5.605ms의 추론 시간을 기록하여 SRGAN(812ms)보다 74배, ESRGAN보다 100배 빠르다.
  • 표준 초해상도 GAN 모델의 1/8 크기이므로 메모리 사용량을 크게 줄여 저성능 장치에의 배포를 가능하게 한다.
  • Set5 벤치마크에서 SwiftSRGAN은 PSNR 25.13과 SSIM 0.794을 기록하여 더 큰 모델들과 경쟁 가능한 성능을 보였다.
  • 시각적 결과에서 SwiftSRGAN은 세밀한 디테일, 조명, 반사 및 색상 정확도를 고해상도 참값과 유사하게 유지함을 확인할 수 있었다.
  • 모바일넷 기반 인지 손실의 사용은 훈련 시간과 모델 크기를 줄이면서도 인지 품질을 유지하는 데 기여했다.
  • 저성능 하드웨어에서도 60FPS로 실시간 비디오 업스케일링이 가능하여 클라우드 게이밍, 감시 및 모바일 AR/VR 애플리케이션에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.