Skip to main content
QUICK REVIEW

[논문 리뷰] Image Super-Resolution Using a Wavelet-based Generative Adversarial Network

Qi Zhang, Huafeng Wang|arXiv (Cornell University)|2019. 07. 24.
Advanced Image Processing Techniques참고 문헌 17인용 수 4
한 줄 요약

이 논문은 웨이블릿 분해를 GAN 프레임워크와 융합하여 고주파 성분을 강화함으로써 고해상도 이미지 복원을 향상시키는 웨이블릿 기반 생성적 적대적 네트워크(WGAN)를 제안한다. 웨이블릿 변환을 통해 전역적이고 국소적인 질감 정보를 유지함으로써, 기준 데이터셋에서 기존의 SRGAN보다 더 뛰어난 재구성 품질을 달성한다.

ABSTRACT

In this paper, we consider the problem of super-resolution recons-truction. This is a hot topic because super-resolution reconstruction has a wide range of applications in the medical field, remote sensing monitoring, and criminal investigation. Compared with traditional algorithms, the current super-resolution reconstruction algorithm based on deep learning greatly improves the clarity of reconstructed pictures. Existing work like Super-Resolution Using a Generative Adversarial Network (SRGAN) can effectively restore the texture details of the image. However, experimentally verified that the texture details of the image recovered by the SRGAN are not robust. In order to get super-resolution reconstructed images with richer high-frequency details, we improve the network structure and propose a super-resolution reconstruction algorithm combining wavelet transform and Generative Adversarial Network. The proposed algorithm can efficiently reconstruct high-resolution images with rich global information and local texture details. We have trained our model by PyTorch framework and VOC2012 dataset, and tested it by Set5, Set14, BSD100 and Urban100 test datasets.

연구 동기 및 목표

  • 기존의 딥러닝 기반 초해상도 방법에서 질감 세부 정보 복구의 취약성을 해결하기 위해.
  • 더 나은 시각적 품질을 위해 재구성된 이미지의 고주파 성분의 정확도를 향상시키기 위해.
  • 웨이블릿 변환을 생성적 적대적 네트워크와 융합하여 다중 척도 특징 학습을 향상시키기 위해.
  • 전역적 맥락과 국소적 질감을 모두 유지하는 더 안정적이고 효과적인 초해상도 프레임워크를 개발하기 위해.
  • 정량적 및 정성적 평가를 통해 제안된 방법을 표준 기준 데이터셋에서 검증하기 위해.

제안 방법

  • 저해상도 이미지를 다중 척도 주파수 성분을 유지하면서 하위대역으로 분해하기 위해 웨이블릿 기반 특징 추출 모듈을 활용한다.
  • 웨이블릿 하위대역에서 고해상도 이미지를 재구성하기 위해 종단 간(end-to-end)으로 생성적 적대적 네트워크를 훈련시킨다.
  • 학습 안정성과 특징 전파 개선을 위해 스킵 연결을 갖춘 잔차 블록을 사용하는 생성자 네트워크를 설계한다.
  • 실제와 생성된 고해상도 이미지를 구분하기 위해 디스커미네이터를 설계하였으며, 주로 감각적 품질과 질감의 현실감을 중점으로 둔다.
  • 정확도와 현실감을 균형 있게 유지하기 위해 적대적 손실, 감각적 손실, 웨이블릿 기반 재구성 손실을 조합한 손실 함수를 사용한다.
  • VOC2012 데이터셋에서 훈련하고, Set5, Set14, BSD100, Urban100 테스트 세트에서 평가하기 위해 PyTorch 프레임워크를 사용한다.

실험 결과

연구 질문

  • RQ1웨이블릿 분해는 초해상도 작업에서 고주파 질감 세부 정보 복구에 기여하는가?
  • RQ2웨이블릿 변환을 GAN과 융합할 경우 재구성된 이미지의 감각적 품질과 구조적 정확도에 어떤 영향을 미치는가?
  • RQ3제안된 WGAN 프레임워크는 PSNR 및 SSIM 등의 정량적 지표와 시각적 품질 측면에서 기존의 SRGAN과 같은 GAN 기반 초해상도 모델을 초월하는가?
  • RQ4웨이블릿 기반 접근법은 다양한 이미지 콘텐츠에서 질감 복구의 강건성에 어느 정도 기여하는가?
  • RQ5손실 함수의 개별 구성 요소들(적대적, 감각적, 웨이블릿 기반)이 최종 성능에 어떤 기여를 하는가?

주요 결과

  • 제안된 방법은 PSNR 및 SSIM 측면에서 Set5, Set14, BSD100, Urban100 기준에서 최신 기술 수준의 성능을 달성한다.
  • SRGAN에 비해 더 나은 질감 세부 정보 복구 성능을 보이며, 더 자연스럽고 일관된 고주파 성분을 제공한다.
  • 웨이블릿 기반 재구성 손실의 포함으로 미세한 질감과 윤곽의 유지가 크게 향상된다.
  • 시각적 점검 결과, 기준 모델 대비 더 풍부한 국소적 세부 정보와 더 적은 아티팩트를 가진 생성된 이미지를 확보하였다.
  • 특히 도시 및 자연 풍경과 같은 도전적인 장면에서 복잡한 질감과 구조를 복원하는 데 있어 더 뛰어난 강건성을 보였다.
  • 제거 실험(ablation study) 결과, 적대적, 감각적, 웨이블릿 기반 손실의 조합이 최적의 성능을 이끌어낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.