Skip to main content
QUICK REVIEW

[논문 리뷰] Wavelet Domain Style Transfer for an Effective Perception-distortion Tradeoff in Single Image Super-Resolution

Xin Deng, Ren Yang|arXiv (Cornell University)|2019. 10. 09.
Advanced Image Processing Techniques참고 문헌 31인용 수 10
한 줄 요약

이 논문은 2차원 정적 웨이블릿 변환(2D stationary wavelet transform, SWT)을 통해 저주파수(객관적 품질)와 고주파수(지각적 품질) 성분을 분리함으로써 단일 이미지 초해상도 복원(SISR)에서 우수한 지각-왜곡(PD) 균형을 달성하는 웨이블릿 도메인 스타일 전이(WDST) 방법을 제안한다. 저주파수 부분대는 전용 네트워크로 향상되고, 지각적 품질은 웨이블릿 도메인 스타일 전이를 통해 향상되어, 다양한 데이터셋에서 GAN 기반 및 융합 방법보다 PSNR와 지각적 점수 측면에서 모두 뛰어난 성능을 기록한다.

ABSTRACT

In single image super-resolution (SISR), given a low-resolution (LR) image, one wishes to find a high-resolution (HR) version of it which is both accurate and photo-realistic. Recently, it has been shown that there exists a fundamental tradeoff between low distortion and high perceptual quality, and the generative adversarial network (GAN) is demonstrated to approach the perception-distortion (PD) bound effectively. In this paper, we propose a novel method based on wavelet domain style transfer (WDST), which achieves a better PD tradeoff than the GAN based methods. Specifically, we propose to use 2D stationary wavelet transform (SWT) to decompose one image into low-frequency and high-frequency sub-bands. For the low-frequency sub-band, we improve its objective quality through an enhancement network. For the high-frequency sub-band, we propose to use WDST to effectively improve its perceptual quality. By feat of the perfect reconstruction property of wavelets, these sub-bands can be re-combined to obtain an image which has simultaneously high objective and perceptual quality. The numerical results on various datasets show that our method achieves the best trade-off between the distortion and perceptual quality among the existing state-of-the-art SISR methods.

연구 동기 및 목표

  • 단일 이미지 초해상도 복원(SISR)에서 낮은 왜곡과 높은 지각적 품질 간의 근본적 상충 관계를 해결하기 위함.
  • 특히 고주파수 세부 정보 합성에서 불안정한 훈련과 아티팩트 생성 문제를 야기하는 GAN 기반 방법의 한계를 극복하기 위함.
  • 웨이블릿 분해를 통해 객관적 품질과 지각적 품질 성분을 분리함으로써 기존 이미지 융합 방법을 향상시키기 위함.
  • 객관적 품질 최적화와 지각적 품질 최적화를 분리함으로써 네트워크 아키텍처 선택의 유연성을 높이고, 네트워크 보간의 제약을 피하기 위함.
  • 웨이블릿 도메인 내 하위대별 최적화를 통해 기존 최신 기술 수준의 방법보다 더 나은 PD 균형을 달성하기 위함.

제안 방법

  • 2차원 정적 웨이블릿 변환(2D stationary wavelet transform, SWT)을 사용해 저해상도 입력 이미지를 저주파수 및 고주파수 하위대로 분해하며, 완벽한 재구성 성질을 활용한다.
  • 저주파수 하위대의 객관적 품질(예: PSNR) 향상을 위해 전용 향상 네트워크를 적용한다.
  • 각 고주파수 하위대(LH, HL, HH)에서 웨이블릿 도메인 스타일 전이(WDST)를 수행하여 지각적 품질(예: NRQM)을 향상시키되, 구조적 세부 정보를 손상시키지 않는다.
  • 사전 훈련된 네트워크(예: VGG)의 특징을 기반으로 한 지각적 손실을 사용해 웨이블릿 도메인 내 스타일 전이를 안내함으로써 자연스러운 질감과 구조 유지 보장을 확보한다.
  • 역방향 SWT를 통해 저주파수 하위대와 스타일화된 고주파수 하위대를 조합하여 최종 고해상도 이미지를 재구성한다.
  • 각 고주파수 하위대에서 지각적 손실 함수의 반복 최소화를 통해 스타일 전이 과정을 최적화함으로써 내용 유지성과 스타일 전이의 정밀도를 확보한다.

실험 결과

연구 질문

  • RQ1웨이블릿 도메인 분해가 SISR에서 객관적 품질에 영향을 주는 성분과 지각적 품질에 영향을 주는 성분을 효과적으로 분리할 수 있는가?
  • RQ2저주파수 하위대에 대한 강화와 고주파수 하위대에 대한 스타일 전이를 별도로 적용하는 최적화 전략이 통합 최적화보다 더 나은 지각-왜곡 균형을 이끌 수 있는가?
  • RQ3초해상도 복원 과정에서 구조적 및 질감 세부 정보를 보존하는 데 있어 웨이블릿 도메인 스타일 전이와 픽셀 도메인 스타일 전이 간의 성능 비교는 어떻게 되는가?
  • RQ4다양한 고주파수 하위대(LH, HL, HH)가 지각적 품질에 기여하는 정도는 어느 정도이며, 각각을 별도로 최적화할 수 있는가?
  • RQ5안정적인 적대적 훈련이 필요하거나 동일한 네트워크 아키텍처를 요구하지 않는다는 점에서, 제안된 방법이 GAN 기반 및 보간 기반 융합 방법보다 뛰어난 성능을 낼 수 있는가?

주요 결과

  • 제안된 방법은 PD 곡선상 모든 오렌지 점 방법 중에서 지각과 왜곡 간 최고의 균형을 달성하였으며, SRGAN-MSE, G–MGBP, PESR, Deng, ESRGAN에 비해 PSNR와 NRQM 양면에서 모두 뛰어난 성능을 기록했다.
  • DIV2K 데이터셋에서 이 방법은 PSNR 26.56 dB, NRQM 8.5005를 기록하여, 입력 네트워크가 최적화되지 않은 상태에서도 Deng(26.46 dB / 8.4452)와 ESRGAN(26.44 dB / 8.3034)를 모두 능가했다.
  • 절단 실험 결과, 고주파수 하위대 중 어느 하나에서라도 WDST를 비활성화할 경우 지각적 품질(NRQM)이 크게 저하되었으며, 특히 LH 및 HL 하위대가 가장 큰 영향을 미쳤다.
  • HH 하위대는 LH 및 HL 하위대보다 지각적 품질 기여도가 낮은 편이었으며, 이는 대각선 세부 정보가 지각적으로 덜 두드러지기 때문일 것이다.
  • 간단한 객관적 품질(예: EDSR) 및 지각적 품질(예: CX) 출력의 보간보다 뚜렷하게 뛰어난 성능을 보였으며, PD 곡선 분석에서 보간 곡선 아래에 위치함으로써 이를 확인했다.
  • 시각적 비교 결과, 이 방법은 창문 테두리, 다리 질감 등의 구조적 세부 정보를 유지하면서도 SRGAN-MSE 및 Deng의 방법에서 흔히 볼 수 있는 노이즈와 아티팩트를 피하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.