Skip to main content
QUICK REVIEW

[논문 리뷰] Perceptual Extreme Super Resolution Network with Receptive Field Block

Taizhang Shang, Qiuju Dai|arXiv (Cornell University)|2020. 05. 26.
Advanced Image Processing Techniques참고 문헌 34인용 수 7
한 줄 요약

이 논문은 수렴 영역 블록(RFB)을 통합하여 다중 척도 특징 추출을 수행하고, 하향 조정된 피그먼트 및 최소 근접 이웃 보간을 번갈아 사용하여 계산 복잡도를 줄이면서도 세부 사항을 유지하는 인지적 극한 초해상도 네트워크인 RFB-ESRGAN을 제안한다. 이 방법은 NTIRE 2020 인지적 극한 초해상도 챌린지에서 PSNR, SSIM, LPIPS, PI 지표에서 최신 기술 수준(SOTA) 성능을 기록하며 1등을 차지하였다.

ABSTRACT

Perceptual Extreme Super-Resolution for single image is extremely difficult, because the texture details of different images vary greatly. To tackle this difficulty, we develop a super resolution network with receptive field block based on Enhanced SRGAN. We call our network RFB-ESRGAN. The key contributions are listed as follows. First, for the purpose of extracting multi-scale information and enhance the feature discriminability, we applied receptive field block (RFB) to super resolution. RFB has achieved competitive results in object detection and classification. Second, instead of using large convolution kernels in multi-scale receptive field block, several small kernels are used in RFB, which makes us be able to extract detailed features and reduce the computation complexity. Third, we alternately use different upsampling methods in the upsampling stage to reduce the high computation complexity and still remain satisfactory performance. Fourth, we use the ensemble of 10 models of different iteration to improve the robustness of model and reduce the noise introduced by each individual model. Our experimental results show the superior performance of RFB-ESRGAN. According to the preliminary results of NTIRE 2020 Perceptual Extreme Super-Resolution Challenge, our solution ranks first among all the participants.

연구 동기 및 목표

  • 이미지 간 높은 변동성으로 인해 미세한 질감과 세부 사항 복구가 어려운 ×16 확대 비율을 가진 인지적 극한 초해상도 문제를 해결하기 위해.
  • 큰 커널 대신 작은 커널을 사용하는 새로운 수렴 영역 블록(RFB)을 도입하여 초해상도 네트워크의 특징 구별 능력과 다중 척도 표현 능력을 향상시키기 위해.
  • 서브픽셀 컨볼루션과 최소 근접 이웃 보간을 번갈아 사용하여 업샘플링 단계의 계산 복잡도를 줄이기 위해.
  • 다양한 학습 반복에서 유도된 10개의 모델을 통합하여 노이즈를 감소시키고 모델의 강건성을 향상시키기 위해.

제안 방법

  • 네트워크 아키텍처는 표준 잔차 블록을 수렴 영역 블록(RFB)으로 대체한 ESRGAN 기반으로, 작은 컨볼루션 커널을 사용하여 다중 척도 특징을 추출한다.
  • RFB는 다중 척도 수렴 영역을 가진 확장 컨볼루션을 사용하여 파rameter 수를 크게 증가시키지 않으면서도 거친 특징과 세밀한 특징을 추출한다.
  • 업샘플링 단계에서는 서브픽셀 컨볼루션과 최소 근접 이웃 보간을 번갈아 사용하여 특징 품질과 계산 효율성의 균형을 맞춘다.
  • 생성적 적대 신경망(GAN) 프레임워크를 사용하며, 절대 진실성 대신 상대적 진실성 예측을 수행하는 상대적 판별자를 포함한 인지적 손실을 적용한다.
  • 테스트 단계에서는 10개의 다른 학습 반복에서 유도된 모델 예측을 통합하여 노이즈 억제 및 안정성 향상을 도모한다.
  • 학습 파이프라인은 평가를 위해 중심 자르기 방식으로 1000×1000 서브이미지를 추출한 DIV8K 데이터셋을 사용하며, 손실 함수로는 L1, 인지적 손실, 적대적 손실 및 LPIPS 기반 손실을 포함한다.

실험 결과

연구 질문

  • RQ1작은 커널을 사용하는 수렴 영역 블록(RFB)이 계산 비용을 줄이며 극한 초해상도에서 다중 척도 특징을 효과적으로 추출할 수 있는가?
  • RQ2서브픽셀과 최소 근접 이웃 보간을 번갈아 사용하는 전략이 초해상도 파이프라인에서 특징 품질 향상과 파라미터 수 감소에 기여하는가?
  • RQ3다양한 학습 반복에서 유도된 모델 앙상블이 인지적 초해상도 결과의 노이즈 감소와 강건성 향상에 상당한 기여를 하는가?
  • RQ4RFB-ESRGAN은 NTIRE 2020 챌린지 벤치마크에서 인지적 품질, PSNR, SSIM, LPIPS 및 PI 측정치에서 기존 최신 기술 수준(SOTA) 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • RFB-ESRGAN은 NTIRE 2020 인지적 극한 초해상도 챌린지에서 참가자 전원 중 1등을 기록하며 최고 점수를 기록하였다.
  • DIV8K의 1,401~1,500장의 테스트 이미지에서 PSNR 24.03, SSIM 0.54, LPIPS 0.345, PI 4.27를 기록하여 강력한 인지적 및 구조적 정밀도를 입증하였다.
  • 절단 실험 결과 RFB는 기준 모델 대비 질감 세부 정보 복구 능력이 뛰어나 특히 털과 머리카락과 같은 미세한 구조에서 뚜렷한 향상을 보였다.
  • 교차 업샘플링 전략은 단일으로 서브픽셀 또는 최소 근접 이웃 보간을 사용하는 것보다 아티팩트를 감소시키고 시각적 현실감을 향상시켰다.
  • 모델 앙상블은 노이즈 억제 및 시각적 품질 향상에 효과적이었으며, 비교 이미지에서 노이즈 수준 감소와 더 자연스러운 질감이 관찰되었다.
  • RFB, 하이브리드 업샘플링 및 앙상블 학습의 조합은 모든 지표에서 뛰어난 성능을 보였으며, 기존 방법 대비 인지적 품질과 재구성 정확도에서 뛰어난 성능을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.