[논문 리뷰] Multi-scale deep neural networks for real image super-resolution
이 논문은 알려지지 않은 배율 인자와 다양한 다운스케일링 연산자를 가진 실사진 초해상도 복원을 위한 다중 척도 딥 네트워크(MsDNN)를 제안한다. 입력을 ×2 및 ×4 스케일의 다운샘플링된 공간에서 처리하여 GPU 메모리 사용량을 줄이고, 효율적인 훈련 및 추론을 가능하게 한다. 이 방법은 NTIRE 2019 챌린지에서 뛰어난 성능을 보였으며, MsDN은 PSNR와 SSIM 측면에서 MsRN을 능가했고, 다양한 카메라 기반 다운스케일링 연산자 간에도 잘 일반화되었다.
Single image super-resolution (SR) is extremely difficult if the upscaling factors of image pairs are unknown and different from each other, which is common in real image SR. To tackle the difficulty, we develop two multi-scale deep neural networks (MsDNN) in this work. Firstly, due to the high computation complexity in high-resolution spaces, we process an input image mainly in two different downscaling spaces, which could greatly lower the usage of GPU memory. Then, to reconstruct the details of an image, we design a multi-scale residual network (MsRN) in the downscaling spaces based on the residual blocks. Besides, we propose a multi-scale dense network based on the dense blocks to compare with MsRN. Finally, our empirical experiments show the robustness of MsDNN for image SR when the upscaling factor is unknown. According to the preliminary results of NTIRE 2019 image SR challenge, our team (ZXHresearch@fudan) ranks 21-st among all participants. The implementation of MsDNN is released https://github.com/shangqigao/gsq-image-SR
연구 동기 및 목표
- 업스케일링 인자가 알려지지 않은 상태에서 다양한 다운스케일링 연산자가 존재하는 실사진 초해상도 복원 문제를 해결한다.
- 고해상도 이미지 초해상도 복원 작업에서 계산 복잡도와 GPU 메모리 사용량을 줄인다.
- 다양한 다운스케일링 연산자(예: 여러 카메라에서 유래한 것들) 간에 일반화 능력을 갖춘 딥 러닝 모델을 개발한다.
- 다중 척도 잔차 및 다중 연결 네트워크를 활용해 초해상도 이미지의 세부 정보 복원을 향상시킨다.
- 제한된 훈련 데이터와 큰 테스트 이미지가 존재하는 NTIRE 2019 이미지 초해상도 챌린지에서 경쟁력 있는 성능을 달성한다.
제안 방법
- 입력 이미지를 여러 다운스케일링 공간(×2 및 ×4)에서 처리하여 해상도를 낮추고 GPU 메모리 소비를 줄인다.
- 다운스케일링 공간에서의 특징 학습을 위해 잔차 블록 기반의 다중 척도 잔차 네트워크(MsRN)를 설계한다.
- 특징 전파를 향상시키고 세부 정보 복원을 개선하기 위해 다중 연결 블록을 사용하는 다중 척도 밀도 네트워크(MsDN)를 제안한다.
- 입력 이미지의 다운샘플된 버전에서 모델을 훈련하고 테스트한 후, 최종 출력을 업스케일링하여 고해상도 이미지를 복원한다.
- 훈련에는 L2 손실를 사용하고, 검증 및 테스트 세트에서 성능 평가에 PSNR 및 SSIM 지표를 활용한다.
- 다중 척도 아키텍처를 활용해 다양한 다운스케일링 연산자와 알려지지 않은 업스케일링 인자에 대한 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1알려지지 않은 업스케일링 인자가 존재할 때 다중 척도 딥 네트워크가 실사진 초해상도 복원에 효과적으로 작용할 수 있는가?
- RQ2이미지를 다운샘플링된 공간에서 처리하면 해상도 복원 품질을 유지하면서도 GPU 메모리 사용량을 크게 줄일 수 있는가?
- RQ3PSNR 및 SSIM 측면에서 MsRN과 MsDN의 성능는 어떻게 비교되는가?
- RQ4제안된 MsDNN는 다양한 다운스케일링 연산자(예: 서로 다른 카메라에서 유래한 것들) 간에 일반화 가능한가?
- RQ5비쿠빅 다운스케일링을 전제로 할 때, 표준 벤치마크(Set5, Set14, DIV2K)에서 모델의 성능는 어떠한가?
주요 결과
- MsDN은 PSNR(29.51)와 SSIM(0.8671)에서 MsRN(29.42 및 0.8646)을 능가하여 세부 정보 복원 능력이 뛰어나다는 것을 보여주었다.
- NTIRE 2019 검증 세트에서, MsDN-2는 Validation-1에서 최고의 PSNR(30.27)와 SSIM(0.8677)를 기록했고, MsDN-1은 Validation-2에서 최고의 SSIM(0.8666)를 기록했다.
- 다양한 다운스케일링 연산자에 대해 강건성을 보였다: Validation-2(Camera-2)에서의 성능가 Validation-1(Camera-1)보다 뛰어나, 다양한 촬영 조건에 대한 적응 능력을 시사했다.
- 비쿠빅 다운스케일링을 전제로 한 표준 벤치마크(Set5, Set14, DIV2K)에서 MsDNN는 비쿠빅 보간법보다 성능이 열 劣하였으며, 이는 훈련 데이터와의 도메인 불일치로 인한 도메인 시프트를 시사했다.
- MsDN의 평균 추론 시간은 1장당 20초였고, MsRN은 21초였으며, 다중 척도 처리에도 불구하고 효율적인 추론을 보였다.
- 이 방법은 NTIRE 2019 이미지 초해상도 챌린지에서 21위를 기록하여, 알려지지 않은 업스케일링 인자를 가진 실세계 데이터셋에서 실용적인 효과를 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.