[논문 리뷰] 3DSRnet: Video Super-resolution using 3D Convolutional Neural Networks
시간 깊이를 보존하고, 잔차 학습과 서브픽셀 출력을 활용하며, 모션 정합 없이도 성능 하락을 피하는 씬 변화 처리 모듈을 포함하는 3D-CNN 기반 비디오 초해상도 프레임워크(3DSRnet)를 제안한다. Vidset4에서 최첨단 PSNR 이득을 달성한다.
In video super-resolution, the spatio-temporal coherence between, and among the frames must be exploited appropriately for accurate prediction of the high resolution frames. Although 2D convolutional neural networks (CNNs) are powerful in modelling images, 3D-CNNs are more suitable for spatio-temporal feature extraction as they can preserve temporal information. To this end, we propose an effective 3D-CNN for video super-resolution, called the 3DSRnet that does not require motion alignment as preprocessing. Our 3DSRnet maintains the temporal depth of spatio-temporal feature maps to maximally capture the temporally nonlinear characteristics between low and high resolution frames, and adopts residual learning in conjunction with the sub-pixel outputs. It outperforms the most state-of-the-art method with average 0.45 and 0.36 dB higher in PSNR for scales 3 and 4, respectively, in the Vidset4 benchmark. Our 3DSRnet first deals with the performance drop due to scene change, which is important in practice but has not been previously considered.
연구 동기 및 목표
- 비디오 SR에서 모션 정합 없이 시공간 상의 일관성을 활용한다.
- 레이어 간에 시간 정보를 보존하는 엔드-투-엔드 3D-CNN을 개발한다.
- 입력 프레임의 씬 변화에 대응하기 위한 전용 씬 변화 서브넷을 설계한다.
- 잔차 학습과 서브픽셀 출력 구조를 활용하여 SR 성능을 향상시킨다.
- 기존 방법과 비교하여 Vidset4에서 최첨단 PSNR 향상을 입증한다.
제안 방법
- 5프레임 입력 윈도우를 가진 3D-CNN 비디오 SR 서브넷을 사용하여 하나의 고해상도 중간 프레임을 생성한다.
- GTFM의 경사 확장을 통해 특성 맵의 시간 깊이를 계층 간에 보존하여 시간 정보를 유지한다.
- 네트워크 입력 경로에서 양상 보간(upscaling) 없이 다채널 출력을 이용해 LR에서 HR로의 직접 매핑을 구현한다.
- HR과 양보간된 LR 프레임 사이의 잔차를 예측하여 잔차 학습을 적용한다.
- 씬 경계 위치를 찾고 같은 씬에서 temporally 가장 가까운 프레임으로 대체하는 경량의 씬 변화 감지 및 프레임 대체(SF) 서브넷을 도입한다.
- 비디오 SR 서브넷용 smallSet과 largeSet 데이터셋, 그리고 SF 서브넷용 데이터셋을 각각 훈련시키고, 평균 제곱 오차 손실과 Adam 최적화를 사용해 최적화한다.
실험 결과
연구 질문
- RQ1Explicit한 모션 정합 없이 3D-CNN이 비디오 SR에서 시공간 정보를 효과적으로 활용할 수 있는가?
- RQ23D 특성 맵에서 시간 깊이를 보존하는 것이 전통적인 2D-CNN 기반 비디오 SR 접근법에 비해 SR 성능을 향상시키는가?
- RQ3씬 전환이 있는 비디오에서 전용 씬 변화 감지 및 프레임 대체 구성 요소가 SR 품질에 어떤 영향을 미치는가?
- RQ4Vidset4에서 3DSRnet이 PSNR 및 SSIM 측면에서 현존 최첨단 이미지/비디오 SR 방법과 비교해 어떤 차이를 보이는가?
주요 결과
- 3DSRnet은 Vidset4에서 스케일 3의 PSNR에서 평균 0.45 dB, 스케일 4에서 0.36 dB의 이점을 달성하며 최첨단 방법을 능가한다.
- 모델은 다수의 3D 합성곱 층을 통해 시간 깊이를 유지하고, 최종 2D HR 출력까지 시간 정보를 보존하기 위해 추정(extrapolation)을 사용한다.
- SF 서브넷은 씬 변화 탐지 정확도(약 99.9%)를 달성하고 씬 변화가 영향을 미치는 프레임에서 PSNR을 약 0.25–0.46 dB 향상시킨다.
- Vidset4에서 3DSRnet은 스케일 인자 2, 3, 4에서 동시대 방법과 비교해 PSNR 이득을 달성한다(표 5 결과에 나타남).
- NVIDIA TITAN X에서 추론 시간은 스케일 2에 대해 166 ms, 스케일 4에 대해 788 ms로 다섯 입력 프레임에서 960x540 프레임의 업스케일링을 수행한다.
- 네트워크는 다채널 출력과 잔차 학습의 이점을 통해 더 높은 지각 품질을 얻고 3D 합성곱의 과도한 계산을 방지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.