Skip to main content
QUICK REVIEW

[논문 리뷰] Recurrent Back-Projection Network for Video Super-Resolution

Muhammad Haris, Greg Shakhnarovich|arXiv (Cornell University)|2019. 03. 25.
Advanced Image Processing Techniques참고 문헌 32인용 수 11
한 줄 요약

이 논문은 단일 이미지 및 다중 프레임 초해상도 복원을 반복적 백프로젝션 메커니즘과 순환 인코더-디코더 모듈을 사용하여 통합하는 새로운 비디오 초해상도 프레임워크인 순환 백프로젝션 네트워크(RBPN)를 제안한다. 각 컨텍스트 프레임을 별도로 처리하고, 업샘플링 및 다운샘플링 루프를 통해 고해상도 특징을 정밀하게 개선함으로써 RBPN은 다양한 운동 조건에서 다수의 벤치마크에서 최신 기술 성능(SOTA)을 달성하여 PSNR 및 SSIM 측면에서 이전 방법들을 능가한다.

ABSTRACT

We proposed a novel architecture for the problem of video super-resolution. We integrate spatial and temporal contexts from continuous video frames using a recurrent encoder-decoder module, that fuses multi-frame information with the more traditional, single frame super-resolution path for the target frame. In contrast to most prior work where frames are pooled together by stacking or warping, our model, the Recurrent Back-Projection Network (RBPN) treats each context frame as a separate source of information. These sources are combined in an iterative refinement framework inspired by the idea of back-projection in multiple-image super-resolution. This is aided by explicitly representing estimated inter-frame motion with respect to the target, rather than explicitly aligning frames. We propose a new video super-resolution benchmark, allowing evaluation at a larger scale and considering videos in different motion regimes. Experimental results demonstrate that our RBPN is superior to existing methods on several datasets.

연구 동기 및 목표

  • 다양한 운동 조건을 모델링하기 어려운 기존의 비디오 초해상도 방법의 한계를 해결하기 위해.
  • 공간적 및 시간적 컨텍스트를 더 잘 활용하기 위해 단일 이미지 초해상도(SISR)와 다중 프레임 초해상도(MISR)를 하나의 순환 아키텍처 안에서 통합하기 위해.
  • 명시적인 프레임 정렬이 아닌 잔차 특징 정밀화를 통해 프레임 간 운동을 암묵적으로 모델링하여 재구성 품질을 향상시키기 위해.
  • 다양한 운동 조건에서 비디오 초해상도 평가를 위한 새로운 벤치마크(Vimeo-90k)를 설정하기 위해.

제안 방법

  • RBPN은 목표 프레임 I_t와 쌍을 이루는 컨텍스트 프레임 I_{t-k}의 잔차 특징을 함께 처리하는 순환 인코더-디코더 모듈을 사용하며, 반복적인 정밀화 루프를 통해 개선한다.
  • 다중 이미지 초해상도에서 영감을 얻은 백프로젝션 메커니즘을 사용하여 재구성된 프레임과 진짜 프레임 간의 잔차 오차를 반복적으로 백프로젝션하여 고해상도 특징을 정밀화한다.
  • 단일 이미지 초해상도(SISR) 경로(목표 프레임만 처리)와 다중 프레임 초해상도(MISR) 경로(컨텍스트 프레임 처리)를 분리하여 서로 다른 소스에서 온 특징을 별도로 모델링할 수 있도록 한다.
  • 컨텍스트 프레임의 잔차 특징은 업샘플링 및 다운샘플링 레이어를 사용하여 목표 프레임의 특징과 순환 정밀화를 통해 융합된다.
  • 정확한 공간 정렬이 필요 없이 목표 프레임에 대한 프레임 간 운동을 명시적으로 모델링함으로써 정렬 오차 위험을 줄인다.
  • 빠르고 느린 운동 시퀀스를 포함한 다양한 운동 유형을 포함한 복잡한 운동 패턴을 다루는 새로운 벤치마크인 Vimeo-90k를 도입한다.
Figure 2: Overview of RBPN. The network has two approaches. The horizontal blue line enlarges $I_{t}$ using SISR. The vertical red line is based on MISR to compute the residual features from a pair of $I_{t}$ to neighbor frames ( $I_{t-1},...,I_{t-n}$ ) and the precomputed dense motion flow maps ( $
Figure 2: Overview of RBPN. The network has two approaches. The horizontal blue line enlarges $I_{t}$ using SISR. The vertical red line is based on MISR to compute the residual features from a pair of $I_{t}$ to neighbor frames ( $I_{t-1},...,I_{t-n}$ ) and the precomputed dense motion flow maps ( $

실험 결과

연구 질문

  • RQ1다양한 프레임에서 유도된 고해상도 특징을 반복적으로 정밀화하는 순환 백프로젝션 메커니즘이 비디오 초해상도 성능을 향상시킬 수 있는가?
  • RQ2합성적으로 처리하는 대신 컨텍스트 프레임을 별도로 처리함으로써 복잡한 운동 상황에서 성능 향상이 이루어지는가?
  • RQ3순환 정밀화 프레임워크를 통해 SISR 및 MISR 경로를 통합함으로써 기존의 엔드 투 엔드 비디오 SR 모델보다 더 나은 재구성 품질을 달성할 수 있는가?
  • RQ4빠르거나 비정상적인 운동을 포함한 어려운 시퀀스에서 RBPN은 이전 방법들에 비해 어떤 성능을 보이는가?

주요 결과

  • RBPN은 Vid4 및 SPMCS 데이터셋에서 최신 기술 성능(SOTA)을 달성하였으며, SPMCS-32에서 PSNR 31.64 dB, SSIM 0.883을 기록하여 이전 방법들을 능가했다.
  • Vimeo-90k 벤치마크에서 RBPN/6-PF는 4× 스케일링에서 PSNR 30.10 dB를 기록하여 VSR-DUF(29.42 dB)와 DRDVSR(28.82 dB)를 크게 앞섰다.
  • qualitative 비교 결과, Bicubic 및 DBPN에 비해 RBPN/6-PF는 고운동 영역에서 더 선명하고 더 시각적으로 매력적인 결과를 생성하였다.
  • 제거 실험 결과, 현재 초모수 설정 하에서 잔차 학습이 RBPN 성능 향상에 기여하지 않음을 확인하여 주 경로에서 주요 신호가 이미 잘 포착되고 있음을 시사했다.
  • 4× 초해상도에서 1270만 개의 파라미터와 2.475 GFLOPs로도 높은 정확도를 유지하면서도 효율적인 추론 성능를 보였다.
  • Vimeo-90k는 이전의 벤치마크에서 다루지 못한 복잡하고 다양한 운동 패턴을 포함하고 있어, RBPN은 다양한 운동 조건에서 뛰어난 성능과 강건성을 입증하였다.
Figure 3: The proposed projection module. The target features ( $L_{t-n-1}$ ) is projected to neighbor features ( $M_{t-n}$ ) to construct better HR features ( $H_{t-n}$ ) and produce next LR features ( $L_{t-n}$ ) for the next step.
Figure 3: The proposed projection module. The target features ( $L_{t-n-1}$ ) is projected to neighbor features ( $M_{t-n}$ ) to construct better HR features ( $H_{t-n}$ ) and produce next LR features ( $L_{t-n}$ ) for the next step.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.