Skip to main content
QUICK REVIEW

[논문 리뷰] Zooming SlowMo: An Efficient One-Stage Framework for Space-Time Video Super-Resolution

Xiaoyu Xiang, Yapeng Tian|arXiv (Cornell University)|2021. 04. 15.
Advanced Image Processing Techniques참고 문헌 64인용 수 7
한 줄 요약

이 논문은 특징을 보간하는 방식으로 픽셀을 직접 보간하지 않고, 저해상도·저프레임레ート 입력에서 고해상도·고프레임레ート 영상을 직접 복원하는 일단계 공간-시간 영상 초해상도 프레임워크인 Zooming SlowMo를 제안한다. 이는 타원형 특징 보간과 타원형 ConvLSTM을 사용하여 시간적 운동과 공간적 초해상도를 동시에 처리하며, 이중 단계 SOTA 방법보다 3배 빠른 추론 속도와 4배 작은 모델 크기로 최신 성능을 달성한다.

ABSTRACT

In this paper, we address the space-time video super-resolution, which aims at generating a high-resolution (HR) slow-motion video from a low-resolution (LR) and low frame rate (LFR) video sequence. A naïve method is to decompose it into two sub-tasks: video frame interpolation (VFI) and video super-resolution (VSR). Nevertheless, temporal interpolation and spatial upscaling are intra-related in this problem. Two-stage approaches cannot fully make use of this natural property. Besides, state-of-the-art VFI or VSR deep networks usually have a large frame reconstruction module in order to obtain high-quality photo-realistic video frames, which makes the two-stage approaches have large models and thus be relatively time-consuming. To overcome the issues, we present a one-stage space-time video super-resolution framework, which can directly reconstruct an HR slow-motion video sequence from an input LR and LFR video. Instead of reconstructing missing LR intermediate frames as VFI models do, we temporally interpolate LR frame features of the missing LR frames capturing local temporal contexts by a feature temporal interpolation module. Extensive experiments on widely used benchmarks demonstrate that the proposed framework not only achieves better qualitative and quantitative performance on both clean and noisy LR frames but also is several times faster than recent state-of-the-art two-stage networks. The source code is released in https://github.com/Mukosame/Zooming-Slow-Mo-CVPR-2020 .

연구 동기 및 목표

  • 공간-시간 영상 초해상도(STVSR)에서 이중 단계 접근 방식의 한계를 해결하기 위해, 영상 프레임 보간(VFI)과 영상 초해상도(VSR)를 별도로 수행함으로써 효율성과 최적 성능에 제약이 생기는 문제를 해결한다.
  • STVSR에서 시간적 보간과 공간적 확대 간의 상호의존성을 극복하기 위해 두 작업을 하나의 종단 간 훈련 가능한 프레임워크로 통합한다.
  • 계산 비용과 모델 크기를 줄이면서도, 특히 운동 블러와 노이즈와 같은 도전적인 조건에서도 시각적 품질을 유지하거나 향상시킨다.
  • 특히 직접적인 저해상도 감독이 없는 중간 프레임에 대해 복원된 고해상도 영상 시퀀스의 시간적 일관성을 향상시킨다.

제안 방법

  • 입력된 저해상도·저프레임레ート(LR, LFR) 시퀀스에서 직접 고해상도(HR) 프레임을 예측하는 일단계 STVSR 프레임워크를 제안하며, 직접적인 픽셀 수준의 보간을 생략한다.
  • 학습 가능한 오프셋을 가진 타원형 특징 보간 모듈을 도입하여 저해상도 프레임의 특징을 시간적으로 보간함으로써 국소적인 시간적 맥락과 운동 패턴을 포착한다.
  • 전체 시간적 맥락을 통합하면서도, 시간 간 특징 정렬을 운동 인식 기반으로 수행하는 새로운 타원형 ConvLSTM을 활용한다.
  • 특징 보간을 유도하기 위해 순환 보간 손실을 사용하여 재구성 정확도와 운동 일관성을 향상시킨다.
  • 보간 및 집계된 특징에 깊이 있는 초해상도 네트워크를 적용하여 최종 고해상도 프레임을 재구성한다.
  • 특히 노이즈 조건에서 성능을 강화하기 위해 중간 지도 지침을 적용하여 특징 보간 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1일단계 프레임워크가 시간적 보간과 공간적 초해상도를 동시에 모델링함으로써 이중 단계 STVSR 방법보다 정확성과 효율성 면에서 뛰어나지 못할까?
  • RQ2운동 처리 능력과 시각적 품질 측면에서 픽셀 수준의 보간 대비 특징 수준의 시간적 보간은 어떻게 비교될 수 있을까?
  • RQ3타원형 ConvLSTM이 STVSR에서 시간적 일관성과 운동 내성에 얼마나 기여할 수 있을까?
  • RQ4제안된 순환 보간 손실이 특징 보간과 전체 STVSR 성능에 어떻게 기여하는가?
  • RQ5노이즈와 압축과 같은 실제 세계의 열악한 조건에서 모델은 어떻게 성능을 보일까?

주요 결과

  • Zooming SlowMo는 청소년 및 노이즈가 있는 STVSR 벤치마크에서 최신 기술을 초월하며, DAIN+EDVR와 같은 최근 이중 단계 방법보다 PSNR와 SSIM 측면에서 뛰어난 성능을 보였다.
  • DAIN+EDVR 기준선 대비 추론 속도가 3배 이상 빠르고 모델 크기가 4배 작아, 뛰어난 효율성을 입증했다.
  • QF=10 압축 조건의 Vid4 데이터셋에서 지도 지침 없이도 PSNR 22.03, SSIM 0.5216를 유지했으며, 지도 지침을 적용하면 약간 향상되어 각각 21.99와 0.5204를 기록하여 노이즈에 대한 강건성을 입증했다.
  • 절단 분석 결과, 지도 지도된 특징 보간이 고운동 영역에서 운동 처리 능력을 향상시키며 블러를 줄이고 가장자리 선명도를 높임을 확인했다.
  • 개선된 성능에도 불구하고 시간적 일관성 문제는 여전히 존재한다 — 예를 들어 중간 프레임(t)은 인접 프레임(t−1, t+1)보다 더 블러져 있으며, 이는 재구성 난이도의 내재적 불균형을 시사한다.
  • 큰 기하학적 변화가 수반되는 애니메이션 손의 경우와 같이 심한 물체 변형 상황에서는 모델이 블러진 재구성을 보이며, 더 강건한 변형 처리 능력을 갖춘 정렬 기법이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.