Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Modulation Network for Controllable Space-Time Video Super-Resolution

Gang Xu, Jun Xu|arXiv (Cornell University)|2021. 04. 21.
Advanced Image Processing Techniques참고 문헌 47인용 수 4
한 줄 요약

이 논문은 임의의 중간 프레임을 보간할 수 있도록 허용하는 제어 가능한 공간-시간 비디오 초해상도 분석을 위한 시간 조절 네트워크(TMNet)를 제안한다. 시간 조절 블록(TMB)을 통해 시간적 파arameter t를 이용해 가변적인 변형 가능 컨볼루션 커널을 동적으로 조정함으로써 이를 실현한다. 이 방법은 국소적 운동 정보를 처리하기 위해 국소-시간 특징 비교(LFC) 모듈을 통합하고, 이중 방향 변형 가능 컨볼루션LSTM을 통해 장기적 맥락을 처리하여 Vimeo-90K Fast에서 최대 37.04dB의 PSNR를 기록하며 세 가지 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Space-time video super-resolution (STVSR) aims to increase the spatial and temporal resolutions of low-resolution and low-frame-rate videos. Recently, deformable convolution based methods have achieved promising STVSR performance, but they could only infer the intermediate frame pre-defined in the training stage. Besides, these methods undervalued the short-term motion cues among adjacent frames. In this paper, we propose a Temporal Modulation Network (TMNet) to interpolate arbitrary intermediate frame(s) with accurate high-resolution reconstruction. Specifically, we propose a Temporal Modulation Block (TMB) to modulate deformable convolution kernels for controllable feature interpolation. To well exploit the temporal information, we propose a Locally-temporal Feature Comparison (LFC) module, along with the Bi-directional Deformable ConvLSTM, to extract short-term and long-term motion cues in videos. Experiments on three benchmark datasets demonstrate that our TMNet outperforms previous STVSR methods. The code is available at https://github.com/CS-GangXu/TMNet.

연구 동기 및 목표

  • 기존 STVSR 방법들이 사전 정의된 중간 프레임만 생성할 수 있는 한계를 해결하여, 더 유연한 방송 환경에서의 응용 가능성을 높이기 위해.
  • 임의의 화면 재생률 생성을 위해 변형 가능 컨볼루션에 제어 가능한 시간 조절을 통합함으로써 특징 보간 정확도를 향상시키기 위해.
  • 더 나은 공간 정렬과 복원을 위해 단기 및 장기 시간적 신호를 융합함으로써 운동 모델링을 향상시키기 위해.
  • 저항성과 더 나은 시각적 품질을 갖춘 고품질, 시간적으로 일관된 비디오 초해상도 분석을 달성하기 위해.

제안 방법

  • 임의의 중간 프레임 보간을 위해 시간적 파arameter t를 변형 벡터 vt로 변환하는 시간 조절 블록(TMB)을 도입하여 변형 가능 컨볼루션 커널의 샘플링을 제어한다.
  • 정확한 단기 운동 모델링과 공간 정렬을 위해 다중 프레임 특징을 추출하고 비교하는 국소-시간 특징 비교(LFC) 모듈을 설계한다.
  • 전체 비디오 시퀀스에 걸친 장기적 운동 변화를 포착하기 위해 이중 방향 변형 가능 컨볼루션LSTM을 활용한다.
  • 지역 융합(국소적 융합)은 LFC를 통해, 전역 융합은 GFF를 통해 이루어지는 이중 단계 시간 특징 융합 전략을 구현하여 단기 및 장기 신호를 효과적으로 통합한다.
  • 픽셀 셔플 레이어 이전에 고해상도 특징 𝒮𝐻 와 초기 저해상도 특징 𝒮𝐿 을 결합하여 운동 및 구조적 세부 정보를 유지한다.
  • 재구성에 대해 L1 손실을 사용하여 Vimeo-90K, Adobe240fps, Vid4 데이터셋에서 네트워크를 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 고정된 화면 재생률 출력에 국한되지 않고, 공간-시간 비디오 초해상도 분석에서 임의의 중간 프레임을 보간할 수 있는가?
  • RQ2접근하는 프레임의 운동 신호를 효과적으로 모델링하면 특징 보간 및 복원 품질이 어떻게 향상되는가?
  • RQ3국소 및 전역 시간 특징 융합을 융합했을 때 STVSR 성능에 어떤 영향을 미치는가?
  • RQ4고해상도 특징과 초기 저해상도 특징을 모두 통합하면 최종 복원 품질이 향상되는가?

주요 결과

  • TMNet는 세 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, Vimeo-90K Fast 세트에서 PSNR 37.04dB를 기록하여 이전 방법들을 능가한다.
  • 제거 실험 결과 LFC 모듈이 필수적임을 확인하였으며, Vid4에서는 0.07dB, Vimeo-Fast에서는 최대 0.17dB의 성능 저하가 발생한다.
  • 비선형층을 포함한 TMB는 선형 버전보다 略로 뛰어나 26.95dB 대비 26.93dB의 PSNR를 기록하여 시간 조절에서 비선형성의 이점이 있음을 입증한다.
  • 고품질 특징 𝒮𝐻 와 초기 특징 𝒮𝐿 의 융합은 모든 데이터셋에서 PSNR를 0.07–0.12dB 향상시키며, 이는 특징 결합 전략의 타당성을 입증한다.
  • 이중 단계 융합(LFC → GFF)은 필수적이다. 반대로 순서(GFF → LFC)로 바꾸면 노이즈가 많은 장기 신호로 인해 훈련이 붕괴된다.
  • TMNet는 0.3, 0.5, 0.7의 간격에서 원하는 화면 재생률로도 임의의 프레임을 생성할 수 있어, 이전 방법이 고정된 중간 프레임에 국한된 것과는 달리 매우 높은 유연성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.