[논문 리뷰] VideoINR: Learning Video Implicit Neural Representation for Continuous Space-Time Super-Resolution
VideoINR는 영상 초해상도를 위한 연속적인 공간-시간 암묵적 신경망 표현을 제안하며, 임의의 공간적 및 시간적 확대를 가능하게 한다. 3차원 좌표 (x, y, t)를 RGB 값으로 매핑하는 신경망 함수를 학습함으로써, 내분포 해상도에서 최신 기술 수준의 성능을 달성하고, 외분포 해상도 및 프레임 레이트에서 기존 방법들을 크게 능가한다.
Videos typically record the streaming and continuous visual data as discrete consecutive frames. Since the storage cost is expensive for videos of high fidelity, most of them are stored in a relatively low resolution and frame rate. Recent works of Space-Time Video Super-Resolution (STVSR) are developed to incorporate temporal interpolation and spatial super-resolution in a unified framework. However, most of them only support a fixed up-sampling scale, which limits their flexibility and applications. In this work, instead of following the discrete representations, we propose Video Implicit Neural Representation (VideoINR), and we show its applications for STVSR. The learned implicit neural representation can be decoded to videos of arbitrary spatial resolution and frame rate. We show that VideoINR achieves competitive performances with state-of-the-art STVSR methods on common up-sampling scales and significantly outperforms prior works on continuous and out-of-training-distribution scales. Our project page is at http://zeyuan-chen.com/VideoINR/ .
연구 동기 및 목표
- 기존의 공간-시간 영상 초해상도(STVSR) 방법에서 고정된 확대 스케일에 대한 한계를 해결한다.
- 저해상도, 저프레임 레이트 입력에서 연속적이고 임의의 해상도 및 프레임 레이트로의 영상 복원을 가능하게 한다.
- 암묵적 신경망 표현을 통해 외분포 공간적 및 시간적 스케일로의 일반화 능력을 향상시킨다.
- 재구성 손실 이외의 명시적 지도 없이도 공간적 및 시간적 특징을 동시에 학습할 수 있는 엔드 투 엔드 미분 가능한 프레임워크를 개발한다.
제안 방법
- 영상은 암묵적 신경망 함수로 표현되며, f(x, y, t) → [R, G, B] 형태로, 입력은 연속적인 3차원 공간-시간 좌표이다.
- 두 개의 저해상도 프레임에서 특징 맵을 생성하기 위해 인코더를 사용하며, 이는 잠재 표현으로 기능한다.
- 공간적 암묵적 신경망 표현(SpatialINR)을 적용하여 인코딩된 맵에서 고해상도 특징을 샘플링한다.
- 시간적 암묵적 신경망 표현(TemporalINR)을 학습하여 특징 워핑을 위한 움직임 흐름 필드를 출력한다.
- 예측된 흐름 필드를 사용해 공간적 워핑을 적용하여 고해상도 특징을 타겟 프레임에 정렬한 후 디코딩한다.
- 재구성 손실만을 사용해 엔드 투 엔드로 훈련하며, 공간적 및 시간적 모델링을 동시에 최적화한다.
실험 결과
연구 질문
- RQ1암묵적 신경망 표현이 연속적이고 임의의 해상도 및 프레임 레이트로 영상 초해상도를 가능하게 할 수 있는가?
- RQ2고정 스케일 STVSR 방법과 비교해 VideoINR은 외분포 공간적 및 시간적 스케일로 어떻게 일반화되는가?
- RQ3신경망 함수를 통해 움직임 흐름을 암묵적으로 학습하는 것이 보간 품질과 일반화 능력에 어떤 영향을 미치는가?
- RQ4다중 스케일 특징 집약 및 공간과 시간의 별도 모델링이 통합 네트워크보다 성능 향상에 기여하는가?
- RQ5전체 재구성 없이도 특정 영역이나 시간 간격만 효율적으로 디코딩할 수 있는가?
주요 결과
- GOPRO 데이터셋에서 ×4 공간 확대 비율에서 VideoINR은 경쟁력 있는 PSNR(29.61)와 SSIM(0.8734) 성능을 기록하며 최신 STVSR 방법과 동등한 성능을 달성한다.
- 외분포 스케일에서 VideoINR은 기존 방법들을 크게 능가한다: ×12 공간 확대 비율에서 PSNR 24.11(SSIM 0.6913), 반면 VideoINR(×4 고정 훈련)는 23.82(SSIM 0.6857)를 기록한다.
- 고정 스케일에서의 사전 훈련 없이 연속적인 공간 스케일에서부터 학습을 시작한 VideoINR -continuous는 성능 저하를 보였다 (×2에서 PSNR 27.46), 이는 고정 스케일에서의 사전 훈련의 유용성을 시사한다.
- 제거 실험 결과, 움직임 흐름을 제거한 경우(VideoINR -f) 성능 저하가 발생함을 확인하여, 큰 움직임과 시간적 맥락을 모델링하는 데서 움직임 흐름의 중요성을 입증한다.
- 다중 스케일 특징 집약(VideoINR -m)과 공간 및 시간 구성 요소의 별도 모델링(VideoINR -s)은 성능 향상을 이끌어내어 아키텍처 설계의 유용성을 입증한다.
- 정성적 결과는 내분포 및 외분포 시간 좌표에서 안정적인 성능을 보이며, 다른 방법이 실패하는 경우에도 일관된 디테일 복원 능력을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.