Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Neural Video Representations with Learnable Positional Features

Subin Kim, Sihyun Yu|arXiv (Cornell University)|2022. 10. 13.
Advanced Vision and Imaging인용 수 12
한 줄 요약

이 논문은 영상의 시공간 신호를 2차원 잠재 키프레임과 3차원 희소 위치 특징으로 분해함으로써 고품질, 파rameter 효율적이고 계산 효율적인 영상 인코딩을 달성하는 새로운 좌표 기반 신경 표현인 학습 가능한 위치 특징을 가진 신경 영상 표현(NVP)을 제안한다. NVP는 단일 V100 GPU에서 5분 이내에 학습되며, 기존 방법보다 8배 이상 적은 파라미터를 사용하면서 UVG 벤치마크에서 PSNR를 34.07에서 34.57로 향상시킨다.

ABSTRACT

Succinct representation of complex signals using coordinate-based neural representations (CNRs) has seen great progress, and several recent efforts focus on extending them for handling videos. Here, the main challenge is how to (a) alleviate a compute-inefficiency in training CNRs to (b) achieve high-quality video encoding while (c) maintaining the parameter-efficiency. To meet all requirements (a), (b), and (c) simultaneously, we propose neural video representations with learnable positional features (NVP), a novel CNR by introducing "learnable positional features" that effectively amortize a video as latent codes. Specifically, we first present a CNR architecture based on designing 2D latent keyframes to learn the common video contents across each spatio-temporal axis, which dramatically improves all of those three requirements. Then, we propose to utilize existing powerful image and video codecs as a compute-/memory-efficient compression procedure of latent codes. We demonstrate the superiority of NVP on the popular UVG benchmark; compared with prior arts, NVP not only trains 2 times faster (less than 5 minutes) but also exceeds their encoding quality as 34.07$ ightarrow$34.57 (measured with the PSNR metric), even using $>$8 times fewer parameters. We also show intriguing properties of NVP, e.g., video inpainting, video frame interpolation, etc.

연구 동기 및 목표

  • 기존 영상용 좌표 기반 신경 표현(CNR)에서의 계산 비효율성과 파라미터 과잉 문제를 해결하기 위해.
  • 파라미터 효율성과 학습 시간을 유지하면서도 고품질 영상 인코딩을 달성하기 위해.
  • 새로운 시공간 특징 분해를 통해 확장 가능하고 효율적이며 고정밀도 영상 표현을 가능하게 하기 위해.
  • CNR 내 잠재 코드의 효율적 압축을 위해 강력한 이미지 및 영상 코덱을 통합하기 위해.

제안 방법

  • 좌표에서 잠재 표현으로의 매핑을 2차원 잠재 키프레임(또는 xy, xt, yt 평면)과 3차원 희소 위치 특징(xyт)으로 분해함으로써 파라미터 증가를 줄이는 CNR 아키텍처를 제안한다.
  • 영상 콘텐츠를 압축된 잠재 코드로 암시적으로 표현하는 학습 가능한 위치 특징을 도입하여 큰 3차원 격자 구조를 피한다.
  • 요소 분해 구조를 사용: gθ = gθ_xy × gθ_xt × gθ_yt × gθ_xyt로, 각 성분이 학습된 격자를 통해 좌표를 잠재 코드로 매핑한다.
  • 희소 위치 특징의 연결을 통해 재구성의 부드러움과 세부 사항 보존을 향상시킨다.
  • 추론 중에 미리 보지 못한 좌표를 처리하기 위해 희소 위치 특징에 업샘플링(예: 선형 보간)을 적용한다.
  • 기존의 이미지 및 영상 코덱(예: 잠재 코드 압축용)을 활용하여 메모리 및 계산 효율적인 인코딩을 실현한다.

실험 결과

연구 질문

  • RQ1CNR 아키텍처가 파라미터 효율성과 계산 효율성을 동시에 확보하면서도 고품질 영상 인코딩을 달성할 수 있는가?
  • RQ2시공간 특징을 2차원 키프레임과 3차원 희소 특징으로 분해함으로써 효율성과 품질이 어떻게 향상되는가?
  • RQ3희소 위치 특징의 연결이 재구성의 선명도 향상과 잡음 감소에 미치는 영향은 무엇인가?
  • RQ4희소 특징의 업샘플링이 학습 시간과 재구성 품질에 어떤 영향을 미치는가?
  • RQ5기존 영상 코덱이 제안된 CNR에서 생성된 잠재 코드를 효과적으로 압축할 수 있는가?

주요 결과

  • NVP는 UVG-HD 벤치마크에서 기존 작업 대비 PSNR 34.57을 달성하여 34.07에서 향상되었으며, 파라미터 수가 8배 이상 적다.
  • 단일 NVIDIA V100 GPU에서 영상당 학습 시간이 5분 이내로 단축되어 기존 최상위 방법 대비 2배 빠른 속도를 기록했다.
  • 희소 위치 특징의 연결이 잡음 감소에 크게 기여하며, 특히 날카운 테두리와 질감의 세부 정보를 더 잘 유지한다.
  • 희소 특징의 업샘플링은 재구성의 부드러움과 미리 보지 못한 좌표로의 일반화 능력을 향상시키지만, 반복당 학습 시간을 1.61배로 증가시킨다.
  • NVP는 고품질 영상 복원 및 프레임 보간 기능을 통해 생성 및 재구성 능력을 입증한다.
  • 운동하는 말이나 울타리와 같은 복잡한 질감을 포함한 다양한 영상 콘텐츠에서 뛰어난 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.