Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Neural Video Representations with Learnable Positional Features

Subin Kim, Sihyun Yu|arXiv (Cornell University)|Oct 13, 2022
Advanced Vision and Imaging被引用数 12
ひとこと要約

本稿では、空間的・時間的信号を2次元潜在キーフレームと3次元スパース位置特徴に分解することで、高品質でパラメータ効率的かつ計算効率的な動画符号化を実現する、新しい座標ベースの神経表現である学習可能位置特徴を備えた神経的動画表現(NVP)を提案する。NVPは1台のV100 GPUで5分未塔で学習可能であり、UVGベンチマークにおいてPSNRを34.07から34.57に向上させ、先行手法と比較して8倍以上の少ないパラメータ数を実現した。

ABSTRACT

Succinct representation of complex signals using coordinate-based neural representations (CNRs) has seen great progress, and several recent efforts focus on extending them for handling videos. Here, the main challenge is how to (a) alleviate a compute-inefficiency in training CNRs to (b) achieve high-quality video encoding while (c) maintaining the parameter-efficiency. To meet all requirements (a), (b), and (c) simultaneously, we propose neural video representations with learnable positional features (NVP), a novel CNR by introducing "learnable positional features" that effectively amortize a video as latent codes. Specifically, we first present a CNR architecture based on designing 2D latent keyframes to learn the common video contents across each spatio-temporal axis, which dramatically improves all of those three requirements. Then, we propose to utilize existing powerful image and video codecs as a compute-/memory-efficient compression procedure of latent codes. We demonstrate the superiority of NVP on the popular UVG benchmark; compared with prior arts, NVP not only trains 2 times faster (less than 5 minutes) but also exceeds their encoding quality as 34.07$ ightarrow$34.57 (measured with the PSNR metric), even using $>$8 times fewer parameters. We also show intriguing properties of NVP, e.g., video inpainting, video frame interpolation, etc.

研究の動機と目的

  • 動画用の既存の座標ベース神経表現(CNR)における計算非効率性とパラメータの肥大化問題に対処すること。
  • パラメータ効率性を保ちつつ、訓練時間の短縮を図りながら高品質な動画符号化を達成すること。
  • 空間的・時間的特徴の新規分解を用いて、スケーラブルで効率的かつ高精度な動画表現を実現すること。
  • 強力な画像および動画コーデックを統合し、CNRにおける潜在コードの効率的圧縮を実現すること。

提案手法

  • 座標から潜在表現へのマッピングを2次元潜在キーフレーム(xy、xt、yt平面)と3次元スパース位置特徴(xyt)に分解するCNRアーキテクチャを提案し、パラメータの増加を抑制する。
  • 動画コンテンツをコンactな潜在コードとしてアーモナイズする学習可能位置特徴を導入し、大規模な3次元グリッドを回避する。
  • 因数分解構造:gθ = gθ_xy × gθ_xt × gθ_yt × gθ_xyt を採用し、各成分が学習済みグリッドを介して座標から潜在コードへマッピングする。
  • スパース位置特徴の連結により、再構成における滑らかさと詳細の保持を向上させる。
  • 推論時に未観測の座標を扱うために、スパース位置特徴にアップサンプリング(例:線形補間)を適用する。
  • 既存の画像および動画コーデック(例:潜在コードの圧縮に使用)を活用し、メモリおよび計算効率の高い符号化を実現する。

実験結果

リサーチクエスチョン

  • RQ1CNRアーキテクチャは、パラメータ効率性と計算効率性を両立させつつ、高品質な動画符号化を達成できるか?
  • RQ2空間的・時間的特徴を2次元キーフレームと3次元スパース特徴に分解することで、効率性と品質がどのように向上するか?
  • RQ3スパース位置特徴の連結が、再構成のシャープネスとアーチファクト低減に与える影響は何か?
  • RQ4スパース特徴のアップサンプリングは、訓練時間および再構成品質にどのように影響するか?
  • RQ5既存の動画コーデックは、提案されたCNRが生成する潜在コードを効果的に圧縮できるか?

主な発見

  • NVPはUVG-HDベンチマークでPSNR 34.57を達成し、先行研究の34.07から向上したが、パラメータ数は8倍以上も削減された。
  • 1台のNVIDIA V100 GPUで1動画あたり5分未塔の訓練時間にまで短縮され、先行最先端手法と比較して2倍の高速化が達成された。
  • スパース位置特徴の連結により、アーチファクトが顕著に低減され、特にシャープなエッジやテクスチャの再現性が向上した。
  • スパース特徴のアップサンプリングにより、再構成の滑らかさと未観測座標への一般化性能が向上したが、1イテレーションあたりの訓練時間は1.61倍に増加した。
  • NVPは高品質な動画インpaintingおよびフレーム補間を実現し、生成および再構成能力を示した。
  • 本手法は、走る馬のような動的シーンやフェンスのような複雑なテクスチャを含む多様な動画コンテンツにおいても、優れた性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。