Skip to main content
QUICK REVIEW

[論文レビュー] VideoINR: Learning Video Implicit Neural Representation for Continuous Space-Time Super-Resolution

Zeyuan Chen, Yinbo Chen|arXiv (Cornell University)|Jun 9, 2022
Advanced Image Processing Techniques被引用数 6
ひとこと要約

VideoINR は、動画超解像のための連続的空間時間暗黙的ニューラル表現を提案し、任意の空間的・時間的拡大を可能にする。3次元座標 (x, y, t) を RGB 値へマッピングするニューラル関数を学習することで、分布内スケールでは最先端の性能を達成し、分布外の解像度およびフレームレートにおいてもベースラインを著しく上回る性能を発揮する。

ABSTRACT

Videos typically record the streaming and continuous visual data as discrete consecutive frames. Since the storage cost is expensive for videos of high fidelity, most of them are stored in a relatively low resolution and frame rate. Recent works of Space-Time Video Super-Resolution (STVSR) are developed to incorporate temporal interpolation and spatial super-resolution in a unified framework. However, most of them only support a fixed up-sampling scale, which limits their flexibility and applications. In this work, instead of following the discrete representations, we propose Video Implicit Neural Representation (VideoINR), and we show its applications for STVSR. The learned implicit neural representation can be decoded to videos of arbitrary spatial resolution and frame rate. We show that VideoINR achieves competitive performances with state-of-the-art STVSR methods on common up-sampling scales and significantly outperforms prior works on continuous and out-of-training-distribution scales. Our project page is at http://zeyuan-chen.com/VideoINR/ .

研究の動機と目的

  • 既存の空間時間動画超解像(STVSR)手法における固定アップスケーリングの制限を解消すること。
  • 低解像度・低フレームレート入力から、任意解像度およびフレームレートの動画再構成を可能にする連続的かつ柔軟な再構成を実現すること。
  • 暗黙的ニューラル表現を用いて、分布外の空間的・時間的スケールへの一般化を向上させること。
  • 再構成損失以外に明示的教師信号を必要としない、エンドツーエンド微分可能なフレームワークを構築すること。

提案手法

  • 動画を暗黙的ニューラル関数として表現:f(x, y, t) → [R, G, B]、入力は連続的な3次元空間時間座標。
  • 2つの入力低解像度フレームから特徴マップを生成するエンコーダを用い、潜在表現を生成する。
  • 空間的暗黙的ニューラル表現(SpatialINR)を適用し、エンコードされたマップから高解像度特徴をサンプリングする。
  • 時間的暗黙的ニューラル表現(TemporalINR)を学習し、特徴のワープに用いる動きフィールドを出力する。
  • 予測された動きフィールドを用いて空間的ワープを実行し、高解像度特徴をターゲットフレームにあわせる。その後、デコーダで出力へ変換する。
  • 再構成損失のみを用いてエンドツーエンドで訓練し、空間的および時間的モデリングの共同最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1暗黙的ニューラル表現は、連続的かつ任意解像度・フレームレートの動画超解像を可能にするか?
  • RQ2VideoINR は、固定スケール STVSR 手法と比較して、分布外の空間的・時間的スケールへどのように一般化するか?
  • RQ3ニューラル関数による動きフィールドの暗黙的学習が、補間品質および一般化性能に与える影響は何か?
  • RQ4マルチスケール特徴集約と空間的・時間的成分の分離モデリングは、統合ネットワークと比較して性能向上に寄与するか?
  • RQ5完全再構成なしに、特定の領域や時間間隔のみを効率的にデコードできるか?

主な発見

  • GOPRO データセットにおいて、×4 空間拡大で PSNR 29.61、SSIM 0.8734 の競争力ある性能を達成し、最先端の STVSR 手法と同等の結果を示した。
  • 分布外スケールでは、VideoINR が顕著に優れた性能を発揮した:×12 空間拡大で PSNR 24.11(SSIM 0.6913)、対照的に VideoINR(×4 固定学習)では 23.82(SSIM 0.6857)であった。
  • 連続的空間スケールからスクラッチで学習した場合(VideoINR -continuous)は、性能が低下(×2 時に PSNR 27.46)した。これは、固定スケールでの事前学習の利点を示している。
  • アブレーション実験では、動きフィールドを除去した場合(VideoINR -f)に性能が低下した。これは、大規模な動きおよび時間的文脈をモデル化する上で動きフィールドの重要性を裏付けている。
  • マルチスケール特徴集約(VideoINR -m)および空間的・時間的成分の分離モデリング(VideoINR -s)により性能が向上した。これはアーキテクチャ上の利点を示している。
  • 定性的な結果では、分布内・分布外の時間的座標においても安定した性能を示し、他の手法が失敗する場面でも一貫した詳細回復が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。