Skip to main content
QUICK REVIEW

[论文解读] Scalable Neural Video Representations with Learnable Positional Features

Subin Kim, Sihyun Yu|arXiv (Cornell University)|Oct 13, 2022
Advanced Vision and Imaging被引用 12
一句话总结

本文提出神经视频表征(NVP),一种新型基于坐标的神经表征,通过将时空信号分解为2D潜在关键帧与3D稀疏位置特征,实现高质量、参数高效且计算高效的视频编码。NVP在单张V100 GPU上训练时间不足5分钟,且在UVG基准测试中将PSNR从34.07提升至34.57,参数量较之前方法减少8倍以上。

ABSTRACT

Succinct representation of complex signals using coordinate-based neural representations (CNRs) has seen great progress, and several recent efforts focus on extending them for handling videos. Here, the main challenge is how to (a) alleviate a compute-inefficiency in training CNRs to (b) achieve high-quality video encoding while (c) maintaining the parameter-efficiency. To meet all requirements (a), (b), and (c) simultaneously, we propose neural video representations with learnable positional features (NVP), a novel CNR by introducing "learnable positional features" that effectively amortize a video as latent codes. Specifically, we first present a CNR architecture based on designing 2D latent keyframes to learn the common video contents across each spatio-temporal axis, which dramatically improves all of those three requirements. Then, we propose to utilize existing powerful image and video codecs as a compute-/memory-efficient compression procedure of latent codes. We demonstrate the superiority of NVP on the popular UVG benchmark; compared with prior arts, NVP not only trains 2 times faster (less than 5 minutes) but also exceeds their encoding quality as 34.07$ ightarrow$34.57 (measured with the PSNR metric), even using $>$8 times fewer parameters. We also show intriguing properties of NVP, e.g., video inpainting, video frame interpolation, etc.

研究动机与目标

  • 解决现有基于坐标的神经表征(CNR)在视频应用中计算效率低下与参数膨胀的问题。
  • 在保持参数效率的同时,实现高质量视频编码并缩短训练时间。
  • 通过新颖的时空特征分解方法,实现可扩展、高效且高保真度的视频表征。
  • 集成强大的图像与视频编解码器,实现CNR中潜在码的高效压缩。

提出的方法

  • 提出一种CNR架构,将坐标到潜在码的映射分解为2D潜在关键帧(对应xy、xt、yt平面)与3D稀疏位置特征(xyt),从而减少参数增长。
  • 引入可学习的位置特征,将视频内容压缩为紧凑的潜在码,避免使用庞大的3D网格。
  • 采用因子分解结构:gθ = gθ_xy × gθ_xt × gθ_yt × gθ_xyt,其中每个分量通过学习的网格将坐标映射为潜在码。
  • 通过拼接稀疏位置特征,提升重建过程中的平滑性与细节保留能力。
  • 在推理阶段对稀疏位置特征应用上采样(如线性插值),以处理未见过的坐标。
  • 利用现有的图像与视频编解码器(如用于潜在码压缩),实现内存与计算效率的优化。

实验结果

研究问题

  • RQ1CNR架构是否能在保持参数高效与计算高效的同时,实现高质量的视频编码?
  • RQ2将时空特征分解为2D关键帧与3D稀疏特征,如何提升效率与质量?
  • RQ3拼接稀疏位置特征对重建清晰度与伪影减少有何影响?
  • RQ4对稀疏特征进行上采样如何影响训练时间与重建质量?
  • RQ5现有视频编解码器能否有效压缩所提出的CNR生成的潜在码?

主要发现

  • NVP在UVG-HD基准测试中实现34.57的PSNR,相较之前工作提升自34.07,且参数量减少8倍以上。
  • 在单张NVIDIA V100 GPU上,每段视频的训练时间缩短至5分钟以内,相较之前最先进方法提速2倍。
  • 稀疏位置特征的拼接显著减少伪影并提升细节捕捉能力,尤其在锐利边缘与纹理区域表现更优。
  • 对稀疏特征进行上采样可提升重建平滑性并增强对未见坐标的泛化能力,但每轮迭代训练时间增加1.61倍。
  • NVP支持高质量的视频修复与帧插值,展现出其生成与重建能力。
  • 该方法在各类视频内容中均保持优异性能,包括奔跑的马匹等动态场景以及栏杆等复杂纹理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。