Skip to main content
QUICK REVIEW

[论文解读] Versatile Learned Video Compression

Runsen Feng, Zongyu Guo|arXiv (Cornell University)|Nov 5, 2021
Video Coding and Compression Technologies参考文献 40被引用 5
一句话总结

该论文提出了一种通用的深度学习视频压缩框架——通用学习视频压缩(VLVC),该框架采用3D体素光流进行运动补偿,并通过基于多项式的光流预测方法降低比特成本,支持所有帧间预测模式(单向、双向及多参考帧)。与VVC/H.266标准相比,VLVC在MS-SSIM指标上表现更优,是首个在该指标上超越VVC的端到端学习视频编码器。

ABSTRACT

Learned video compression methods have demonstrated great promise in catching up with traditional video codecs in their rate-distortion (R-D) performance. However, existing learned video compression schemes are limited by the binding of the prediction mode and the fixed network framework. They are unable to support various inter prediction modes and thus inapplicable for various scenarios. In this paper, to break this limitation, we propose a versatile learned video compression (VLVC) framework that uses one model to support all possible prediction modes. Specifically, to realize versatile compression, we first build a motion compensation module that applies multiple 3D motion vector fields (i.e., voxel flows) for weighted trilinear warping in spatial-temporal space. The voxel flows convey the information of temporal reference position that helps to decouple inter prediction modes away from framework designing. Secondly, in case of multiple-reference-frame prediction, we apply a flow prediction module to predict accurate motion trajectories with unified polynomial functions. We show that the flow prediction module can largely reduce the transmission cost of voxel flows. Experimental results demonstrate that our proposed VLVC not only supports versatile compression in various settings, but also is the first end-to-end learned video compression method that outperforms the latest VVC/H.266 standard reference software in terms of MS-SSIM.

研究动机与目标

  • 为克服现有学习视频编码器受限于固定预测模式与网络架构的局限性。
  • 使单一模型能够支持多种编码场景,包括低延迟(单向)与随机访问(双向)配置。
  • 在不牺牲预测精度的前提下,降低多参考帧预测中运动信息的比特成本。
  • 在所有帧间预测模式下实现具有竞争力的率失真性能,达到或超越传统标准(如VVC)的水平。

提出的方法

  • 该框架采用基于体素光流的运动补偿模块,利用多个3D运动矢量场(体素光流)表示时空运动,实现对任意参考帧的灵活帧间预测。
  • 通过使用多个体素光流进行加权三线性插值,合成目标帧像素,相比单光流方法显著提升了运动补偿精度。
  • 引入基于多项式的光流预测模块,统一建模运动轨迹,减少对完整体素光流的传输需求,从而降低编码成本。
  • 采用统一架构进行端到端训练,将预测模式与网络设计解耦,实现对所有可能帧间预测模式的支持。
  • 运动信息通过学习的熵模型进行编码,框架在单参考帧与多参考帧场景下均保持一致的性能表现。
  • 该方法基于标准HEVC与VVC测试序列进行评估,采用一致的预处理与评估流程,确保比较的公平性。

实验结果

研究问题

  • RQ1单一学习视频压缩模型是否能够在无需架构微调的情况下,支持所有帧间预测模式(包括单向、双向及多参考帧)?
  • RQ2如何使运动补偿具备足够的灵活性,以处理空间与时间上任意位置的参考帧?
  • RQ3基于多项式函数的统一光流预测模块是否能够降低运动信息的比特成本,同时保持高预测精度?
  • RQ4所提出的框架是否在率失真性能上优于最新的VVC/H.266标准,特别是在主观感知质量(MS-SSIM)方面?
  • RQ5该模型是否能够在无需架构变更的情况下,泛化至不同编码配置(如低延迟与随机访问)?

主要发现

  • VLVC是首个在所有测试序列中,于MS-SSIM指标上超越VVC/H.266参考软件的端到端学习视频压缩模型。
  • 采用多个体素光流并结合加权三线性插值显著提升了运动补偿精度,降低了残差能量,从而实现更高效的压缩。
  • 基于多项式的光流预测模块显著降低了运动信息的比特成本,尤其在多参考帧场景下优势明显。
  • VLVC在所有帧间预测模式下均实现了具有竞争力的率失真性能,包括低延迟与随机访问配置。
  • 主观评价显示,在相同比特率下,VLVC重建的帧比VVC重建的帧更清晰、纹理更丰富。
  • 该框架在多种视频内容与编码配置下均保持高性能,展现出强大的泛化能力与通用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。