Skip to main content
QUICK REVIEW

[论文解读] Neural Video Compression using Spatio-Temporal Priors

Haojie Liu, Tong Chen|arXiv (Cornell University)|Feb 20, 2019
Advanced Image Processing Techniques参考文献 19被引用 10
一句话总结

本文提出了一种神经视频压缩框架,利用联合的时空先验——通过低分辨率特征获得的空间先验和通过基于ConvLSTM的循环网络获得的时间先验——以提高压缩效率。通过使用学习到的先验来建模帧内纹理、运动和残差,该方法在以MS-SSIM作为失真度量时,相较于HEVC Main Profile实现了38%的平均Bjontegaard-Delta Rate(BD-Rate)增益。

ABSTRACT

The pursuit of higher compression efficiency continuously drives the advances of video coding technologies. Fundamentally, we wish to find better "predictions" or "priors" that are reconstructed previously to remove the signal dependency efficiently and to accurately model the signal distribution for entropy coding. In this work, we propose a neural video compression framework, leveraging the spatial and temporal priors, independently and jointly to exploit the correlations in intra texture, optical flow based temporal motion and residuals. Spatial priors are generated using downscaled low-resolution features, while temporal priors (from previous reference frames and residuals) are captured using a convolutional neural network based long-short term memory (ConvLSTM) structure in a temporal recurrent fashion. All of these parts are connected and trained jointly towards the optimal rate-distortion performance. Compared with the High-Efficiency Video Coding (HEVC) Main Profile (MP), our method has demonstrated averaged 38% Bjontegaard-Delta Rate (BD-Rate) improvement using standard common test sequences, where the distortion is multi-scale structural similarity (MS-SSIM).

研究动机与目标

  • 通过用数据驱动的端到端学习先验来替代手工设计的编码工具,以提高视频压缩效率。
  • 利用下采样后的低分辨率特征作为空间先验,挖掘帧内相关性。
  • 通过基于ConvLSTM的循环网络建模时间依赖性,以捕捉帧间运动和残差统计特性。
  • 通过整合帧内、帧间和残差编码并共享先验,联合优化率失真性能。
  • 在标准测试序列和基于MS-SSIM的失真度量下,与HEVC和H.264/AVC相比达到最先进性能。

提出的方法

  • 通过将当前帧聚合下采样生成低分辨率特征,以生成空间先验,用于帧内编码。
  • 通过处理先前重建帧和残差的ConvLSTM循环网络捕获时间先验。
  • 框架采用带有GDN激活函数和超先验的变分自编码器,以实现高效的潜在表示和熵编码。
  • 残差通过以先前残差、潜在特征和时间隐藏状态为条件的联合概率分布进行建模。
  • 基于具有学习到的均值和方差的高斯分布的累积分布函数(CDF)用于精确的熵建模。
  • 采用两阶段端到端训练:首先对帧内和光流网络进行预训练,然后通过结合MS-SSIM和L1/光流失真损失的率失真损失进行联合优化。

实验结果

研究问题

  • RQ1通过深度神经网络学习到的联合时空先验是否能显著提升视频压缩效率,超越传统手工设计的工具?
  • RQ2基于ConvLSTM的循环网络在建模视频压缩中运动和残差预测的长期时间依赖性方面有多高效?
  • RQ3从低分辨率特征导出的空间先验在多大程度上能提升帧内编码性能?
  • RQ4对空间、时间及残差先验的联合建模能否带来更优的熵编码效率和率失真权衡?
  • RQ5在相同质量度量(MS-SSIM)下,所提出的神经框架与HEVC和H.264/AVC相比,BD-Rate增益如何?

主要发现

  • 所提出的神经视频压缩框架在标准测试序列上,相较于HEVC Main Profile,实现了平均38.12%的BD-Rate降低。
  • 在KristenAndSara序列上,该方法实现了96.96%的BD-Rate增益,表明在高运动内容上表现极为出色。
  • 在目标MS-SSIM约为0.988时,该框架在比特率上显著优于H.264/AVC High Profile和HEVC Main Profile。
  • 使用光流和基于ConvLSTM的时间建模,使得运动预测比传统的基于块的运动估计更为准确。
  • 空间、时间及残差先验的联合建模显著提升了熵编码效率,这一点在率失真性能上得到验证。
  • 该框架保持了高视觉质量,帧快照显示在较低比特率下与HEVC和H.264/AVC相比失真极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。