Skip to main content
QUICK REVIEW

[论文解读] Perceptual Learned Video Compression with Recurrent Conditional GAN

Ren Yang, Radu Timofte|arXiv (Cornell University)|Sep 7, 2021
Advanced Image Processing Techniques被引用 5
一句话总结

该论文提出了一种基于循环条件生成对抗网络的感知学习视频压缩(PLVC)框架,其中循环自编码器生成器通过结合空间、时间及隐藏状态特征的判别器进行对抗训练,实现在低比特率下生成逼真且时序一致的视频。该方法在多种指标和用户研究中均优于HEVC(HM 16.20)及现有学习视频压缩模型的感知质量。

ABSTRACT

This paper proposes a Perceptual Learned Video Compression (PLVC) approach with recurrent conditional GAN. We employ the recurrent auto-encoder-based compression network as the generator, and most importantly, we propose a recurrent conditional discriminator, which judges on raw vs. compressed video conditioned on both spatial and temporal features, including the latent representation, temporal motion and hidden states in recurrent cells. This way, the adversarial training pushes the generated video to be not only spatially photo-realistic but also temporally consistent with the groundtruth and coherent among video frames. The experimental results show that the learned PLVC model compresses video with good perceptual quality at low bit-rate, and that it outperforms the official HEVC test model (HM 16.20) and the existing learned video compression approaches for several perceptual quality metrics and user studies. The codes will be released at the project page: https://github.com/RenYang-home/PLVC.

研究动机与目标

  • 为弥补感知视频压缩中的差距,通过提升视觉质量超越传统以失真优化的方法。
  • 开发一种视频压缩模型,以在压缩帧中保留逼真纹理和时序一致性。
  • 探索使用循环和条件判别器进行对抗训练在端到端视频压缩中的有效性。
  • 通过客观指标和用户研究评估感知性能,证明其在HEVC和先前学习方法上的优越性。

提出的方法

  • 采用基于循环自编码器的生成器,通过隐藏状态实现时间记忆,以压缩和重建视频帧。
  • 引入一种循环条件判别器,基于潜在表征、运动特征和循环隐藏状态,评估原始视频与压缩视频的差异。
  • 设计一种多条件对抗损失,通过利用空间和时间上下文,平衡比特率、失真和感知质量。
  • 采用双I-PPP GOP结构(每9帧一个I帧)以限制误差传播并支持长期时序建模。
  • 将所提出的判别器和GAN损失应用于不同主干网络(包括DVC),证明其在主PLVC架构之外的泛化能力。
  • 采用端到端对抗优化训练模型,其中生成器最小化感知损失,而判别器区分真实视频与重建视频。

实验结果

研究问题

  • RQ1循环条件生成对抗网络是否能在保持低比特率效率的同时提升学习视频压缩的感知质量?
  • RQ2在判别器中对隐藏状态和运动特征进行条件化,在提升压缩视频时序一致性方面有多有效?
  • RQ3所提出的对抗训练框架是否在感知质量指标和用户感知上优于以失真优化的模型(如HEVC,HM 16.20)?
  • RQ4所提出的判别器在不同视频压缩架构上的泛化能力有多强?
  • RQ5在判别器中移除空间、时间或隐藏状态条件,对感知质量和伪影生成的影响如何?

主要发现

  • 所提出的PLVC模型比特率(0.0730 bpp)低于HEVC(0.0813 bpp),同时在视觉对比中展现出显著更逼真的纹理。
  • 用户研究(MOS)显示,PLVC在低比特率下感知质量优于HEVC和现有学习视频压缩方法。
  • LPIPS、FID和KID指标证实,PLVC在感知质量上优于HM 16.20和基线学习模型。
  • 消融研究显示,若从判别器中移除时间条件(隐藏状态和运动特征),将导致时序一致性和感知质量下降,MOS值甚至低于失真优化模型。
  • 所提出的循环条件判别器具有良好的泛化能力:当应用于DVC时,其提升了感知指标(FID、KID)并优于HM 16.20,证明其广泛适用性。
  • 在GOP内的P帧中未观察到显著误差传播,归因于双I-PPP结构以及保留时序先验的循环记忆。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。