Skip to main content
QUICK REVIEW

[论文解读] CVEGAN: A Perceptually-inspired GAN for Compressed Video Enhancement

Di Ma, Fan Zhang|arXiv (Cornell University)|Nov 18, 2020
Advanced Image Processing Techniques参考文献 94被引用 8
一句话总结

CVEGAN 提出了一种用于压缩视频增强的新型 GAN 架构,集成了多级残差块(Mul 2 Res)、增强残差非局部块(ERNB)以及增强 CBAM(ECBAM),并结合了相对论球 GAN(ReSphereGAN)训练策略与数据驱动的感知损失。在后处理和空间分辨率自适应任务中,其编码增益分别达到 HEVC HM16.20 的 28% 和 38%,显著提升了感知质量,减少了伪影并增强了纹理细节。

ABSTRACT

We propose a new Generative Adversarial Network for Compressed Video quality Enhancement (CVEGAN). The CVEGAN generator benefits from the use of a novel Mul2Res block (with multiple levels of residual learning branches), an enhanced residual non-local block (ERNB) and an enhanced convolutional block attention module (ECBAM). The ERNB has also been employed in the discriminator to improve the representational capability. The training strategy has also been re-designed specifically for video compression applications, to employ a relativistic sphere GAN (ReSphereGAN) training methodology together with new perceptual loss functions. The proposed network has been fully evaluated in the context of two typical video compression enhancement tools: post-processing (PP) and spatial resolution adaptation (SRA). CVEGAN has been fully integrated into the MPEG HEVC video coding test model (HM16.20) and experimental results demonstrate significant coding gains (up to 28% for PP and 38% for SRA compared to the anchor) over existing state-of-the-art architectures for both coding tools across multiple datasets.

研究动机与目标

  • 解决现有压缩视频增强方法依赖简单损失函数和浅层网络的局限性。
  • 通过利用先进的深度学习架构与感知对齐的训练策略,提升视频压缩中的感知质量。
  • 开发一种基于 GAN 的框架,在 HEVC 中实现后处理与空间分辨率自适应的性能提升,且比特率开销极低。
  • 设计一种可稳定 GAN 训练并更好地匹配人类视觉感知的训练策略。
  • 在多个数据集和真实世界的视频编码场景中验证所提方法的有效性。

提出的方法

  • 提出 Mul 2 Res 块,一种具有多分支与不同卷积核大小的多级残差学习架构,以增强特征表示能力与网络容量。
  • 采用增强残差非局部块(ERNB),以捕捉长距离依赖关系,并在生成器与判别器中提升特征建模能力。
  • 集成增强卷积块注意力模块(ECBAM),以动态聚焦于重要的空间与通道特征。
  • 采用相对论球 GAN(ReSphereGAN)训练方法,利用超球面上的测地线距离来稳定训练并改善生成样本与真实样本在特征空间中的对齐。
  • 提出一种新型感知损失函数,将四个损失分量的对数进行组合,其权重通过八个主观视频质量数据库的数据进行优化。
  • 将 CVEGAN 集成至 HEVC HM16.20 测试模型中,用于在后处理与空间分辨率自适应场景下的端到端评估。

实验结果

研究问题

  • RQ1与标准残差块相比,具有可变卷积核大小的多级残差块是否能提升视频增强性能?
  • RQ2增强注意力机制与非局部模块(ERNB、ECBAM)在压缩视频增强中能在多大程度上提升感知质量?
  • RQ3ReSphereGAN 训练策略是否能带来比标准 GAN 更稳定的训练过程与更优的感知结果?
  • RQ4所提出的基于数据驱动的感知损失函数在多大程度上能实现模型输出与人类视觉感知的一致性?
  • RQ5在相同比特率下,CVEGAN 在后处理与空间分辨率自适应任务中相较于最先进方法的编码增益如何?

主要发现

  • 在多个数据集上,CVEGAN 在后处理任务中相较 HEVC HM16.20 基线实现了最高达 28% 的编码增益。
  • 在空间分辨率自适应任务中,CVEGAN 相较基线实现了最高达 38% 的编码增益,表现出卓越性能。
  • 主观评估结果表明,CVEGAN 输出相比 HEVC、RNAN 与 MSRGAN 具有更少的块效应伪影、更丰富的纹理细节与更高的对比度。
  • 所提出的 ReSphereGAN 训练方法有效稳定了训练过程,并减少了生成特征与目标特征在超球面空间中的差异。
  • 基于真实主观数据优化的感知损失函数与人类视觉质量评估结果表现出强相关性。
  • 图 1、10–13 的视觉对比结果一致表明,CVEGAN 在后处理(PP)与空间分辨率自适应(SRA)场景中均优于当前最先进模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。