Skip to main content
QUICK REVIEW

[论文解读] Learned Variable-Rate Multi-Frequency Image Compression using Modulated Generalized Octave Convolution

Jianping Lin, Mohammad Akbari|arXiv (Cornell University)|Sep 25, 2020
Advanced Data Compression Techniques参考文献 8被引用 4
一句话总结

该论文提出了一种基于调制广义八度卷积(M-GoConv)的可学习可变比特率图像压缩框架,通过将潜在特征分离为高频和低频分量,实现高效的多尺度表征。通过将网络条件化为拉格朗日参数λ,该方法仅使用三个模型即可在广泛比特率范围内实现高性能的率失真表现,其Y-MS-SSIM性能优于VVC,YUV-PSNR性能与BPG相当。

ABSTRACT

In this proposal, we design a learned multi-frequency image compression approach that uses generalized octave convolutions to factorize the latent representations into high-frequency (HF) and low-frequency (LF) components, and the LF components have lower resolution than HF components, which can improve the rate-distortion performance, similar to wavelet transform. Moreover, compared to the original octave convolution, the proposed generalized octave convolution (GoConv) and octave transposed-convolution (GoTConv) with internal activation layers preserve more spatial structure of the information, and enable more effective filtering between the HF and LF components, which further improve the performance. In addition, we develop a variable-rate scheme using the Lagrangian parameter to modulate all the internal feature maps in the auto-encoder, which allows the scheme to achieve the large bitrate range of the JPEG AI with only three models. Experiments show that the proposed scheme achieves much better Y MS-SSIM than VVC. In terms of YUV PSNR, our scheme is very similar to HEVC.

研究动机与目标

  • 开发一种无需微调或训练多个模型即可在宽比特率范围内支持可变比特率的深度学习图像压缩方法。
  • 通过使用广义八度卷积对潜在表征进行分解,将高频与低频分量分离,从而提升率失真性能。
  • 通过单一拉格朗日参数λ调节内部特征图,实现高效端到端训练,实现率控。
  • 在保持低编码/解码延迟的同时,实现与BPG和VVC等最先进编解码器相当的高性能。

提出的方法

  • 该方法采用调制广义八度卷积(M-GoConv)和转置卷积(M-GoTConv)层,将特征图分解为高频(HF)和低频(LF)分量,其中LF分量的空间分辨率减半。
  • 通过可学习的缩放网络对内部特征图进行缩放,将拉格朗日参数λ映射为通道级调制因子,实现率控。
  • 网络采用共享架构与单一参数集,其中λ用于条件化所有内部卷积,实现可变比特率操作。
  • 模型通过多比特率率失真目标进行训练,最小化率与失真加权和,失真度量为0.9×RGB-MSE + 0.1×(1−Y-MS-SSIM)。
  • 使用学习的超先验对潜在表征进行熵编码,比特率通过高斯和均匀量化模型计算。
  • 通过在不同λ设置下训练三个独立模型,覆盖JPEG-AI CfE标准的完整比特率范围,实现在所有目标比特率下的精确比特率控制。

实验结果

研究问题

  • RQ1单一可学习自编码器架构是否可在无需微调或使用多个模型的情况下,在宽比特率范围内实现可变比特率图像压缩?
  • RQ2与标准卷积网络相比,使用λ调制的广义八度卷积及其特征缩放机制在率失真性能方面有何提升?
  • RQ3在相同条件下,该方法在Y-MS-SSIM和YUV-PSNR方面与VVC和BPG相比能提升多少?
  • RQ4拉格朗日参数λ是否可有效用于条件化内部层,以实现对多样化图像内容的精确比特率控制?
  • RQ5在该多频带、多比特率框架中,模型复杂度、编码/解码速度与压缩性能之间的权衡如何?

主要发现

  • 在高比特率下,该方法的Y-MS-SSIM比VVC测试模型(VTM)高出最多5 dB,显著优于其结构相似性表现。
  • 在YUV-PSNR方面,该方法在多个测试图像上与BPG性能相当,表现出优异的保真度。
  • 通过选择合适的λ值,该方案在所有目标比特率下的比特率偏差控制在1%以内,即使在训练集外也保持准确。
  • 对于1944×1296图像,CPU上的编码和解码时间分别为15秒和21秒,GPU上均低于10秒,表明其具有高效率。
  • 仅需三个模型即可覆盖JPEG-AI CfE标准的全部比特率范围,证明了其强大的泛化能力与可扩展性。
  • 与标准八度卷积相比,调制广义八度卷积更好地保留了空间结构,有助于提升重建质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。