Skip to main content
QUICK REVIEW

[论文解读] Performance Comparison of Convolutional AutoEncoders, Generative Adversarial Networks and Super-Resolution for Image Compression

Zhengxue Cheng, Heming Sun|arXiv (Cornell University)|Jul 1, 2018
Advanced Image Processing Techniques被引用 13
一句话总结

本文提出并比较了三种基于深度学习的图像压缩方法:卷积自编码器(CAEs)、生成对抗网络(GANs)和超分辨率(SR)。CAEs 通过学习紧凑的表示,在编码效率上优于 JPEG;GANs 在高比特率下表现出色,主观质量更优;而基于 SR 的压缩方法在率失真性能上表现最佳,其性能接近 BPG,同时在 0.15 bpp 时的客观指标上优于 CAEs 和 GANs。

ABSTRACT

Image compression has been investigated for many decades. Recently, deep learning approaches have achieved a great success in many computer vision tasks, and are gradually used in image compression. In this paper, we develop three overall compression architectures based on convolutional autoencoders (CAEs), generative adversarial networks (GANs) as well as super-resolution (SR), and present a comprehensive performance comparison. According to experimental results, CAEs achieve better coding efficiency than JPEG by extracting compact features. GANs show potential advantages on large compression ratio and high subjective quality reconstruction. Super-resolution achieves the best rate-distortion (RD) performance among them, which is comparable to BPG.

研究动机与目标

  • 评估并比较三种基于深度学习的图像压缩架构:CAEs、GANs 和超分辨率。
  • 在不同压缩比下评估编码效率、主观质量以及率失真权衡。
  • 探究学习型图像压缩方法是否能够超越传统编码器如 JPEG 和 BPG。
  • 探索将深度学习与超分辨率结合以提升重建质量的潜力。
  • 使用 PSNR 和 MS-SSIM 等标准指标,为端到端学习型压缩方法提供全面基准。

提出的方法

  • 基于 CAE 的方法采用带有 PReLU 激活函数的卷积自编码器,并使用结合 MSE 重建损失与潜在码 L2 范数的率失真损失函数。
  • 基于 GAN 的方法采用生成器-判别器架构,其中生成器充当解码器,判别器通过特征匹配损失提供感知反馈。
  • 超分辨率方法在预处理阶段使用双三次插值,并在解码器端应用学习型超分滤波器以提升重建图像质量。
  • 所有方法均使用 PCA、均匀量化和 JPEG2000 无损熵编码生成最终比特流。
  • 训练使用 Adam 优化器,学习率和批量大小固定,模型在 CLIC 验证数据集上进行评估。
  • 率失真性能通过在不同比特率下使用 PSNR 和 MS-SSIM 进行评估,并对输入尺寸、码率大小和量化位数进行消融研究。

实验结果

研究问题

  • RQ1基于 CAE 的压缩方法在率失真性能上与 JPEG 和 BPG 相比如何?
  • RQ2基于 GAN 的对抗性训练在高比特率下对主观图像质量有何影响?
  • RQ3超分辨率技术能否提升学习型图像压缩的重建质量与率失真性能?
  • RQ4不同的预处理策略(如插值和量化)如何影响最终的压缩效率?
  • RQ5在 PSNR 和 MS-SSIM 指标上,学习型压缩方法在多大程度上优于传统编码器如 JPEG2000 和 BPG?

主要发现

  • 由于能够学习图像的紧凑、低维表示,CAEs 在编码效率上优于 JPEG。
  • 在低比特率下,基于 GAN 的压缩方法在主观图像质量方面表现更优,尤其在 0.2–0.8 bpp 范围内,MS-SSIM 表现突出。
  • 基于超分辨率的压缩方法在率失真性能上表现最佳,在 0.143 bpp 时达到 30.00 dB PSNR 和 0.947 MS-SSIM,性能接近 BPG。
  • 在 0.15 bpp 时,SR 方法在 PSNR 和 MS-SSIM 上均优于 CAE 和 GAN,分别达到 30.00 dB 和 0.947 MS-SSIM,而 BPG 的对应值为 30.85 dB 和 0.948 MS-SSIM。
  • 将插值尺度从 (W,H) 提升至 (4W,4H) 可使 PSNR 提升约 3.5 dB,但比特率增加近 4 倍,表明质量与效率之间存在权衡。
  • 将量化位数从 8 位减少到 5 位会显著降低重建质量,PSNR 降至 25.179 dB,凸显对位深的敏感性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。