Skip to main content
QUICK REVIEW

[论文解读] Autoencoder based image compression: can the learning be quantization independent?

Thierry Dumas, Aline Roumy|arXiv (Cornell University)|Feb 23, 2018
Advanced Data Compression Techniques参考文献 13被引用 7
一句话总结

本文展示了通过为每个特征图学习共享的变换和量化步长,单一深度自编码器可在无需为每个码率重新训练模型的情况下,在多个率失真点上实现具有竞争力的图像压缩性能。关键贡献在于无需依赖量化的学习方法,即在推理时改变量化步长也不会导致性能下降。

ABSTRACT

This paper explores the problem of learning transforms for image compression via autoencoders. Usually, the rate-distortion performances of image compression are tuned by varying the quantization step size. In the case of autoen-coders, this in principle would require learning one transform per rate-distortion point at a given quantization step size. Here, we show that comparable performances can be obtained with a unique learned transform. The different rate-distortion points are then reached by varying the quantization step size at test time. This approach saves a lot of training time.

研究动机与目标

  • 探究单一学习得到的自编码器变换是否可在不重新训练的情况下支持多个率失真点。
  • 确定是否显式学习每个特征图的量化步长可实现在推理时的码率自适应。
  • 将无需依赖量化的学习方法与传统方法进行对比,后者需为每个码率单独训练模型。
  • 评估联合学习变换与量化参数是否能提升压缩效率。
  • 评估学习到的表征在推理时使用与训练时不同的量化步长时是否仍能保持性能。

提出的方法

  • 训练一个带有卷积层和非线性激活的单一深度自编码器,避免使用全连接层以确保尺寸不变性。
  • 在潜在表征 $\mathbf{Y}$ 的 $m$ 个特征图中引入可学习的量化步长 $\delta_i$,替代基于固定归一化的比特分配方式。
  • 将率失真目标表述为 $\min_{\theta, \varphi_e, \varphi_d, \phi} \mathbb{E}[\|\mathbf{X} - \overline{g}_d(\mathcal{Q}(\overline{g}_e(\mathbf{X}; \theta, \varphi_e)); \varphi_d, \phi)\|_F^2 + \gamma \sum_i H_i]$,其中 $H_i$ 为第 $i$ 个特征图的熵。
  • 通过均匀噪声注入技巧近似不可微的量化操作,以支持基于梯度的优化。
  • 在 24,000 幅 $256 \times 256$ 尺寸的 ImageNet 图像上训练自编码器,随后在 Kodak 24 幅亮度图像上评估,使用不同推理时的量化步长。
  • 通过量化系数的经验熵估算码率,使用无损编码验证码率估算结果(差异 < 0.04 bpp)。

实验结果

研究问题

  • RQ1单一学习得到的自编码器变换是否可在不重新训练的情况下,在多个比特率下实现具有竞争力的率失真性能?
  • RQ2显式学习每个特征图的量化步长是否可实现在推理时的有效码率自适应?
  • RQ3联合学习变换与量化参数的方法与训练时使用固定量化步长的传统方法相比,性能如何?
  • RQ4学习到的潜在表征在推理时对量化步长变化是否具有鲁棒性?
  • RQ5该模型是否能以单一模型在率失真性能上超越标准编解码器如 JPEG2000 和 H.265?

主要发现

  • 使用每个特征图可学习量化步长训练的单一自编码器,在率失真性能上可与为每个率失真点单独训练模型的性能相媲美。
  • 尽管量化参数仅使用 128 个参数,而归一化方法需 33,024 个参数,但无需依赖量化的模型性能与使用学习归一化且固定量化步长(1.0)的模型几乎完全一致。
  • 学习到的潜在表征表现出量化步长与码率之间的线性关系,且各特征图的熵可预测性地缩放。
  • 该模型在所有测试码率下均优于 JPEG2000,展现出更优的率失真效率。
  • 在推理时使用不同量化步长(从 $\beta = 1.0$ 到 $10.0$)进行码率自适应,性能保持一致,证实了对量化变化的鲁棒性。
  • 通过无损编码估算的实际码率与估计码率之间的差异小于 0.04 bpp,验证了基于熵的码率估算的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。