[论文解读] Compressing Images by Encoding Their Latent Representations with Relative Entropy Coding
本文提出了一种新型的无损与有损图像压缩方法——相对熵编码(REC),通过基于索引的重要性采样,直接对变分自编码器(VAE)的潜在表示进行编码,实现接近后验分布与先验分布之间相对熵的码率。与以往的 bits-back 方法不同,REC 消除了辅助位,可在单张图像上高效运行,并在连续潜在空间中直接操作,无需量化,其在无损压缩基准测试中表现优于现有方法,在有损压缩方面也达到了最先进的 PSNR 和 MS-SSIM 指标表现。
Variational Autoencoders (VAEs) have seen widespread use in learned image compression. They are used to learn expressive latent representations on which downstream compression methods can operate with high efficiency. Recently proposed 'bits-back' methods can indirectly encode the latent representation of images with codelength close to the relative entropy between the latent posterior and the prior. However, due to the underlying algorithm, these methods can only be used for lossless compression, and they only achieve their nominal efficiency when compressing multiple images simultaneously; they are inefficient for compressing single images. As an alternative, we propose a novel method, Relative Entropy Coding (REC), that can directly encode the latent representation with codelength close to the relative entropy for single images, supported by our empirical results obtained on the Cifar10, ImageNet32 and Kodak datasets. Moreover, unlike previous bits-back methods, REC is immediately applicable to lossy compression, where it is competitive with the state-of-the-art on the Kodak dataset.
研究动机与目标
- 为解决现有 bits-back 方法在单图像无损压缩中效率低下的问题,这些方法需要辅助位,且在孤立图像上性能下降。
- 实现对 VAE 中连续潜在表示的直接、高效压缩,无需量化,以避免训练困难与模型可扩展性受限的问题。
- 开发一种方法,使单张图像的码率接近后验分布与先验分布之间的相对熵,从而实现高效无损与有损压缩。
- 证明 REC 可应用于具有连续潜在空间的现成 VAE,无需引入不可微的量化步骤。
提出的方法
- REC 使用共享随机种子通过伪随机数生成器生成的共享序列 z₁, z₂, ..., zₙ ~ p(z) 中,对来自 q(z|x) 的潜在样本 z 的索引 i 进行编码。
- 通过重要性采样,索引 i 的码率近似于相对熵 KL[q(z|x) || p(z)],其中选择索引 i 的概率与后验密度 q(zᵢ|x) 成正比。
- 接收方通过使用相同的共享随机序列重建第 i 个先验样本,从而恢复 z,确保正确解码而无需额外传输。
- 残差部分通过熵编码(如算术编码)单独编码,码率为 -log P(x|z),总码率在期望下接近负 ELBO。
- 该方法实现为索引编码(iREC),其使用固定大小的先验样本缓冲区,并基于后验密度动态选择最可能的 zᵢ。
- iREC 通过直接在连续潜在变量上操作避免量化,从而实现 VAE 的端到端训练,无可微性问题。
实验结果
研究问题
- RQ1无损压缩方法能否在不使用辅助位的情况下,实现接近后验与先验分布之间相对熵的码率,适用于单张图像?
- RQ2能否在训练过程中不引入不可微量化步骤的情况下,使用连续潜在空间进行图像压缩?
- RQ3REC 能否扩展至有损压缩,并在性能上与最先进的学习型压缩方法相媲美?
- RQ4REC 中无辅助位的设计是否显著提升了单张图像压缩效率,相比现有 bits-back 方法?
主要发现
- iREC 在单图像基准测试中实现的无损压缩性能显著优于现有 bits-back 方法,且无需辅助位。
- 在 Cifar10、ImageNet32 和 Kodak 数据集上,iREC 实现的码率接近由相对熵给出的理论下界,且无辅助开销。
- 在有损压缩方面,iREC 在 PSNR 和 MS-SSIM 指标上与最先进的学习型压缩方法相当或更优,尤其在 Kodak 数据集上表现突出。
- 该方法直接作用于连续潜在空间,避免量化,从而实现 VAE 的无不可微性问题训练,提升模型可扩展性。
- 即使 VAE 存在剪枝或冗余潜在维度,iREC 仍保持高效率,因为码率仅依赖于相对熵,与维度数量无关。
- 压缩速度目前仍是限制因素,但作者指出这是未来优化的目标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。