[论文解读] Deep Generative Models for Distribution-Preserving Lossy Compression
本文提出分布保持有损压缩(DPLC),一种新颖的框架,在优化率失真权衡的同时,强制重建样本遵循真实数据分布。通过将Wasserstein GAN与Wasserstein自编码器结合成一种新方法——Wasserstein++,该方法在所有比特率下均实现了无伪影、多样化的图像重建——从零比特率时的随机生成建模到高比特率时的近乎完美重建。
We propose and study the problem of distribution-preserving lossy compression. Motivated by recent advances in extreme image compression which allow to maintain artifact-free reconstructions even at very low bitrates, we propose to optimize the rate-distortion tradeoff under the constraint that the reconstructed samples follow the distribution of the training data. The resulting compression system recovers both ends of the spectrum: On one hand, at zero bitrate it learns a generative model of the data, and at high enough bitrates it achieves perfect reconstruction. Furthermore, for intermediate bitrates it smoothly interpolates between learning a generative model of the training data and perfectly reconstructing the training samples. We study several methods to approximately solve the proposed optimization problem, including a novel combination of Wasserstein GAN and Wasserstein Autoencoder, and present an extensive theoretical and empirical characterization of the proposed compression systems.
研究动机与目标
- 形式化并解决分布保持有损压缩(DPLC)问题,即在所有比特率下,重建样本必须遵循真实数据分布。
- 通过在压缩过程中施加分布约束,克服先前方法的局限性,特别是低比特率下的模式崩溃和缺乏随机性。
- 开发一个统一框架,平滑地在生成建模(零比特率)与完美重建(高比特率)之间过渡。
- 理论表征重建分布与失真界限作为比特率的函数。
- 在标准数据集上实证验证该方法,结果表明其在样本多样性与视觉质量方面优于先前方法。
提出的方法
- 提出一个正式的DPLC优化问题,即在重建分布必须与训练数据分布匹配的约束下,最小化率失真权衡。
- 采用Wasserstein距离作为度量,量化并最小化生成数据分布与真实数据分布之间的分布差异。
- 提出Wasserstein++,一种新型架构,结合了WAE(结构化潜在空间、解耦性)与WGAN(高质量样本生成、模式覆盖)的优势。
- 使用通过WAE目标训练的随机解码器,同时通过WGAN训练生成器,以确保高保真度且多样化的样本。
- 采用变分推理框架,其中编码器将输入数据映射到潜在码,解码器则从学习到的分布中生成样本。
- 采用联合训练目标,通过可微分瓶颈平衡重建保真度、分布对齐与率约束。
实验结果
研究问题
- RQ1能否设计一种深度压缩系统,使其在所有比特率下的重建样本分布与训练数据完全一致?
- RQ2如何确保解码器在低比特率下保持随机性,避免模式崩溃,同时维持高重建质量?
- RQ3此类系统中,比特率、失真与分布保真度之间的理论关系是什么?
- RQ4能否构建一个统一框架,实现从生成建模到完美重建的平滑过渡,而无需改变架构或训练制度?
- RQ5与现有基于GAN和自编码器的压缩方法相比,所提出的Wasserstein++方法在样本质量与分布准确性方面表现如何?
主要发现
- 所提出的DPLC框架在所有比特率下均成功生成了随机、多样化且无伪影的重建结果,包括零比特率时,此时其作为真正的生成模型运行。
- Wasserstein++在CelebA数据集上实现了SOTA的Fréchet Inception Distance(FID)10.93,在LSUN卧室数据集上达到27.52,样本质量优于WAE,与WGAN-GP相当。
- 在零比特率下,该方法在重建中保持了有效的数据分布,而诸如全局生成压缩(GC)等先前方法则因模式崩溃而表现不佳。
- 系统在CelebA上的重建FID为10.93,在LSUN上的重建FID为27.52;样本FID分别为23.36和60.97,表明其具有出色的模式覆盖与样本多样性。
- 理论分析表明,失真可作为比特率的函数被有界,且当比特率趋近于零时,重建分布收敛于真实数据分布。
- 实证结果证实,该方法避免了常见的伪影(如模糊与块效应),尤其在低比特率下,其视觉质量优于CAE基线与GC方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。