Skip to main content
QUICK REVIEW

[论文解读] Deep Generative Models for Distribution-Preserving Lossy Compression

Michael Tschannen, Eirikur Agustsson|arXiv (Cornell University)|May 28, 2018
Advanced Image Processing Techniques参考文献 43被引用 15
一句话总结

本文提出分布保持有损压缩(DPLC),一种新颖的框架,在优化率失真权衡的同时,强制重建样本遵循真实数据分布。通过将Wasserstein GAN与Wasserstein自编码器结合成一种新方法——Wasserstein++,该方法在所有比特率下均实现了无伪影、多样化的图像重建——从零比特率时的随机生成建模到高比特率时的近乎完美重建。

ABSTRACT

We propose and study the problem of distribution-preserving lossy compression. Motivated by recent advances in extreme image compression which allow to maintain artifact-free reconstructions even at very low bitrates, we propose to optimize the rate-distortion tradeoff under the constraint that the reconstructed samples follow the distribution of the training data. The resulting compression system recovers both ends of the spectrum: On one hand, at zero bitrate it learns a generative model of the data, and at high enough bitrates it achieves perfect reconstruction. Furthermore, for intermediate bitrates it smoothly interpolates between learning a generative model of the training data and perfectly reconstructing the training samples. We study several methods to approximately solve the proposed optimization problem, including a novel combination of Wasserstein GAN and Wasserstein Autoencoder, and present an extensive theoretical and empirical characterization of the proposed compression systems.

研究动机与目标

  • 形式化并解决分布保持有损压缩(DPLC)问题,即在所有比特率下,重建样本必须遵循真实数据分布。
  • 通过在压缩过程中施加分布约束,克服先前方法的局限性,特别是低比特率下的模式崩溃和缺乏随机性。
  • 开发一个统一框架,平滑地在生成建模(零比特率)与完美重建(高比特率)之间过渡。
  • 理论表征重建分布与失真界限作为比特率的函数。
  • 在标准数据集上实证验证该方法,结果表明其在样本多样性与视觉质量方面优于先前方法。

提出的方法

  • 提出一个正式的DPLC优化问题,即在重建分布必须与训练数据分布匹配的约束下,最小化率失真权衡。
  • 采用Wasserstein距离作为度量,量化并最小化生成数据分布与真实数据分布之间的分布差异。
  • 提出Wasserstein++,一种新型架构,结合了WAE(结构化潜在空间、解耦性)与WGAN(高质量样本生成、模式覆盖)的优势。
  • 使用通过WAE目标训练的随机解码器,同时通过WGAN训练生成器,以确保高保真度且多样化的样本。
  • 采用变分推理框架,其中编码器将输入数据映射到潜在码,解码器则从学习到的分布中生成样本。
  • 采用联合训练目标,通过可微分瓶颈平衡重建保真度、分布对齐与率约束。

实验结果

研究问题

  • RQ1能否设计一种深度压缩系统,使其在所有比特率下的重建样本分布与训练数据完全一致?
  • RQ2如何确保解码器在低比特率下保持随机性,避免模式崩溃,同时维持高重建质量?
  • RQ3此类系统中,比特率、失真与分布保真度之间的理论关系是什么?
  • RQ4能否构建一个统一框架,实现从生成建模到完美重建的平滑过渡,而无需改变架构或训练制度?
  • RQ5与现有基于GAN和自编码器的压缩方法相比,所提出的Wasserstein++方法在样本质量与分布准确性方面表现如何?

主要发现

  • 所提出的DPLC框架在所有比特率下均成功生成了随机、多样化且无伪影的重建结果,包括零比特率时,此时其作为真正的生成模型运行。
  • Wasserstein++在CelebA数据集上实现了SOTA的Fréchet Inception Distance(FID)10.93,在LSUN卧室数据集上达到27.52,样本质量优于WAE,与WGAN-GP相当。
  • 在零比特率下,该方法在重建中保持了有效的数据分布,而诸如全局生成压缩(GC)等先前方法则因模式崩溃而表现不佳。
  • 系统在CelebA上的重建FID为10.93,在LSUN上的重建FID为27.52;样本FID分别为23.36和60.97,表明其具有出色的模式覆盖与样本多样性。
  • 理论分析表明,失真可作为比特率的函数被有界,且当比特率趋近于零时,重建分布收敛于真实数据分布。
  • 实证结果证实,该方法避免了常见的伪影(如模糊与块效应),尤其在低比特率下,其视觉质量优于CAE基线与GC方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。