Skip to main content
QUICK REVIEW

[论文解读] Improving Statistical Fidelity for Neural Image Compression with Implicit Local Likelihood Models

Matthew J. Muckley, Alaaeldin El-Nouby|arXiv (Cornell University)|Jan 26, 2023
Digital Media Forensic Detection被引用 7
一句话总结

本文提出了一种新颖的非二值对抗判别器——隐式局部似然模型(ILLM),用于神经图像压缩,通过VQ-VAE嵌入的潜在码建模局部图像似然,从而提升统计保真度。在CLIC2020、DIV2K和Kodak数据集上的评估表明,MS-ILLM在30–40%更低的比特率下实现了与HiFiC相当的FID,同时保持了相近的PSNR,其在失真-保真度权衡上优于基于PatchGAN的基线模型。

ABSTRACT

Lossy image compression aims to represent images in as few bits as possible while maintaining fidelity to the original. Theoretical results indicate that optimizing distortion metrics such as PSNR or MS-SSIM necessarily leads to a discrepancy in the statistics of original images from those of reconstructions, in particular at low bitrates, often manifested by the blurring of the compressed images. Previous work has leveraged adversarial discriminators to improve statistical fidelity. Yet these binary discriminators adopted from generative modeling tasks may not be ideal for image compression. In this paper, we introduce a non-binary discriminator that is conditioned on quantized local image representations obtained via VQ-VAE autoencoders. Our evaluations on the CLIC2020, DIV2K and Kodak datasets show that our discriminator is more effective for jointly optimizing distortion (e.g., PSNR) and statistical fidelity (e.g., FID) than the PatchGAN of the state-of-the-art HiFiC model. On CLIC2020, we obtain the same FID as HiFiC with 30-40\% fewer bits.

研究动机与目标

  • 为解决神经图像压缩中固有的失真与统计保真度之间的权衡,尤其是在低比特率下出现模糊的问题。
  • 改进现有基于GAN的压缩判别器,这些判别器多源自全局图像生成任务,可能与压缩中局部细节恢复的本质不一致。
  • 开发一种利用VQ-VAE学习的码书表示来建模局部图像似然的判别器,以优化保真度。
  • 证明基于局部隐式似然建模可实现优于标准PatchGAN的率失真感知权衡。
  • 在多个基准(CLIC2020、DIV2K、Kodak)上通过定量与定性比较验证该方法的有效性。

提出的方法

  • ILLM判别器通过VQ-VAE编码器对量化后的局部图像块进行条件控制,在局部图像邻域的潜在空间中学习隐式似然。
  • 判别器实现为无归一化层的U-Net结构,实证表明其在训练稳定性和性能上优于谱归一化与实例归一化。
  • 该方法与均值-尺度超先验架构集成,形成一种新型压缩器MS-ILLM,联合优化PSNR与FID。
  • VQ-VAE组件为局部图像块生成离散潜在码,判别器利用这些码估计局部似然,无需显式密度估计。
  • 训练目标平衡重建损失(PSNR)与对抗损失(FID),判别器被训练以区分真实图像与重建图像在局部潜在空间中的样本。
  • 消融研究评估了潜在空间尺寸与码书大小对性能的影响,结果表明对这些超参数仅有轻微敏感性。

实验结果

研究问题

  • RQ1基于局部隐式似然的判别器是否能在神经图像压缩中超越全局GAN判别器,实现更高的统计保真度?
  • RQ2将判别器条件化于VQ-VAE学习的局部潜在码,是否能在低比特率下实现优于PatchGAN的FID与PSNR权衡?
  • RQ3归一化层等架构选择如何影响ILLM判别器的性能?
  • RQ4所提方法是否能在显著更低的比特率下实现超越HiFiC的SOTA FID表现?
  • RQ5在包含精细纹理与文字等挑战性图像内容中,该方法表现如何,而GAN常在此类任务中失效?

主要发现

  • 在CLIC2020数据集上,MS-ILLM以30–40%更低的比特率实现了与HiFiC相当的FID,证明了其在率失真感知权衡上的优越性。
  • 在0.149 bpp时,MS-ILLM实现26.6 PSNR与FID 2.55,优于HiFiC在0.181 bpp下的26.8 PSNR与FID 3.04。
  • 与HiFiC相比,ILLM判别器在纹理丰富区域(如毛发与精细细节)中显著减少了伪影,定性比较结果清晰显示了这一点。
  • 出人意料的是,尽管谱归一化在以往GAN工作中为标准配置,但无任何归一化层的U-Net判别器表现最佳。
  • 消融实验表明,将VQ-VAE潜在空间尺寸从16×16提升至32×32,可在0.121 bpp下使FID降低0.12(从2.65降至2.55),而码书大小的影响可忽略不计。
  • 在文字密集图像中,MS-ILLM比HiFiC更好地保持了可读性,尽管两者均劣于非对抗性基线,表明在文字保真度上存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。