Skip to main content
QUICK REVIEW

[论文解读] Estimating the Resize Parameter in End-to-end Learned Image Compression

Li–Heng Chen, Christos G. Bampis|arXiv (Cornell University)|Apr 26, 2022
Advanced Vision and Imaging被引用 5
一句话总结

本文提出了一种可学习的、内容自适应的图像缩放框架,通过联合训练神经网络以估计最优缩放因子,从而在端到端学习的图像压缩中提升率失真性能。通过在预训练压缩模型前后插入由轻量级辅助网络(ResizeParamNet)控制的可微下采样和上采样层,该方法在不修改核心压缩模型的前提下,相较于最先进的人类感知编码器,实现了高达10%的Bjøntegaard-Delta率增益。

ABSTRACT

We describe a search-free resizing framework that can further improve the rate-distortion tradeoff of recent learned image compression models. Our approach is simple: compose a pair of differentiable downsampling/upsampling layers that sandwich a neural compression model. To determine resize factors for different inputs, we utilize another neural network jointly trained with the compression model, with the end goal of minimizing the rate-distortion objective. Our results suggest that "compression friendly" downsampled representations can be quickly determined during encoding by using an auxiliary network and differentiable image warping. By conducting extensive experimental tests on existing deep image compression models, we show results that our new resizing parameter estimation framework can provide Bjøntegaard-Delta rate (BD-rate) improvement of about 10% against leading perceptual quality engines. We also carried out a subjective quality study, the results of which show that our new approach yields favorable compressed images. To facilitate reproducible research in this direction, the implementation used in this paper is being made freely available online at: https://github.com/treammm/ResizeCompression.

研究动机与目标

  • 解决在学习型图像压缩中通过暴力搜索寻找最优缩放因子的低效问题。
  • 在不改变核心压缩架构的前提下,提升深度图像压缩模型的率失真权衡性能。
  • 开发一种可泛化的、端到端可训练的框架,利用轻量级神经网络估计内容自适应的缩放参数。
  • 通过客观指标和主观质量评估验证所提方法的感知相关性。

提出的方法

  • 在现有压缩模型之前和之后引入可微的下采样和上采样层,并共享缩放因子M。
  • 训练一个辅助神经网络ResizeParamNet,以内容自适应的方式为每张输入图像预测最优的M。
  • 使用率失真目标,端到端联合优化压缩模型和ResizeParamNet,其中M通过比特流传递。
  • 利用可微图像变形技术,实现在训练过程中通过缩放操作的反向传播。
  • 将该框架作为无需修改核心架构的即插即用“增强模块”集成到现有学习型压缩模型中。
  • 以极低开销在比特流中传递估计的M值,使解码器能够重建图像。

实验结果

研究问题

  • RQ1神经网络能否有效估计内容自适应的缩放因子,从而提升学习型图像压缩中的率失真性能?
  • RQ2与固定分辨率基线相比,所提框架是否在感知质量和率失真效率方面实现了可测量的增益?
  • RQ3在客观和主观评估中,所提方法与最先进学习型压缩模型相比表现如何?
  • RQ4在自适应缩放的背景下,现有图像质量评估模型与人类感知的相关性有多高?

主要发现

  • 所提框架在领先的人类感知图像压缩模型上实现了平均10%的Bjøntegaard-Delta率增益。
  • 主观质量研究表明,人类观察者更偏好该方法生成的低比特率压缩图像。
  • 该方法在多个深度压缩模型(包括Ballé18-Hyper)上表现出良好的泛化能力,且作为无需修改核心架构的即插即用增强模块。
  • VIF和VMAF与人类感知的相关性最强,而PSNR-based指标表现较差,证实了所提方法的感知相关性。
  • 当缩放过程引入明显伪影(如模糊的标志)时,观察到失败案例,表明其在处理高对比度或含文字内容时存在局限性。
  • 2AFC评分分析表明,VIF和VMAF是人类判断的强预测因子,其得分接近理论上的最优性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。