[论文解读] Perceptually Optimizing Deep Image Compression
本文提出一种代理网络方法,通过使用感知质量度量(如 VMAF)而非 MSE 来优化深度图像压缩。通过训练一个可微分的代理网络以模仿感知质量模型,该方法实现了端到端优化,在固定感知质量水平下相比基于 MSE 的训练,平均码率降低了 28.7%。
Mean squared error (MSE) and $\ell_p$ norms have largely dominated the measurement of loss in neural networks due to their simplicity and analytical properties. However, when used to assess visual information loss, these simple norms are not highly consistent with human perception. Here, we propose a different proxy approach to optimize image analysis networks against quantitative perceptual models. Specifically, we construct a proxy network, which mimics the perceptual model while serving as a loss layer of the network.We experimentally demonstrate how this optimization framework can be applied to train an end-to-end optimized image compression network. By building on top of a modern deep image compression models, we are able to demonstrate an averaged bitrate reduction of $28.7\%$ over MSE optimization, given a specified perceptual quality (VMAF) level.
研究动机与目标
- 解决基于 MSE 的损失函数与人类视觉感知之间的不匹配问题。
- 实现使用复杂、不可微分的感知质量模型(如 VMAF)对深度压缩网络进行端到端训练。
- 开发一个可训练的代理网络,以近似感知质量得分,用作可微分的损失函数。
- 在保持或提升感知图像质量的同时,实现显著的码率节省。
- 在现代深度图像压缩架构上验证该框架,并在与基于 MSE 的优化相比中实现可测量的性能提升。
提出的方法
- 训练一个代理网络,从重建图像中预测感知质量得分(如 VMAF),以模仿全参考图像质量评估模型。
- 将代理网络作为可微分损失层集成到深度图像压缩自编码器的训练过程中。
- 采用交替训练策略:首先在真实图像对上预训练代理网络,然后在端到端训练期间与压缩网络联合微调。
- 通过最大化代理网络预测的质量得分来优化压缩网络,从而间接优化感知保真度。
- 通过训练相应的代理网络,该框架可支持任何可微分的感知质量模型。
- 该方法保持计算效率,编码和解码时间与基于 MSE 优化的模型相当,尤其在 GPU 加速下表现更优。
实验结果
研究问题
- RQ1可微分的代理网络能否有效近似复杂、不可微分的感知图像质量模型(如 VMAF),以用于深度学习训练?
- RQ2使用感知度量的代理来优化深度图像压缩网络,是否能在等效感知质量下实现可测量的码率节省?
- RQ3代理网络与压缩网络之间的交替训练策略如何影响真实与预测感知得分之间的对齐程度?
- RQ4所提出的框架是否可应用于现有深度压缩架构,且不会带来显著的计算开销?
- RQ5在端到端压缩中,用感知代理损失替代 MSE 时,感知质量与码率之间的权衡关系如何?
主要发现
- 所提出的 VMAF 代理优化模型在固定感知质量水平(VMAF)下,相比基于 MSE 的优化模型,平均码率降低了 28.7%。
- 在高码率下,VMAF 代理模型在不造成感知质量退化的情况下,码率降低了约 16%,显示出显著的效率优势。
- 交替训练策略成功地将代理网络预测与真实 VMAF 得分对齐,减少了使用预训练代理时观察到的初始偏差。
- 在极端压缩(0.05 bpp)下的视觉对比显示,VMAF 代理模型优于基于 MSE 的优化模型,并达到了 HEVC 和 JPEG2000 的感知质量水平。
- VMAF 代理模型的运行时间与基于 MSE 的优化模型几乎相同,编码和解码时间与标准编解码器相当,尤其在 GPU 上表现优异。
- 该框架展现出良好的泛化能力,通过训练相应的代理网络,该方法可轻松适配其他感知质量度量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。