Skip to main content
QUICK REVIEW

[论文解读] Flexible Neural Image Compression via Code Editing

Chenjian Gao, Tongda Xu|arXiv (Cornell University)|Sep 19, 2022
Cell Image Analysis Techniques被引用 5
一句话总结

本文提出了一种名为 Code Editing 的新型神经图像压缩框架,可实现灵活的连续率失真(R-D)权衡、感兴趣区域(ROI)编码以及使用单一解码器的多失真优化。通过利用半归约推理和自适应量化,该方法在推理时对潜在码本进行编辑,从而实现无需微调的可变比特率控制,在率失真性能和灵活性方面优于现有方法。

ABSTRACT

Neural image compression (NIC) has outperformed traditional image codecs in rate-distortion (R-D) performance. However, it usually requires a dedicated encoder-decoder pair for each point on R-D curve, which greatly hinders its practical deployment. While some recent works have enabled bitrate control via conditional coding, they impose strong prior during training and provide limited flexibility. In this paper we propose Code Editing, a highly flexible coding method for NIC based on semi-amortized inference and adaptive quantization. Our work is a new paradigm for variable bitrate NIC. Furthermore, experimental results show that our method surpasses existing variable-rate methods, and achieves ROI coding and multi-distortion trade-off with a single decoder.

研究动机与目标

  • 为解决神经图像压缩(NIC)中缺乏灵活比特率控制的问题,传统方法通常需为每个 R-D 点训练独立模型。
  • 克服条件式 NIC 方法的局限性,后者依赖离散且预定义的拉格朗日乘子,且在插值过程中性能会下降。
  • 实现细粒度的连续 R-D 权衡与空间自适应比特分配,类似于传统编解码器,但具备神经网络的性能优势。
  • 探索半归约推理在可变比特率 NIC 中的潜力,此前该方法在该领域尚未被研究。
  • 使用单一模型和解码器实现多失真权衡(例如 MSE 与 LPIPS 之间的平衡)。

提出的方法

  • Code Editing 使用半归约推理,在推理时基于期望的 R-D 权衡优化潜在码本,其参数由拉格朗日乘子 λ 控制。
  • 它首先使用在基础 λ₀ 下预训练的编码器初始化潜在码本,然后通过基于梯度的优化达到目标 λ。
  • 引入自适应量化步长以稳定性能并改善速度-性能权衡。
  • 通过应用 ROI 映射,该方法可实现任意空间比特分配,引导各区域潜在码本的优化。
  • 通过修改损失函数,引入可学习权重的感知(如 LPIPS)和保真度(如 MSE)项,实现多失真权衡。
  • 所有操作均使用单一固定解码器和熵模型完成,仅在基础 λ₀ 下训练一次。

实验结果

研究问题

  • RQ1能否有效利用半归约推理,在神经图像压缩中实现连续且灵活的比特率控制?
  • RQ2Code Editing 是否能在仅使用一个解码器和固定模型的情况下,优于现有可变比特率 NIC 方法?
  • RQ3Code Editing 是否能在不重新训练或使用复杂先验的前提下,支持针对 ROI 的空间自适应比特分配?
  • RQ4该方法能否实现多失真权衡(例如平衡 MSE 与 LPIPS)?
  • RQ5自适应量化如何提升 Code Editing 的性能与效率?

主要发现

  • Code Editing Enhanced 在所有三个基线中均优于现有可变比特率 NIC 方法,包括 Theis 等(2017)、Cui 等(2021)和 Song 等(2021),在率失真性能方面表现更优。
  • 该方法仅使用一个解码器和熵模型,即可在广泛比特率范围内(例如从低到中等比特率,约 0.5 bpp)实现连续的 R-D 权衡。
  • 成功实现了基于任意形状掩码(如棋盘格、字母)的 ROI 编码,性能优于以往方法,后者常受 ROI 映射衰减效应影响。
  • 定性结果表明,随着 LPIPS 权重 λₚ 增加,感知质量显著提升,证实了有效的多失真权衡。
  • 在高比特率区域,该方法相比 Theis 等(2017)实现了显著性能提升,后者存在性能退化问题。
  • 自适应量化步长显著提升了 Code Editing 的稳定性与性能,尤其在高比特率区域表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。