[论文解读] Target-Quality Image Compression with Recurrent, Convolutional Neural Networks
本文提出了一种针对循环神经网络与卷积神经网络的停用码容错(SCT)训练方法,用于图像压缩,实现了基于内容复杂度的图像区域自适应符号分配。通过采用两阶段训练流程,增强对代码截断的鲁棒性并提升熵编码效率,该方法在Kodak数据集上实现了比JPEG和非SCT RNN自编码器更低的码率,同时获得更高且更均匀的图像质量。
We introduce a stop-code tolerant (SCT) approach to training recurrent convolutional neural networks for lossy image compression. Our methods introduce a multi-pass training method to combine the training goals of high-quality reconstructions in areas around stop-code masking as well as in highly-detailed areas. These methods lead to lower true bitrates for a given recursion count, both pre- and post-entropy coding, even using unstructured LZ77 code compression. The pre-LZ77 gains are achieved by trimming stop codes. The post-LZ77 gains are due to the highly unequal distributions of 0/1 codes from the SCT architectures. With these code compressions, the SCT architecture maintains or exceeds the image quality at all compression rates compared to JPEG and to RNN auto-encoders across the Kodak dataset. In addition, the SCT coding results in lower variance in image quality across the extent of the image, a characteristic that has been shown to be important in human ratings of image quality
研究动机与目标
- 解决先前基于神经网络的图像压缩方法中固定符号分配的局限性,即不考虑内容复杂度,对所有图像区域一视同仁。
- 通过实现自适应符号传输(简单区域使用更少符号,复杂区域使用更多符号)来降低码率并提升重建质量,同时避免引入块状伪影。
- 开发一种使循环卷积自编码器对停用码遮蔽与代码截断具有鲁棒性的训练方法,避免产生伪影与模糊。
- 通过SCT架构设计,创建高度不均衡的0/1码分布,从而提升熵编码(如LZ77)的效率。
- 实现整个重建图像中更均匀的图像质量,这一因素已被证明与人类对质量的感知密切相关。
提出的方法
- 引入两阶段训练流程:第一阶段使用人工遮蔽的停用码训练解码器,以模拟代码截断,确保模型鲁棒性。
- 第二阶段使用前一迭代生成的自然二进制码掩码进行标准重建,构成主要损失用于训练。
- 通过一种掩码逻辑强制实现停用码行为:一旦发出停用码,其信号将向前传播,防止模型依赖缺失的符号。
- 架构采用完全卷积的循环自编码器,包含LSTM单元与空间下采样,生成 $\frac{H}{16} \times \frac{W}{16}$ 的码表示。
- 解码器使用“深度到空间”重排操作,将码表示上采样回完整的 $H \times W$ 分辨率。
- 该方法保持完整的卷积结构,避免了JPEG或WebP中常见的基于块的伪影。
实验结果
研究问题
- RQ1能否训练一个循环卷积神经网络,使其在停用码遮蔽与代码截断的情况下仍能保持高重建质量?
- RQ2自适应符号分配(在简单图像区域减少符号数量)是否能在不牺牲质量的前提下降低整体码率?
- RQ3所提出的两阶段训练方法能否降低重建过程中图像质量的方差,从而提升感知一致性?
- RQ4与非SCT网络相比,SCT架构在多大程度上提升了熵编码效率(如LZ77)?
- RQ5该方法能否在多个压缩率下实现优于JPEG与先前RNN自编码器的率失真性能?
主要发现
- 在最佳情况下,SCT方法相比标称码率实现了35%的码率降低,其中30%归因于停用码截断,5%归因于LZ77压缩效率提升。
- 在0.125 bpp的标称码率下,SCT重建在LZ77与停用码截断后达到0.115 bpp,优于非SCT的0.121 bpp。
- 在约0.75 bpp时,SCT重建的$L_1$块误差平均值降低11%,标准差也降低11%,表明质量更均匀。
- 在Kodak数据集上,SCT架构在所有压缩率下均保持或超过JPEG与非SCT RNN自编码器的图像质量。
- 通过从一开始就训练网络以应对代码截断,而非在推理阶段进行补偿,该方法减少了块状伪影与模糊。
- 两阶段训练流程使模型收敛到兼顾停用码容错性与表征能力的符号分配,从而同时提升了鲁棒性与压缩效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。