[论文解读] Multi-scale and Context-adaptive Entropy Model for Image Compression
该论文提出了一种端到端可训练的图像压缩框架,采用多尺度、上下文自适应的熵模型,结合自回归与分层先验,以提升率失真性能,尤其在低比特率下表现优异。该方法通过整合多尺度掩码卷积、感受野裁剪与选择性算术编码的计算优化,以及跨多个模型的比特率分配策略,在约束条件下最大化MS-SSIM,实现了SOTA的MS-SSIM性能。
We propose an end-to-end trainable image compression framework with a multi-scale and context-adaptive entropy model, especially for low bitrate compression. Due to the success of autoregressive priors in probabilistic generative model, the complementary combination of autoregressive and hierarchical priors can estimate the distribution of each latent representation accurately. Based on this combination, we firstly propose a multi-scale masked convolutional network as our autoregressive model. Secondly, for the significant computational penalty of generative model, we focus on decoded representations covered by receptive field, and skip full zero latents in arithmetic codec. At last, according to the low-rate compression's constraint in CLIC-2019, we use a method to maximize MS-SSIM by allocating bitrate for each image.
研究动机与目标
- 通过多尺度与上下文自适应建模提升熵模型精度,以改善低比特率下的图像压缩性能。
- 通过感受野裁剪与选择性算术编码优化推理过程,降低自回归熵模型的高计算成本。
- 在总比特率约束下,通过跨多个模型的自适应比特率分配,最大化数据集上的整体MS-SSIM。
- 通过结合先进熵建模与高效压缩策略,在CLIC-2019基准测试中实现SOTA性能。
提出的方法
- 引入一种多尺度掩码卷积网络,包含三个并行的掩码卷积层,分别采用不同感受野大小(7×7、5×5、3×3),以在每个像素周围三个环状区域中自适应建模上下文。
- 将中间编码器层的多尺度特征图与潜在表示融合,以增强基于超先验的熵建模中的上下文信息。
- 通过将处理范围限制在最大感受野(7×7)内,减少自回归上下文模型的计算量,避免在此范围之外的冗余操作。
- 通过引入标志向量优化算术编码,跳过全零特征图的编码,从而在不损失性能的前提下减少比特流大小与解码时间。
- 采用基于0-1背包问题的比特率分配策略,为在不同λ值下训练的多个模型中的每张图像分配最优比特率,以最大化整体MS-SSIM。
- 对超先验使用因子化熵模型,对每个潜在特征使用带1×1卷积的可学习熵模型,以预测高斯分布参数(μ 和 σ)。
实验结果
研究问题
- RQ1多尺度、上下文自适应的自回归熵模型是否能提升图像压缩中的率失真性能,尤其是在低比特率下?
- RQ2如何在不损失压缩精度的前提下降低自回归熵建模的高计算成本?
- RQ3基于全零特征图检测的选择性算术编码在比特率损失可忽略的情况下,能否显著提升解码速度?
- RQ4在总比特率约束下,对在不同λ值下训练的多个模型进行比特率分配,能否提升整体MS-SSIM性能?
- RQ5结合分层先验与自回归先验,并引入多尺度上下文建模,是否能在Kodak与CLIC-2019等基准数据集上实现SOTA性能?
主要发现
- 在CLIC-2019测试数据集上,该方法在0.150 bpp下实现了0.9739的MS-SSIM,优于单模型基线,创下新SOTA记录。
- 在比特率范围[0.120, 0.267] bpp内,该方法在所有评估模型中实现了最高的MS-SSIM(0.9739)与PSNR(28.50),证明了更宽比特率分配的优势。
- 选择性算术编码方法使大图像(如2000×2000)的解码时间减少超过96%,同时熵增加可忽略(<0.0001 bpp)。
- 感受野裁剪将每像素的计算量从O(h×w×c)降低至O(7×7×c),且性能无下降,因为完整上下文信息已包含在7×7感受野内。
- 多尺度上下文模型通过多种卷积核大小捕获长距离依赖关系,提升概率估计精度,从而改善重建质量。
- 联合比特率分配策略使模型在CLIC-2019挑战中取得MS-SSIM第二名与MOS(平均意见得分)第三名,验证了其在真实评估场景中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。