Skip to main content
QUICK REVIEW

[论文解读] Dynamic Kernel-Based Adaptive Spatial Aggregation for Learned Image Compression

Huairui Wang, Nianxiang Fu|arXiv (Cornell University)|Aug 17, 2023
Advanced Data Compression TechniquesComputer Science被引用 3
一句话总结

本文提出动态核基图像压缩(DKIC),一种基于动态核的自适应空间聚合机制以增强感受野灵活性与内容感知特征聚合的可学习图像压缩框架。通过将轻量可变形卷积(LDCN)与广义的粗到细熵模型及非对称空间-通道建模相结合,DKIC在中等模型复杂度下实现了最先进(SOTA)的率失真性能,在标准基准测试中优于VTM-12.1和SOTA方法。

ABSTRACT

Learned image compression methods have shown superior rate-distortion performance and remarkable potential compared to traditional compression methods. Most existing learned approaches use stacked convolution or window-based self-attention for transform coding, which aggregate spatial information in a fixed range. In this paper, we focus on extending spatial aggregation capability and propose a dynamic kernel-based transform coding. The proposed adaptive aggregation generates kernel offsets to capture valid information in the content-conditioned range to help transform. With the adaptive aggregation strategy and the sharing weights mechanism, our method can achieve promising transform capability with acceptable model complexity. Besides, according to the recent progress of entropy model, we define a generalized coarse-to-fine entropy model, considering the coarse global context, the channel-wise, and the spatial context. Based on it, we introduce dynamic kernel in hyper-prior to generate more expressive global context. Furthermore, we propose an asymmetric spatial-channel entropy model according to the investigation of the spatial characteristics of the grouped latents. The asymmetric entropy model aims to reduce statistical redundancy while maintaining coding efficiency. Experimental results demonstrate that our method achieves superior rate-distortion performance on three benchmarks compared to the state-of-the-art learning-based methods.

研究动机与目标

  • 为克服标准卷积与基于窗口的注意力机制在可学习图像压缩中固定感受野范围的局限性。
  • 通过引入内容条件化的动态核偏移,提升感受野自适应性,以改善特征表示。
  • 设计一种广义的粗到细熵模型,整合全局、通道相关性与空间上下文,以实现更优的概率估计。
  • 通过针对分组潜在分布定制的非对称空间-通道熵模型,减少统计冗余。
  • 在保持可接受的模型复杂度与推理速度的前提下,实现卓越的率失真性能。

提出的方法

  • 提出一种基于轻量可变形卷积(LDCN)的动态核机制,可学习内容自适应的核偏移与组共享权重,实现灵活的空间聚合。
  • 采用残差瓶颈块,结合后归一化与动态核层,以提升非线性表示学习能力。
  • 提出一种广义的粗到细熵模型,联合建模全局上下文、通道依赖性与空间上下文,以提升分布估计性能。
  • 设计一种非对称空间-通道熵模型,根据潜在特征组的特性,差异化地建模空间与通道上下文,以减少冗余。
  • 利用局部归因图(LAM)与路径积分梯度,可视化并分析不同方法的有效感受野(ERF)。
  • 采用两阶段训练策略,结合自回归熵建模与渐进式上下文优化,以平衡精度与速度。

实验结果

研究问题

  • RQ1基于动态核的空间聚合是否能提升可学习图像压缩中的感受野自适应性与内容感知特征学习?
  • RQ2粗到细熵建模的整合如何提升潜在表示的概率估计并减少冗余?
  • RQ3非对称空间-通道熵模型在多大程度上减少了统计冗余,同时保持编码效率?
  • RQ4与最先进可学习压缩模型相比,所提方法在率失真性能与计算成本方面表现如何?
  • RQ5动态核设计对有效感受野形状与重建中特征相关性的影响为何?

主要发现

  • 在Kodak、CLIC及其他基准测试中,DKIC在所有对比方法中实现了最佳率失真性能,优于VTM-12.1及STF、InvComp等SOTA方法。
  • 有效感受野(ERF)可视化结果表明,DKIC能捕获更多相关、内容相关的区域,形成椭圆状、聚焦的感知区域,而避免无关像素的干扰,这与固定核或窗口注意力方法形成鲜明对比。
  • 在单张RTX 3090上,DKIC对768×512图像的编码时间约为150ms,其速度优于Cheng2020与InvComp等自回归方法,同时保持了更优的RD性能。
  • 所提出的非对称空间-通道熵模型有效减少了冗余,实现了高编码效率,该结论通过上下文建模策略的消融实验得到验证。
  • 后归一化的动态残差块设计(LN位于LDCN与MLP之后)表现最佳,与其它Transformer及CNN架构的研究发现一致。
  • DKIC参数量为5330万,相比SwinT-ChARM(6050万)更高效,显著优于STF(9980万),同时仍保持更优的RD性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。