Skip to main content
QUICK REVIEW

[论文解读] Joint Global and Local Hierarchical Priors for Learned Image Compression

Jun-Hyuk Kim, Byeongho Heo|arXiv (Cornell University)|Dec 8, 2021
Advanced Data Compression Techniques被引用 4
一句话总结

本文提出了一种新颖的图像压缩学习熵模型——Informer,通过内容相关的注意力机制同时利用全局和局部层次化先验。通过结合使用交叉注意力的全局超先验与通过1×1卷积实现的局部超先验,Informer在Kodak和Tecnick数据集上实现了最先进(SOTA)的率失真性能,同时避免了先前全局方法的二次方计算复杂度。

ABSTRACT

Recently, learned image compression methods have outperformed traditional hand-crafted ones including BPG. One of the keys to this success is learned entropy models that estimate the probability distribution of the quantized latent representation. Like other vision tasks, most recent learned entropy models are based on convolutional neural networks (CNNs). However, CNNs have a limitation in modeling long-range dependencies due to their nature of local connectivity, which can be a significant bottleneck in image compression where reducing spatial redundancy is a key point. To overcome this issue, we propose a novel entropy model called Information Transformer (Informer) that exploits both global and local information in a content-dependent manner using an attention mechanism. Our experiments show that Informer improves rate--distortion performance over the state-of-the-art methods on the Kodak and Tecnick datasets without the quadratic computational complexity problem. Our source code is available at https://github.com/naver-ai/informer.

研究动机与目标

  • 解决基于CNN的熵模型因感受野局部化而难以捕捉长距离空间依赖性的问题。
  • 克服卷积操作内容无关的特性,即在感受野内对不同图像区域一视同仁地处理。
  • 设计一种熵模型,以内容相关的方式有效整合全局与局部依赖性,从而提升压缩效率。
  • 在不产生二次方计算复杂度的前提下,实现优于先前全局注意力模型的率失真性能,与以往方法形成对比。

提出的方法

  • 提出一种新型熵模型Informer,利用交叉注意力机制,通过关注量化潜在表示的不同区域来生成全局超先验。
  • 通过1×1卷积层引入局部超先验,以专门建模局部依赖性,并防止全局令牌过度拟合到局部模式。
  • 采用联合自回归与层次化先验框架,其中上下文先验通过同时使用局部和全局超先验进行更新。
  • 在全局超先验中使用掩码多头自注意力机制,以内容感知的方式建模长距离依赖性。
  • 设计双分支架构,使全局与局部超先验分别处理后融合,再用于熵估计网络。
  • 采用可学习的全局令牌机制,支持可变数量的令牌(N),以根据比特率需求自适应建模依赖性。
Figure 1 : Overview of the proposed method. Our Informer is a learned entropy model capturing global dependencies in a content-dependent manner using the attention mechanism [ 46 ] .
Figure 1 : Overview of the proposed method. Our Informer is a learned entropy model capturing global dependencies in a content-dependent manner using the attention mechanism [ 46 ] .

实验结果

研究问题

  • RQ1内容相关的注意力机制是否能有效建模图像压缩潜在表示中的长距离空间依赖性?
  • RQ2结合全局与局部超先验是否能提升率失真性能,相较于仅使用单一类型的先验?
  • RQ3所提方法是否能在避免二次方计算复杂度的前提下,实现优于最先进全局注意力模型的性能?
  • RQ4全局令牌数量如何影响不同比特率范围下的率失真权衡?
  • RQ5注意力机制在图像压缩中的优越性是源于其架构设计,还是源于全局与局部先验联合设计的特定优势?

主要发现

  • 在Kodak数据集上,当λ = 0.0067时,Informer实现0.2763 bpp的码率和31.3254 dB的PSNR,优于基线模型与全局参考模型。
  • 当λ = 0.0483时,Informer实现0.8514 bpp与36.9739 dB PSNR,再次超越全局上下文模型(0.8718 bpp,36.9134 dB),并在不同比特率水平下均表现出一致的性能提升。
  • 在低比特率下使用四个全局令牌可获得最佳性能,而在高比特率下使用八个令牌更优,表明其能根据残余冗余自适应建模依赖性。
  • 注意力图的可视化结果证实,全局令牌会关注不同且与内容相关的图像区域(如砖墙与窗户),验证了内容相关性全局建模的有效性。
  • 消融实验表明,使用全局超先验更新上下文先验比使用局部超先验更有效,表明全局先验具有更强的建模能力。
  • Informer避免了先前全局模型的二次方计算复杂度,同时保持或提升了性能,使其在实际部署中更具可行性。
(a) Hyperprior [ 8 ]
(a) Hyperprior [ 8 ]

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。