Skip to main content
QUICK REVIEW

[论文解读] Frequency-Aware Transformer for Learned Image Compression

Han Li, Shaohui Li|arXiv (Cornell University)|Oct 25, 2023
Advanced Data Compression Techniques被引用 7
一句话总结

本文提出了一种用于学习图像压缩的频率感知变换器(FAT)模块,通过频率分解窗口注意力(FDWA)和频率调制前馈网络(FMFFN)实现多尺度、方向性频率分析,达到最先进(SOTA)的率失真性能,在Kodak、Tecnick和CLIC数据集上的BD-rate相比VTM-12.1提升14.5–15.1%。

ABSTRACT

Learned image compression (LIC) has gained traction as an effective solution for image storage and transmission in recent years. However, existing LIC methods are redundant in latent representation due to limitations in capturing anisotropic frequency components and preserving directional details. To overcome these challenges, we propose a novel frequency-aware transformer (FAT) block that for the first time achieves multiscale directional ananlysis for LIC. The FAT block comprises frequency-decomposition window attention (FDWA) modules to capture multiscale and directional frequency components of natural images. Additionally, we introduce frequency-modulation feed-forward network (FMFFN) to adaptively modulate different frequency components, improving rate-distortion performance. Furthermore, we present a transformer-based channel-wise autoregressive (T-CA) model that effectively exploits channel dependencies. Experiments show that our method achieves state-of-the-art rate-distortion performance compared to existing LIC methods, and evidently outperforms latest standardized codec VTM-12.1 by 14.5%, 15.1%, 13.0% in BD-rate on the Kodak, Tecnick, and CLIC datasets.

研究动机与目标

  • 为解决现有学习图像压缩方法在捕捉各向异性频率分量和保持方向细节方面的局限性。
  • 通过注意力机制实现在潜在表示中端到端、学习得到的多尺度和方向性频率分解。
  • 通过频率调制前馈网络自适应调制频率分量,提升率失真性能。
  • 利用基于变换器的通道自回归熵模型,对频率分量之间的通道依赖关系进行建模。

提出的方法

  • 提出频率分解窗口注意力(FDWA),采用四种不同的窗口形状,单个注意力层即可捕捉低频、高频、垂直和水平分量。
  • 引入频率调制前馈网络(FMFFN),根据频域中学习到的滤波器自适应地增强或抑制频率分量。
  • 设计基于变换器的通道自回归(T-CA)熵模型,利用因果掩码对频率分量和通道之间的依赖关系进行建模。
  • 采用端到端训练,基于FAT模块的非线性变换,并联合优化编码和解码变换。
  • 利用快速傅里叶变换(FFT)对特征图中的频率内容进行可视化与分析,以验证FDWA的频率分解能力。
  • 在不同切片中共享变换器架构,以平衡模型复杂度与性能,超参数经调优以实现最优率失真权衡。

实验结果

研究问题

  • RQ1能否在学习图像压缩框架中,通过注意力机制有效捕捉自然图像中的多尺度和方向性频率分量?
  • RQ2通过可学习滤波器对频率分量进行自适应调制,如何提升率失真性能?
  • RQ3基于变换器的通道自回归模型在捕捉子带间频率分量与通道间依赖关系方面,能在多大程度上改善熵建模?
  • RQ4与现有学习图像压缩模型中的手工设计或非方向性注意力相比,频率感知注意力模块的端到端优化是否能带来更高的压缩效率?

主要发现

  • 所提出的FAT模型实现了最先进(SOTA)的率失真性能,在Kodak数据集上相比VTM-12.1的BD-rate降低14.5%。
  • 在Tecnick数据集上,该方法相比VTM-12.1的BD-rate降低15.1%,表明在多样化图像集上具有持续优越性。
  • 在CLIC Professional Validation数据集上,该方法相比VTM-12.1的BD-rate降低13.0%,证实其在基准标准下的鲁棒性。
  • 频谱分析表明,FDWA能有效分离频率分量:LL-WA捕捉低频分量,HH-WA捕捉高频分量,HL/LH-WA捕捉方向性分量。
  • FMFFN滤波器的可视化显示,高比特率模型学习到了更多高频分量,验证了自适应调制机制的有效性。
  • T-CA熵模型在仅使用5个切片(对比CHAREM的10个切片)且模型复杂度更低的情况下,仍保持更优的率失真性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。