Skip to main content
QUICK REVIEW

[论文解读] Enhanced Invertible Encoding for Learned Image Compression

Yueqi Xie, Ka Leong Cheng|arXiv (Cornell University)|Aug 8, 2021
Advanced Data Compression Techniques参考文献 42被引用 9
一句话总结

该论文提出了一种基于可逆神经网络(INNs)的增强型可逆编码网络,以减少学习型图像压缩中的信息损失,取代传统的自编码器风格编码器。通过引入注意力通道压缩层实现稳定的维度压缩,并结合特征增强模块以提升非线性表达能力,该方法在Kodak、CLIC和Tecnick数据集上实现了最先进性能,尤其在高分辨率下优于VVC(VTM 12.1)。

ABSTRACT

Although deep learning based image compression methods have achieved promising progress these days, the performance of these methods still cannot match the latest compression standard Versatile Video Coding (VVC). Most of the recent developments focus on designing a more accurate and flexible entropy model that can better parameterize the distributions of the latent features. However, few efforts are devoted to structuring a better transformation between the image space and the latent feature space. In this paper, instead of employing previous autoencoder style networks to build this transformation, we propose an enhanced Invertible Encoding Network with invertible neural networks (INNs) to largely mitigate the information loss problem for better compression. Experimental results on the Kodak, CLIC, and Tecnick datasets show that our method outperforms the existing learned image compression methods and compression standards, including VVC (VTM 12.1), especially for high-resolution images. Our source code is available at https://github.com/xyq7/InvCompress.

研究动机与目标

  • 解决由非可逆自编码器风格编码器引起的端到端图像压缩中的信息损失问题。
  • 克服先前基于INN的压缩方法在训练稳定性与表征能力方面的局限性。
  • 通过在编码-解码过程中严格保持可逆性,实现在高比特率下的最小信息损失压缩。
  • 通过用可学习的、基于注意力的通道压缩层替代不稳定的采样机制,稳定INN在图像压缩中的训练过程。
  • 通过引入残差连接和同分辨率变换的非线性特征增强模块,在不破坏可逆性的前提下提升INN的非线性表征能力。

提出的方法

  • 采用可逆神经网络(INNs)作为核心架构,确保图像空间与潜在特征空间之间的严格可逆变换。
  • 引入一种注意力通道压缩层,通过通道分组平均实现特征维度压缩,从而在保持可逆性的同时实现更低比特率的压缩。
  • 使用缩放因子μ对原始特征与压缩后特征之间的平均绝对偏差进行归一化,实现不同质量等级下相对信息损失的公平比较。
  • 设计一种具有残差连接和同分辨率变换的非线性特征增强模块,以在不损失可逆性的前提下提升表征能力。
  • 将先前INN方法中不稳定的基于采样的反向传播替换为通过通道复制实现的确定性、可微分的逆操作。
  • 采用联合优化的率失真目标,通过算术编码进行熵建模,实现端到端的网络训练。

实验结果

研究问题

  • RQ1可逆神经网络(INNs)能否被有效集成到学习型图像压缩中,以相比自编码器方法减少信息损失?
  • RQ2在应用于低比特率压缩的维度压缩时,如何缓解基于INN的压缩方法的训练不稳定性?
  • RQ3所提出的特征增强模块在多大程度上提升了INN在图像压缩中的非线性表征能力?
  • RQ4注意力通道压缩层是否提供了一种稳定且可扩展的特征维度控制方式,同时保持可逆性?
  • RQ5所提出方法在高分辨率图像数据集上与当前最先进(SOTA)的端到端学习压缩方法及传统编码标准VVC相比表现如何?

主要发现

  • 所提方法在Kodak、CLIC和Tecnick数据集上优于现有学习型图像压缩方法及VVC(VTM 12.1)标准,尤其在高分辨率下表现更优。
  • 在CLIC Professional Validation数据集上,该方法在相近比特率下实现了比VVC更高的PSNR和MS-SSIM,表明其在高分辨率图像上的优越性能。
  • 消融实验表明,非线性特征增强模块显著提升了压缩性能,实现了更低的比特率以及更高的PSNR/MS-SSIM值。
  • 原始特征与压缩后特征之间的归一化平均绝对偏差(ε̃)始终保持较低水平——低于或接近量化误差,表明信息损失极小。
  • 视觉结果表明,在相近比特率下,重建图像保留了比VVC及其他SOTA方法更多的精细细节。
  • 相对偏差(ε̃)随质量等级提升而减小,证实高质量模型在注意力通道压缩层的平均操作中引入的失真更小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。