[论文解读] Learning-Driven Lossy Image Compression; A Comprehensive Survey
本篇全面综述回顾了基于深度学习架构(如自编码器、卷积神经网络、生成对抗网络和循环神经网络)的、以学习驱动的有损图像压缩技术,重点聚焦于静态图像压缩的端到端框架。文章识别出关键挑战,如条带区域失真、GPU显存溢出、混叠效应以及缺乏CPU/GPU兼容性,同时指出了该领域内近期的进展与尚未解决的研究空白。
In the realm of image processing and computer vision (CV), machine learning (ML) architectures are widely applied. Convolutional neural networks (CNNs) solve a wide range of image processing issues and can solve image compression problem. Compression of images is necessary due to bandwidth and memory constraints. Helpful, redundant, and irrelevant information are three different forms of information found in images. This paper aims to survey recent techniques utilizing mostly lossy image compression using ML architectures including different auto-encoders (AEs) such as convolutional auto-encoders (CAEs), variational auto-encoders (VAEs), and AEs with hyper-prior models, recurrent neural networks (RNNs), CNNs, generative adversarial networks (GANs), principal component analysis (PCA) and fuzzy means clustering. We divide all of the algorithms into several groups based on architecture. We cover still image compression in this survey. Various discoveries for the researchers are emphasized and possible future directions for researchers. The open research problems such as out of memory (OOM), striped region distortion (SRD), aliasing, and compatibility of the frameworks with central processing unit (CPU) and graphics processing unit (GPU) simultaneously are explained. The majority of the publications in the compression domain surveyed are from the previous five years and use a variety of approaches.
研究动机与目标
- 提供近期基于机器学习的静态图像压缩技术的全面综述,特别是基于端到端深度神经网络的方法。
- 识别并分析学习驱动有损图像压缩中的开放研究问题,包括SRD、OOM、混叠效应以及CPU/GPU兼容性问题。
- 评估各类深度学习模型(如CAE、VAE、GAN和RNN)与传统标准(如JPEG和JPEG-2000)在性能上的对比。
- 通过指出当前框架的局限性并提出改进方向,为未来研究提供指导,以提升压缩效率和视觉质量。
提出的方法
- 根据深度学习架构对图像压缩方法进行分类,包括自编码器(CAE、VAE)、卷积神经网络、循环神经网络、生成对抗网络、主成分分析(PCA)以及模糊聚类。
- 分析集成学习熵模型与超先验的端到端压缩框架,以提升率失真性能。
- 回顾注意力机制与非局部操作在增强全局特征建模方面的应用,以提升重建质量。
- 考察广义除法归一化(GDN)及其反向GDN层在超先验模型中的集成,以优化熵编码。
- 评估基于块的与自回归熵模型,指出其在并行化与计算效率方面的局限性。
- 在不同硬件平台(CPU与GPU)上对比模型性能,识别出训练与推理环境不一致时导致的推理不一致问题。

实验结果
研究问题
- RQ1哪种端到端学习图像压缩框架在率失真权衡方面实现了最佳压缩效率?
- RQ2哪些学习压缩模型在重建图像中能提供更优的视觉质量,尤其是在保留细小纹理与边缘方面?
- RQ3哪些框架能最小化GPU内存使用量,并支持在CPU与GPU平台上高效推理?
- RQ4哪些架构能够实现更快的响应时间,并支持高分辨率图像的实时压缩?
- RQ5如何缓解深度学习压缩中持续存在的问题,如条带区域失真、混叠效应以及内存溢出错误?
主要发现
- 基于深度学习的压缩模型,尤其是使用卷积神经网络与自编码器的模型,在率失真性能上优于JPEG-2000等传统标准。
- 变分自编码器(VAE)与超先验模型可提升熵编码效率,但通常伴随更高的计算成本与内存占用。
- 条带区域失真(SRD)是深度学习模型重建图像中一个显著且尚未解决的问题,目前文献中尚无有效解决方案。
- 在全分辨率推理过程中,由于GPU显存有限,显存溢出(OOM)问题频繁发生,尤其在高分辨率图像中更为明显。
- 混叠效应(表现为方向性图案失真)在基于CNN与CAE的模型中普遍存在,尤其在低比特率下更为显著。
- 当前框架缺乏在CPU与GPU之间的可移植性,当训练与推理在不同硬件平台进行时,常导致重建失败。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。