Skip to main content
QUICK REVIEW

[论文解读] Variable-Rate Deep Image Compression through Spatially-Adaptive Feature Transform

Myungseo Song, Jin-Young Choi|arXiv (Cornell University)|Aug 21, 2021
Advanced Image Processing Techniques参考文献 42被引用 4
一句话总结

本文提出一种用于可变码率图像压缩的单一深度神经网络,通过空间自适应特征变换(SFT)实现基于连续像素级质量图的压缩条件化。该模型通过反向传播优化质量图而无需微调,实现任务感知压缩,相比固定码率模型,取得了更优的率失真性能和更高的任务特定准确率(如图像分类与文本保留)。

ABSTRACT

We propose a versatile deep image compression network based on Spatial Feature Transform (SFT arXiv:1804.02815), which takes a source image and a corresponding quality map as inputs and produce a compressed image with variable rates. Our model covers a wide range of compression rates using a single model, which is controlled by arbitrary pixel-wise quality maps. In addition, the proposed framework allows us to perform task-aware image compressions for various tasks, e.g., classification, by efficiently estimating optimized quality maps specific to target tasks for our encoding network. This is even possible with a pretrained network without learning separate models for individual tasks. Our algorithm achieves outstanding rate-distortion trade-off compared to the approaches based on multiple models that are optimized separately for several different target rates. At the same level of compression, the proposed approach successfully improves performance on image classification and text region quality preservation via task-aware quality map estimation without additional model training. The code is available at the project website: https://github.com/micmic123/QmapCompression

研究动机与目标

  • 解决固定码率深度压缩模型需为每个目标码率单独训练的局限性。
  • 实现空间自适应压缩,使图像不同区域根据像素重要性以不同码率压缩。
  • 开发一种在推理时生成任务特定质量图的方法,无需微调主压缩模型。
  • 使用单一模型在广泛码率范围内实现最先进水平的率失真性能。
  • 通过为任务特定目标优化质量图,保留关键图像内容以支持下游任务(如分类、文本识别)。

提出的方法

  • 将图像压缩网络以实数值、连续的质量图作为条件,该质量图指定像素级重要性以加权失真。
  • 采用空间自适应特征变换(SFT)层,根据质量图调制特征图,实现逐像素码率自适应。
  • 使用包含质量图作为空间可变权重的率失真损失进行网络训练,用于均方误差(MSE)失真加权。
  • 在推理时通过反向传播最小化率-任务损失,优化任务感知质量图,利用预训练的任务模型(如VGG16)提供指导。
  • 使用单一端到端可训练模型覆盖广泛压缩码率,避免对多个独立训练模型的需求。
  • 将质量图优化集成到编码阶段,无需微调主压缩网络,实现快速、实时的自适应。

实验结果

研究问题

  • RQ1单一深度压缩模型能否通过连续像素级质量图在广泛码率范围内实现高性能?
  • RQ2能否在测试时无需重训练压缩模型即可生成任务感知质量图,且是否能提升下游任务性能?
  • RQ3与多个固定码率模型相比,该方法在率失真性能和任务特定准确率方面表现如何?
  • RQ4通过SFT实现的空间自适应在感兴趣区域相比均匀或分块压缩,能否显著提升重建质量?
  • RQ5所提框架中缺乏自回归上下文模型是否限制性能,是否可通过引入此类组件进一步提升?

主要发现

  • 所提模型在率失真性能上优于单码率模型(如M&S和M&S+Context),即使未使用自回归上下文模型。
  • 该模型在性能上达到或超越最先进方法,包括采用复杂上下文建模的方法,同时更具灵活性与效率。
  • 在推理时进行任务感知质量图优化,相比均匀质量图,可将图像分类准确率提升最高达12.5%,且在TitanXp GPU上推理耗时不足1秒。
  • 在Grad-CAM或手动定义的文本感兴趣区域(ROIs)引导下,该模型在低码率下仍能比均匀压缩更好地保留文本区域。
  • 消融实验证实,使用原始图像作为质量图生成器输入的源条件化显著提升性能,尤其在空间自适应方面。
  • 该模型在各类质量图下均保持高MS-SSIM与PSNR值,重建图像在纹理保留方面优于BPG与M&S Hyperprior。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。