Skip to main content
QUICK REVIEW

[论文解读] Deep Perceptual Compression

Yash Patel, Srikar Appalaraju|arXiv (Cornell University)|Jul 18, 2019
Advanced Image Processing Techniques参考文献 43被引用 20
一句话总结

本文提出深度感知压缩(DPC),一种学习型图像压缩方法,通过联合优化深度感知度量(LPIPS)与MS-SSIM,以提升视觉质量。在人类评估中,DPC优于基于深度学习的方法和JPEG-2000,在低比特率下对目标检测准确率的退化程度也低于其他方法,表现更优。

ABSTRACT

Several deep learned lossy compression techniques have been proposed in the recent literature. Most of these are optimized by using either MS-SSIM (multi-scale structural similarity) or MSE (mean squared error) as a loss function. Unfortunately, neither of these correlate well with human perception and this is clearly visible from the resulting compressed images. In several cases, the MS-SSIM for deep learned techniques is higher than say a conventional, non-deep learned codec such as JPEG-2000 or BPG. However, the images produced by these deep learned techniques are in many cases clearly worse to human eyes than those produced by JPEG-2000 or BPG. We propose the use of an alternative, deep perceptual metric, which has been shown to align better with human perceptual similarity. We then propose Deep Perceptual Compression (DPC) which makes use of an encoder-decoder based image compression model to jointly optimize on the deep perceptual metric and MS-SSIM. Via extensive human evaluations, we show that the proposed method generates visually better results than previous learning based compression methods and JPEG-2000, and is comparable to BPG. Furthermore, we demonstrate that for tasks like object-detection, images compressed with DPC give better accuracy.

研究动机与目标

  • 解决传统度量(如PSNR和MS-SSIM)与人类感知在学习型图像压缩中相关性差的问题。
  • 通过用更深层的感知度量替代或补充MS-SSIM,提升基于深度学习压缩的感知图像质量。
  • 证明人工判断的感知质量更准确地由学习型感知度量捕捉,而非MS-SSIM或PSNR。
  • 评估压缩图像在下游计算机视觉任务中的实用性,特别是目标检测任务。
  • 展示DPC在视觉质量与任务退化方面优于当前最先进的学习型与传统编码器。

提出的方法

  • 该方法采用编码器-解码器神经网络架构进行图像压缩,并支持端到端训练。
  • 联合优化两个损失分量:学习型感知图像块相似度(LPIPS)度量与MS-SSIM,以平衡感知质量与结构保真度。
  • LPIPS度量通过一个在人类判断数据上预训练的CNN计算得出,用于图像失真感知。
  • 为减少棋盘状伪影,反卷积上采样层采用可被步长整除的卷积核尺寸,避免滤波器模式重叠。
  • 模型通过结合LPIPS(越低越好)与MS-SSIM(越高越好)的多任务损失进行训练,以正则化优化过程。
  • 评估包括人类感知研究、PSNR/MS-SSIM对比,以及在MS-COCO数据集上使用预训练的Faster R-CNN(ResNet-101)进行目标检测性能测试。

实验结果

研究问题

  • RQ1在深度图像压缩中,优化学习型感知度量(LPIPS)是否能带来优于优化MS-SSIM或PSNR的视觉质量?
  • RQ2在人类评估中,DPC的感知质量相较于其他学习型与传统编码器(如JPEG-2000、BPG)如何?
  • RQ3与其它压缩方法相比,DPC在多大程度上保留了对下游计算机视觉任务(如目标检测)的实用性?
  • RQ4将LPIPS与MS-SSIM联合作为多任务损失,是否能同时提升感知质量与结构相似性?
  • RQ5现有学习型压缩模型中是否存在高MS-SSIM得分但人类感知差的矛盾现象?DPC能否缓解此问题?

主要发现

  • 在Kodak、Urban100、Set14与Set5数据集上,DPC在所有测试比特率下均获得最佳的人工评分感知质量,优于基于深度学习的方法与JPEG-2000。
  • 尽管部分方法(如Mentzer等人与Ballé等人)的MS-SSIM得分更高,但DPC在人类评估中始终排名更高,表明MS-SSIM并非感知质量的可靠代理指标。
  • 在0.37 bpp时,DPC在人类感知上达到或超过BPG;在0.23 bpp时,其在人类判断中显著优于所有其他方法。
  • 在MS-COCO数据集上,DPC在所有方法中造成的目标检测性能退化最小(AP@[.5:.95]),尤其在低比特率(如0.23 bpp)下表现更优,甚至在某些情况下超过BPG。
  • 深度感知度量(LPIPS)与人类感知的相关性优于PSNR或MS-SSIM,证据显示:高MS-SSIM得分的方法常获得较差的人工评分。
  • 将LPIPS与MS-SSIM联合作为多任务损失,可生成视觉更优的重建结果,并在下游任务中表现更佳,优于单独使用任一度量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。