Skip to main content
QUICK REVIEW

[论文解读] Multiple Description Convolutional Neural Networks for Image Compression

Lijun Zhao, Huihui Bai|arXiv (Cornell University)|Jan 20, 2018
Advanced Data Compression Techniques参考文献 37被引用 6
一句话总结

本文提出了一种基于深度学习的多描述编码(MDC)框架,采用卷积神经网络生成外观相似但特征多样的图像描述,以实现鲁棒传输。该方法采用多描述生成网络(MDGN),结合距离损失与结构相似性损失;采用重建网络(MDRN)实现单边和中央解码;并通过虚拟编解码网络(MDVCN)实现端到端训练,相较于基线方法在客观与主观图像质量方面均表现更优。

ABSTRACT

Multiple description coding (MDC) is able to stably transmit the signal in the un-reliable and non-prioritized networks, which has been broadly studied for several decades. However, the traditional MDC doesn't well leverage image's context features to generate multiple descriptions. In this paper, we propose a novel standard-compliant convolutional neural network-based MDC framework in term of image's context features. Firstly, multiple description generator network (MDGN) is designed to produce appearance-similar yet feature-different multiple descriptions automatically according to image's content, which are compressed by standard codec. Secondly, we present multiple description reconstruction network (MDRN) including side reconstruction network (SRN) and central reconstruction network (CRN). When any one of two lossy descriptions is received at the decoder, SRN network is used to improve the quality of this decoded lossy description by removing the compression artifact and up-sampling simultaneously. Meanwhile, we utilize CRN network with two decoded descriptions as inputs for better reconstruction, if both of lossy descriptions are available. Thirdly, multiple description virtual codec network (MDVCN) is proposed to bridge the gap between MDGN network and MDRN network in order to train an end-to-end MDC framework. Here, two learning algorithms are provided to train our whole framework. In addition to structural similarity loss function, the produced descriptions are used as opposing labels with multiple description distance loss function to regularize the training of MDGN network. These losses guarantee that the generated description images are structurally similar yet finely diverse. Experimental results show a great deal of objective and subjective quality measurements to validate the efficiency of the proposed method.

研究动机与目标

  • 为解决传统MDC在生成多描述时未能充分利用图像上下文特征的局限性。
  • 设计一种与标准编解码器兼容的端到端可训练MDC框架,利用深度学习技术。
  • 通过生成在结构上相似但细节上具有多样性的多描述,提升重建质量。
  • 通过为不同接收场景设计专用网络,提升单边与中央重建性能。

提出的方法

  • 提出多描述生成网络(MDGN),利用图像上下文生成外观相似但特征不同的描述,通过结构相似性(SSIM)和描述距离损失进行正则化。
  • 采用多描述重建网络(MDRN),包含用于单描述恢复的单边重建网络(SRN)和用于双描述融合的中央重建网络(CRN)。
  • 使用多描述虚拟编解码网络(MDVCN)连接MDGN与MDRN,实现与标准编解码器兼容的端到端训练。
  • 采用两种学习算法:一种结合SSIM与距离损失,用于正则化MDGN训练,确保在保持结构相似性的同时实现特征层面的多样性。
  • 利用标准编解码器(如JPEG)对生成的描述进行压缩,确保与现有压缩标准的兼容性。
  • 通过距离损失中的对抗性标签(对立项)强制实现描述之间的特征级多样性。

实验结果

研究问题

  • RQ1基于深度学习的MDC框架能否利用图像上下文生成在结构上相似且特征多样的多个描述?
  • RQ2结合SSIM与描述距离损失如何提升生成描述的质量与多样性?
  • RQ3所提出的MDRN架构在单描述或双描述接收条件下,对重建质量的提升程度如何?
  • RQ4通过虚拟编解码网络实现的端到端训练,能否实现与现有MDC方法相当或更优的性能?

主要发现

  • 所提方法在大多数比特率范围内显著提升了PSNR与SSIM,尤其在高比特率下表现更优,优于包括MDB1a–MDB4a与MDB1b–MDB4b在内的所有基线方法。
  • 单边重建质量优于全部八个基线方法,其中MDB1a–MDB4a与MDB1b–MDB4b在对比方法中表现最佳。
  • 中央重建性能优于所有基线方法,MDB3a与MDB3b达到最高PSNR,而MDB1a–MDB3a表现非常接近。
  • 视觉对比结果表明,与多相位下采样基线相比,所提方法在压缩后仍能更好地保留图像中的重要细节与关键特征。
  • 该方法能有效保护描述中的显著特征,确保关键图像内容在压缩失真下依然完整。
  • 在低比特率下使用结构距离损失与分辨率降低可提升性能,表明未来优化有望进一步改善低比特率下的重建效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。