Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Description Convolutional Neural Networks for Image Compression

Lijun Zhao, Huihui Bai|arXiv (Cornell University)|Jan 20, 2018
Advanced Data Compression Techniques参考文献 37被引用数 6
ひとこと要約

本論文は、畳み込みニューラルネットワークを用いた深層学習ベースの複数記述符号化(MDC)フレームワークを提案し、外観的に類似したが特徴が多様な画像記述を生成することで、耐障害性の高い伝送を実現する。複数記述生成ネットワーク(MDGN)は距離および構造的類似度損失を用い、サイドおよび中央の復元用に再構成ネットワーク(MDRN)を採用し、エンドツーエンドの学習を可能にする仮想コーデックネットワーク(MDVCN)を導入することで、ベースラインと比較して優れた客観的および主観的な画像品質を達成した。

ABSTRACT

Multiple description coding (MDC) is able to stably transmit the signal in the un-reliable and non-prioritized networks, which has been broadly studied for several decades. However, the traditional MDC doesn't well leverage image's context features to generate multiple descriptions. In this paper, we propose a novel standard-compliant convolutional neural network-based MDC framework in term of image's context features. Firstly, multiple description generator network (MDGN) is designed to produce appearance-similar yet feature-different multiple descriptions automatically according to image's content, which are compressed by standard codec. Secondly, we present multiple description reconstruction network (MDRN) including side reconstruction network (SRN) and central reconstruction network (CRN). When any one of two lossy descriptions is received at the decoder, SRN network is used to improve the quality of this decoded lossy description by removing the compression artifact and up-sampling simultaneously. Meanwhile, we utilize CRN network with two decoded descriptions as inputs for better reconstruction, if both of lossy descriptions are available. Thirdly, multiple description virtual codec network (MDVCN) is proposed to bridge the gap between MDGN network and MDRN network in order to train an end-to-end MDC framework. Here, two learning algorithms are provided to train our whole framework. In addition to structural similarity loss function, the produced descriptions are used as opposing labels with multiple description distance loss function to regularize the training of MDGN network. These losses guarantee that the generated description images are structurally similar yet finely diverse. Experimental results show a great deal of objective and subjective quality measurements to validate the efficiency of the proposed method.

研究の動機と目的

  • 従来のMDCが画像の文脈特徴を活用して複数の記述を生成する点での制限を解消すること。
  • 標準コーデックと互換性を持つ深層学習を用いたエンドツーエンドで学習可能なMDCフレームワークを設計すること。
  • 構造的に類似しているが細部において多様性を持つ複数の記述を生成することで、再構成品質を向上させること。
  • 異なる受信状況に対応するための専用ネットワークを用いて、サイドおよび中央の再構成性能を向上させること。

提案手法

  • 画像の文脈を活用し、構造的類似度(SSIM)および記述距離損失で正則化することで、外観的に類似したが特徴が異なる記述を生成する複数記述生成ネットワーク(MDGN)を導入。
  • サイド再構成ネットワーク(SRN)を用いて単一記述の回復を実現し、二重記述の統合を目的とした中央再構成ネットワーク(CRN)を備えた複数記述再構成ネットワーク(MDRN)を採用。
  • MDGNとMDRNの間のギャップを埋めるために仮想コーデックネットワーク(MDVCN)を用い、標準コーデックとの互換性を保ちつつエンドツーエンドの学習を可能にした。
  • 二つの学習アルゴリズムを適用:SSIMと距離損失を用いたもので、MDGNの学習を正則化し、構造的類似度を維持しながら多様性を確保。
  • 生成された記述を圧縮するために標準コーデック(例:JPEG)を用い、既存の圧縮基準との互換性を確保。
  • 距離損失における逆方向ラベルを用いた敵対的ラベル付けにより、記述間の特徴レベルでの多様性を強制した。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースのMDCフレームワークは、画像の文脈を活用して、構造的に類似しているが特徴が多様な複数の記述を生成できるか?
  • RQ2SSIMと記述距離損失を組み合わせることで、生成された記述の品質と多様性はどのように向上するか?
  • RQ3提案されたMDRNアーキテクチャは、単一または二重記述受信状況下で再構成品質をどの程度向上させるか?
  • RQ4仮想コーデックネットワークを用いたエンドツーエンドの学習は、既存のMDC手法と同等またはそれ以上の性能向上を達成できるか?

主な発見

  • 提案手法は、特に高ビットレート域において、PSNRおよびSSIMの両面で顕著な向上を示し、MDB1a–MDB4aおよびMDB1b–MDB4bを含むベースライン手法を上回った。
  • サイド再構成品質は、全8つのベースラインを上回り、特にMDB1a–MDB4aおよびMDB1b–MDB4bが比較手法の中で最高の性能を示した。
  • 中央再構成性能は、すべてのベースラインの中で最高であり、MDB3aおよびMDB3bが最高のPSNRを記録した。一方、MDB1a–MDB3aは非常に類似した性能を示した。
  • 視覚的比較により、提案手法は、ポリフェーズダウンサンプリングベースラインと比較して、圧縮後でも重要な画像ディテールやキーフィーチャーをよりよく保持していることが確認された。
  • 本手法は、記述全体にわたり顕著な特徴を効果的に保護しており、圧縮ノイズの影響を受けても重要な画像コンテンツが損なわれないことを示した。
  • 低ビットレート域では、構造的距離損失と解像度の低減が性能向上に寄与しており、今後の改良によって低ビットレート再構成性能をさらに向上できる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。