Skip to main content
QUICK REVIEW

[論文レビュー] Learning a Virtual Codec Based on Deep Convolutional Neural Network to Compress Image

Lijun Zhao, Huihui Bai|arXiv (Cornell University)|Dec 16, 2017
Advanced Data Compression Techniques参考文献 7被引用数 7
ひとこと要約

本論文は、標準コ덱(例:JPEG)と特徴記述ネットワーク、およびポストプロセッシングネットワークを統合したエンドツーエンドのディープラーニングフレームワークを提案する。非微分可能な量子化ステップを通過する勾配逆伝播を可能にする学習可能なバーチャルコデックを用いることで、非常に低いビットレートでも最先端の性能を達成し、歪みを著しく低減しながら、既存のコデックとの互換性を維持する。

ABSTRACT

Although deep convolutional neural network has been proved to efficiently eliminate coding artifacts caused by the coarse quantization of traditional codec, it's difficult to train any neural network in front of the encoder for gradient's back-propagation. In this paper, we propose an end-to-end image compression framework based on convolutional neural network to resolve the problem of non-differentiability of the quantization function in the standard codec. First, the feature description neural network is used to get a valid description in the low-dimension space with respect to the ground-truth image so that the amount of image data is greatly reduced for storage or transmission. After image's valid description, standard image codec such as JPEG is leveraged to further compress image, which leads to image's great distortion and compression artifacts, especially blocking artifacts, detail missing, blurring, and ringing artifacts. Then, we use a post-processing neural network to remove these artifacts. Due to the challenge of directly learning a non-linear function for a standard codec based on convolutional neural network, we propose to learn a virtual codec neural network to approximate the projection from the valid description image to the post-processed compressed image, so that the gradient could be efficiently back-propagated from the post-processing neural network to the feature description neural network during training. Meanwhile, an advanced learning algorithm is proposed to train our deep neural networks for compression. Obviously, the priority of the proposed method is compatible with standard existing codecs and our learning strategy can be easily extended into these codecs based on convolutional neural network. Experimental results have demonstrated the advances of the proposed method as compared to several state-of-the-art approaches, especially at very low bit-rate.

研究の動機と目的

  • 標準画像コデックにおける量子化の非微分性がディープニューラルネットワーク統合に与える影響を解消すること。
  • 特徴記述ネットワークから標準コデック、そしてポストプロセッシングネットワークに至るエンドツーエンドの学習を可能にすること。
  • 非常に低いビットレートにおいて、ブロッキング、ぼやけ、リバーブ歪みなどのアーティファクトを低減することで、画像再構成品質を向上させること。
  • JPEGなどの既存の標準コデックと互換性を保ちながら、圧縮効率を向上させること。
  • 非微分可能なコデック段階を通過する勾配の有効な逆伝播を可能にする訓練戦略の開発

提案手法

  • 特徴記述ニューラルネットワーク(FDNN)が、元の画像をデータサイズを低減するための低次元表現に圧縮する。
  • 低次元表現が標準コデック(例:JPEG)を通過することで、制御された歪みとアーティファクトが導入される。
  • ポストプロセッシングニューラルネットワーク(ComCNN)が、ブロッキングやぼやけなどの圧縮アーティファクトを除去することで画像を回復する。
  • バーチャルコデックニューラルネットワークを導入し、特徴記述から圧縮画像へのマッピングを近似することで、ポストプロセッサからFDNNへの勾配伝播を可能にする。
  • 全体の問題を3つの部分問題(FDNN、バーチャルコデック、ComCNNの訓練)に分解する共同最適化戦略を用いてフレームワークを訓練する。
  • バーチャルコデックネットワークは、標準コデックの代理として機能し、非微分可能な量子化ステップを通過する勾配伝播を可能にする。

実験結果

リサーチクエスチョン

  • RQ1非微分可能な標準コデックが特徴エンコーダとポストプロセッサの間に配置された場合、ディープラーニングフレームワークをエンドツーエンドで学習可能か?
  • RQ2標準コデックの量子化ステップを通過する勾配を、ディープラーニング圧縮パイプラインで効果的に逆伝播するにはどうすればよいか?
  • RQ3学習可能なバーチャルコデックは、非常に低いビットレートにおけるアーティファクト除去と再構成品質をどの程度向上できるか?
  • RQ4極端な圧縮条件下でも、PSNRおよびSSIMの観点から、本手法は最先端の手法と比較してどのように差をつけるか?
  • RQ5特徴表現(FDNN出力)の選択が、圧縮アーティファクトの分布およびその後の回復品質に顕著な影響を与えるか?

主な発見

  • 提案手法は、比較対象のすべての手法と比較して、特に非常に低いビットレート(例:bpp ≤ 0.25)において最高のPSNRおよびSSIMスコアを達成した。
  • 本手法は、特に髪の毛や目の輪郭などの細かいディテールを保持する点で、Jiangら[35]を著しく上回った。
  • バーチャルコデックネットワークにより、ポストプロセッサから特徴記述ネットワークへの勾配伝播が効果的に可能となり、最適な訓練に不可欠である。
  • フレームワークはJPEGなどの標準コデックと完全に互換性があり、変更なしに既存の圧縮パイプラインへの統合が可能である。
  • 視覚的比較では、本手法がFoi[14]、BM3D[22]、DicTV[17]、CONCOLOR[18]と比較して、ブロッキングやぼやけのアーティファクトをより効果的に低減していることが示された。
  • 本手法とJiangら[35]との間のアーティファクト分布の差異は、FDNNが学習する異なる特徴表現に起因し、デコーダでの再構成品質が向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。