Skip to main content
QUICK REVIEW

[論文レビュー] An End-to-End Compression Framework Based on Convolutional Neural Networks

Feng Jiang, Tao Wen|arXiv (Cornell University)|Aug 2, 2017
Image and Signal Denoising Methods参考文献 6被引用数 9
ひとこと要約

この論文は、JPEG や JPEG2000 などの標準画像コーデックと組み合わせて使用する、コンactな畳み込みニューラルネットワーク(ComCNN)と再構築用CNN(RecCNN)を統合したエンドツーエンドのディープラーニングフレームワークを提案する。構造的でコンactな表現を学習し、非微分可能な量子化を経由する勾配伝搬を可能にする共同学習により、後処理手法よりも高速な推論を実現しながら、最先端の圧縮性能を達成する。

ABSTRACT

Deep learning, e.g., convolutional neural networks (CNNs), has achieved great success in image processing and computer vision especially in high level vision applications such as recognition and understanding. However, it is rarely used to solve low-level vision problems such as image compression studied in this paper. Here, we move forward a step and propose a novel compression framework based on CNNs. To achieve high-quality image compression at low bit rates, two CNNs are seamlessly integrated into an end-to-end compression framework. The first CNN, named compact convolutional neural network (ComCNN), learns an optimal compact representation from an input image, which preserves the structural information and is then encoded using an image codec (e.g., JPEG, JPEG2000 or BPG). The second CNN, named reconstruction convolutional neural network (RecCNN), is used to reconstruct the decoded image with high-quality in the decoding end. To make two CNNs effectively collaborate, we develop a unified end-to-end learning algorithm to simultaneously learn ComCNN and RecCNN, which facilitates the accurate reconstruction of the decoded image using RecCNN. Such a design also makes the proposed compression framework compatible with existing image coding standards. Experimental results validate that the proposed compression framework greatly outperforms several compression frameworks that use existing image coding standards with state-of-the-art deblocking or denoising post-processing methods.

研究の動機と目的

  • JPEG や JPEG2000 などの従来の画像コーデックが低ビットレートでブロッキングアーティファクトやノイズを発生させるという限界を解消すること。
  • 標準コーデックにおける量子化の非微分性を克服し、CNNを標準コーデックと統合してエンドツーエンドで学習可能にする。
  • 計算コストの高い後処理フィルタに依存せずに、低ビットレートでも高品質な画像再構築を実現すること。
  • 実用的な展開を可能にするために、既存の画像符号化標準と互換性を持つフレームワークを設計すること。

提案手法

  • フレームワークは、入力画像の圧縮された情報保持表現を学習するコンパクトなCNN(ComCNN)を用いる。
  • このコンパクトな表現は、変換、量子化、エントロピー符号化を含む標準画像コーデック(例:JPEG、JPEG2000、BPG)で符号化される。
  • 別個の再構築用CNN(RecCNN)が符号化された表現を復号し、高品質な画像を再構築する。
  • 非微分可能な量子化ステップを経由する勾配伝搬を可能にするために、統合的エンドツーエンド学習アルゴリズムを考案。このアルゴリズムでは、微分可能近似を用いて量子化を補完する。
  • コンパクトな表現が構造的情報を保持するように設計され、標準コーデックとの組み合わせにより、効率的かつ高品質な圧縮が実現可能となる。

実験結果

リサーチクエスチョン

  • RQ1標準画像コーデックとCNNを統合したディープラーニングフレームワークは、従来のコーデックや後処理手法を上回る画像圧縮品質を達成できるか?
  • RQ2標準コーデックにおける量子化の非微分性を考慮したエンドツーエンド学習は、どのように実現できるか?
  • RQ3コンパクトなCNN表現が、十分な構造的情報を保持できるか?
  • RQ4提案されたフレームワークは、既存の後処理ベースの圧縮手法よりも高速な推論を達成できるか?

主な発見

  • 4つのデータセット全体で、同等のビットレートにおいてJPEG や JPEG2000 よりも平均5.22%のPSNR向上を達成。
  • General-100 データセットでは、0.3 bpp で32.88 dB のPSNRを達成し、JPEG2000(32.00 dB)を0.88 dB 以上上回った。
  • 256×256 の画像に対して、CPU では1.56秒、GPU では0.017秒で処理が完了し、多数の後処理手法よりも顕著に高速であった。
  • 実行時間のほぼ全半分を占めるRecCNNサブネットワークは20層に及び、符号化表現からの高品質再構築を可能にしている。
  • Peppers画像では、2747 bpp で31.43 dB のPSNRと0.8287のSSIMを達成し、同じレートでJPEG2000(30.81 dB、0.8108 SSIM)を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。