Skip to main content
QUICK REVIEW

[論文レビュー] Observer Dependent Lossy Image Compression

Maurice Weber, Cédric Renggli|arXiv (Cornell University)|Oct 8, 2019
Advanced Image Processing Techniques参考文献 41被引用数 6
ひとこと要約

本稿では、深層ニューラルネットワークを用いた観測者依存の可逆圧縮を提案し、人間の視覚的品質(MS-SSIMを介して)または分類精度(VGG-16特徴量を介して)に最適化された知覚的損失関数で圧縮モデルを訓練する。主な貢献は、人間の知覚と分類性能の間の明確なトレードオフを示したことであり、分類精度最適化圧縮では0.25 bppでInception-ResNet-V2の精度の98%を維持し、再トレーニングなしにBPGや従来のコーデックを上回る性能を発揮した。

ABSTRACT

Deep neural networks have recently advanced the state-of-the-art in image compression and surpassed many traditional compression algorithms. The training of such networks involves carefully trading off entropy of the latent representation against reconstruction quality. The term quality crucially depends on the observer of the images which, in the vast majority of literature, is assumed to be human. In this paper, we aim to go beyond this notion of compression quality and look at human visual perception and image classification simultaneously. To that end, we use a family of loss functions that allows to optimize deep image compression depending on the observer and to interpolate between human perceived visual quality and classification accuracy, enabling a more unified view on image compression. Our extensive experiments show that using perceptual loss functions to train a compression system preserves classification accuracy much better than traditional codecs such as BPG without requiring retraining of classifiers on compressed images. For example, compressing ImageNet to 0.25 bpp reduces Inception-ResNet classification accuracy by only 2%. At the same time, when using a human friendly loss function, the same compression system achieves competitive performance in terms of MS-SSIM. By combining these two objective functions, we show that there is a pronounced trade-off in compression quality between the human visual system and classification accuracy.

研究の動機と目的

  • 人間が知覚する画像圧縮品質と機械視覚システムが知覚する品質の間のトレードオフを調査すること。
  • 圧縮画像上で再トレーニングを必要とせず、さまざまな分類器に一般化可能な圧縮フレームワークを開発すること。
  • 深層特徴に基づく知覚的損失関数が、高圧縮率でも従来のコーデックよりも分類精度をよりよく保持できるかどうかを評価すること。
  • 統合されたディープラーニングフレームワーク内で、人間や分類器といった異なる観測者に特化した圧縮品質を明示的に最適化できることを示すこと。

提案手法

  • 本手法は、MS-SSIMによる人間の視覚的品質と、VGG-16特徴量再構成損失による分類精度を目的とした、2つの損失関数の凸結合を用いた深層ニューラルネットワークベースの画像圧縮アーキテクチャを採用する。
  • 分類精度のための知覚的損失は、事前学習済みのVGG-16ネットワークの内部特徴量から計算され、下流タスクに重要な判別的特徴を保持できるようにする。
  • モデルは2つの損失の重み付き和を用いてエンドツーエンドで訓練され、人間フレンドリーと分類フレンドリーな圧縮目的の間の補間が可能になる。
  • フレームワークはImageNet-1K、CUB-200-2011、Stanford Dogsデータセットで評価され、人間の知覚にはMS-SSIM、分類にはトップ1精度が用いられた。
  • 本手法は、ImageNet-1Kでスクラッチから訓練されたRNNベースの学習済み圧縮モデルに適用され、圧縮データ上で微調整は一切行われなかった。
  • 分類器アーキテクチャに依存しないことが示されており、Inception-ResNet-V2 や VGG-16 といった異なるモデルで一貫した性能を発揮した。

実験結果

リサーチクエスチョン

  • RQ11つの学習済み画像圧縮システムが、人間の視覚的知覚と機械分類精度の両方に最適化可能か?
  • RQ2事前学習済み分類器の深層特徴に基づく知覚的損失が、高圧縮率でも従来のコーデックよりも分類精度をよりよく保持できるか?
  • RQ3人間の圧縮品質と機械視覚システムの品質の間には、測定可能なトレードオフが存在するか?
  • RQ4圧縮システムは、圧縮画像上で再トレーニングを必要とせず、さまざまな分類器アーキテクチャに一般化可能か?
  • RQ5BPG、JPEG、WebPといった最先端のコーデックと比較して、観測者依存圧縮のMS-SSIMおよび分類精度の両面での性能はどの程度か?

主な発見

  • 0.25 bppで、分類精度最適化圧縮システムはImageNet-1KにおけるInception-ResNet-V2のトップ1精度をわずか2%低下に抑え、BPGの19.6%低下を上回った。
  • 分類精度最適化システムは、0.25 bppでImageNet-1Kで78.0%のトップ1精度を維持し、BPG(70.7%)およびJPEG(71.5%)を著しく上回った。
  • 人間最適化システムはKodakデータセットでMS-SSIM 0.954を達成し、BPG(0.942)およびWebPを上回り、Mentzerらの最先端手法(0.959)と同等の性能を示した。
  • 細粒度視覚分類タスク(Stanford DogsおよびCUB-200-2011)において、分類精度最適化システムは、全ビットレートでBPG、JPEG、WebP、およびMentzer らの手法を一貫して上回った。特に0.5 bpp未満では顕著な優位性を示した。
  • 人間の知覚と分類精度の間のトレードオフは顕著であり、一方を向上させると他方が損なわれる。わずかな分類損失へのシフトでも、精度の大幅な向上とMS-SSIMのわずかな低下が得られた。
  • 本手法は分類器アーキテクチャに一般化可能であり、VGG-16特徴量に基づく損失が、圧縮データ上で再トレーニングを必要とせず、Inception-ResNet-V2や他のモデルの性能を保持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。