Skip to main content
QUICK REVIEW

[論文レビュー] Perceptually Optimizing Deep Image Compression

Li–Heng Chen, Christos G. Bampis|arXiv (Cornell University)|Jul 3, 2020
Image and Video Quality Assessment参考文献 46被引用数 8
ひとこと要約

本論文は、MSEの代わりにVMAFなどの知覚的品質指標を用いた深層画像圧縮の最適化のため、プロキシネットワーク手法を提案する。知覚的品質モデルを模倣する微分可能なプロキシネットワークを訓練することで、エンドツーエンド最適化を可能にし、MSEベースの学習と比較して、固定された知覚的品質レベルで平均28.7%のビットレート削減を達成した。

ABSTRACT

Mean squared error (MSE) and $\ell_p$ norms have largely dominated the measurement of loss in neural networks due to their simplicity and analytical properties. However, when used to assess visual information loss, these simple norms are not highly consistent with human perception. Here, we propose a different proxy approach to optimize image analysis networks against quantitative perceptual models. Specifically, we construct a proxy network, which mimics the perceptual model while serving as a loss layer of the network.We experimentally demonstrate how this optimization framework can be applied to train an end-to-end optimized image compression network. By building on top of a modern deep image compression models, we are able to demonstrate an averaged bitrate reduction of $28.7\%$ over MSE optimization, given a specified perceptual quality (VMAF) level.

研究の動機と目的

  • 深層画像圧縮におけるMSEベースの損失関数と人間の視覚的知覚の間の不一致を解消すること。
  • VMAFのような複雑で微分不可能な知覚的品質モデルを、エンドツーエンド学習で使用可能な形にすること。
  • 知覚的品質スコアを近似可能な学習可能なプロキシネットワークを構築し、微分可能な損失関数として利用すること。
  • 知覚的品質を維持または向上させつつ、顕著なビットレート削減を実現すること。
  • 最新の深層画像圧縮アーキテクチャに対して、MSE最適化と比較して測定可能な向上を示すフレームワークの妥当性を検証すること。

提案手法

  • 再構築画像から知覚的品質スコア(例:VMAF)を予測するプロキシネットワークを訓練し、フルリファレンス画像品質評価モデルを模倣する。
  • プロキシネットワークを深層画像圧縮オートエンコーダーの学習における微分可能な損失層として統合する。
  • 交互に学習する戦略を採用する:まずプロキシネットワークを実際の画像ペアで事前学習し、その後エンドツーエンド学習中に圧縮ネットワークと共同でファインチューニングする。
  • 圧縮ネットワークは、プロキシネットワークが予測する品質スコアを最大化するように最適化され、間接的に知覚的忠実度を最適化する。
  • 微分可能な知覚的品質モデルであれば、それに応じたプロキシネットワークを訓練することで、あらゆるモデルに適用可能である。
  • 計算効率を維持しており、特にGPUで加速された場合、エンコードおよびデコード時間はMSE最適化モデルと同等の水準を保っている。

実験結果

リサーチクエスチョン

  • RQ1微分不可能な複雑な知覚的画像品質モデル(例:VMAF)を、深層学習の学習に使用可能な微分可能なプロキシネットワークで効果的に近似できるか?
  • RQ2知覚的指標のプロキシを用いて深層画像圧縮ネットワークを最適化することで、同等の知覚的品質レベルで測定可能なビットレート削減が達成できるか?
  • RQ3プロキシネットワークと圧縮ネットワーク間の交互学習戦略が、真のスコアと予測スコアの整合性に与える影響は何か?
  • RQ4提案されたフレームワークは、既存の深層圧縮アーキテクチャに、顕著な計算オーバーヘッドを伴わずに適用可能か?
  • RQ5エンドツーエンド圧縮においてMSEを知覚的プロキシ損失に置き換えた場合、知覚的品質とビットレートのトレードオフはどのように変化するか?

主な発見

  • 提案されたVMAFプロキシ最適化モデルは、固定された知覚的品質レベル(VMAF)で、MSE最適化モデルと比較して平均28.7%のビットレート削減を達成した。
  • 高ビットレート域では、知覚的品質に劣化を来さずに約16%のビットレート削減が達成され、効率性の向上が示された。
  • 交互学習戦略により、プロキシネットワークの予測値が真のVMAFスコアと良好に一致し、事前学習済みプロキシを使用した際の初期の乖離が解消された。
  • 極端な圧縮(0.05 bpp)における視覚的比較では、VMAFプロキシモデルがMSE最適化モデルを上回り、HEVCやJPEG2000と同等の知覚的品質を達成した。
  • VMAFプロキシモデルの実行時間はMSE最適化モデルとほぼ同一であり、エンコードおよびデコード時間も、特にGPUで加速された場合、標準的なコーデックと同等の水準を維持した。
  • フレームワークは汎用性を示し、他の知覚的品質指標に対しても、対応するプロキシネットワークを訓練することで、同様のアプローチを適用可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。