Skip to main content
QUICK REVIEW

[論文レビュー] Video Compression through Image Interpolation

Chao-Yuan Wu, Nayan Singhal|arXiv (Cornell University)|Apr 18, 2018
Advanced Image Processing Techniques参考文献 26被引用数 20
ひとこと要約

この論文は、ビデオ圧縮を繰り返し行われる深層画像補間として定式化する、最初のエンド・ツー・エンドで学習可能な深層ビデオコーデックを提示する。キーフレームを符号化し、動きに配慮した圧縮可能な補間ネットワークを用いて中間フレームを再構築することで、複数のデータセットにおいてH.264と同等の性能を達成し、MPEG-4 Part 2 や H.261 を上回り、ブロックアーチファクトがなく、低ビットレートでも優れた視覚的品質を実現する。

ABSTRACT

An ever increasing amount of our digital communication, media consumption, and content creation revolves around videos. We share, watch, and archive many aspects of our lives through them, all of which are powered by strong video compression. Traditional video compression is laboriously hand designed and hand optimized. This paper presents an alternative in an end-to-end deep learning codec. Our codec builds on one simple idea: Video compression is repeated image interpolation. It thus benefits from recent advances in deep image interpolation and generation. Our deep video codec outperforms today's prevailing codecs, such as H.261, MPEG-4 Part 2, and performs on par with H.264.

研究の動機と目的

  • 従来のコーデックで用いられる手作業で設計されたヒューリスティクスを避けるエンド・ツー・エンドで学習可能な深層学習ベースのビデオコーデックを開発すること。
  • キーフレーム間の繰り返し画像補間としての再解釈により、ビデオ圧縮効率を向上させること。
  • 学習された、知覚的に忠実な補間によって、従来のコーデックで一般的なブロックアーチファクトを排除すること。
  • 階層的補間と適応的エントロピー符号化を用いて、低ビットレートでも高い視覚的品質を達成すること。
  • タスク固有のチューニングなしに、多様なビデオコンテンツ、解像度、品質レベルに一般化できることを示すこと。

提案手法

  • 各レベルが次第に近い参照フレーム間で補間を行う階層的アーキテクチャを採用し、低レベルで冗長性を低減する。
  • キーフレームは、バイナリボトルネックと適応的算術符号化を備えた標準的な深層画像圧縮オートエンコーダーで符号化される。
  • 中間フレームは、事前に計算された動き推定(例:光流またはブロック動き)を組み込んだU-Netベースの補間ネットワークにより再構築される。
  • 別個のエンコーダーが、周囲のフレームからの推定が不可能な残差コンテンツをキャプチャし、解釈の明確化に役立つ小さな圧縮可能なコードを生成する。
  • 残差の空間的冗長性は、より高いビットレート効率を得るために、3次元のPixelCNNと適応的算術符号化を用いてさらに圧縮される。
  • システム全体は、再構築損失を最小化するようにエンド・ツー・エンドで学習され、知覚的品質と圧縮レートの最適化が図られる。

実験結果

リサーチクエスチョン

  • RQ1ビデオ圧縮を、深層画像補間タスクの連続として効果的に再考できるか?
  • RQ2エンド・ツー・エンドで学習されたコーデックは、H.264 や MPEG-4 Part 2 のような手作業で設計されたコーデックを、レート・ディストーション性能と視覚的品質の両面で上回れるか?
  • RQ3学習された補間ネットワークに動き推定を組み込むことで、圧縮効率が著しく向上し、アーチファクトが減少するか?
  • RQ41つのデータセットで学習した単一のモデルが、多様なビデオコンテンツ、解像度、品質レベルに一般化できるか?
  • RQ5階層的補間はどの程度ビットレートを低減させつつ、高い視覚的忠実性を維持できるか?

主な発見

  • ブレンドラーのTears of Steel動画において、0.080 BPPでMS-SSIM 0.984を達成し、MPEG-4 Part 2(MS-SSIM 0.946)を上回り、H.264(MS-SSIM 0.980)と同等の性能を示した。
  • 高解像度のUVGデータセットでは、PSNRでH.264を上回り、HEVCと同等の性能を示し、高品質な性能を実証した。
  • キーフレーム間の補間を活用することで、標準的な深層画像圧縮に比べてビットレートを1桁低減した。
  • 従来のコーデックとは異なり、低ビットレートでもブロックアーチファクトがなく、視覚的に忠実な再構築を実現した。
  • Kinetics-5K、VTL、UVGなど、さまざまなデータセットにわたって一般化が良好であり、解像度、コンテンツタイプ、動画品質の違いに関わらず一貫した性能を示した。
  • 階層的補間はビットレートを顕著に低減させ、階層の最も低いレベルが圧縮効果の大部分を占めている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。