Skip to main content
QUICK REVIEW

[論文レビュー] Deep Predictive Video Compression with Bi-directional Prediction

Woonsung Park, Munchurl Kim|arXiv (Cornell University)|Apr 5, 2019
Advanced Image Processing Techniques参考文献 3被引用数 6
ひとこと要約

この論文では、双方向予測符号化と光流速度推定、および双方向予測ネットワークを統合することで、動きベクトルの送信を不要にする深層学習ベースの動画符号化フレームワーク、BP-DVC Netを提案する。特徴マップにおける学習済みの光流速度と時間的文脈を活用することで、PSNRおよびMS-SSIMにおいてH.264やHEVCと同等の符号化効率を達成し、光流速度損失および予測損失を用いたエンドツーエンド学習を実現している。

ABSTRACT

Recently, deep image compression has shown a big progress in terms of coding efficiency and image quality improvement. However, relatively less attention has been put on video compression using deep learning networks. In the paper, we first propose a deep learning based bi-predictive coding network, called BP-DVC Net, for video compression. Learned from the lesson of the conventional video coding, a B-frame coding structure is incorporated in our BP-DVC Net. While the bi-predictive coding in the conventional video codecs requires to transmit to decoder sides the motion vectors for block motion and the residues from prediction, our BP-DVC Net incorporates optical flow estimation networks in both encoder and decoder sides so as not to transmit the motion information to the decoder sides for coding efficiency improvement. Also, a bi-prediction network in the BP-DVC Net is proposed and used to precisely predict the current frame and to yield the resulting residues as small as possible. Furthermore, our BP-DVC Net allows for the compressive feature maps to be entropy-coded using the temporal context among the feature maps of adjacent frames. The BP-DVC Net has an end-to-end video compression architecture with newly designed flow and prediction losses. Experimental results show that the compression performance of our proposed method is comparable to those of H.264, HEVC in terms of PSNR and MS-SSIM.

研究の動機と目的

  • 画像符号化に比べて深層学習ベースの動画符号化分野における進展が著しく遅れているという問題に対処すること。
  • 従来の動画コーデックで見られる動きベクトルと残差の送信に起因する非効率性を克服すること。
  • 時間的文脈と光流速度を活用するエンドツーエンドで学習可能な動画符号化ネットワークの開発。
  • 学習済みの二重予測メカニズムにより残差誤差を最小限に抑えることで符号化効率を向上させること。
  • 隣接フレーム間の時間的依存関係を活用して、圧縮特徴マップのエントロピー符号化を可能にすること。

提案手法

  • 双方向予測符号化のためのBフレーム構造を深層ニューラルネットワークに統合する。
  • エンコーダーとデコーダーの両方に光流速度推定ネットワークを配置し、動きベクトルの送信を排除する。
  • 前方および後方予測を統合する二重予測ネットワークを設計し、高精度なフレーム再構築を実現する。
  • 隣接フレームからの学習済み特徴マップをエントロピー符号化の文脈として活用し、符号化効率を向上させる。
  • 再構築品質と残差最小化を最適化するため、専用の光流速度損失関数と予測損失関数を用いてネットワークをエンドツーエンドで学習する。
  • 隣接フレームからの時間的文脈を活用して、圧縮特徴マップのエントロピー符号化を実施し、ビットレートを低減する。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースの動画符号化フレームワークは、動きベクトルの送信なしにH.264およびHEVCと同等の符号化効率を達成できるか?
  • RQ2エンドツーエンド動画符号化において、光流速度推定は従来の動きベクトル信号の送信をどの程度効果的に置き換えられるか?
  • RQ3学習済みの統合手法による二重予測は、残差圧縮と再構築品質の向上にどの程度寄与するか?
  • RQ4特徴マップにおける時間的文脈は、深層動画符号化におけるエントロピー符号化性能を向上させるか?
  • RQ5光流速度損失と予測損失を同時に最適化することで、全体の符号化性能にどのような影響を与えるか?

主な発見

  • BP-DVC Netは、標準的な動画シーケンスにおいてH.264およびHEVCと同等のPSNRおよびMS-SSIM性能を達成した。
  • 学習済みの光流速度により動きベクトルの送信を排除することで、オーバーヘッドを削減し符号化効率が向上した。
  • 二重予測ネットワークにより残差エネルギーが顕著に低減され、同じ品質水準でより低いビットレートを達成した。
  • 隣接特徴マップからの時間的文脈を用いたエントロピー符号化により、符号化効率が向上した。
  • 光流速度損失と予測損失を併用したエンドツーエンド学習により、動き推定と再構築の有効な共同最適化が可能になった。
  • 明示的な動きベクトル信号なしに、多様な動画コンテンツに対して優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。