Skip to main content
QUICK REVIEW

[論文レビュー] DVC: An End-to-end Deep Video Compression Framework

Guo Lu, Wanli Ouyang|arXiv (Cornell University)|Nov 30, 2018
Advanced Vision and Imaging参考文献 32被引用数 6
ひとこと要約

この論文では、ニューラルネットワークを用いて、動き推定、動き圧縮、残差圧縮を統合的に最適化する、最初のエンド・ツー・エンドのディープビデオ圧縮フレームワークDVCを提案する。学習されたオプティカルフローと統一された率歪み損失を用いた自己符号化器ベースの圧縮により、DVCはPSNRにおいてH.264を上回り、MS-SSIMにおいてはH.265と同等の性能を示しながら、より少ないビットレートを実現した。

ABSTRACT

Conventional video compression approaches use the predictive coding architecture and encode the corresponding motion information and residual information. In this paper, taking advantage of both classical architecture in the conventional video compression method and the powerful non-linear representation ability of neural networks, we propose the first end-to-end video compression deep model that jointly optimizes all the components for video compression. Specifically, learning based optical flow estimation is utilized to obtain the motion information and reconstruct the current frames. Then we employ two auto-encoder style neural networks to compress the corresponding motion and residual information. All the modules are jointly learned through a single loss function, in which they collaborate with each other by considering the trade-off between reducing the number of compression bits and improving quality of the decoded video. Experimental results show that the proposed approach can outperform the widely used video coding standard H.264 in terms of PSNR and be even on par with the latest standard H.265 in terms of MS-SSIM. Code is released at https://github.com/GuoLusjtu/DVC.

研究の動機と目的

  • 従来の手作業で設計されたモジュールに起因する制限を克服し、すべてのコンponentsを統合的に最適化するエンド・ツー・エンドのディープラーニングフレームワークを構築すること。
  • ビデオ圧縮に最適な動き表現と圧縮の学習方法を、単なる精度の向上ではなく、圧縮の観点から最適化すること。
  • すべてのネットワークコンponentsにわたる統一された率歪み損失関数を用いて、率歪み最適化を統合的に実現し、圧縮効率を向上させること。
  • ビデオ圧縮、コンピュータビジョン、ディープラーニングの間のギャップを埋めるために、モジュラーや拡張性に優れたフレームワークを提供すること。

提案手法

  • フレームワークは、従来のブロックベースの動き推定に代わって、深層ニューラルネットワークを用いてオプティカルフローを推定する。
  • 動きベクトルと残差フレームを圧縮する2つの自己符号化器型のニューラルネットワークを採用し、ビットレート削減のためのコンact表現を学習する。
  • 動き推定、圧縮、量子化、ビットレート推定のすべてのコンponentsが、1つの率歪み損失関数を用いて一括して学習される。
  • 損失関数は歪み(再構成品質)とレート(ビットレート)のバランスを調整し、効率的なエンド・ツー・エンド最適化を可能にする。
  • 勾配の流れと性能向上を図るため、動き補償および圧縮ネットワークにプリアクティベーション構造を備えた残差ブロックを採用する。
  • 高度なオプティカルフローおよび画像圧縮モデルのプラグイン統合をサポートしており、モジュラーサイズの拡張が可能である。

実験結果

リサーチクエスチョン

  • RQ1エンド・ツー・エンドのディープラーニングフレームワークは、動き推定、動き圧縮、残差圧縮を統合的に最適化できるか?
  • RQ2手作業で設計された動きベクトルではなく、ニューラルネットワークによる動き表現の学習は、より高い圧縮効率をもたらすか?
  • RQ3すべてのコンponentsにわたる統一された率歪み損失関数は、H.264 や H.265 といった従来のモジュラービデオコーデックを上回る性能を発揮できるか?
  • RQ4同等のビットレート下で、提案されたDVCモデルのPSNRおよびMS-SSIM性能は、H.264 や H.265 と比べてどのように差がつくか?

主な発見

  • PSNRで測定した場合、DVCはH.264に比べて19.22%のビットレート削減を達成し、優れた性能を示した。
  • MS-SSIMで測定した場合、DVCはH.264に比べて29%以上のビットレート削減を達成し、この指標においてH.265を上回った。
  • HEVC Class CおよびDデータセットにおいて、DVCはそれぞれH.264に比べて3.88%および9.68%のビットレート削減を達成した。
  • Kineticsデータセットで学習したモデルは、H.264および先行研究のベースライン手法よりも優れた性能を示した。
  • DVCはH.265と同等のMS-SSIM性能を達成しながらも、より少ないビットレートを用いたため、より優れた率歪み効率を示した。
  • PSNR基準でH.264と比較した場合のBDBRは19.22%、MS-SSIM基準では29.32%であり、DVCの圧縮優位性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。