Skip to main content
QUICK REVIEW

[論文レビュー] Content Adaptive and Error Propagation Aware Deep Video Compression

Guo Lu, Chunlei Cai|arXiv (Cornell University)|Mar 25, 2020
Advanced Data Compression Techniques参考文献 34被引用数 10
ひとこと要約

本論文は、複数の連続フレームにわたる率歪み性能を統合最適化することで、誤差蓄積を軽減するコンテンツに適応した、誤差伝播に配慮した深層動画符号化フレームワークを提案する。推論中にオンラインエンコーダー更新機構を導入することで、モデルサイズや復号の計算複雑度を増大させることなく、動画コンテンツに適応したエンコーダーに変更可能であり、ベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

Recently, learning based video compression methods attract increasing attention. However, the previous works suffer from error propagation due to the accumulation of reconstructed error in inter predictive coding. Meanwhile, the previous learning based video codecs are also not adaptive to different video contents. To address these two problems, we propose a content adaptive and error propagation aware video compression system. Specifically, our method employs a joint training strategy by considering the compression performance of multiple consecutive frames instead of a single frame. Based on the learned long-term temporal information, our approach effectively alleviates error propagation in reconstructed frames. More importantly, instead of using the hand-crafted coding modes in the traditional compression systems, we design an online encoder updating scheme in our system. The proposed approach updates the parameters for encoder according to the rate-distortion criterion but keeps the decoder unchanged in the inference stage. Therefore, the encoder is adaptive to different video contents and achieves better compression performance by reducing the domain gap between the training and testing datasets. Our method is simple yet effective and outperforms the state-of-the-art learning based video codecs on benchmark datasets without increasing the model size or decreasing the decoding speed.

研究の動機と目的

  • 相互フレーム予測における累積的再構成誤差によって引き起こされる学習ベースの動画符号化における誤差伝播を緩和すること。
  • 動画コンテンツに応じて推論中にエンコーダーを動的に更新することで、コンテンツ適応型符号化を実現すること。
  • モデルサイズや復号計算複雑度を増加させることなく、符号化効率を向上させること。
  • トレーニングデータとテストデータのドメインギャップを、多様な動画コンテンツに適応したエンコーダーの適応によって低減すること。

提案手法

  • 本手法は、1フレームではなくT個の連続フレームのシーケンス全体の率歪みコストを最小化する共同学習戦略を採用し、長期的な時間的依存関係を活用する。
  • オンラインエンコーダー更新(OEU)スキームを導入し、推論中に各フレームごとに率歪み基準に基づいてエンコーダーのパラメータを最適化するが、デコーダーは固定されたままに保つ。
  • エンコーダーは率歪み最適化目的関数を用いて繰り返し更新され、動きの複雑さやコンテンツの特徴に応じた適応が可能になる。
  • マルチフレーム最適化を用いたエンドツーエンド学習により、手動で設計された符号化モードに依存せず、各フレームごとに最適な符号化戦略を学習する。
  • デコーダーを固定することで、復号時間やモデルサイズに増加が生じず、コンテンツ固有のエンコーダー適応が可能になる。
  • トレーニング目的関数には時間間隔Tを組み込み、長期的誤差伝播をモデル化する。実験により、T=5が最適な性能を示した。

実験結果

リサーチクエスチョン

  • RQ1長期的な時間的依存関係を活用することで、トレーニング段階で深層動画符号化における誤差伝播をどのように軽減できるか?
  • RQ2推論中にオンラインでエンコーダーを適応させることで、多様な動画コンテンツに対して符号化性能が向上するか?
  • RQ3提案手法は、モデルサイズや復号複雑度を増加させることなく、最先端の学習ベース符号化方式を上回る率歪み性能を達成するか?
  • RQ4共同学習目的関数における時間間隔Tの選択が、誤差伝播および符号化効率にどのように影響するか?

主な発見

  • 共同学習目的関数に時間間隔T=5を用いた場合、ベースラインと比較してビットレートを5.59%削減した。
  • オンラインエンコーダー更新(OEU)スキームにより、ベースラインと比較して率歪み性能が0.5 dB以上向上した。
  • EPAトレーニングとOEUを組み合わせた完全な手法は、モデルサイズや復号複雑度を増加させることなく、最先端の手法[19]を上回る性能を達成した。
  • 単純なシーン(例:HEVC Class B)ではエンコーダー更新に3回のイテレーションで十分であり、複雑なシーン(例:HEVC Class C)ではより多くのイテレーションを要したが、複雑なケースで1 dBの性能向上を達成した。
  • 複雑な動画シーケンスにおいて、提案手法の符号化速度(1.4 fps)はH.265(0.1 fps)よりも顕著に高速であり、実用的妥当性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。