Skip to main content
QUICK REVIEW

[論文レビュー] Improving Deep Video Compression by Resolution-adaptive Flow Coding

Zhihao Hu, Zhenghao Chen|arXiv (Cornell University)|Sep 13, 2020
Advanced Vision and Imaging参考文献 32被引用数 5
ひとこと要約

本稿では、深層動画圧縮のための新規フレームワークである分解能適応型フローディング(RaFC)を提案する。この手法は、運動量マップの最適な分解能表現を、フレーム単位(RaFC-frame)およびブロック単位(RaFC-block)で、率歪み最適化を用いて動的に選択する。運動の複雑さに応じて高分解能または低分解能のフローマップと運動特徴量を選択することで、最先端の性能を達成し、ベースラインのDVC手法と比較して運動量の符号化ビットを最大70%削減しながら、高い再構成品質を維持する。

ABSTRACT

In the learning based video compression approaches, it is an essential issue to compress pixel-level optical flow maps by developing new motion vector (MV) encoders. In this work, we propose a new framework called Resolution-adaptive Flow Coding (RaFC) to effectively compress the flow maps globally and locally, in which we use multi-resolution representations instead of single-resolution representations for both the input flow maps and the output motion features of the MV encoder. To handle complex or simple motion patterns globally, our frame-level scheme RaFC-frame automatically decides the optimal flow map resolution for each video frame. To cope different types of motion patterns locally, our block-level scheme called RaFC-block can also select the optimal resolution for each local block of motion features. In addition, the rate-distortion criterion is applied to both RaFC-frame and RaFC-block and select the optimal motion coding mode for effective flow coding. Comprehensive experiments on four benchmark datasets HEVC, VTL, UVG and MCL-JCV clearly demonstrate the effectiveness of our overall RaFC framework after combing RaFC-frame and RaFC-block for video compression.

研究の動機と目的

  • 深層動画圧縮における単一分解能のフローマップ表現の限界を是正すること。これは、フレーム間の運動の複雑さの変動に適応できないためである。
  • グローバル(フレーム単位)およびローカル(ブロック単位)の運動特徴量に対して、分解能の動的選択を可能にすることで、運動情報の符号化を改善すること。
  • 各フレームやブロックに対して最も効率的な分解能を自動的に選択することにより、運動量符号化における率歪みトレードオフを最適化すること。
  • DVCやH.264、H.265といった既存の深層学習ベースの手法と比較して、優れた動画圧縮性能を達成すること。

提案手法

  • 運動の複雑さと率歪み(RD)基準に基づき、全体のフローマップに対して最適な分解能を選択するフレーム単位の手法であるRaFC-frameを提案する。
  • 各ローカルブロックの運動特徴量に対して個別に分解能を選択することで、局所的な運動パターンに適合するブロック単位の手法であるRaFC-blockを導入する。
  • 分解能適応を可能にするために、入力の光学的フローマップおよび出力の運動特徴量の両方に対して、マルチ分解能表現を採用する。
  • フレームおよびブロックレベルで、率歪み最適化フレームワークを用いて最良の分解能選択を決定し、ビットコストを最小限に抑えつつ品質を保持する。
  • RaFC-frameとRaFC-blockを統合した統一されたRaFCフレームワークを構築し、動画全体にわたる分解能選択を共同で最適化する。
  • 運動ベクトル符号化および残差符号化の両方に対して、RD最適化された分解能選択を適用することで、全体の圧縮効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1マルチ分解能のフローマップ表現は、深層動画圧縮における運動量符号化効率を向上させ得るか?
  • RQ2グローバルな運動の複雑さに基づくフレーム単位の分解能適応は、より優れた率歪み性能をもたらすか?
  • RQ3局所的な運動パターンに基づくブロック単位の分解能選択は、さらに圧縮効率を向上させ得るか?
  • RQ4フレーム単位とブロック単位の両方の分解能適応を組み合わせた手法は、単一分解能のベースラインと比較してどのように差がつくか?
  • RQ5分解能適応により、視覚的品質を損なわず、運動量符号化ビットをどの程度削減できるか?

主な発見

  • 4つのベンチマークデータセット(HEVC Class E、VTL、UVG、MCL-JCV)において、RaFCフレームワークはH.264、H.265、およびベースラインのDVC手法を上回る性能を示した。
  • 同じPSNR条件下で、ベースラインのDVC手法と比較して、運動量符号化ビットを最大70%削減し、運動量圧縮効率を顕著に向上させた。
  • 低ビットレート(低λ)では、低分解能のフローマップと大きなブロックが選択され、ビットの節約を図る従来の圧縮戦略と整合的である。
  • 高ビットレート(高λ)では、徐々に高分解能のフローマップと小さなブロックが選択され、利用可能なビット量に応じて高精度な詳細を活用する適応的使用が行われていることが示された。
  • 可視化結果から、高運動領域(例:物体の境界)では小さなブロックが優先的に選択され、滑らかな領域では大きなブロックが使用されることが確認され、運動の複雑さと整合的である。
  • RaFCでは、DVCと比較して運動量符号化に使用されるビットの割合が顕著に低下した。例えばλ=256のとき、61.11%から38.89%に減少した。これは、運動量のビットコストが顕著に削減されたことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。