[論文レビュー] FVC: A New Framework towards Deep Video Compression in Feature Space
本稿では、可変畳み込みとマルチフレーム特徴融合を用いて、動き推定、補償、残差圧縮をすべて特徴空間で実行する、FVCと呼ばれる新しい深層動画圧縮フレームワークを提案する。学習されたオフセットマップによる動的カーネルアライメントと、参照特徴の集約に非局所自己注意機構を活用することで、HEVC、UVG、VTL、MCL-JCVのデータセットにおいて最先端の性能を達成し、PSNRおよびBDレート効率の両面で先行手法を上回っている。
Learning based video compression attracts increasing attention in the past few years. The previous hybrid coding approaches rely on pixel space operations to reduce spatial and temporal redundancy, which may suffer from inaccurate motion estimation or less effective motion compensation. In this work, we propose a feature-space video coding network (FVC) by performing all major operations (i.e., motion estimation, motion compression, motion compensation and residual compression) in the feature space. Specifically, in the proposed deformable compensation module, we first apply motion estimation in the feature space to produce motion information (i.e., the offset maps), which will be compressed by using the auto-encoder style network. Then we perform motion compensation by using deformable convolution and generate the predicted feature. After that, we compress the residual feature between the feature from the current frame and the predicted feature from our deformable compensation module. For better frame reconstruction, the reference features from multiple previous reconstructed frames are also fused by using the non-local attention mechanism in the multi-frame feature fusion module. Comprehensive experimental results demonstrate that the proposed framework achieves the state-of-the-art performance on four benchmark datasets including HEVC, UVG, VTL and MCL-JCV.
研究の動機と目的
- 複雑な非剛性運動において不正確さを示す、従来のピクセルレベルの動き推定・補償に起因する深層動画圧縮の限界を是正すること。
- 学習されたオフセットマップを用いた可変畳み込みによる特徴空間での演算により、動き補償の正確性を向上させること。
- 非局所自己注意機構を用いて複数の過去の再構築済みフレームからの特徴を統合することで、フレーム再構築品質を向上させること。
- 特徴空間での演算をシームレスに統合するハイブリッドな深層動画圧縮フレームワークをエンドツーエンドで訓練可能とする。
- 既存の学習ベースの動画コーデックと比較して、優れた圧縮効率と再構築品質を達成すること。
提案手法
- 動き推定は特徴空間で実行され、可変畳み込みによる動き補償を導くオフセットマップを生成する。
- オフセットマップはオートエンコーダー形式のネットワークを用いて圧縮され、可変畳み込みで現在フレームの特徴を予測するために再構築される。
- 正解と予測された特徴の間の残差特徴は、別のオートエンコーダー形式のネットワークを用いて圧縮される。
- マルチフレーム特徴統合モジュールは、非局所自己注意を用いて複数の過去の再構築済みフレームからの特徴を統合し、初期再構築を精緻化する。
- すべてのモジュールはエンドツーエンドで訓練され、全フレームワークがレート・ディストーション性能最適化のために最適化される。
- ハイブリッド設計を採用しており、従来の動画コーデックの構造を維持しつつ、ピクセルレベルの演算を特徴空間での演算に置き換えている。
実験結果
リサーチクエスチョン
- RQ1可変畳み込みを用いた特徴空間での動き補償は、従来のピクセルレベルのオプティカルフローに基づく手法を上回る性能を示せるか?
- RQ2特徴空間で学習されたオフセットマップとして動き情報を圧縮することは、ピクセル空間でのオプティカルフローの圧縮よりも優れたレート・ディストーション性能をもたらすか?
- RQ3非局所自己注意を用いたマルチフレーム特徴統合は、複数の先行フレームからの時間的文脈を活用することで再構築品質を向上させられるか?
- RQ4すべてのコア演算(動き推定、補償、残差圧縮)を特徴空間で実行する場合に、深層動画圧縮ネットワークをエンドツーエンドで訓練することが可能か?
- RQ5提案されたFVCフレームワークは、HEVC、UVG、VTL、MCL-JCVを含む多様なベンチマークデータセットで最先端の性能を達成できるか?
主な発見
- HEVC Class Cデータセットにおいて、FVCはDVC*と比較して0.017 bppで1.75 dBのPSNR向上を達成し、特徴空間での動き補償の有効性を示した。
- 可変補償モジュールは、動きのズームインしたRaceHorsesシーケンスのパッチにおいて、動き符号化レートを65%削減するとともに、0.27 dBのPSNR向上を達成した。
- HEVC Class Dデータセットにおいて、FVCはH.265と比較してBDレートを-18.39%まで改善し、DVCおよびDVC*を上回った。
- FVC-basic(軽量版)は、BDレートを-7.09%まで改善し、1920×1080動画の推論時間を201msまで短縮した。
- マルチフレーム特徴統合モジュールは再構築品質に顕著な寄与を示しており、統合に347msの推論時間がかかっているが、さらなる最適化が可能である。
- 4つのベンチマークデータセットにおける包括的な実験から、FVCはPSNRおよびBDレートの両指標で最先端の性能を達成していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。