[論文レビュー] Versatile Learned Video Compression
本稿では、3次元ボクセルフローを用いた動き補償と多項式ベースのフローピドクションにより、ビットコストを低減する統合的深層学習フレームワークであるVersatile Learned Video Compression(VLVC)を提案する。VLVCは、単方向、双方向、複数参照フレームを含むすべてのインターピクチャリングモードをサポートし、VVC/H.266基準と比較して優れたMS-SSIM性能を達成しており、MS-SSIMでVVCを上回る最初のエンド・ツー・エンドの学習済み動画コーデックである。
Learned video compression methods have demonstrated great promise in catching up with traditional video codecs in their rate-distortion (R-D) performance. However, existing learned video compression schemes are limited by the binding of the prediction mode and the fixed network framework. They are unable to support various inter prediction modes and thus inapplicable for various scenarios. In this paper, to break this limitation, we propose a versatile learned video compression (VLVC) framework that uses one model to support all possible prediction modes. Specifically, to realize versatile compression, we first build a motion compensation module that applies multiple 3D motion vector fields (i.e., voxel flows) for weighted trilinear warping in spatial-temporal space. The voxel flows convey the information of temporal reference position that helps to decouple inter prediction modes away from framework designing. Secondly, in case of multiple-reference-frame prediction, we apply a flow prediction module to predict accurate motion trajectories with unified polynomial functions. We show that the flow prediction module can largely reduce the transmission cost of voxel flows. Experimental results demonstrate that our proposed VLVC not only supports versatile compression in various settings, but also is the first end-to-end learned video compression method that outperforms the latest VVC/H.266 standard reference software in terms of MS-SSIM.
研究の動機と目的
- 既存の学習済み動画コーデックが固定された予測モードやネットワークアーキテクチャに束縛されているという制限を克服すること。
- 低遅延(単方向)およびランダムアクセス(双方向)の両方の構成を含む、多様なコーディングシナリオを1つのモデルでサポートできること。
- 予測精度を損なわず、複数参照フレーム予測における動き情報の送信ビットコストを低減すること。
- すべてのインターピクチャリングモードで、VVCなどの従来の基準と同等またはそれを上回るレート・ディストーション性能を達成すること。
提案手法
- 複数の3次元動きベクトル場(ボクセルフロー)を用いて空間的・時間的動きを表現するボクセルフローに基づく動き補償モジュールを採用し、任意の参照フレームに対して柔軟なインターピクチャリングを可能にする。
- 複数のボクセルフローを用いた重み付き三線形ワープを適用して、ターゲットフレームの画素を合成することで、単一フロー手法よりも高い動き補償精度を実現する。
- 動きの軌道を一様にモデル化する多項式ベースのフローピドクションモジュールを導入し、完全なボクセルフローを送信する必要を減らし、エンコードコストを低減する。
- 予測モードとネットワーク設計を分離する統一されたアーキテクチャを用いてエンド・ツー・エンドで学習し、あらゆる可能なインターピクチャリングモードのサポートを可能にする。
- 動き情報は学習済みエントロピー・モデルを用いて符号化され、単一および複数の参照フレームの両方を一貫した性能でサポートする。
- 標準のHEVCおよびVVCテストシーケンスを用いて評価され、公平な比較を保つために一貫した前処理および評価パイプラインが採用された。
実験結果
リサーチクエスチョン
- RQ1固定されたアーキテクチャの再トレーニングなしに、単方向、双方向、複数参照フレームを含むすべてのインターピクチャリングモードを1つの学習済み動画圧縮モデルがサポートできるか?
- RQ2空間的・時間的任意の参照フレーム位置に対応できるほど、動き補償をどれほど柔軟にできるか?
- RQ3多項式関数に基づく統一されたフローピドクションモジュールは、動き情報のビットコストを低減しつつ高い予測精度を維持できるか?
- RQ4提案されたフレームワークは、最新のVVC/H.266基準を上回るレート・ディストーション性能を達成するか、特に知覚的品質(MS-SSIM)の観点で?
- RQ5アーキテクチャの変更なしに、低遅延とランダムアクセスの両方のコーディング構成に一般化できるか?
主な発見
- VLVCは、テストされたすべてのシーケンスでVVC/H.266のリファレンスソフトウェアをMS-SSIMの観点で上回る最初のエンド・ツー・エンドの学習済み動画圧縮モデルである。
- 重み付き三線形ワープを用いた複数のボクセルフローの使用により、動き補償の精度が向上し、残差エネルギーが低減され、より効率的な圧縮が可能になった。
- 多項式ベースのフローピドクションモジュールは、特に複数参照フレームのシナリオにおいて、動き情報の送信ビットコストを顕著に低減した。
- VLVCは、低遅延およびランダムアクセスの構成を含む、すべてのインターピクチャリングモードで競争力のあるレート・ディストーション性能を達成した。
- 主観的評価では、同じビットレートでVVCの再構成フレームと比較して、VLVCの再構成フレームがよりシャープで、テクスチャが豊かであることが示された。
- 多様な動画コンテンツおよびコーディング構成にわたり、高い性能を維持し、優れた一般化能力と多様性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。