Skip to main content
QUICK REVIEW

[論文レビュー] Neural Video Coding using Multiscale Motion Compensation and Spatiotemporal Context Model

Haojie Liu, Ming Lu|arXiv (Cornell University)|Jul 9, 2020
Advanced Image Processing Techniques参考文献 44被引用数 4
ひとこと要約

本稿では、ピラミッドデコーダーを用いたマルチスケール運動補償と、新規のマルチスケール運動補償ネットワーク(MS-MCN)を活用するエンドツーエンドのニューラル動画符号化フレームワーク(NVC)を提案する。さらに、適応的空間時間的文脈モデルと非局所注意機構を導入し、レート・ディストーション性能を向上させた。NVCは、多様な動画シーケンスにおいてH.265/HEVCおよび他の学習型動画符号化方式を上回る一貫した性能向上を達成し、PSNRで平均-50.83%、MS-SSIMで-46.52%のBDレート削減を実現した。

ABSTRACT

Over the past two decades, traditional block-based video coding has made remarkable progress and spawned a series of well-known standards such as MPEG-4, H.264/AVC and H.265/HEVC. On the other hand, deep neural networks (DNNs) have shown their powerful capacity for visual content understanding, feature extraction and compact representation. Some previous works have explored the learnt video coding algorithms in an end-to-end manner, which show the great potential compared with traditional methods. In this paper, we propose an end-to-end deep neural video coding framework (NVC), which uses variational autoencoders (VAEs) with joint spatial and temporal prior aggregation (PA) to exploit the correlations in intra-frame pixels, inter-frame motions and inter-frame compensation residuals, respectively. Novel features of NVC include: 1) To estimate and compensate motion over a large range of magnitudes, we propose an unsupervised multiscale motion compensation network (MS-MCN) together with a pyramid decoder in the VAE for coding motion features that generates multiscale flow fields, 2) we design a novel adaptive spatiotemporal context model for efficient entropy coding for motion information, 3) we adopt nonlocal attention modules (NLAM) at the bottlenecks of the VAEs for implicit adaptive feature extraction and activation, leveraging its high transformation capacity and unequal weighting with joint global and local information, and 4) we introduce multi-module optimization and a multi-frame training strategy to minimize the temporal error propagation among P-frames. NVC is evaluated for the low-delay causal settings and compared with H.265/HEVC, H.264/AVC and the other learnt video compression methods following the common test conditions, demonstrating consistent gains across all popular test sequences for both PSNR and MS-SSIM distortion metrics.

研究の動機と目的

  • モバイルの法則の限界に起因する、手作業で設計されたツールに依存する伝統的なブロックベース動画符号化の限界を是正するため、エンドツーエンドのディープラーニングベースの動画符号化フレームワークを開発すること。
  • 大規模な運動ベクトルに対しても予測精度と耐性を向上させるために、マルチスケールの運動補償ネットワーク(MS-MCN)とピラミッドデコーダーを導入し、マルチスケールの光流を生成すること。
  • VAEボトルネックからの空間的、時間的、ハイパープライア情報とを統合した適応的文脈モデルを用いて、運動情報の空間時間的相関をモデル化し、エントロピー符号化の効率を向上させること。
  • 予測符号化における時間的誤差伝搬を軽減するため、複数の連続するPフレームにおける再構成誤差を最小化するマルチフレーム学習戦略を採用すること。
  • 内部符号化、運動符号化、残差符号化の各コンponentを統合最適化することで、H.265/HEVCや既存の学習型動画符号化方式を上回る優れたレート・ディストーション性能を達成すること。

提案手法

  • NVCフレームワークは、ニューロ・イントラ、ニューロ・モーション、ニューロ・リジデュアルの3つの独立した変分オートエンコーダー(VAE)を用い、エンドツーエンドでインラインピクセル、運動、残差情報を圧縮する。
  • 複数スケールでの運動推定と補償を可能にする新規のマルチスケール運動補償ネットワーク(MS-MCN)を導入し、予測精度を向上させるマルチスケールのフロー場を生成する。
  • ニューロ・モーション VAE におけるピラミッドデコーダーにより、運動特徴の階層的表現が可能となり、効率的なマルチスケールフロー推定と再構成が実現される。
  • 空間的文脈、前フレームからの時間的文脈、VAEボトルネックからのハイパープライアを統合してモデル化する適応的空間時間的文脈モデルを設計し、エントロピー符号化の効率を向上させる。
  • VAEボトルネックに非局所注意モジュール(NLAM)を統合し、グローバルおよびローカルの受容 field を持つ適応的特徴を暗黙的に抽出することで、表現能力を向上させる。
  • マルチモジュール最適化とマルチフレーム学習戦略を採用し、複数の連続するPフレームにおける再構成誤差を統合的に最適化することで、時間的誤差伝搬を低減する。

実験結果

リサーチクエスチョン

  • RQ1ディープニューラルネットワークベースの動画符号化フレームワークは、H.265/HEVCのような伝統的なブロックベースコアープに比べ、レート・ディストーション効率で優れていると言えるか?
  • RQ2ピラミッドデコーダーを用いたマルチスケール運動補償は、特に大規模な運動ベクトルに対して、運動推定と予測精度を顕著に向上させるか?
  • RQ3適応的空間時間的文脈モデルは、空間的文脈とハイパープライアを上回る運動情報のエントロピー符号化効率を向上させられるか?
  • RQ4マルチフレーム学習は、予測符号化における時間的誤差伝搬をどの程度低減し、安定性を向上させるか?
  • RQ5VAEボトルネックに非局所注意モジュールを統合することで、動画特徴の表現品質と符号化効率にどのような影響を与えるか?

主な発見

  • NVCは、すべてのテストシーケンスにおいてH.265/HEVCと比較して、PSNRで平均-50.83%、MS-SSIMで-46.52%のBDレート削減を達成し、一貫した優位性を示した。
  • 提案されたMS-MCNにピラミッドデコーダーを組み合わせた手法は、段階的なノイズ除去ネットワークを用いた単一スケールの運動補償を上回り、幅広いビットレート範囲で0.2–0.3 dBのPSNR向上を達成した。
  • マルチフレーム学習は時間的安定性と性能の一貫性を顕著に向上させ、GOP全体にわたる品質劣化を単一フレーム学習と比較して低減した。
  • 高運動度コンテンツでは時間的プライアが運動情報の圧縮に最も寄与し、HEVC Class Eデータセットでは最大58.63%のビット削減が達成された。
  • 適応的空間時間的文脈モデルは、空間、時間、ハイパープライアの相関を効率的にモデル化することで、特に高運動度シーケンスにおいて運動ビットレートを削減した。
  • 非局所注意モジュールの導入により、長距離依存性を捉える能力が向上し、再構成品質と符号化効率の両方を改善した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。