Skip to main content
QUICK REVIEW

[論文レビュー] Neural Video Compression using Spatio-Temporal Priors

Haojie Liu, Tong Chen|arXiv (Cornell University)|Feb 20, 2019
Advanced Image Processing Techniques参考文献 19被引用数 10
ひとこと要約

本論文は、空間的プライオリティ(低解像度特徴からの空間的プライオリティ)と時間的プライオリティ(ConvLSTMベースの再帰的ネットワークによる)を統合したニューラル動画圧縮フレームワークを提案する。学習されたプライオリティを用いてフレーム内テクスチャ、動き、残差をモデル化することで、MS-SSIM を歪度指標として用いた場合、HEVC Main Profile よりも平均 38% の Bjontegaard-Delta Rate (BD-Rate) の向上を達成した。

ABSTRACT

The pursuit of higher compression efficiency continuously drives the advances of video coding technologies. Fundamentally, we wish to find better "predictions" or "priors" that are reconstructed previously to remove the signal dependency efficiently and to accurately model the signal distribution for entropy coding. In this work, we propose a neural video compression framework, leveraging the spatial and temporal priors, independently and jointly to exploit the correlations in intra texture, optical flow based temporal motion and residuals. Spatial priors are generated using downscaled low-resolution features, while temporal priors (from previous reference frames and residuals) are captured using a convolutional neural network based long-short term memory (ConvLSTM) structure in a temporal recurrent fashion. All of these parts are connected and trained jointly towards the optimal rate-distortion performance. Compared with the High-Efficiency Video Coding (HEVC) Main Profile (MP), our method has demonstrated averaged 38% Bjontegaard-Delta Rate (BD-Rate) improvement using standard common test sequences, where the distortion is multi-scale structural similarity (MS-SSIM).

研究の動機と目的

  • 手動で設計されたコーディングツールに代わって、データ駆動型でエンドツーエンドに学習されたプライオリティを用いることで、動画圧縮効率を向上させること。
  • ダウンスケーリングされた低解像度特徴を空間的プライオリティとして用いて、フレーム内の空間相関を活用すること。
  • 動きと残差の統計を複数フレームにわたって捉えるために、ConvLSTM ベースの再帰的ネットワークを用いて時間的依存関係をモデル化すること。
  • 共通のプライオリティを用いてフレーム内、フレーム間、および残差符号化を統合的に最適化することで、レート・歪度性能を最適化すること。
  • 標準テストシーケンスと MS-SSIM を用いた歪度指標に基づく比較において、HEVC や H.264/AVC と比較して最先端の性能を達成すること。

提案手法

  • フレーム内符号化のための空間的プライオリティは、現在のフレームを集約的にダウンスケーリングすることで低解像度特徴を生成する。
  • 時間的プライオリティは、以前に再構築されたフレームと残差を再帰的に処理する ConvLSTM を用いて捉える。
  • 効率的な潜在表現とエントロピー符号化のため、GDN 活性化関数とハイパープライオリティを備えた変分オートエンコーダを採用する。
  • 残差は、以前の残差、潜在特徴、時間的隠れ状態を条件として持つ結合確率分布でモデル化する。
  • 学習された平均と分散を持つガウス分布に基づく累積分布関数(CDF)を用いて、正確なエントロピーモデリングを実現する。
  • 2段階のエンドツーエンド学習が実施される:まずフレーム内符号化ネットワークとフロー(動き)ネットワークの事前学習を行い、その後、MS-SSIM と L1/ワープ損失を組み合わせたレート・歪度損失を用いて統合最適化を行う。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークを用いて学習された統合的空間的・時間的プライオリティは、従来の手動設計ツールを上回る動画圧縮効率を著しく向上させることができるか?
  • RQ2ConvLSTM ベースの再帰的ネットワークは、動画圧縮における動きと残差予測の長期的時間的依存関係をどの程度効果的にモデル化できるか?
  • RQ3低解像度特徴から導出される空間的プライオリティは、フレーム内符号化性能をどの程度向上させることができるか?
  • RQ4空間的、時間的、および残差プライオリティを統合的にモデリングすることで、より優れたエントロピー符号化とレート・歪度トレードオフが達成できるか?
  • RQ5同じ品質指標(MS-SSIM)を用いた場合、提案されたニューラルフレームワークは HEVC や H.264/AVC と比較してどの程度の BD-Rate の向上を示すか?

主な発見

  • 提案されたニューラル動画圧縮フレームワークは、標準テストシーケンス全体で HEVC Main Profile よりも平均 38.12% の BD-Rate 減少を達成した。
  • KristenAndSara シーケンスでは、96.96% の BD-Rate の向上を達成しており、高動的コンテンツにおいて優れた性能を示している。
  • MS-SSIM 約 0.988 のターゲット品質において、ビットレートの大幅な削減が実現され、H.264/AVC High Profile や HEVC Main Profile を上回った。
  • オプティカルフローと ConvLSTM ベースの時間的モデリングの併用により、従来のブロックベースの動き推定よりも正確な動き予測が可能になった。
  • 空間的・時間的・残差プライオリティの統合的モデリングにより、エントロピー符号化効率が向上し、その結果、レート・歪度性能が向上したことが裏付けられた。
  • フレームスナップショットによる確認により、HEVC や H.264/AVC よりも低いビットレートでも高い視覚的品質を維持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。