Skip to main content
QUICK REVIEW

[論文レビュー] Perceptual Learned Video Compression with Recurrent Conditional GAN

Ren Yang, Radu Timofte|arXiv (Cornell University)|Sep 7, 2021
Advanced Image Processing Techniques被引用数 5
ひとこと要約

本稿では、空間的・時間的・隠れ状態特徴量に条件付けられた再帰的畳み込み生成対抗ネットワーク(GAN)を用いた知覚的学習済み動画圧縮(PLVC)フレームワークを提案する。再帰的オートエンコーダー生成器は、判別器によって敵対的に訓練され、低ビットレートでも写真のようにリアルで時間的に整合性のある動画を生成する。本手法は、複数の指標およびユーザースタディーにおいて、HEVC(HM 16.20)および既存の学習済み動画圧縮モデルを上回る知覚的品質を達成する。

ABSTRACT

This paper proposes a Perceptual Learned Video Compression (PLVC) approach with recurrent conditional GAN. We employ the recurrent auto-encoder-based compression network as the generator, and most importantly, we propose a recurrent conditional discriminator, which judges on raw vs. compressed video conditioned on both spatial and temporal features, including the latent representation, temporal motion and hidden states in recurrent cells. This way, the adversarial training pushes the generated video to be not only spatially photo-realistic but also temporally consistent with the groundtruth and coherent among video frames. The experimental results show that the learned PLVC model compresses video with good perceptual quality at low bit-rate, and that it outperforms the official HEVC test model (HM 16.20) and the existing learned video compression approaches for several perceptual quality metrics and user studies. The codes will be released at the project page: https://github.com/RenYang-home/PLVC.

研究の動機と目的

  • 従来の歪み最適化手法に比べて知覚的品質を向上させるという知覚的動画圧縮におけるギャップを埋める。
  • 圧縮フレームにおいて写真的テクスチャと時間的整合性を保持する動画圧縮モデルを開発する。
  • エンドツーエンド動画圧縮に向けた再帰的かつ条件付き判別器を用いた敵対的訓練の有効性を検証する。
  • 客観的指標およびユーザースタディーを用いて知覚的性能を評価し、HEVCおよび先行の学習済み手法を上回ることを示す。

提案手法

  • 時間的記憶を隠れ状態を介して保持する再帰的オートエンコーダー型生成器を採用し、フレームを圧縮・再構築する。
  • 潜在表現、動き特徴量、再帰的隠れ状態に条件付けられた再帰的条件付き判別器を導入し、生動画と圧縮動画を評価する。
  • 空間的および時間的文脈を活用することで、ビットレート、歪み、知覚的品質のバランスを取る多条件敵対的損失を設計する。
  • 誤差伝播を制限し長期的な時間的モデリングを可能にするために、Bi-IPPP GOP 構造(9フレームごとにIフレームを配置)を採用する。
  • 提案された判別器とGAN損失を、DVCを含む複数のバックボーンに適用し、主なPLVCアーキテクチャを超えた汎用性を示す。
  • 生成器が知覚的損失を最小化するように、エンドツーエンドで敵対的最適化を実行する。判別器は、本物の動画と再構築された動画を識別する。

実験結果

リサーチクエスチョン

  • RQ1再帰的条件付きGANは、低ビットレート効率を維持したまま、学習済み動画圧縮における知覚的品質を向上させることができるか?
  • RQ2判別器に隠れ状態および動き特徴量を条件付けすることで、圧縮動画の時間的整合性がどの程度向上するか?
  • RQ3提案された敵対的訓練フレームワークは、HEVC(HM 16.20)のような歪み最適化モデルを上回る知覚的品質指標およびユーザーパーセプションを達成するか?
  • RQ4提案された判別器は、異なる動画圧縮アーキテクチャにどの程度一般化可能か?
  • RQ5判別器における空間的・時間的・隠れ状態の条件付けを削除した場合、知覚的品質およびアーティファクト生成にどのような影響が生じるか?

主な発見

  • 提案されたPLVCモデルは、HEVC(0.0813 bpp)よりも低いビットレート(0.0730 bpp)を達成しながら、視覚的比較で著しく写真的テクスチャを再現している。
  • ユーザースタディー(MOS)では、特に低ビットレートにおいて、PLVCがHEVCおよび既存の学習済み動画圧縮手法を上回る知覚的品質を示している。
  • LPIPS、FID、KID指標により、PLVCがHM 16.20およびベースラインの学習済みモデルを上回る優れた知覚的品質を達成していることが確認された。
  • アブレーションスタディーでは、判別器から時間的条件(隠れ状態および動き特徴量)を削除すると、時間的整合性および知覚的品質が低下し、MOS値が歪み最適化モデルを下回ることが示された。
  • 提案された再帰的条件付き判別器は効果的に一般化可能である:DVCに適用した場合、FIDおよびKID指標が向上し、HM 16.20を上回る性能を示した。これにより、広範な適用可能性が裏付けられた。
  • GOP内のPフレームにおいて顕著な誤差伝播は観察されず、Bi-IPPP構造と再帰的記憶が時間的事前知識を保持していることが要因とされている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。