Skip to main content
QUICK REVIEW

[論文レビュー] CVEGAN: A Perceptually-inspired GAN for Compressed Video Enhancement

Di Ma, Fan Zhang|arXiv (Cornell University)|Nov 18, 2020
Advanced Image Processing Techniques参考文献 94被引用数 8
ひとこと要約

CVEGANは、マルチレベルリーマンブロック(Mul 2 Res)、強化されたリーマン非局所ブロック(ERNB)、および強化されたCBAM(ECBAM)を統合した、圧縮動画の品質向上を目的としたGANアーキテクチャを提案する。加えて、相対的球面GAN(ReSphereGAN)トレーニング戦略とデータ駆動型の知覚的損失関数を採用している。Post-processingと空間的解像度変換の両方において、HEVC HM16.20と比較して最大28%および38%のコーディングゲインを達成し、アーチファクトを低減させながらも、より洗練されたテクスチャの詳細を実現することで、知覚的品質が著しく向上した。

ABSTRACT

We propose a new Generative Adversarial Network for Compressed Video quality Enhancement (CVEGAN). The CVEGAN generator benefits from the use of a novel Mul2Res block (with multiple levels of residual learning branches), an enhanced residual non-local block (ERNB) and an enhanced convolutional block attention module (ECBAM). The ERNB has also been employed in the discriminator to improve the representational capability. The training strategy has also been re-designed specifically for video compression applications, to employ a relativistic sphere GAN (ReSphereGAN) training methodology together with new perceptual loss functions. The proposed network has been fully evaluated in the context of two typical video compression enhancement tools: post-processing (PP) and spatial resolution adaptation (SRA). CVEGAN has been fully integrated into the MPEG HEVC video coding test model (HM16.20) and experimental results demonstrate significant coding gains (up to 28% for PP and 38% for SRA compared to the anchor) over existing state-of-the-art architectures for both coding tools across multiple datasets.

研究の動機と目的

  • 単純な損失関数と浅いネットワークに依存する従来の圧縮動画強化手法の限界を解消すること。
  • 高度なディープラーニングアーキテクチャと知覚的に整合したトレーニングを活用して、動画圧縮における知覚的品質を向上させること。
  • 最小限のビットレートオーバーヘッドで、HEVCにおけるポストプロセッシングおよび空間的解像度変換の両方を強化するGANベースのフレームワークを開発すること。
  • GANトレーニングの安定化と人間の視覚的認知に適したアライメントを実現するトレーニング戦略を設計すること。
  • 複数のデータセットおよび実世界の動画コーディングシナリオにおいて、提案手法の有効性を検証すること。

提案手法

  • 複数のブランチと異なるカーネルサイズを持つマルチレベルリーマン学習アーキテクチャを備えたMul 2 Resブロックを導入し、特徴表現の向上とネットワークの濃度を強化する。
  • 生成器およびディスクリミネータの両方で、長距離依存性を捉え、特徴モデリングを向上させるために、強化されたリーマン非局所ブロック(ERNB)を採用する。
  • 重要な空間的およびチャネル特徴に動的に注目できるように、強化された畳み込みブロック注意モジュール(ECBAM)を統合する。
  • 超球面上の測地線距離を用いることで、トレーニングの安定化と生成画像と偽物サンプルのアライメントを向上させる、相対的球面GAN(ReSphereGAN)トレーニング手法を採用する。
  • 4つの損失成分の対数の組み合わせからなる新規な知覚的損失関数を提案し、8つの主観的動画品質データベースからのデータを用いて重みを最適化する。
  • エンドツーエンドの評価を実現するため、CVEGANをHEVC HM16.20のテストモデルに統合し、ポストプロセッシングおよび空間的解像度変換の両シナリオで評価する。

実験結果

リサーチクエスチョン

  • RQ1可変カーネルサイズを持つマルチレベルリーマンブロックは、標準的なリーマンブロックと比較して、動画強化性能を向上させることができるか?
  • RQ2強化された注目機構および非局所機構(ERNB, ECBAM)は、圧縮動画強化における知覚的品質にどの程度寄与するか?
  • RQ3ReSphereGANトレーニング戦略は、従来のGANと比較して、動画強化においてより安定したトレーニングと優れた知覚的結果をもたらすか?
  • RQ4提案されたデータ駆動型知覚的損失関数は、モデル出力と人間の視覚的品質評価をどの程度うまく一致させられるか?
  • RQ5同一ビットレート下で、ポストプロセッシングおよび空間的解像度変換の両方において、CVEGANは最先端手法に対してどの程度のコーディングゲインを達成するか?

主な発見

  • CVEGANは、複数のデータセットにおいて、HEVC HM16.20アンカーと比較して、ポストプロセッシングタスクで最大28%のコーディングゲインを達成した。
  • 空間的解像度変換においては、ベースラインと比較して最大38%のコーディングゲインを達成し、優れた性能を示した。
  • 主観的評価では、CVEGANの出力がHEVC、RNAN、MSRGANと比較してブロッキングアーチファクトが少なく、より豊かなテクスチャの詳細と高いコントラストを示していることが確認された。
  • 提案されたReSphereGANトレーニング手法は、トレーニングの安定化を図り、超球面上での生成特徴とターゲット特徴の乖離を低減した。
  • 実際の主観的データを用いて最適化された知覚的損失関数は、人間の視覚的品質評価と強い相関を示した。
  • 図1および図10~13の視覚的比較では、PPおよびSRAの両シナリオにおいて、CVEGANが最先端のモデルを一貫して上回っていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。