Skip to main content
QUICK REVIEW

[論文レビュー] Perceptual Video Super Resolution with Enhanced Temporal Consistency

Eduardo Pérez-Pellitero, Mehdi S. M. Sajjadi|arXiv (Cornell University)|Jul 20, 2018
Advanced Image Processing Techniques参考文献 37被引用数 4
ひとこと要約

本稿では、動画識別器と新しい時間的整合性損失を備えた再帰的生成対抗ネットワークを提案し、知覚的動画スーパーレゾリューションにおいて、再帰的特徴伝搬とマルチフレームワープを活用することで、知覚的品質を向上させるとともにフレッケーリングを低減し、最先端の結果を達成した。

ABSTRACT

With the advent of perceptual loss functions, new possibilities in super-resolution have emerged, and we currently have models that successfully generate near-photorealistic high-resolution images from their low-resolution observations. Up to now, however, such approaches have been exclusively limited to single image super-resolution. The application of perceptual loss functions on video processing still entails several challenges, mostly related to the lack of temporal consistency of the generated images, i.e., flickering artifacts. In this work, we present a novel adversarial recurrent network for video upscaling that is able to produce realistic textures in a temporally consistent way. The proposed architecture naturally leverages information from previous frames due to its recurrent architecture, i.e. the input to the generator is composed of the low-resolution image and, additionally, the warped output of the network at the previous step. Together with a video discriminator, we also propose additional loss functions to further reinforce temporal consistency in the generated sequences. The experimental validation of our algorithm shows the effectiveness of our approach which obtains images with high perceptual quality and improved temporal consistency.

研究の動機と目的

  • 知覚的損失関数がフレッケーリングアーティファクトを引き起こすため、知覚的動画スーパーレゾリューションにおける時間的整合性の欠如に対処する。
  • 単一画像から動画スーパーレゾリューションへの知覚的損失関数の成功を、まだ未開拓である分野に応用する。
  • 高周波成分の時間的整合性を保ちつつ、写実的なテクスチャを維持することで、動画品質を向上させる。
  • 過去にスーパーレゾリュートされたフレームを無視するスライディングウィンドウアプローチの限界を克服する。
  • 専用の損失関数と再帰的アーキテクチャを通じて、時間的整合性を明示的に強制する訓練フレームワークを開発する。

提案手法

  • 現在の低解像度フレームと、ワープ処理を施した以前の高解像度出力を入力とする再帰的ジェネレータを採用し、過去の結果を記憶可能にする。
  • 連続するフレーム間における空間的・時間的整合性を評価する動画識別器を導入し、現実的な動きと一貫性を促進する。
  • 処理前に、周辺フレームを現在のフレームにあわせるためにマルチイメージワープを適用し、特徴の整合性を向上させ、動きアーティファクトを低減する。
  • 2つの新しい損失項を設計:静的損失($\mathcal{L}_{T_d}$)は、静止領域のフレッケーリングを最小化し、分散距離損失($\mathcal{L}_{T_s}$)は、時間にわたるピクセル統計の変動を低減する。
  • 知覚的損失($\mathcal{L}_c$)、対抗的損失($\mathcal{L}_A$)、および2つの時間的整合性損失を組み合わせた複合損失を最適化してモデルを訓練する。
  • 知覚的損失の計算に事前学習済みの特徴抽出器(例:VGG や AlexNet)を用い、アライメントを改善するための追加の線形キャリブレーション層を追加する。

実験結果

リサーチクエスチョン

  • RQ1単一画像スーパーレゾリューションで使用される知覚的損失関数を、フレッケーリングを引き起こさずに動画スーパーレゾリューションに拡張することは可能か?
  • RQ2過去のフレームの再帰的記憶を組み込むことで、動画スーパーレゾリューションにおける時間的整合性はどの程度向上するか?
  • RQ3専用の時間的整合性損失($\mathcal{L}_{T_d}$ と $\mathcal{L}_{T_s}$)は、生成された動画シーケンスにおけるフレッケーリング低減と知覚的品質向上にどの程度寄与するか?
  • RQ4本手法は、既存のGANベースおよびMSE最適化VSRモデルと比較して、知覚的品質および時間的安定性の面で優れているか?
  • RQ5動画識別器と再帰的アーキテクチャの組み合わせは、非再帰的でスライディングウィンドウアプローチに比べ、長期的な時間的整合性をより効果的に維持できるか?

主な発見

  • 本手法は、vid4 および seq12 データセットで最先端の LPIPS および NIQE スコアを達成し、優れた知覚的品質と歪みの低減を示した。
  • 知覚的手法の中で、$\mathcal{L}_c$ を用いて訓練されたモデルが、vid4 および seq12 で最も良い LPIPS スコアを達成し、SRGAN や Enhancenet を上回った。
  • 時間的損失に直接最適化しなくても、再帰的アーキテクチャと動画識別器を組み合わせることで、非再帰的モデル(例:SRGAN)よりも顕著に時間的整合性が向上した。
  • アブレーションスタディにより、$\mathcal{L}_{T_d}$ が $\mathcal{L}_{T_s}$ よりも時間的整合性に強い影響を持つことが確認され、$\mathcal{L}_A$ と組み合わせることで最良の全体的性能が得られた。
  • すべての指標(ワーピング誤差PSNR、tLPIPSを含む)において、$\mathcal{L}_c$ 損失を用いたモデルが最も高い時間的整合性を示し、損失定式化全体の有効性を裏付けた。
  • 定性的な分析では、SRGAN や Enhancenet は細かいテクスチャを生成するが、しばしば過剰にシャープ化されたり、現実的でないパターンを生成するが、本手法ではこれらが緩和された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。