Skip to main content
QUICK REVIEW

[論文レビュー] Progressive Perception-Oriented Network for Single Image Super-Resolution

Hui Zheng, Jie Li|arXiv (Cornell University)|Jul 24, 2019
Advanced Image Processing Techniques参考文献 50被引用数 8
ひとこと要約

本稿では、3段階の段階的モジュール(コンテンツ、構造、写真的リアリズム再構築)を介して画像品質を段階的に向上させるプログレッシブ・パーセプション指向ネットワーク(PPON)を提案する。これらのモジュールを逐次訓練し、マルチスケール階層的特徴統合を用いることで、従来手法よりも低いLPIPS(0.1194)と高いMOS(3.58)を達成し、パラメータの凍結により訓練時間を短縮した。

ABSTRACT

Recently, it has been demonstrated that deep neural networks can significantly improve the performance of single image super-resolution (SISR). Numerous studies have concentrated on raising the quantitative quality of super-resolved (SR) images. However, these methods that target PSNR maximization usually produce blurred images at large upscaling factor. The introduction of generative adversarial networks (GANs) can mitigate this issue and show impressive results with synthetic high-frequency textures. Nevertheless, these GAN-based approaches always have a tendency to add fake textures and even artifacts to make the SR image of visually higher-resolution. In this paper, we propose a novel perceptual image super-resolution method that progressively generates visually high-quality results by constructing a stage-wise network. Specifically, the first phase concentrates on minimizing pixel-wise error, and the second stage utilizes the features extracted by the previous stage to pursue results with better structural retention. The final stage employs fine structure features distilled by the second phase to produce more realistic results. In this way, we can maintain the pixel, and structural level information in the perceptual image as much as possible. It is useful to note that the proposed method can build three types of images in a feed-forward process. Also, we explore a new generator that adopts multi-scale hierarchical features fusion. Extensive experiments on benchmark datasets show that our approach is superior to the state-of-the-art methods. Code is available at https://github.com/Zheng222/PPON.

研究の動機と目的

  • 高倍率での超解像においてPSNRとパーセプション品質のトレードオフを緩和すること。
  • GANベースの超解像手法に共通するぼやけやアーティファクトを、コンテンツ、構造、リアリズムの各段階で段階的に画像品質を向上させることで軽減すること。
  • 初期段階のパラメータを凍結し、段階的にパーセプション指向モジュールを微調整することで、訓練時間を短縮すること。
  • マルチブランチで階層的な特徴統合アーキテクチャを用いて、ピクセルレベルの正確さを維持しながら、構造的およびパーセプション的忠実度を向上させること。

提案手法

  • 本手法は3ブランチのアーキテクチャを採用する:ピクセル単位の誤差を最小化するコンテンツ再構築モジュール(CRM)、構造的損失を用いて構造の保持を図る構造再構築モジュール(SRM)、敵対的損失およびパーセプション損失を用いてパーセプション的リアリズムを向上させる写真的リアリズム再構築モジュール(PRM)。
  • 各ブロック内で複数の率を有するドーナツ型畳み込み(dilated convolutions)を用いることで、マルチスケール特徴を捉える新しい階層的特徴統合ブロック(HFFB)を提案する。
  • 深層ネットワークにおける訓練の安定化を図るため、Residual-in-Residual結合を用いたResidual-in-Residual Fusion Block(RRFB)を採用する。
  • 段階的訓練戦略として、事前学習後にCRMおよびSRMを凍結し、その後PRMを最小限のパラメータ更新で微調整することで、訓練時間を短縮する。
  • パーセプション特徴は事前学習済みのVGGネットワークを用いて抽出され、中間特徴上でパーセプション損失が計算され、リアルなテクスチャ生成をガイドする。
  • 1回のフォワードパスで、低解像度入力、強化されたコンテンツ画像、最終的な写真的リアリスティック出力の3種類の画像を生成する。

実験結果

リサーチクエスチョン

  • RQ1段階的で段階的な訓練戦略は、PSNR や SSIM といった定量的指標を劣化させることなく、パーセプション指向画像超解像を向上させることができるか?
  • RQ2マルチスケール階層的特徴統合は、超解像画像におけるテクスチャと構造的詳細の両方をどのように保持に寄与するか?
  • RQ3段階的訓練におけるパラメータの凍結は、性能を維持したまま訓練時間をどの程度短縮できるか?
  • RQ4提案手法は、LPIPS および MOS で測定されたパーセプション品質において、従来の GAN ベースおよび PSNR 最適化手法を上回るか?
  • RQ5非参照パーセプション指標である PI は画像品質を的確に反映するものか、それとも LPIPS が SR 評価においてより頑健な指標であるか?

主な発見

  • PPON は PIRM の検証セットで LPIPS スコア 0.1194 を達成し、ESRGAN(0.1443)を上回り、パーセプション品質において新たな最先端(SOTA)を樹立した。
  • PPON の平均意見スコア(MOS)は 3.58 であり、ESRGAN(3.23)や CX(2.42)を大きく上回り、優れた視覚的品質を示している。
  • PPON は PIRM 検証セットで PSNR 26.20 dB、SSIM 0.6995 を維持しており、パーセプション的およびピクセルレベルの忠実度の両方をバランスよく保っている。
  • パーセプションブランチで 192×192 パッチを用いることで、計算コストの制限によりこのような大きなパッチを使用できない ESRGAN よりも優れた結果を得た。
  • アブレーションスタディにより、より大きなトレーニングパッチ(192×192)がパーセプション品質を向上させ、段階的訓練スキームが後段階でのパラメータ更新を最小限に抑え、訓練時間を短縮することが確認された。
  • 視覚的比較では、一部のケースで LPIPS が低い ESRGAN に比べ、PPON はぼやけが少なく、より鋭くリアルなテクスチャを生成し、アーティファクトも少ないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。