Skip to main content
QUICK REVIEW

[論文レビュー] Details or Artifacts: A Locally Discriminative Learning Approach to Realistic Image Super-Resolution

Jie Liang, Hui Zeng|arXiv (Cornell University)|Mar 17, 2022
Advanced Image Processing Techniques被引用数 8
ひとこと要約

本稿では、局所的残差分散統計を活用して、GANベースの超解像における視覚的アーティファクトと現実的詳細を区別する、局所的特徴的学習(LDL)を提案する。ピクセル単位のアーティファクトマップを生成し、それを adversarial 学習に正則化することで、アーティファクトを顕著に低減するとともに、知覚的詳細品質を維持する。合成および実世界のベンチマークにおいて、最先端の GAN-SR メソッドを上回る性能を発揮する。

ABSTRACT

Single image super-resolution (SISR) with generative adversarial networks (GAN) has recently attracted increasing attention due to its potentials to generate rich details. However, the training of GAN is unstable, and it often introduces many perceptually unpleasant artifacts along with the generated details. In this paper, we demonstrate that it is possible to train a GAN-based SISR model which can stably generate perceptually realistic details while inhibiting visual artifacts. Based on the observation that the local statistics (e.g., residual variance) of artifact areas are often different from the areas of perceptually friendly details, we develop a framework to discriminate between GAN-generated artifacts and realistic details, and consequently generate an artifact map to regularize and stabilize the model training process. Our proposed locally discriminative learning (LDL) method is simple yet effective, which can be easily plugged in off-the-shelf SISR methods and boost their performance. Experiments demonstrate that LDL outperforms the state-of-the-art GAN based SISR methods, achieving not only higher reconstruction accuracy but also superior perceptual quality on both synthetic and real-world datasets. Codes and models are available at https://github.com/csjliang/LDL.

研究の動機と目的

  • GANベースの単一画像超解像(SISR)モデルにおける不安定性とアーティファクト生成を解消すること。
  • SISRの出力において、知覚的に不快なアーティファクトと現実的な高周波成分を区別すること。
  • アーティファクトを抑制するが、現実的な詳細生成に悪影響を及げない訓練正則化手法を開発すること。
  • 既存の SISR フレームワークと互換性のあるプラグイン型ソリューションを構築し、忠実度を向上させること。
  • 合成および実世界の SISR データセットの両方で有効性を検証すること。

提案手法

  • 本手法は、SR出力と正解HR画像間の局所的残差分散を用いて、ピクセル単位のアーティファクトマップを構築する。
  • 安定性と精度を向上させるために、EMA(指数移動平均)ネットワークを用いたモデルアンサンブル戦略により、アーティファクトマップを精緻化する。
  • 敵対的学習中に、高確率でアーティファクトと予測される領域に対してペナルティを与えるために、局所的特徴的損失($\mathcal{L}_{\text{artif}}$)を導入する。
  • アーティファクトマップはピクセルおよびパッチレベルで計算され、感度とロバストネスのバランスを取るために、グローバルスケーリング($\sigma \cdot \mathbf{M}$)が適用される。
  • アーキテクチャの変更なしに、既存の GAN-SR モデル(例:ESRGAN、SwinIR、RealESRGAN)に統合可能である。
  • 推論時には、アーティファクトマップ予測の安定化に、EMAベースのモデル($\Psi_{\text{EMA}}$)が用いられる。

実験結果

リサーチクエスチョン

  • RQ1残差の局所的統計的差異は、GANベースの SISR 出力において、視覚的アーティファクトと現実的詳細を効果的に区別できるか?
  • RQ2学習されたアーティファクトマップを用いることで、詳細忠実度に悪影響を与えずに敵対的学習の安定性を高め、アーティファクトを低減できるか?
  • RQ3提案手法 LDL は、異なる SISR アーキテクチャおよびデータ分布に一般化可能か?
  • RQ4未知の劣化を伴う実世界の SISR において、LDL は知覚的品質と再構成精度の両方を向上させられるか?
  • RQ5アーティファクトマップの精緻化と EMA の統合が、モデルの安定性と性能にどのように寄与するか?

主な発見

  • RRDB に適用した場合、DIV2K 検証セットで LPIPS 0.0999、PSNR 28.819 を達成し、ベースラインおよびアブレーション変種を上回る。
  • DF2K 学習セットでは、SwinIR+GAN に対して PSNR と LPIPS の向上を示し、アーキテクチャ間での一般化を実証した。
  • 定性的な結果から、LDL は細かい構造部(例:密集した窓、細い枝)におけるアーティファクトを顕著に低減するとともに、詳細のシャープネスを向上させている。
  • 実世界の SISR では、真値が存在しないため、RealESRGAN+LDL は RealESRGAN よりもアーティファクトをより効果的に抑制し、BSRGAN よりもシャープな詳細を生成している。
  • アブレーションスタディにより、アーティファクトマップ、スケーリング、精緻化、EMA の各要素が、性能向上に段階的に寄与していることが確認された。
  • Transformer ベースのモデル(例:SwinIR)に対しても本手法が有効であるため、強力なアーキテクチャ一般化性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。