Skip to main content
QUICK REVIEW

[論文レビュー] Perceptual Extreme Super Resolution Network with Receptive Field Block

Taizhang Shang, Qiuju Dai|arXiv (Cornell University)|May 26, 2020
Advanced Image Processing Techniques参考文献 34被引用数 7
ひとこと要約

本論文では、多スケール特徴抽出に受容 field ブロック (RFB) を統合し、サブピクセルと最近傍補間を交互に使用することで計算量を低減しながらも詳細を保持する、知覚的極端スーパーエンリッチャー ネットワーク RFB-ESRGAN を提案する。この手法は、PSNR、SSIM、LPIPS、PI メトリクスにおいて最先端の性能を達成し、NTIRE 2020 知覚的極端スーパーエンリッチャー チャレンジで1位を獲得した。

ABSTRACT

Perceptual Extreme Super-Resolution for single image is extremely difficult, because the texture details of different images vary greatly. To tackle this difficulty, we develop a super resolution network with receptive field block based on Enhanced SRGAN. We call our network RFB-ESRGAN. The key contributions are listed as follows. First, for the purpose of extracting multi-scale information and enhance the feature discriminability, we applied receptive field block (RFB) to super resolution. RFB has achieved competitive results in object detection and classification. Second, instead of using large convolution kernels in multi-scale receptive field block, several small kernels are used in RFB, which makes us be able to extract detailed features and reduce the computation complexity. Third, we alternately use different upsampling methods in the upsampling stage to reduce the high computation complexity and still remain satisfactory performance. Fourth, we use the ensemble of 10 models of different iteration to improve the robustness of model and reduce the noise introduced by each individual model. Our experimental results show the superior performance of RFB-ESRGAN. According to the preliminary results of NTIRE 2020 Perceptual Extreme Super-Resolution Challenge, our solution ranks first among all the participants.

研究の動機と目的

  • 画像間の高いばらつきのため、細かいテクスチャーや詳細の回復が困難な ×16 のアップスケーリング要因を有する知覚的極端スーパーエンリッチャーの課題に対処すること。
  • 大きなカーネルではなく、小さなカーネルを用いた新しい受容 field ブロック (RFB) を用いることで、スーパーエンリッチャー ネットワークにおける特徴の識別性と多スケール表現を向上させること。
  • サブピクセル畳み込みと最近傍補間を交互に使用することで、補間段階の計算複雑性を低減すること。
  • 異なるトレーニングイテレーションからの10個のモデルを統合することで、モデルのロバスト性を高め、ノイズを低減すること。

提案手法

  • ネットワークアーキテクチャは ESRGAN をベースとし、標準の残差ブロックを、小さな畳み込みカーネルを用いて多スケール特徴を捉える受容 field ブロック (RFB) に置き換えている。
  • RFB は、複数の受容 field を有する拡張畳み込みを用い、パrameter数を著しく増加させることなく、粗いおよび細かい特徴を抽出する。
  • 補間段階では、サブピクセル畳み込みと最近傍補間を交互に使用することで、特徴の質と計算効率のバランスをとる。
  • 生成的対抗ネットワーク (GAN) フレームワークを採用し、知覚的損失と相対的判別器(絶対的真正性ではなく相対的真正性を予測)を用いている。
  • テスト段階ではアンサンブル推論を適用し、異なるイテレーションで訓練された10個のモデルの予測を統合することで、ノイズを抑制し、安定性を向上させている。
  • トレーニングパイプラインでは、評価用に中央クロップされた 1000×1000 のサブ画像を用いた DIV8K データセットを用い、損失関数には L1、知覚的損失、 adversarial 損失、LPIPS を用いている。

実験結果

リサーチクエスチョン

  • RQ1小さなカーネルを用いた受容 field ブロック (RFB) は、計算コストを低減しつつ、極端スーパーエンリッチャーにおいて多スケール特徴を効果的に抽出できるか?
  • RQ2サブピクセルと最近傍補間を交互に使用することで、スーパーエンリッチャー パイプラインにおける特徴の質を向上させるとともに、パrameter数を削減できるか?
  • RQ3複数のトレーニングイテレーションからのモデル アンサンブルは、知覚的スーパーエンリッチャーの結果におけるノイズを顕著に低減し、ロバスト性を向上させられるか?
  • RQ4NTIRE 2020 チャレンジベンチマークにおいて、RFB-ESRGAN は既存の最先端手法と比較して、知覚的品質、PSNR、SSIM、LPIPS、PI においてどのように差をつけるか?

主な発見

  • RFB-ESRGAN は、NTIRE 2020 知覚的極端スーパーエンリッチャー チャレンジで最高スコアを記録し、参加者全員の中で1位を獲得した。
  • DIV8K の 1,401–1,500 テスト画像において、PSNR 24.03、SSIM 0.54、LPIPS 0.345、PI 4.27 を達成し、強力な知覚的および構造的忠実度を示した。
  • アブレーションスタディにより、RFB を搭載したモデルは、髪の毛や毛布のような細かい構造において、RFB を搭載しないベースラインモデルと比較して、顕著にテクスチャーの詳細回復が向上していることが確認された。
  • 補間戦略を交互に使用することで、サブピクセルまたは最近傍補間を単独で使用する場合と比較して、アーティファクトが低減され、視覚的リアリズムが向上した。
  • モデル アンサンブルにより、ノイズが効果的に抑制され、比較画像においてノイズレベルが低下し、より自然なテクスチャーが得られた。
  • RFB、ハイブリッド補間、アンサンブル学習の組み合わせにより、すべてのメトリクスで優れたパフォーマンスを発揮し、既存手法に比べて知覚的品質と再構成精度の両面で優れた結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。