Skip to main content
QUICK REVIEW

[論文レビュー] A Practical Contrastive Learning Framework for Single-Image Super-Resolution

Gang Wu, Junjun Jiang|arXiv (Cornell University)|Nov 27, 2021
Advanced Image Processing Techniques参考文献 65被引用数 10
ひとこと要約

本稿では、周波数空間で情報豊かなポジティブサンプルおよびハードネガティブサンプルを生成し、事前学習モデルの代わりにタスク固有で学習可能な埋め込みネットワークを用いる、実用的な単一画像超解像用対照学習フレームワークPCL-SRを提案する。本手法は、テクスチャの忠実性と一般化性能を向上させ、再訓練された既存のSISRモデルにおいて、複数のベンチマークで最先端の性能を達成する。

ABSTRACT

Contrastive learning has achieved remarkable success on various high-level tasks, but there are fewer contrastive learning-based methods proposed for low-level tasks. It is challenging to adopt vanilla contrastive learning technologies proposed for high-level visual tasks to low-level image restoration problems straightly. Because the acquired high-level global visual representations are insufficient for low-level tasks requiring rich texture and context information. In this paper, we investigate the contrastive learning-based single image super-resolution from two perspectives: positive and negative sample construction and feature embedding. The existing methods take naive sample construction approaches (e.g., considering the low-quality input as a negative sample and the ground truth as a positive sample) and adopt a prior model (e.g., pre-trained VGG model) to obtain the feature embedding. To this end, we propose a practical contrastive learning framework for SISR, named PCL-SR. We involve the generation of many informative positive and hard negative samples in frequency space. Instead of utilizing an additional pre-trained network, we design a simple but effective embedding network inherited from the discriminator network which is more task-friendly. Compared with existing benchmark methods, we re-train them by our proposed PCL-SR framework and achieve superior performance. Extensive experiments have been conducted to show the effectiveness and technical contributions of our proposed PCL-SR thorough ablation studies. The code and pre-trained models can be found at https://github.com/Aitical/PCL-SISR.

研究の動機と目的

  • 超解像を含む低レベル画像修復タスクに特化した有効な対照学習フレームワークの欠如に取り組むこと。
  • SISRにおける対照学習において、事前学習済みネットワークと単純なサンプル構築の限界を克服すること。
  • 周波数ドメイン変換を用いてハードネガティブサンプルと洗練されたポジティブサンプルを生成することで、テクスチャの正確性と一般化性能を向上させること。
  • 固定された事前学習モデルに依存せず、劣化固有の特徴を捉えることができる、タスクに適した学習可能な埋め込みネットワークを設計すること。
  • PCL-SRフレームワークの汎用性と有効性を、複数のSISRモデルおよびデータセットを用いて実証すること。

提案手法

  • 真値をシャープ化することで複数のポジティブサンプルを生成し、真値にわずかなぼかしを適用することでハードネガティブサンプルを生成する、新しいデータオーグメンテーション戦略を提案する。
  • 生成されたサンプルに周波数ドメイン変換(例:ハールウェーブレットおよびFFT)を適用し、高周波成分を強調して対照損失を誘導する。
  • GANに類似したフレームワークのディスクリミネーターから派生した学習可能な埋め込みネットワークを設計し、主なSRネットワークとエンドツーエンドで訓練することで、タスク固有の特徴を捉える。
  • 周波数埋め込み空間における対照損失を定義し、ポジティブペアは真値のシャープ化版、ネガティブペアは真値のぼかし版とする。
  • 対照損失と再構成損失のバランスを取るためのハイパーパrameter αを導入し、知覚的品質と忠実度のトレードオフを最適化する。
  • アブレーションスタディおよびクロスドメイン評価を用いて、サンプル生成、埋め込み設計、変換タイプの各コンponentの有効性を検証する。

実験結果

リサーチクエスチョン

  • RQ1制御された劣化を用いてハードネガティブサンプルを生成することで、超解像画像のテクスチャ品質が向上するか?
  • RQ2シャープ化などの手段でポジティブサンプルを洗練させることで、SISRモデルの一般化および知覚的品質が向上するか?
  • RQ3学習可能なタスク固有の埋め込みネットワークは、固定された事前学習済みネットワークを上回る性能を発揮できるか?
  • RQ4周波数空間における表現学習は、超解像における対照学習の性能にどのように影響を与えるか?
  • RQ5既存のSISRモデルをPCL-SRの提案された対照的目的関数で再訓練した場合、どの程度性能が向上するか?

主な発見

  • PCL-SRで既存のSISRモデル(例:RCAN)を再訓練すると、Set5、Set14、Urban100、Manga109を含むすべてのベンチマークデータセットで優れた性能を達成する。
  • わずかなぼかしを適用して生成されたハードネガティブサンプルの使用により、テクスチャの正確性が向上し、不自然な平均化された出力が減少する。
  • シャープ化によるポジティブサンプルの洗練は、特にManga109でのクロスドメインテストにおいて顕著に一般化性能を向上させる。
  • 周波数空間表現において、ハールウェーブレット変換はFFTを上回り、特徴マップのサイズが著しく小さくなるため、トレーニングがはるかに高速である。
  • 対照損失と再構成損失のバランスを取る最適なハイパーパrameter αは0.1であり、それ以上の値は性能を低下させる。
  • 事前学習済み埋め込みネットワークの使用はさらなる性能向上をもたらすため、事前学習モデルに内蔵された知識を活用することは、今後の有望な方向性である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。