Skip to main content
QUICK REVIEW

[論文レビュー] Image Super-Resolution with Text Prompt Diffusion

Zheng Chen, Yulun Zhang|arXiv (Cornell University)|Nov 24, 2023
Advanced Image Processing Techniques被引用数 6
ひとこと要約

この論文では、合成的および現実世界のシナリオの両方で再構成品質を向上させるために、劣化の事前分布としてテキストプロンプトを活用する新しい画像スーパーレゾリューション手法PromptSRを紹介する。事前学習済み言語モデル(例:T5、CLIP)からのテキスト埋め込みを条件とする拡散モデルを用い、バインニングに基づく劣化表現を用いて生成されたテキスト-画像データセット上で学習することで、Real-ESRGAN や SwinIR-GAN、DiffBIR よりも顕在的および美的指標において最先端の性能を達成している。

ABSTRACT

Image super-resolution (SR) methods typically model degradation to improve reconstruction accuracy in complex and unknown degradation scenarios. However, extracting degradation information from low-resolution images is challenging, which limits the model performance. To boost image SR performance, one feasible approach is to introduce additional priors. Inspired by advancements in multi-modal methods and text prompt image processing, we introduce text prompts to image SR to provide degradation priors. Specifically, we first design a text-image generation pipeline to integrate text into the SR dataset through the text degradation representation and degradation model. By adopting a discrete design, the text representation is flexible and user-friendly. Meanwhile, we propose the PromptSR to realize the text prompt SR. The PromptSR leverages the latest multi-modal large language model (MLLM) to generate prompts from low-resolution images. It also utilizes the pre-trained language model (e.g., T5 or CLIP) to enhance text comprehension. We train the PromptSR on the text-image dataset. Extensive experiments indicate that introducing text prompts into SR, yields impressive results on both synthetic and real-world images. Code: https://github.com/zhengchen1999/PromptSR.

研究の動機と目的

  • 複雑で未知の劣化条件下における画像スーパーレゾリューション(SR)の一般化能力の制限に取り組む。
  • 低解像度(LR)画像からの劣化情報の抽出が困難であるのを補うために、外部の事前分布を導入する。
  • 自然言語の記述を用いて劣化パターンを表現し、SR性能を向上させることの可能性を検証する。
  • テキストと画像生成を統合した包括的なフレームワークを構築し、耐障害性の高いSRモデルの学習を可能にする。
  • 記述的なテキストプロンプトを用いて、特定の劣化タイプに再トレーニングを行わずにゼロショットまたはフェイントショットの適応を可能にする。

提案手法

  • 劣化タイプ(例:ぼかし、ノイズ)を抽象的かつ柔軟なテキスト記述として表現するためのバインニングベースの離散化手法を提案する。
  • 劣化モデルを用いて、合成されたHR-LR画像ペアと対応する劣化テキストプロンプトをペアリングするテキスト-画像生成パイプラインを設計する。
  • 事前学習済み言語モデル(T5、CLIP)からのテキスト埋め込みと低解像度画像の両方に条件付けられた拡散モデルを訓練し、高解像度出力を生成する。
  • クロスアテンション機構を介してテキスト埋め込みを拡散モデルに組み込み、ノイズ除去プロセスをガイドする。
  • トレーニング中に事前学習済み言語モデルを固定し、生成されたテキスト-画像データセット上で唯一拡散モデルのみを微調整する。
  • 高忠実度で現実的な画像生成を最適化するため、複数の損失関数(例:L1、顕在的、 adversarial)を用いる。

実験結果

リサーチクエスチョン

  • RQ1テキストプロンプトは、複雑で未知の劣化状況下において、画像スーパーレゾリューション性能の向上に有効に劣化の事前分布として機能するか?
  • RQ2エンドツーエンドで学習された表現と比較して、バインニングベースのテキスト表現は一般化性と柔軟性においてどのように異なるか?
  • RQ3拡散ベースのSRと組み合わせた場合、事前学習済み言語モデル(例:T5、CLIP)が劣化の事前分布のモデリングをどの程度向上させるか?
  • RQ4テキストガイドランスを導入することで、現実世界の画像スーパーレゾリューションベンチマークにおける顕在的品質と現実性に測定可能な向上が見られるか?
  • RQ5提案手法は、特定の劣化タイプに再トレーニングを行わずに、多様な現実世界の劣化に一般化可能か?

主な発見

  • RealSRベンチマークにおいて、ST-LPIPS(0.1937)、CNNIQA(0.6376)、NIMA(4.8917)の観点で最高の性能を示し、顕在的および美的品質に優れていることが示された。
  • RealSRデータセットにおいて、LPIPS や DISTS といった重要な顕在的指標において、Real-ESRGAN+(PSNR: 25.62)、SwinIR-GAN(PSNR: 26.54)、DiffBIR(PSNR: 27.42)を上回った。
  • 視覚的比較では、Blurを引き起こすStable Diffusion やアーティファクトを追加するFeMaSRと比較して、PromptSRはよりシャープなテクスチャと少ないアーティファクトを生成した。
  • 図6の第3例では、PromptSRは4本の異なるギターの弦を正常に回復させたが、他の手法はぼやけたまたは誤った結果を出力した。
  • Real45データセットを含む現実世界のデータに対しても、明示的な再トレーニングなしに多様で未知の劣化に対して堅牢であることが示され、一般化性能が優れている。
  • アブレーションスタディにより、テキストプロンプトのガイドランスが、特に困難な現実世界の状況下で再構成忠実度を顕著に向上させることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。