Skip to main content
QUICK REVIEW

[論文レビュー] ResDiff: Combining CNN and Diffusion Model for Image Super-Resolution

Shuyao Shang, Zhengyang Shan|arXiv (Cornell University)|Mar 15, 2023
Advanced Image Processing Techniques被引用数 7
ひとこと要約

ResDiffは、低周波成分の回復に事前学習済みCNNを組み合わせ、高周波成分の予測に周波数ガイドドの拡散モデルを用いる、単一画像超解像のための新規拡散モデルを提案する。CNNの予測と残留空間を通じてノイズ除去をガイドすることで、収束を加速し、サンプルの品質と多様性を向上させ、ベンチマークデータセットにおいて従来の拡散ベース手法を上回る性能を達成する。

ABSTRACT

Adapting the Diffusion Probabilistic Model (DPM) for direct image super-resolution is wasteful, given that a simple Convolutional Neural Network (CNN) can recover the main low-frequency content. Therefore, we present ResDiff, a novel Diffusion Probabilistic Model based on Residual structure for Single Image Super-Resolution (SISR). ResDiff utilizes a combination of a CNN, which restores primary low-frequency components, and a DPM, which predicts the residual between the ground-truth image and the CNN predicted image. In contrast to the common diffusion-based methods that directly use LR images to guide the noise towards HR space, ResDiff utilizes the CNN's initial prediction to direct the noise towards the residual space between HR space and CNN-predicted space, which not only accelerates the generation process but also acquires superior sample quality. Additionally, a frequency-domain-based loss function for CNN is introduced to facilitate its restoration, and a frequency-domain guided diffusion is designed for DPM on behalf of predicting high-frequency details. The extensive experiments on multiple benchmark datasets demonstrate that ResDiff outperforms previous diffusion based methods in terms of shorter model convergence time, superior generation quality, and more diverse samples.

研究の動機と目的

  • 直接的な拡散モデリングによる超解像において、低周波成分と高周波成分を同時に回復するという非効率性を解消すること。
  • 低解像度空間からのランダムノイズ生成に依存するのを減らすことで、サンプルの品質と多様性を向上させること。
  • CNNの初期予測を構造的事前分布として活用することで、訓練収束を加速すること。
  • 拡散プロセスにおける周波数ドメインのガイドランスを通じて、高周波成分の詳細生成を向上させること。
  • 顔や一般シーンを含む多様なデータセットにわたる一般化性能を示すこと。

提案手法

  • ResDiffは、事前学習済みCNN(SimpleSR)を用いて、初期の低解像度予測を生成し、主要な低周波成分を回復する。
  • 拡散モデルは、低解像度画像そのものではなく、正解の高解像度画像とCNNの予測との間の残留空間に条件付けられる。
  • CNNの低周波成分回復精度を向上させるために、周波数ドメインに基づく損失関数が適用される。
  • 周波数ドメインガイドド拡散(FD-guided Diffusion)モジュールが導入され、適応的ノイズ除去のためのFD情報スプリッターと高周波成分ガイドドのクロスアテンションモジュールで構成される。
  • FD情報スプリッターは、ノイズがかかる画像内の高周波成分と低周波成分を分離し、的を絞ったノイズ除去を実現する。
  • 高周波成分ガイドドクロスアテンションモジュールは、拡散モデルの微細なテクスチャーや高周波成分の詳細の予測能力を強化する。

実験結果

リサーチクエスチョン

  • RQ1CNNベースの初期予測は、拡散ベースの超解像の効率性と品質を向上させ得るか?
  • RQ2正解の高解像度画像とCNN予測との残留空間を通じて拡散プロセスをガイドすることで、収束が速くなり、サンプル品質が向上するか?
  • RQ3拡散モデルにおける周波数ドメインガイドランスは、標準的な拡散条件付けと比較して、高周波成分の詳細生成を向上させ得るか?
  • RQ4ResDiffは、既存の拡散ベースおよび非拡散SISR手法と比較して、性能と多様性において優れているか?
  • RQ5ResDiffは、顔や一般画像ベンチマークを含む多様なデータセットにどの程度一般化可能か?

主な発見

  • Urban100データセットにおいて4倍拡大した際、ResDiffはPSNR 27.94、FID 42.35を達成し、すべての先行拡散ベース手法を上回った。
  • DIV2Kデータセットでは、PSNR 27.43、FID 42.35を達成し、SR3や他の拡散ベースベースラインと比較して両方の指標で顕著に優れた性能を示した。
  • アブレーションスタディの結果、FD情報スプリッターとHFガイドドCAモジュールの両方がPSNRとSSIMの向上に寄与しており、フルモデルではFFHQでPSNR 26.73、SSIM 0.818を達成した。
  • 従来の拡散ベース手法と比較して、ResDiffは収束が速く、直接ノイズから高解像度画像を生成する手法と比較して最大50%の訓練時間短縮が達成された。
  • モデルはより多様なサンプルを生成し、FIDスコア(例:Urban100で42.35)が低く抑えられ、モード崩壊の低減を示す知覚的評価指標によって裏付けられた。
  • 単純なバイリニア補間ベースラインでさえも、残留構造のおかげで直接拡散手法を上回る性能を示しており、残留設計の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。