Skip to main content
QUICK REVIEW

[論文レビュー] Synthesizing Realistic Image Restoration Training Pairs: A Diffusion Approach

Tao Yang, Peiran Ren|arXiv (Cornell University)|Mar 13, 2023
Advanced Image Processing Techniques被引用数 6
ひとこと要約

本稿では、事前学習済みのノイズ除去拡散確率的モデル(DDPM)を用いて、手作業で設計された劣化出力を精錬することで、現実的で高品質(HQ)および低品質(LQ)の画像復元トレーニングペアを合成する、新しい拡散ベースの手法を提案する。このアプローチにより、合成されたLQ画像と現実世界のLQ画像の間の分布ギャップが顕著に縮小され、ブラインド画像復元および超解像タスクで最先端の性能が達成される。

ABSTRACT

In supervised image restoration tasks, one key issue is how to obtain the aligned high-quality (HQ) and low-quality (LQ) training image pairs. Unfortunately, such HQ-LQ training pairs are hard to capture in practice, and hard to synthesize due to the complex unknown degradation in the wild. While several sophisticated degradation models have been manually designed to synthesize LQ images from their HQ counterparts, the distribution gap between the synthesized and real-world LQ images remains large. We propose a new approach to synthesizing realistic image restoration training pairs using the emerging denoising diffusion probabilistic model (DDPM). First, we train a DDPM, which could convert a noisy input into the desired LQ image, with a large amount of collected LQ images, which define the target data distribution. Then, for a given HQ image, we synthesize an initial LQ image by using an off-the-shelf degradation model, and iteratively add proper Gaussian noises to it. Finally, we denoise the noisy LQ image using the pre-trained DDPM to obtain the final LQ image, which falls into the target distribution of real-world LQ images. Thanks to the strong capability of DDPM in distribution approximation, the synthesized HQ-LQ image pairs can be used to train robust models for real-world image restoration tasks, such as blind face image restoration and blind image super-resolution. Experiments demonstrated the superiority of our proposed approach to existing degradation models. Code and data will be released.

研究の動機と目的

  • 教師付き画像復元トレーニングのための現実的で整合性のあるHQ-LQ画像ペアを入手する課題に対処すること。
  • モデルの汎化性能を制限する、合成されたLQ画像と現実世界の劣化画像との間の分布ギャップを低減すること。
  • 複雑な現実世界の劣化を捉えきれない、手作業で設計された劣化モデルの限界を克服すること。
  • 高精細な合成トレーニングデータを用いて、ブラインド画像復元モデルの強固なトレーニングを可能にすること。
  • 拡散モデルが画像復元データ合成における分布モデリングに有効であることを実証すること。

提案手法

  • 大規模な現実世界のLQ画像データセット上で、それらの潜在的データ分布を学習するため、ノイズ除去拡散確率的モデル(DDPM)をトレーニングする。
  • 各HQ画像に対して、標準的な手作業による劣化モデル(例:ぼかし、ノイズ、ダウンサンプリング)を適用して、初期のLQ画像を生成する。
  • 初期のLQ画像に段階的にガウスノイズを追加し、実際のLQ分布から逸脱するノイズを含む入力を生成する。
  • 事前トレーニング済みのDDPMを用いて、ノイズを除去し、実際の現実世界のLQ分布に近い最終的なLQ画像を生成する。
  • 元のHQ画像と精錬されたLQ画像を組み合わせ、現実的で整合性のあるHQ-LQトレーニングペアを形成する。
  • 下流の画像復元モデル(例:RRDBベース)を、合成されたペアでトレーニングし、現実世界のデータに対する性能を向上させる。
Figure 1 : Illustration of the proposed HQ-LQ image pair synthesis process. Please refer to Sec. 3.1 for details.
Figure 1 : Illustration of the proposed HQ-LQ image pair synthesis process. Please refer to Sec. 3.1 for details.

実験結果

リサーチクエスチョン

  • RQ1大規模データセットから、現実世界の低品質画像の分布を効果的に学習・再構成できるか。
  • RQ2DDPMを用いて手作業で劣化させた画像を精錬することで、合成されたLQ画像と現実世界のLQ画像との間の分布ギャップはどの程度低減されるか。
  • RQ3本拡散ベース手法で合成されたHQ-LQペアの品質は、従来の劣化モデルで生成されたものと比較して、下流の画像復元タスクでどのように向上するか。
  • RQ4合成ペアでトレーニングされたモデルは、ブラインドフェイス復元やブラインド画像超解像といった現実世界の画像復元ベンチマークにおいて、より良い汎化性能を示すか。
  • RQ5本手法は、ブラインド画像復元および超解像タスクにおける知覚的および定量的指標にどのような影響を与えるか。

主な発見

  • 再トレーニングされたRRDBベースのモデル(RRDB+)は、FID、PSNR、SSIM指標においてReal-ESRGANを上回り、LPIPSスコアは類似した水準を維持しており、復元品質の向上が裏付けられている。
  • ユーザースタディーの結果、ブラインドフェイス復元においてRRDB+はベースラインモデルを著しく上回り、70%の投票が合成データでトレーニングされたモデルを支持した。
  • ブラインド画像超解像タスクにおいて、RRDB+は最も好まれる(ランク1)投票数が最も多い一方で、最も好まれない(ランク5)投票数が最少であり、優れた知覚的品質を示している。
  • 視覚的比較では、RRDB+はBSSRGAN や Real-ESRGAN と比較して、より明確なディテール、より良い構造保存性、およびより少ないアーティファクトを生成している。
  • 実世界のテストセットでの性能向上とユーザーサーベイの結果から、本手法は合成されたLQ画像と現実世界のLQ画像の間の分布ギャップを効果的に低減していることが示された。
  • 本手法は汎用性がある:ユーザーはドメイン固有のLQデータセット上でカスタムDDPMをトレーニングし、特定の画像復元タスクに特化したトレーニングペアを生成できる。
Figure 2 : Sample face and natural scene images in our collected degraded image dataset (DID).
Figure 2 : Sample face and natural scene images in our collected degraded image dataset (DID).

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。