Skip to main content
QUICK REVIEW

[論文レビュー] Progressive Deblurring of Diffusion Models for Coarse-to-Fine Image Synthesis

Sangyun Lee, Hyungjin Chung|arXiv (Cornell University)|Jul 16, 2022
Generative Adversarial Networks and Image Synthesis被引用数 6
ひとこと要約

本稿では、周波数に依存する拡散速度を持つ回転座標系で動作する周波数に配慮した拡散プロセスにおいて、段階的ぼかしを用いた粗いから細かい画像生成フレームワークを提案する。標準の拡散モデルを回転座標系に一般化し、周波数ごとに異なる拡散速度を実現することで、低周波成分を最初に復元するぼかし拡散を適用し、LSUN bedroomおよびchurchデータセットにおいて標準の拡散モデルよりも優れたFIDスコアを達成した。

ABSTRACT

Recently, diffusion models have shown remarkable results in image synthesis by gradually removing noise and amplifying signals. Although the simple generative process surprisingly works well, is this the best way to generate image data? For instance, despite the fact that human perception is more sensitive to the low frequencies of an image, diffusion models themselves do not consider any relative importance of each frequency component. Therefore, to incorporate the inductive bias for image data, we propose a novel generative process that synthesizes images in a coarse-to-fine manner. First, we generalize the standard diffusion models by enabling diffusion in a rotated coordinate system with different velocities for each component of the vector. We further propose a blur diffusion as a special case, where each frequency component of an image is diffused at different speeds. Specifically, the proposed blur diffusion consists of a forward process that blurs an image and adds noise gradually, after which a corresponding reverse process deblurs an image and removes noise progressively. Experiments show that the proposed model outperforms the previous method in FID on LSUN bedroom and church datasets. Code is available at https://github.com/sangyun884/blur-diffusion.

研究の動機と目的

  • 標準の拡散モデルが周波数成分を優先する方法に制限を受けること、特に人間の低周波成分に対する知覚感受性と一致しないこと。
  • 別個のアップサンプリングモジュールや事前定義された段階を必要とせず、自然に粗いから細かい画像生成を可能にする生成プロセスの開発。
  • 回転座標系を用いて周波数適応的な方法で拡散をモデル化することで、画像データに対する誘導的バイアスを組み込むこと。
  • 生成プロセスの初期段階でグローバル構造と低周波成分を強調することで、サンプル品質とFID性能を向上させること。

提案手法

  • 直交行列Uを用いた回転座標系を導入することで、標準の拡散モデルを一般化し、周波数成分ごとに独立した拡散速度を可能にする。
  • 各周波数成分が関数f(i)によって制御される周波数依存スケーリング行列Df(i)を介して異なる速度で拡散される一般化された前向きプロセスを定義する。
  • 前向きプロセスが段階的に画像をぼかしながらノイズを追加する状況としてぼかし拡散を提案し、逆向きプロセスが段階的にぼかしを解除しノイズを除去する。
  • SDE離散化を用いて逆向き拡散サンプラーを導出する。この際、復元プロセスをガイドするスコアベース補正項sθ(xi, i)を組み込む。
  • 1000ステップの線形ノイズスケジュールを用い、LSUNデータセットで121Mパラメータ、1台のV100 GPUで学習したUNetアーキテクチャを採用する。
  • フーリエ変換の固有値によって制御される周波数に配慮したノイズスケジュールを採用し、初期段階で粗い構造の回復を促進する。

実験結果

リサーチクエスチョン

  • RQ1周波数適応的拡散によって低周波成分を優先する拡散モデルは、画像合成品質を向上させることができるか?
  • RQ2回転周波数空間における段階的ぼかしは、標準の拡散モデルと比較してFIDおよび知覚的品質において優れているか?
  • RQ3別個のアップスケーリングヘッドやマルチステージ学習を必要とせずに、粗いから細かい画像生成を達成できるか?
  • RQ4周波数依存の拡散は、拡散モデルにおける高解像度の精錬段階の必要性を低減するか?
  • RQ5LSUN bedroomおよびchurchといった標準ベンチマークにおいて、この手法は標準の拡散モデルよりもどれほど性能向上を達成するか?

主な発見

  • 提案されたぼかし拡散モデルは、LSUN bedroomデータセットにおいて標準の拡散モデルよりも低いFréchet Inception Distance (FID) スコアを達成し、より優れたサンプル品質を示した。
  • LSUN churchデータセットにおいても、ベースラインより低いFIDスコアを達成し、異なる画像ドメインにおいても一貫した性能向上を確認した。
  • 別個のアップサンプラーもマルチステージ学習も必要とせず、粗いから細かい画像生成を成功させ、アーキテクチャを単純化した。
  • 周波数に配慮した拡散プロセスにより、生成プロセスの初期段階でグローバル構造と低周波成分を強調することで、より優れた知覚的品質を実現した。
  • アブレーションスタディにより、周波数依存の拡散速度が性能向上に不可欠であることが確認され、ランダムまたは均一なスケジュールでは結果が劣化した。
  • 評価されたベンチマークにおいて、単一ステージの拡散モデルとして最先端のFID性能を達成し、別個のアップスケーリングコンponentに依存する先行手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。