[論文レビュー] Relay Diffusion: Unifying diffusion process across resolutions for image synthesis
本論文は、ブロッキングノイズとぼかし拡散を用いて低次元ノイズまたは画像を同等の高次元表現に転送することで、解像度間で拡散プロセスを統一する、新しい段階的拡散フレームワークであるリレーディフュージョンモデル(RDM)を提案する。RDMは、分類器フリー正則化を用いたImageNet 256×256でSOTAのFID(1.87)と、CelebA-HQ 256×256でsFIDを達成し、ADM、LDM、DiTといった先行手法を上回っている。これは、分布の不一致を排除し、純粋なノイズからの再起動なしにスムーズな解像度スケーリングを可能にするためである。
Diffusion models achieved great success in image synthesis, but still face challenges in high-resolution generation. Through the lens of discrete cosine transformation, we find the main reason is that \emph{the same noise level on a higher resolution results in a higher Signal-to-Noise Ratio in the frequency domain}. In this work, we present Relay Diffusion Model (RDM), which transfers a low-resolution image or noise into an equivalent high-resolution one for diffusion model via blurring diffusion and block noise. Therefore, the diffusion process can continue seamlessly in any new resolution or model without restarting from pure noise or low-resolution conditioning. RDM achieves state-of-the-art FID on CelebA-HQ and sFID on ImageNet 256$ imes$256, surpassing previous works such as ADM, LDM and DiT by a large margin. All the codes and checkpoints are open-sourced at \url{https://github.com/THUDM/RelayDiffusion}.
研究の動機と目的
- 標準のノイズスケジュールが大規模解像度において最適でないという問題に取り組むこと、特に解像度の上昇に伴うノイズの知覚的影響を明らかにすること。
- 段階的拡散モデルの限界、特に生成された低次元条件と実際の低次元条件の間の分布の不一致、および純粋なノイズからの再帰的サンプリングの冗長性を克服すること。
- 異なる解像度およびモデルアーキテクチャ間で拡散プロセスを統一し、ノイズから再起動せずにサンプリングを継続可能にする。
- サンプリングステップ数を削減し、低次元条件の必要性を排除することで、トレーニングおよび推論の効率を向上させること。
提案手法
- RDMは、各段階が純粋なノイズからではなく、直前の段階の出力を起点として拡散を開始するリレーメカニズムを導入することで、解像度を越えて連続的な生成を可能にする。
- 低次元ノイズまたは画像を同等の高次元表現に転送するために、ぼかし拡散を採用し、構造的および周波数ドメインの一貫性を保持する。
- 高周波数ノイズパターンをモデル化するためにブロッキングノイズを導入し、周波数ドメインにおける解像度依存のノイズ効果のモデリングを改善する。
- 調整可能な確率的スケール η を持つ確率的SDEサンプラーを用い、ImageNetおよびCelebA-HQの両方で最適な性能が得られる η = 0.2 を特定した。
- 拡散プロセスを下位のニューラルネットワークから分離することで、サンプリング中にアーキテクチャや解像度の柔軟な変更が可能になる。
- FLOPsは計算コストに応じて各段階に割り当てられ、最初の段階に多くのステップを割り当てることで最終的なFIDが向上する。
実験結果
リサーチクエスチョン
- RQ1なぜ標準のノイズスケジュールは高解像度拡散モデルで失敗するのか?また、解像度はノイズの知覚的影響にどのように影響するか?
- RQ2純粋なノイズからの再起動や低次元条件に依存せずに、異なる解像度間で拡散プロセスを統一できるか?
- RQ3ブロッキングノイズの追加が高解像度拡散生成における性能にどのように寄与するか?
- RQ4段階的拡散パイプラインにおいて、最小のFIDを達成するための各段階間のサンプリングステップ数の最適なバランスは何か?
- RQ5統一された拡散フレームワークは、非条件および条件付きの高解像度画像生成においてSOTA性能を達成できるか?
主な発見
- RDMは、分類器フリー正則化を用いたImageNet 256×256でSOTAのFID 1.87を達成し、ADM、LDM、DiTといった先行手法を顕著に上回った。
- CelebA-HQ 256×256では、報告された最高のsFIDを達成し、優れた画像品質と多様性を示した。
- ブロッキングノイズの追加によりFIDが顕著に改善され、最も良い性能は α = 0.15 および カーネルサイズ s = 4 の組み合わせで達成された。
- SDEサンプラーにおける最適な確率的スケール η = 0.2 が、ImageNetおよびCelebA-HQの両方で最良のFIDをもたらし、ノイズカバレッジと過剰なノイズのバランスを示した。
- RDMは200未満のNFE(関数評価回数)でも高い性能を維持し、低サンプリングステップ下でDiT-XL/2およびMDT-XL/2を上回った。
- 最初の段階に多くのFLOPsを割り当てることでFIDが向上し、初期段階の精錬が高品質な生成にとって極めて重要であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。