Skip to main content
QUICK REVIEW

[論文レビュー] Deep Equilibrium Approaches to Diffusion Models

Ashwini Pokle, Zhengyang Geng|arXiv (Cornell University)|Oct 23, 2022
Generative Adversarial Networks and Image Synthesis被引用数 7
ひとこと要約

本稿では、denoising diffusion implicit models (DDIM) のための深層均衡 (DEQ) 定式化を提案する。従来の逐次的サンプリングプロセスに代わり、全ノイズ除去ステップにわたる並列的・連合的な固定点最適化を採用することで、より高速な推論と、implicit differentiation を用いた顕著な高速化によるモデル逆問題の実行を実現する。CIFAR-10 および CelebA において最大 2× の高速化を達成し、高品質な知覚的性能を維持している。

ABSTRACT

Diffusion-based generative models are extremely effective in generating high-quality images, with generated samples often surpassing the quality of those produced by other models under several metrics. One distinguishing feature of these models, however, is that they typically require long sampling chains to produce high-fidelity images. This presents a challenge not only from the lenses of sampling time, but also from the inherent difficulty in backpropagating through these chains in order to accomplish tasks such as model inversion, i.e. approximately finding latent states that generate known images. In this paper, we look at diffusion models through a different perspective, that of a (deep) equilibrium (DEQ) fixed point model. Specifically, we extend the recent denoising diffusion implicit model (DDIM; Song et al. 2020), and model the entire sampling chain as a joint, multivariate fixed point system. This setup provides an elegant unification of diffusion and equilibrium models, and shows benefits in 1) single image sampling, as it replaces the fully-serial typical sampling process with a parallel one; and 2) model inversion, where we can leverage fast gradients in the DEQ setting to much more quickly find the noise that generates a given image. The approach is also orthogonal and thus complementary to other methods used to reduce the sampling time, or improve model inversion. We demonstrate our method's strong performance across several datasets, including CIFAR10, CelebA, and LSUN Bedrooms and Churches.

研究の動機と目的

  • 拡散モデルのサンプリング速度が遅いため、その根本的要因たる逐次的ノイズ除去プロセスを是正すること。
  • 標準的な拡散モデルでは計算的に非現実的であるが、モデル逆問題などのタスクにおけるサンプリングチェーンを効率的にバックプロパゲーション可能にするため。
  • 全 DDIM サンプリングチェーンを多次元固定点系としてモデル化することで、拡散モデルと深層均衡 (DEQ) フレームワークを統合すること。
  • DEQ 定式化が複数の GPU にわたる並列化を可能にし、単一画像生成に対しても有効であることを示すこと。
  • DEQ フレームワークにおける implicit differentiation が、逐次的サンプリングと比較して、モデル逆問題を著しく高速化できることを示すこと。

提案手法

  • 全 T 個のノイズ除去ステップを同時に解く連合多次元固定点系として DDIM サンプリングプロセスを定式化し、深層均衡問題として扱う。
  • ブラックボックス根の探索ソルバ(例:Anderson 加速法)を用いて、全系の固定点を並列に計算し、マルチGPU推論を可能にする。
  • DEQ フレームワークを用いた implicit differentiation により、固定点を経由する勾配を O(1) のメモリ複雑度で計算し、計算グラフの全保持を回避する。
  • 固定点系にノイズ項を組み込むことで、DDIM の確率的バージョンを扱えるように DEQ 定式化を拡張する。
  • 同一の固定点ソルバを用いて、単一画像生成とモデル逆問題の両タスクに DEQ フレームワークを適用する。
  • DEQ フレームワークを用いて、画像再構築のための潜在コードを最適化し、モデル逆問題タスクにおける収束をより速くする。

実験結果

リサーチクエスチョン

  • RQ1全 DDIM サンプリングチェーンを深層均衡系として再定式化することで、並列推論が可能になるか?
  • RQ2DEQ 定式化は、逐次的 DDIM と比較して収束性が向上し、サンプリング効率が向上するか?
  • RQ3DEQ フレームワークにおける implicit differentiation は、拡散モデルのモデル逆問題を著しく高速化するか?
  • RQ4多様なデータセットにおいて、DEQ-DDIM は標準的 DDIM と比較して FID スコアおよび知覚的品質で優れているか?
  • RQ5DEQ 定式化は、DDPM のような確率的拡散モデルへ一般化可能か?

主な発見

  • DEQ-DDIM は、標準的逐次的 DDIM と比較して、CIFAR-10 および CelebA において最大 2× のサンプリング時間の高速化を達成したが、FID スコアは同等を維持した。
  • DEQ-DDIM を用いたモデル逆問題は、逐次的 DDIM と比較して著しく収束が速く、効率的な implicit 勾配計算のおかげである。
  • DEQ 定式化により、単一画像生成に対しても複数の GPU にわたる並列サンプリングが可能となり、標準的拡散モデルにおける逐次処理のボトルネックを克服した。
  • DEQ 逆問題により回復された初期潜在コードは、元の画像をより正確に再生成でき、逐次的 DDIM 逆問題と比較して微細なディテールを保持していた。
  • DEQ フレームワークは、サンプリングチェーンに沿ったバックプロパゲーションに対して O(1) のメモリ複雑度をサポートしており、長時間の拡散プロセスを微分可能にした。
  • 本手法は、固定点系にノイズ項を組み込むことで、DDPM のような確率的拡散モデルへも容易に拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。