Skip to main content
QUICK REVIEW

[論文レビュー] Denoising MCMC for Accelerating Diffusion-Based Generative Models

Beomsu Kim, Jong Chul Ye|arXiv (Cornell University)|Sep 29, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、データと拡散時間の積空間からサンプリングするためのMCMCを用い、その後に逆方向のS/ODE統合によりノイズ除去を行う、スコアベース生成モデルのための直交的加速手法であるDenoising MCMC (DMCMC)を提案する。データ多様体に近い初期状態から出発することで、逆方向S/ODE統合のコストを著しく削減し、CIFAR10では3.86(約10 NFE)の最先端FIDスコア、CelebA-HQ-256では6.99(約160 NFE)を達成した。

ABSTRACT

Diffusion models are powerful generative models that simulate the reverse of diffusion processes using score functions to synthesize data from noise. The sampling process of diffusion models can be interpreted as solving the reverse stochastic differential equation (SDE) or the ordinary differential equation (ODE) of the diffusion process, which often requires up to thousands of discretization steps to generate a single image. This has sparked a great interest in developing efficient integration techniques for reverse-S/ODEs. Here, we propose an orthogonal approach to accelerating score-based sampling: Denoising MCMC (DMCMC). DMCMC first uses MCMC to produce samples in the product space of data and variance (or diffusion time). Then, a reverse-S/ODE integrator is used to denoise the MCMC samples. Since MCMC traverses close to the data manifold, the computation cost of producing a clean sample for DMCMC is much less than that of producing a clean sample from noise. To verify the proposed concept, we show that Denoising Langevin Gibbs (DLG), an instance of DMCMC, successfully accelerates all six reverse-S/ODE integrators considered in this work on the tasks of CIFAR10 and CelebA-HQ-256 image generation. Notably, combined with integrators of Karras et al. (2022) and pre-trained score models of Song et al. (2021b), DLG achieves SOTA results. In the limited number of score function evaluation (NFE) settings on CIFAR10, we have $3.86$ FID with $\approx 10$ NFE and $2.63$ FID with $\approx 20$ NFE. On CelebA-HQ-256, we have $6.99$ FID with $\approx 160$ NFE, which beats the current best record of Kim et al. (2022) among score-based models, $7.16$ FID with $4000$ NFE. Code: https://github.com/1202kbs/DMCMC

研究の動機と目的

  • スコアベース生成モデルにおけるスコアサンプリングの高速化を図り、逆方向S/ODE統合の計算コストを低減すること。
  • 多様なモードが存在する高次元データ分布において、従来のMCMC手法の非効率性を解消し、離れたモード間を効果的に移動可能にする。
  • MCMCと逆方向S/ODE統合器を組み合わせた即挿し可能なフレームワークを構築し、より高速かつ高品質なサンプル生成を実現すること。
  • CIFAR10 や CelebA-HQ-256 といった標準ベンチマークで、スコア関数評価回数(NFE)を最小限に抑えながら最先端のFIDスコアを達成すること。

提案手法

  • データと拡散時間(分散)の積空間からMCMCを用いてサンプリングし、データ多様体に近い高密度領域を探索するDMCMCフレームワークを提案する。
  • MCMCサンプルを、0に近い時間(低ノイズ)から出発する逆方向S/ODE統合器を用いてノイズ除去する。最大ノイズからではなく、低ノイズ状態から出発することで、統合区間を著しく短縮できる。
  • Denoising Langevin Gibbs (DLG) を提案し、これは、データ更新のためのラングジュアンダイナミクスと、ノイズレベル予測のためのギブスサンプリングを交互に実行するDMCMCの実用的実装である。
  • 事前学習済みのノイズ条件付きスコアネットワークと、軽量なノイズレベル分類器を用い、追加計算コストをほとんどかけずに効率的かつスケーラブルなサンプリングを実現する。
  • 拡散プロセスを時間依存のスコア関数とみなすことにより、任意の初期時刻 t_n(0に近い)から逆方向S/ODEの統合を開始できる。
  • ステップサイズ η、総NFE、ノイズ除去に割り当てられるNFEの割合(n_den/n)といったハイパーパrameterを最適化し、サンプル品質と多様性のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1データと拡散時間の積空間におけるMCMCサンプリングは、スコアベース生成モデルにおける逆方向S/ODE統合の高速化と効率化を可能にするか?
  • RQ2MCMCによって低ノイズ状態から逆方向S/ODE統合を開始することで、スコア関数評価回数(NFE)を著しく削減しつつ、サンプル品質を維持または向上できるか?
  • RQ3MCMCと逆方向S/ODE統合器を組み合わせた即挿しフレームワークは、多様な生成モデルベンチマークで最先端のパフォーマンスを達成できるか?
  • RQ4ラングジュアンステップサイズ(η)、総NFE、ノイズ除去割合(n_den/n)といったハイパーパrameterは、DMCMCフレームワークにおけるサンプル品質と多様性のトレードオフにどのように影響を与えるか?

主な発見

  • DLGは、CIFAR10でわずか約10 NFEで最先端のFID 3.86を達成し、同NFE予算下で4.17のFIDを達成した先行手法を上回った。
  • CelebA-HQ-256では、約160 NFEでSOTAのFID 6.99を達成し、別のスコアベースモデルを用いた4,000 NFEで達成された7.16のFIDを上回った。
  • ノイズレベルを0に近い状態から出発することで、平均的な逆方向S/ODE統合区間長を短縮し、追加計算コストをほとんどかけずに高速収束を実現した。
  • アブレーションスタディの結果、最適なパフォーマンスは、n_den/n が極端に0または1に近い値でない中間領域で達成され、次元に依存しない移動パラメータ(κ = η/√d)が、異なるデータセット間でのハイパーパrameterの転送を可能にした。
  • ノイズレベル分類器の計算コストは無視できるほど小さく、追加FLOPsの観点から見れば、加速効果は実質的に無料である。
  • フレームワークは汎用的かつ即挿し可能である:任意のMCMC、VEプロセス、逆方向S/ODE統合器を組み合わせられる。広範な適用可能性とスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。