Skip to main content
QUICK REVIEW

[論文レビュー] SciRE-Solver: Accelerating Diffusion Models Sampling by Score-integrand Solver with Recursive Difference

Shigui Li, Wei Chen|arXiv (Cornell University)|Aug 15, 2023
Model Reduction and Neural NetworksPhysics and Astronomy被引用数 3
ひとこと要約

本稿では、高次テイラー展開におけるスコア関数の微分を効率的に推定する再帰的差分(RD)技術を用いて推論を高速化する、トレーニングフリーなサンプリング手法であるSciRE-Solverを提案する。この手法は、CIFAR-10で100 NFEで2.40のFIDスコア、84 NFEで3.15のFIDスコアを達成し、1,000以上のNFEを用いてトレーニングされたモデルの結果を上回る。

ABSTRACT

Diffusion models (DMs) have made significant progress in the fields of image, audio, and video generation. One downside of DMs is their slow iterative process. Recent algorithms for fast sampling are designed from the perspective of differential equations. However, in higher-order algorithms based on Taylor expansion, estimating the derivative of the score function becomes intractable due to the complexity of large-scale, well-trained neural networks. Driven by this motivation, in this work, we introduce the recursive difference (RD) method to calculate the derivative of the score function in the realm of DMs. Based on the RD method and the truncated Taylor expansion of score-integrand, we propose SciRE-Solver with the convergence order guarantee for accelerating sampling of DMs. To further investigate the effectiveness of the RD method, we also propose a variant named SciREI-Solver based on the RD method and exponential integrator. Our proposed sampling algorithms with RD method attain state-of-the-art (SOTA) FIDs in comparison to existing training-free sampling algorithms, across both discrete-time and continuous-time pre-trained DMs, under various number of score function evaluations (NFE). Remarkably, SciRE-Solver using a small NFEs demonstrates promising potential to surpass the FID achieved by some pre-trained models in their original papers using no fewer than $1000$ NFEs. For example, we reach SOTA value of $2.40$ FID with $100$ NFE for continuous-time DM and of $3.15$ FID with $84$ NFE for discrete-time DM on CIFAR-10, as well as of $2.17$ (2.02) FID with $18$ (50) NFE for discrete-time DM on CelebA 64$ imes$64.

研究の動機と目的

  • 通常数百回の反復ステップを要する拡散モデルのサンプリング速度の遅さに対処すること。
  • 大規模ニューラルネットワークにおける高次スコア関数微分の推定が困難であるという課題を克服すること。
  • 数学的に根拠を持つ、トレーニングを必要としない方法を開発し、サンプリングを高速化するとともに、サンプル品質を維持または向上させること。
  • 従来の手法よりもはるかに少ないスコア関数評価回数(NFE)で高精細な生成を可能にすること。
  • 離散時刻および連続時刻の両方の拡散モデルにおいて、再帰的差分法の有効性を実証すること。

提案手法

  • スコア関数のテイラー展開から低次の微分情報を再帰的に抽出することで、スコア関数の高次微分を計算する再帰的差分(RD)法を導入する。
  • RDで推定された微分を用いて、スコア被積分関数の切り捨てられたテイラー展開を定式化し、高次数値積分器を構築する。
  • RD法による微分近似を活用することで、収束保証付きの高次数値積分器としてのSciRE-Solverを提案する。
  • 指数積分法とRD法を組み合わせることで安定性と精度を向上させた、変種であるSciREI-Solverを提案する。
  • SNRに基づくまたはNSRタイプの軌道を用いた適応的時間ステップスケジューリングを設計し、サンプリング効率を向上させる。
  • 追加のトレーニングを必要とせず、事前学習済みの拡散モデルに直接適用可能である。

実験結果

リサーチクエスチョン

  • RQ1再帰的差分法は、拡散モデルにおけるスコア関数の高次微分を効率的かつ正確に推定できるか?
  • RQ2提案されたSciRE-Solverは、従来のトレーニングフリーな数値積分法と比較して高次収束性と高いサンプリング効率を達成できるか?
  • RQ3RDに基づく手法は、ベースライン手法と比較して顕著に少ないスコア関数評価回数(NFE)でSOTAのFIDスコアを達成できるか?
  • RQ4NFEの一部のみを用いた場合、SciRE-Solverの性能は元の事前学習済みモデルと比べてどうか?
  • RQ5SciREI-SolverにおけるRD法と指数積分法の組み合わせは、さらにサンプリング品質と安定性を向上させるか?

主な発見

  • SciRE-Solverは、CIFAR-10で100 NFE(スコア関数評価回数)で2.40のSOTA FIDを達成し、1,000以上のNFEを用いてトレーニングされたモデルを上回る。
  • CIFAR-10の離散時刻拡散モデルにおいて、84 NFEでFID 3.15を達成し、トレーニングフリー手法としての新記録を樹立した。
  • CelebA 64×64では、18 NFEでFID 2.17、50 NFEでFID 2.02を達成し、極めて少ないNFEでも優れたサンプル品質を示した。
  • ImageNet や LSUN を含む複数のデータセットにおける視覚的比較から、DDIM や DPM-Solver よりも少ないステップ数で高品質なサンプルを生成した。
  • 連続時刻モデルでは、12 NFEでCIFAR-10でFID 3.48、20 NFEでFID 2.42を達成し、先行SOTAと同等またはそれを上回った。
  • これらの結果は、RD法が追加のトレーニングを必要とせずに正確な微分推定を可能にし、高速かつ高品質なサンプリングに極めて効果的であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。