Skip to main content
QUICK REVIEW

[논문 리뷰] Denoising MCMC for Accelerating Diffusion-Based Generative Models

Beomsu Kim, Jong Chul Ye|arXiv (Cornell University)|2022. 09. 29.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 데이터와 확산 시간의 곱공간에서 MCMC를 사용해 표본을 추출한 후 역방향-S/ODE 통합을 통해 표본을 복원하는, 점도 제거 MCMC(DMCMC)를 제안한다. 데이터 다양체 근처에서 시작함으로써, 역방향-S/ODE 통합 비용을 크게 감소시켜 CIFAR10에서 3.86(약 10 NFE)의 최고 성능 FID 점수와 CelebA-HQ-256에서 6.99(약 160 NFE)의 최고 성능 FID 점수를 달성한다.

ABSTRACT

Diffusion models are powerful generative models that simulate the reverse of diffusion processes using score functions to synthesize data from noise. The sampling process of diffusion models can be interpreted as solving the reverse stochastic differential equation (SDE) or the ordinary differential equation (ODE) of the diffusion process, which often requires up to thousands of discretization steps to generate a single image. This has sparked a great interest in developing efficient integration techniques for reverse-S/ODEs. Here, we propose an orthogonal approach to accelerating score-based sampling: Denoising MCMC (DMCMC). DMCMC first uses MCMC to produce samples in the product space of data and variance (or diffusion time). Then, a reverse-S/ODE integrator is used to denoise the MCMC samples. Since MCMC traverses close to the data manifold, the computation cost of producing a clean sample for DMCMC is much less than that of producing a clean sample from noise. To verify the proposed concept, we show that Denoising Langevin Gibbs (DLG), an instance of DMCMC, successfully accelerates all six reverse-S/ODE integrators considered in this work on the tasks of CIFAR10 and CelebA-HQ-256 image generation. Notably, combined with integrators of Karras et al. (2022) and pre-trained score models of Song et al. (2021b), DLG achieves SOTA results. In the limited number of score function evaluation (NFE) settings on CIFAR10, we have $3.86$ FID with $\approx 10$ NFE and $2.63$ FID with $\approx 20$ NFE. On CelebA-HQ-256, we have $6.99$ FID with $\approx 160$ NFE, which beats the current best record of Kim et al. (2022) among score-based models, $7.16$ FID with $4000$ NFE. Code: https://github.com/1202kbs/DMCMC

연구 동기 및 목표

  • 역방향-S/ODE 통합의 계산 비용을 줄임으로써 스코어 기반 생성 모델에서의 표본 추출을 가속화하는 것.
  • 다중 모달리틱이고 고차원적인 데이터 분포에서 전통적인 MCMC 방법의 비효율성을 해결하기 위해, 분리된 모드 간을 횡단할 수 있도록 하는 것.
  • MCMC와 역방향-S/ODE 통합기 간의 통합을 통해 더 빠르고 고성능의 표본 생성이 가능한 플러그 앤 플레이 프레임워크를 개발하는 것.
  • CIFAR10과 CelebA-HQ-256와 같은 표준 벤치마크에서 최소한의 스코어 함수 평가 횟수(NFE)로 최고 성능 FID 점수를 달성하는 것.

제안 방법

  • 데이터와 확산 시간(분산)의 곱공간에서 MCMC를 사용해 데이터 다양체 근처의 고밀도 영역을 탐색하는 DMCMC 프레임워크를 제안한다.
  • 최대 노이즈에서가 아니라 0에 가까운 시간에서 시작하는 표본을 기반으로 역방향-S/ODE 통합기를 사용해 표본을 복원함으로써, 통합 간격을 기존 방법보다 크게 단축시킨다.
  • 데이터 업데이트를 위한 랭글레인 역학과 노이즈 수준 예측을 위한 지브스 샘플링을 번갈아 사용하는 실용적 구현인 점도 제거 랭글레인 지브스(DLG)를 도입한다.
  • 사전 훈련된 노이즈 조건 스코어 네트워크와 경량의 노이즈 수준 분류기 사용으로, 추가 계산 비용이 거의 들지 않는 효율적이고 확장 가능한 표본 추출을 가능하게 한다.
  • 확산 과정을 시간에 따라 변하는 스코어 함수로 간주하여, 임의의 초기 시간 t_n(0에 가까운 값)에서부터도 역방향-S/ODE 통합이 가능하도록 한다.
  • 표본 품질과 다양성의 균형을 맞추기 위해 스텝 크기 η, 총 NFE, 복원 비율(n_den/n) 등의 하이퍼파rameter를 최적화한다.

실험 결과

연구 질문

  • RQ1데이터와 확산 시간의 곱공간에서 MCMC 표본 추출이 스코어 기반 생성 모델에서의 역방향-S/ODE 통합을 더 빠르고 효율적으로 만들 수 있는가?
  • RQ2MCMC에 의해 낮은 노이즈 상태에서 시작하는 것이, 표본 품질을 유지하거나 향상시키면서도 필요한 스코어 함수 평가 횟수(NFE)를 크게 줄일 수 있는가?
  • RQ3MCMC와 역방향-S/ODE 통합기를 결합한 플러그 앤 플레이 프레임워크가 다양한 생성 모델링 벤치마크에서 최고 성능을 달성할 수 있는가?
  • RQ4랭글레인 스텝 크기(η), 총 NFE, 복원 비율(n_den/n) 등의 하이퍼파rameter가 DMCMC 프레임워크에서 표본 품질과 다양성의 상호 간 균형에 미치는 영향은 무엇인가?

주요 결과

  • DLG는 약 10 NFE로 CIFAR10에서 3.86의 최고 성능 FID를 달성하여, 동일한 NFE 예산에서 이전 방법의 4.17 FID를 뛰어넘었다.
  • CelebA-HQ-256에서는 약 160 NFE로 6.99의 최고 성능 FID를 기록하여, 다른 스코어 기반 모델을 사용해 4,000 NFE로 달성한 이전 최고 성능 7.16 FID를 초월했다.
  • 노이즈 수준을 0에 가까운 값에서 시작함으로써, 평균 역방향-S/ODE 통합 간격 길이를 크게 줄여 더 빠른 수렴을 가능하게 하였으며, 추가 계산 비용은 거의 들지 않았다.
  • 제거 분석 결과, 최적의 성능는 복원 비율(n_den/n)이 중간 수준일 때 달성되며, 차원에 영향을 받지 않는 이동 파라미터(κ = η/√d)가 다양한 데이터셋 간 하이퍼파rameter 전이를 효과적으로 가능하게 한다.
  • 노이즈 수준 분류기의 계산 비용은 극히 미미하여, 추가 FLOPs 측면에서 가속 효과가 거의 비용 없이 실현된다.
  • 프레임워크는 일반적이고 플러그 앤 플레이 가능하다: 어떤 MCMC, VE 과정, 역방향-S/ODE 통합기라도 사용 가능하며, 광범위한 적용 가능성과 확장성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.