Skip to main content
QUICK REVIEW

[논문 리뷰] SciRE-Solver: Accelerating Diffusion Models Sampling by Score-integrand Solver with Recursive Difference

Shigui Li, Wei Chen|arXiv (Cornell University)|2023. 08. 15.
Model Reduction and Neural NetworksPhysics and Astronomy인용 수 3
한 줄 요약

이 논문은 확산 모델의 추론 속도를 높이기 위해 고차수 테일러 전개에서 스코어 함수 도함수를 효율적으로 추정하는 재귀적 차분(RD) 기법을 사용하는 학습 불필요 샘플링 방법인 SciRE-Solver를 제안한다. 이 방법은 CIFAR-10에서 100 NFE 시 2.40의 FID 점수, 84 NFE 시 3.15의 FID 점수를 기록하며, 1,000개 이상의 NFE로 훈련된 모델들을 초월하는 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Diffusion models (DMs) have made significant progress in the fields of image, audio, and video generation. One downside of DMs is their slow iterative process. Recent algorithms for fast sampling are designed from the perspective of differential equations. However, in higher-order algorithms based on Taylor expansion, estimating the derivative of the score function becomes intractable due to the complexity of large-scale, well-trained neural networks. Driven by this motivation, in this work, we introduce the recursive difference (RD) method to calculate the derivative of the score function in the realm of DMs. Based on the RD method and the truncated Taylor expansion of score-integrand, we propose SciRE-Solver with the convergence order guarantee for accelerating sampling of DMs. To further investigate the effectiveness of the RD method, we also propose a variant named SciREI-Solver based on the RD method and exponential integrator. Our proposed sampling algorithms with RD method attain state-of-the-art (SOTA) FIDs in comparison to existing training-free sampling algorithms, across both discrete-time and continuous-time pre-trained DMs, under various number of score function evaluations (NFE). Remarkably, SciRE-Solver using a small NFEs demonstrates promising potential to surpass the FID achieved by some pre-trained models in their original papers using no fewer than $1000$ NFEs. For example, we reach SOTA value of $2.40$ FID with $100$ NFE for continuous-time DM and of $3.15$ FID with $84$ NFE for discrete-time DM on CIFAR-10, as well as of $2.17$ (2.02) FID with $18$ (50) NFE for discrete-time DM on CelebA 64$ imes$64.

연구 동기 및 목표

  • 일반적으로 수백 번의 반복 단계가 필요한 확산 모델의 느린 샘플링 속도를 해결한다.
  • 고차수 수치 해법을 위한 대규모 신경망에서 스코어 함수 도함수 추정의 비가역성 문제를 해결한다.
  • 학습이 불필요한 수학적으로 타당한 방법을 개발하여 샘플링 속도를 가속화하면서도 샘플 품질을 유지하거나 향상시킨다.
  • 기존 방법보다 훨씬 적은 스코어 함수 평가 횟수(NFE)로 고해상도 생성을 가능하게 한다.
  • 이론적 기반에 기반한 재귀적 차분 기법이 이산 시간 및 연속 시간 확산 모델 모두에서 효과적으로 작용함을 입증한다.

제안 방법

  • 스코어 함수의 테일러 전개에서 저차수 도함수 정보를 재귀적으로 추출함으로써 스코어 함수의 고차수 도함수를 계산하는 재귀적 차분(RD) 방법을 도입한다.
  • RD로 추정한 도함수를 사용하여 스코어 인테그랄랜드의 절단된 테일러 전개를 구성함으로써 고차수 수치 적분기를 설계한다.
  • RD 방법을 활용하여 도함수 근사치를 제공하는 고차수, 수렴 보장이 되는 확산 ODE 해법인 SciRE-Solver를 제안한다.
  • 안정성과 정확도를 향상시키기 위해 RD 방법과 지수 적분기를 조합한 변형인 SciREI-Solver를 제안한다.
  • 샘플링 효율성을 향상시키기 위해 SNR 기반 또는 NSR 유형의 경로를 기반으로 한 적응형 시간단계 스케줄링을 설계한다.
  • 추가 학습이 필요 없이 사전 훈련된 확산 모델에 직접 적용 가능한 방법을 구현한다.

실험 결과

연구 질문

  • RQ1재귀적 차분 기법은 확산 모델에서 스코어 함수의 고차수 도함수를 효율적이고 정확하게 추정할 수 있는가?
  • RQ2제안된 SciRE-Solver는 기존의 학습 불필요 해법보다 고차수 수렴성과 향상된 샘플링 효율성을 달성하는가?
  • RQ3RD 기반 방법은 기존 기준 방법보다 훨씬 적은 스코어 함수 평가 횟수로 최신 기술 수준의 FID 점수를 달성할 수 있는가?
  • RQ4기존 사전 훈련된 모델의 일부 NFE만을 사용할 경우 SciRE-Solver의 성능는 어떻게 되는가?
  • RQ5SciREI-Solver에서 RD와 지수 적분기의 조합이 샘플링 품질과 안정성을 추가로 향상시키는가?

주요 결과

  • SciRE-Solver는 CIFAR-10에서 단지 100개의 스코어 함수 평가(NFE)로 2.40의 최신 기술 수준(FID) 점수를 기록하며, 1,000개 이상의 NFE로 훈련된 모델들을 초월한다.
  • CIFAR-10의 이산 시간 확산 모델에서 SciRE-Solver는 84 NFE로 FID 3.15를 기록하여 학습 불필요 방법 중 최신 기술 수준을 달성한다.
  • CelebA 64×64에서 SciRE-Solver는 18 NFE로 FID 2.17, 50 NFE로 FID 2.02를 기록하여 낮은 NFE에서도 뛰어난 샘플 품질을 입증한다.
  • ImageNet 및 LSUN을 포함한 다양한 데이터셋에서의 시각적 비교를 통해 DDIM 및 DPM-Solver보다 더 적은 단계로 고품질 샘플을 생성한다.
  • 연속 시간 모델에서 12 NFE로 CIFAR-10에서 FID 3.48을 기록하였고, 20 NFE로 FID 2.42를 달성하여 이전 최신 기술 수준과 비교해도 뒤지지 않는다.
  • 결과는 RD 기법이 추가 학습 없이도 정확한 도함수 추정이 가능하게 하여 고속이고 고품질의 샘플링에 매우 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.