Skip to main content
QUICK REVIEW

[논문 리뷰] A Variational Perspective on Diffusion-Based Generative Models and Score Matching

Chin-Wei Huang, Jae Hyun Lim|arXiv (Cornell University)|2021. 06. 05.
Generative Adversarial Networks and Image Synthesis참고 문헌 54인용 수 40
한 줄 요약

본 논문은 diffusion 기반 생성모델과 점수 매칭을 연결하는 연속-시간 변분 프레임워크를 구축하고, Feynman-Kac 및 Girsanov 이론을 통해 플러그인 역 SDE의 우도 하한과 점수 매칭의 관계를 제시한다.

ABSTRACT

Discrete-time diffusion-based generative models and score matching methods have shown promising results in modeling high-dimensional image data. Recently, Song et al. (2021) show that diffusion processes that transform data into noise can be reversed via learning the score function, i.e. the gradient of the log-density of the perturbed data. They propose to plug the learned score function into an inverse formula to define a generative diffusion process. Despite the empirical success, a theoretical underpinning of this procedure is still lacking. In this work, we approach the (continuous-time) generative diffusion directly and derive a variational framework for likelihood estimation, which includes continuous-time normalizing flows as a special case, and can be seen as an infinitely deep variational autoencoder. Under this framework, we show that minimizing the score-matching loss is equivalent to maximizing a lower bound of the likelihood of the plug-in reverse SDE proposed by Song et al. (2021), bridging the theoretical gap.

연구 동기 및 목표

  • 확산 모델에서 사용되는 연속 시간 확산 프로세스에 대한 우도 추정의 동기를 제시하고 이를 형식화한다.
  • 점수 매칭 손실과 최대 우도 간의 다리를 놓기 위해 변분 ELBO 프레임워크를 제시한다.
  • 점수 매칭 손실을 최소화하는 것이 plug-in 역 SDE의 주변 우도에 대한 하한를 최대화한다는 것을 보인다.
  • 결과를 주변 등가성을 갖는 plug-in 역 SDE 가족으로 일반화하되, 한계 케이스로서 등가 ODE를 포함한다.

제안 방법

  • 기댓값을 이용하여 생성 확산의 주변 밀도를 표현하기 위해 Feynman-Kac를 사용하는 변분 프레임워크를 도출한다.
  • Girsanov의 측도 변화를 적용하여 잠재적 브라운 운동 경로를 추정하고 연속 시간 ELBO(CT-ELBO)를 얻는다.
  • 생성 SDE와 추론 SDE를 재매개변수화하여 점수 함수와의 연결을 드러낸다.
  • 추론 SDE가 주변 밀도의 점수와 일치할 때 연속 시간 ELBO가 더 촘촘해진다는 것을 입증한다.
  • CT-ELBO가 이산-시간 ELBO를 무한히 깊은 계층으로 확장하고 무한 깊이 VAE 관점과 관련이 있음을 보인다.
  • 실용적 추정을 위한 계산 상의 트레이드오프, 편향-분산 고려사항, 편향 제거 전략을 논의한다.

실험 결과

연구 질문

  • RQ1점수 매칭 손실을 최소화하는 것이 plug-in 역 SDE의 샘플링 동작에 어떤 영향을 미치는가?
  • RQ2연속 시간 확산 모델의 주변 우도를 일관되게 추정할 수 있는 변분 ELBO 프레임워크가 있는가?
  • RQ3확산 기반 생성 모델에서 점수 매칭과 최대 우도 간의 관계는 무엇인가?
  • RQ4plug-in 역 SDE들이 점수 매칭에 의해 ELBO가 최대화되는 연속체를 형성하는가?

주요 결과

  • 변분 프레임워크는 plug-in 역 SDE의 로그 주변 밀도에 하한을 주는 연속 시간 ELBO를 도출한다.
  • 점수 매칭 손실을 최소화하는 것은 plug-in 역 SDE의 우도에 대한 하한을 최대화하는 것과 대응하며 점수 매칭과 우도 추정 간의 다리를 놓는다.
  • 이 프레임워크는 이산 시간 확산 모델을 무한 깊이로 확장하여 무한 깊이의 위계적 VAE 관점과 맞닿는다.
  • 일정 조건 하에서 같은 주변 분포를 공유하는 주변 등가성을 갖는 plug-in 역 SDE 가족이 존재하며, 극한 케이스로 등가 ODE를 포함한다.
  • 자세한 비교는 계산 효율성의 트레이드오프를 드러내고, 편향 제거 전략이 MNIST와 CIFAR-10 같은 데이터셋에서 우도 추정의 실용적 정확도를 높인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.