Skip to main content
QUICK REVIEW

[논문 리뷰] Interpreting and Improving Diffusion Models from an Optimization Perspective

Frank Permenter, Chenyang Yuan|arXiv (Cornell University)|2023. 06. 08.
Advanced Neuroimaging Techniques and Applications인용 수 4
한 줄 요약

이 논문은 노이즈 제거 확산 모델을 데이터 다양체에 대한 제곱 유클리드 거리 함수로의 근사적 경사 하강법으로 해석하여 결정론적 최적화 기반 분석을 가능하게 한다. 새로운 샘플러를 제안하여 노이즈 제거기 출력을 집계함으로써 샘플 품질을 향상시키며, 단지 5~10회의 함수 평가로 CIFAR-10 및 CelebA에서 최신 기준(FID 점수)을 달성한다.

ABSTRACT

Denoising is intuitively related to projection. Indeed, under the manifold hypothesis, adding random noise is approximately equivalent to orthogonal perturbation. Hence, learning to denoise is approximately learning to project. In this paper, we use this observation to interpret denoising diffusion models as approximate gradient descent applied to the Euclidean distance function. We then provide straight-forward convergence analysis of the DDIM sampler under simple assumptions on the projection error of the denoiser. Finally, we propose a new gradient-estimation sampler, generalizing DDIM using insights from our theoretical results. In as few as 5-10 function evaluations, our sampler achieves state-of-the-art FID scores on pretrained CIFAR-10 and CelebA models and can generate high quality samples on latent diffusion models.

연구 동기 및 목표

  • 노이즈 제거를 데이터 다양체에 대한 근사적 투영으로 프레임워크화하여, 확산 모델의 결정론적 최적화 기반 해석을 제공한다.
  • 노이즈 제거기의 투영 정확도에 대한 상대 오차 모델 하에서 DDIM 샘플러의 수렴성을 분석한다.
  • 기울기 추정 오차 제어와 노이즈 제거기 출력 집계를 활용하여 샘플 품질을 향상시키는 새로운 샘플링 알고리즘을 개발한다.
  • 기존 기법들인 스코어 디스틸레이션 샘플링과 조건부 생성 기법들을 거리 함수 최적화 프레임워크 아래 통합한다.
  • 원칙적인 거리 최소화 관점에서 사전 학습된 노이즈 제거기를 제약 최적화 작업에 즉시 통합할 수 있도록 한다.

제안 방법

  • 노이즈 제거기 출력을 데이터 다양체에 대한 제곱 유클리드 거리 함수의 기울기 추정치로 해석한다. 즉, ∇f(x) ≈ σεθ(x,σ).
  • 상대 오차 모델을 도입한다: ||∇f(x) − σεθ(x,σ)|| ≤ η||∇f(x)||. 이는 기울기 추정 오차를 제한한다.
  • 상대 오차 가정 하에서 DDIM 샘플링이 f(x) = ½ distK²(x)에 대한 근사적 경사 하강법과 동치임을 보여준다.
  • 오차 매개변수 (η,ν) 가 유계일 때 distK(xt)의 단조 감소를 보장하는 노이즈 스케줄 σt 의 조건을 유도한다.
  • 기울기 추정 오차를 줄이고 수렴성을 향상시키기 위해 다수의 노이즈 제거기 출력을 집계하는 새로운 샘플러(알고리즘 2)를 제안한다.
  • 이 프레임워크를 적용하여 스코어 디스틸레이션 샘플링 및 조건부 생성 기법들을 거리 함수 최적화의 제약 최적화 문제로 재해석하고 일반화한다.

실험 결과

연구 질문

  • RQ1확산 모델에서의 노이즈 제거는 데이터 다양체에 대한 근사적 투영으로 엄밀히 해석될 수 있는가?
  • RQ2노이즈 제거기 출력의 상대 오차는 확산 샘플러의 수렴성에 어떤 영향을 미치는가?
  • RQ3확산 샘플링 과정은 데이터 다양체에 대한 제곱 거리 함수로의 경사 하강법으로 재해석될 수 있는가?
  • RQ4기울기 추정 오차가 유계일 때 샘플링 과정의 수렴을 보장하는 노이즈 스케줄은 무엇인가?
  • RQ5노이즈 제거기 출력을 집계하여 추정 오차를 줄이면 개선된 샘플러를 설계할 수 있는가?

주요 결과

  • 다양체 가정 하에 노이즈 수준 σ가 다양체까지의 거리에 비례할 경우, 노이즈 제거 과정은 다양체에 대한 투영을 근사한다.
  • 상대 오차가 유계일 경우, DDIM 샘플링은 제곱 유클리드 거리 함수에 대한 근사적 경사 하강법과 동치이며, 수렴이 보장된다.
  • 제안된 샘플러는 사전 학습된 CIFAR-10 및 CelebA 모델에서 단지 5~10회의 함수 평가로 최신 기준 FID 점수를 달성한다.
  • 고해상도 잠재 확산 모델인 Stable Diffusion와 같은 모델들에서도 기존 방법들을 능가하며, 최소한의 추론 비용으로 경쟁 가능한 FID 점수를 달성한다.
  • 이 프레임워크는 스코어 디스틸레이션 샘플링을 거리 함수와 매개변수화된 생성자로 구성된 복합 목적 함수에 대한 경사 하강법으로 재해석한다.
  • 분석을 통해 노이즈 제거기 학습이 ||∇d(x)|| = 1 인 Eikonal 방정식의 해를 학습하는 것과 동치임을 밝혀내며, 확산 모델이 수준집합 및 거리 함수 학습과 연결됨을 밝힌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.