Skip to main content
QUICK REVIEW

[논문 리뷰] Bilateral Denoising Diffusion Models

Max W. Y. Lam, Jun Wang|arXiv (Cornell University)|2021. 08. 26.
Generative Adversarial Networks and Image Synthesis참고 문헌 35인용 수 11
한 줄 요약

이 논문은 샘플링 중에 노이즈 스케줄을 최적화하기 위해 스코어 네트워크와 스케줄링 네트워크를 동시에 학습하는 양방향 노이즈 제거 확산 모델(BDDMs)을 제안한다. 이로 인해 최소 3단계의 샘플링으로도 고해상도 이미지 생성이 가능해지며, 표준 DDPM보다 62배 빠른 속도를 달성한다. BDDMs는 로그우도의 더 날카운 감소한 하한을 유도하고, 두 네트워크를 엔드 투 엔드로 훈련함으로써 샘플링 효율성을 크게 향상시키면서도 품질을 손상시키지 않는다.

ABSTRACT

Denoising diffusion probabilistic models (DDPMs) have emerged as competitive generative models yet brought challenges to efficient sampling. In this paper, we propose novel bilateral denoising diffusion models (BDDMs), which take significantly fewer steps to generate high-quality samples. From a bilateral modeling objective, BDDMs parameterize the forward and reverse processes with a score network and a scheduling network, respectively. We show that a new lower bound tighter than the standard evidence lower bound can be derived as a surrogate objective for training the two networks. In particular, BDDMs are efficient, simple-to-train, and capable of further improving any pre-trained DDPM by optimizing the inference noise schedules. Our experiments demonstrated that BDDMs can generate high-fidelity samples with as few as 3 sampling steps and produce comparable or even higher quality samples than DDPMs using 1000 steps with only 16 sampling steps (a 62x speedup).

연구 동기 및 목표

  • 고품질 출력을 위해 수천 번의 샘플링 단계가 필요한 노이즈 제거 확산 모델의 높은 계산 비용 문제를 해결하기 위해.
  • 고정되거나 수작업으로 설정된 스케줄에 의존하는 대신, 엔드 투 엔드로 노이즈 스케줄을 학습함으로써 샘플링 효율성을 향상시키기 위해.
  • 표준 ELBO보다 더 날카운 감소한 하한을 도출함으로써, 스코어 및 스케줄링 네트워크의 더 나은 훈련을 가능하게 하기 위해.
  • 기존에 훈련된 DDPM에 적용할 수 있는 단순하고 효율적인 훈련 절차를 설계하기 위해.
  • 학습된 노이즈 스케줄이 고정되거나 그리드 서치된 스케줄보다 품질과 안정성 측면에서 뚜렷이 뛰어나다는 것을 입증하기 위해.

제안 방법

  • BDDMs는 스케줄링 네트워크 σφ를 사용하여 전진 과정을 매개변수화하며, 이는 시간에 따라 변화하는 노이즈 분산 βt를 학습함으로써 고정된 스케줄을 대체한다.
  • 역방향 과정은 표준 DDPM과 마찬가지로 노이즈를 예측하는 스코어 네트워크 εθ로 모델링된다.
  • 로그 주변우도에 대한 더 날카운 감소한 하한이 유도되었으며, 이 하한은 θ와 φ에 모두 의존하며 단계별 최적화를 효율적으로 가능하게 한다.
  • εθ의 훈련 목표는 합리적인 조건 하에서 표준 DDPM 손실로 줄어들며, 이는 기존 훈련과의 호환성을 보장한다.
  • σφ의 목표는 θ가 최적화되었을 때 하한을 더욱 날카롭게 하는 함수로 유도되었으며, 이는 노이즈 스케줄의 공동 학습을 가능하게 한다.
  • 사전 훈련된 DDPM의 효율적인 피지컬 튜닝을 가능하게 하며, 추가적인 훈련 비용이 최소한이 되도록 스케줄링 네트워크만 최적화한다.

실험 결과

연구 질문

  • RQ1학습 중에 노이즈 스케줄을 학습함으로써 고해상도 생성을 위해 필요한 샘플링 단계 수를 뚜렷이 줄일 수 있는가?
  • RQ2스코어 및 스케줄링 네트워크를 공동으로 최적화할 때, 로그우도에 대한 더 날카운 감소한 하한이 더 나은 생성 성능을 이끌어내는가?
  • RQ3샘플링 속도와 품질 측면에서 BDDMs는 표준 DDPM, DDIM, NE 기반 방법과 비교해 어떻게 성능을 내는가?
  • RQ4스텝 인덱스에 대한 사전 지식 없이도 스케줄링 네트워크가 효과적인 비균일 노이즈 스케줄을 학습할 수 있는가?
  • RQ5특히 낮은 단계 수에서, 제안된 방법이 다양한 샘플링 단계 수에 대해 확장 가능하고 안정적인가?

주요 결과

  • BDDMs는 단 3단계의 추론 단계만으로도 표준 DDPM이 1000단계를 사용할 때와 유사한 고해상도 샘플을 생성한다.
  • 16단계 샘플링에서 BDDMs는 1000단계를 사용하는 DDPM보다 동일하거나 높은 품질의 샘플을 생성하며, 이로 인해 62배의 속도 향상을 달성한다.
  • BDDMs의 성능은 8, 16, 21단계에서 모두 안정되어 있으나, NE 기반 방법은 8단계를 초과하면 상당히 열화된다.
  • BDDM-21에서 학습된 노이즈 스케줄은 노이즈 크기가 0.01을 초과한 후에 뚜렷한 전환점이 나타나며, 이는 적응형 스케줄링이 성능 향상에 기여함을 시사한다.
  • 직접 βt를 매개변수로 학습하는 것(스케줄링 네트워크 없이)은 성능이 열 劣하고, 메모리 제약으로 인해 큰 단계 수에서는 실현 불가능하다.
  • 스케줄링 네트워크에 음수 ELBO를 손실로 사용할 경우, 네트워크가 일정한 전부 1인 스케줄을 예측하여 성능이 열화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.