Skip to main content
QUICK REVIEW

[논문 리뷰] Denoising Diffusion Bridge Models

Linqi Zhou, Aaron Lou|arXiv (Cornell University)|2023. 09. 29.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

Denoising Diffusion Bridge Models (DDBMs)는 두 개의 임의의 분포 사이의 스코어 기반 확산 다리를 학습함으로써 확산 모델과 최적 운반 이론을 일반화하는 통합된 생성 모델링 프레임워크를 제안한다. 이 방법은 이미지 번역에서 최고 성능을 기록하고 무조건적 생성에서 SOTA FID 점수를 달성하며, 단일 확률 미분 방정식 프레임워크 내에서 스코어 기반 확산과 플로우 매칭을 통합한다.

ABSTRACT

Diffusion models are powerful generative models that map noise to data using stochastic processes. However, for many applications such as image editing, the model input comes from a distribution that is not random noise. As such, diffusion models must rely on cumbersome methods like guidance or projected sampling to incorporate this information in the generative process. In our work, we propose Denoising Diffusion Bridge Models (DDBMs), a natural alternative to this paradigm based on diffusion bridges, a family of processes that interpolate between two paired distributions given as endpoints. Our method learns the score of the diffusion bridge from data and maps from one endpoint distribution to the other by solving a (stochastic) differential equation based on the learned score. Our method naturally unifies several classes of generative models, such as score-based diffusion models and OT-Flow-Matching, allowing us to adapt existing design and architectural choices to our more general problem. Empirically, we apply DDBMs to challenging image datasets in both pixel and latent space. On standard image translation problems, DDBMs achieve significant improvement over baseline methods, and, when we reduce the problem to image generation by setting the source distribution to random noise, DDBMs achieve comparable FID scores to state-of-the-art methods despite being built for a more general task.

연구 동기 및 목표

  • 표준 확산 모델이 랜덤 노이즈 사전을 가정하고 이미지 번역과 같은 비노이즈 입력에서 어려움을 겪는 점을 해결하기 위해.
  • 확산 브리지로 스코어 기반 확산 모델과 최적 운반 기반 플로우 매칭을 하나의 프레임워크로 통합하기 위해.
  • 확산 브리지에서 학습된 스코어 함수를 활용해 이미지 간 번역 및 무조건적 생성 성능를 향상시키기 위해.
  • 조건부 생성에서 히우리스틱 기법(예: 가이던스 또는 프로젝션 샘플링)에 의존도를 줄이기 위해.

제안 방법

  • 학습된 스코어 함수에 의해 구동되는 확률 미분 방정식(SDE)을 사용하여, 주어진 두 분포 사이를 연결하는 역시간 확산 브리지 과정을 모델링한다.
  • 문제를 확산 브리지의 스코어를 학습하는 것으로 설정함으로써, SDE 통합을 통해 한 분포에서 다른 분포로의 샘플링을 가능하게 한다.
  • 사전이 노이즈일 경우 스코어 기반 확산 모델과 동일하고, 경로가 결정론적일 경우 플로우 매칭과 동일한 프레임워크를 제공함으로써 두 파라다임을 일반화한다.
  • 스코어 네트워크를 훈련하기 위해 노이즈 매개변수화 및 사전 조정 기법을 적용한 디노이징 스코어 매칭 목적함수를 사용한다.
  • 고정된 스텝 수와 가이던스 스케일링을 사용하는 에일러-마루야마 샘플러를 적용하여 추론 시 일관성을 확보한다.
  • VAE 기반 버블넥을 사용하여 픽셀 공간과 임베딩 공간 양쪽 모두에 적용 가능하게 하여 고해상도 번역을 효율적으로 수행한다.
Figure 1: A schematic for Denoising Diffusion Bridge Models. DDBM uses a diffusion process guided by a drift adjustment (in blue) towards an endpoint ${\mathbf{x}}_{T}=y$ . They lears to reverse such a bridge process by matching the denoising bridge score (in orange), which allows one to reverse fro
Figure 1: A schematic for Denoising Diffusion Bridge Models. DDBM uses a diffusion process guided by a drift adjustment (in blue) towards an endpoint ${\mathbf{x}}_{T}=y$ . They lears to reverse such a bridge process by matching the denoising bridge score (in orange), which allows one to reverse fro

실험 결과

연구 질문

  • RQ1무조건적 생성과 이미지 간 번역을 모두 자연스럽게 처리할 수 있는 통합된 생성 모델링 프레임워크를 개발할 수 있는가?
  • RQ2기존의 스코어 기반 확산 또는 플로우 매칭과 비교해 확산 브리지의 스코어를 학습하는 방식이 성능와 안정성 측면에서 어떻게 다른가?
  • RQ3복잡한 가이던스나 반복적 정밀화 없이도 제안된 방법이 경쟁력 있는 FID 및 LPIPS 점수를 달성할 수 있는가?
  • RQ4무조건적 생성으로 단순화되었을 때도 이 프레임워크는 최고 수준의 확산 모델과 동등한 성능유지가 가능한가?
  • RQ5이 방법은 이미지 품질과 구조를 유지하면서도 임베딩 공간 번역으로도 효과적으로 일반화될 수 있는가?

주요 결과

  • 임베딩 공간에서 Day → Night 번역 작업에서 DDBM은 FID 27.63을 기록하여 Pix2Pix(157.1)와 SDEdit(151.1)를 모두 앞서며, IS(3.92)와 MSE(0.145)에서도 두 번째로 높은 순위를 기록했다.
  • 픽셀 공간에서의 이미지 번역에서 DIODE 데이터셋에서 DDBM은 FID 12.38을 달성하여 Rectified Flow(12.38)와 I2SB(15.56)를 능가했고, LPIPS(0.366)와 MSE(0.129)에서도 최고 성능을 기록했다.
  • CIFAR-10에서의 무조건적 생성에서 DDBM은 FID 5.88을 기록했으며, 더 일반적인 과제를 학습했음에도 불구하고 최고 수준의 확산 모델과 유사한 성능를 보였다.
  • FFHQ-64×64에서 DDBM은 FID 5.21을 기록하여 무조건적 이미지 생성에서 뛰어난 성능를 입증했다.
  • 사전 조정 및 노이즈 스케줄 적응 기법을 통한 아키텍처 수정을 통해 입력 민감도에 대한 강건성과 훈련 안정성이 향상되었다.
  • 정성적 결과는 고해상도 번역을 통해 이미지의 구조와 정체성을 잘 유지하는 것을 확인했으며, 이미지 간 번역 과제에서 높은 품질의 생성 결과를 보였다.
Denoising Diffusion Bridge Models

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.