Skip to main content
QUICK REVIEW

[논문 리뷰] Relay Diffusion: Unifying diffusion process across resolutions for image synthesis

Jiayan Teng, Wendi Zheng|arXiv (Cornell University)|2023. 09. 04.
Advancements in Photolithography Techniques인용 수 5
한 줄 요약

이 논문은 블러링 확산과 블록 노이즈를 사용하여 저해상도 노이즈 또는 이미지를 등가의 고해상도 표현으로 전달하는 방식으로 해상도 간 확산 과정을 통합하는 새로운 계단식 확산 프레임워크인 리레이 확산 모델(Relay Diffusion Model, RDM)을 제안한다. RDM는 순수한 노이즈에서 다시 시작하지 않고 분포 불일치를 제거함으로써, 재생 가능한 해상도 스케일링이 가능해지며, ImageNet 256×256에서 FID 1.87(분류기 자유 가이드ance 사용 시)과 CelebA-HQ 256×256에서 sFID를 달성하여 이전 방법들인 ADM, LDM, DiT를 능가한다.

ABSTRACT

Diffusion models achieved great success in image synthesis, but still face challenges in high-resolution generation. Through the lens of discrete cosine transformation, we find the main reason is that \emph{the same noise level on a higher resolution results in a higher Signal-to-Noise Ratio in the frequency domain}. In this work, we present Relay Diffusion Model (RDM), which transfers a low-resolution image or noise into an equivalent high-resolution one for diffusion model via blurring diffusion and block noise. Therefore, the diffusion process can continue seamlessly in any new resolution or model without restarting from pure noise or low-resolution conditioning. RDM achieves state-of-the-art FID on CelebA-HQ and sFID on ImageNet 256$ imes$256, surpassing previous works such as ADM, LDM and DiT by a large margin. All the codes and checkpoints are open-sourced at \url{https://github.com/THUDM/RelayDiffusion}.

연구 동기 및 목표

  • 표준 노이즈 스케줄이 더 큰 해상도에서 최적의 성능을 내지 못하는 문제를 해결하기 위해, 특히 고해상도 이미지 생성에서의 확산 모델의 도전 과제를 다루는 것.
  • 계단식 확산 모델의 한계, 즉 생성된 실제 저해상도 조건 간의 분포 불일치와 순수한 노이즈에서의 재반복 샘플링 문제를 해결하는 것.
  • 다양한 해상도와 모델 아키텍처 간에 확산 과정을 통합하여, 순수한 노이즈에서 다시 시작하지 않고도 샘플링을 원활하게 계속할 수 있도록 하는 것.
  • 샘플링 단계 수를 줄이고 저해상도 조건이 필요 없도록 함으로써 훈련 및 추론 효율성을 향상시키는 것.

제안 방법

  • RDM는 각 단계가 순수한 노이즈가 아닌 이전 단계의 출력에서 시작하는 리레이 메커니즘을 도입하여, 해상도 간 연속적인 생성을 가능하게 한다.
  • 저해상도 노이즈 또는 이미지를 등가의 고해상도 표현으로 전달하기 위해 블러링 확산을 활용하여 구조적이고 주파수 도메인 일致성을 유지한다.
  • 고주파 노이즈 패턴을 모델링하기 위해 블록 노이즈를 도입하여 주파수 도메인에서 해상도에 따라 달라지는 노이즈 효과를 개선한다.
  • 조정 가능한 확률적 스케일 η를 가진 확률적 SDE 샘플러를 사용하며, η = 0.2일 때 ImageNet과 CelebA-HQ 양쪽에서 최적의 성능을 낸다.
  • 확산 과정을 기반 신경망 아키텍처에서 분리하여 샘플링 중에 아키텍처와 해상도를 자유롭게 변경할 수 있도록 한다.
  • 계산 비용을 고려해 FLOPs를 단계 간에 할당하며, 첫 번째 단계에 더 많은 스텝을 할당할수록 최종 FID가 향상된다.

실험 결과

연구 질문

  • RQ1표준 노이즈 스케줄이 고해상도 확산 모델에서 실패하는 이유는 무엇이며, 해상도는 노이즈의 인지적 영향에 어떻게 영향을 미치는가?
  • RQ2순수한 노이즈에서 다시 시작하거나 저해상도 조건에 의존하지 않고도 서로 다른 해상도 간에 확산 과정을 통합할 수 있는가?
  • RQ3블록 노이즈의 추가가 고해상도 확산 생성에서 성능 향상에 어떻게 기여하는가?
  • RQ4계단식 확산 파이프라인에서 최소한의 FID를 달성하기 위해 단계 간의 샘플링 스텝 수의 최적 균형은 무엇인가?
  • RQ5통합된 확산 프레임워크는 무조건적 및 조건부 고해상도 이미지 생성 모두에서 최고의 성능을 달성할 수 있는가?

주요 결과

  • RDM는 분류기 자유 가이드ance를 사용한 ImageNet 256×256에서 상태최저 수준의 FID 1.87을 달성하여 이전 방법들인 ADM, LDM, DiT를 크게 능가한다.
  • CelebA-HQ 256×256에서 RDM는 보고된 바 없는 최고의 sFID를 기록하여 뛰어난 이미지 품질과 다양성을 입증한다.
  • 블록 노이즈 추가로 FID가 놀라운 수준으로 향상되었으며, 최고 성능는 α = 0.15 및 커널 크기 s = 4에서 달성된다.
  • SDE 샘플러에서 최적의 확률적 스케일 η = 0.2는 ImageNet과 CelebA-HQ 양쪽에서 최고의 FID를 낳으며, 노이즈 커버리지와 과도한 노이즈 사이의 균형을 나타낸다.
  • RDM는 NFE(함수 평가 수)가 200 미만일 때도 뛰어난 성능을 유지하며, 낮은 샘플링 스텝 수 조건에서 DiT-XL/2와 MDT-XL/2를 능가한다.
  • 첫 번째 단계에 더 많은 FLOPs를 할당할수록 FID가 향상되며, 이는 초기 단계의 정밀 조정이 고품질 생성에 핵심적임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.