[논문 리뷰] Progressive Deblurring of Diffusion Models for Coarse-to-Fine Image Synthesis
이 논문은 주파수 인지 가능한 확산 과정에서 점진적 흐림 해제를 사용하는 새로운 코arse-to-fine 이미지 생성 프레임워크를 제안한다. 표준 확산 모델을 주파수에 따라 다른 속도로 확산되는 회전된 좌표계에서 일반화함으로써, 저주파 성분이 먼저 해체되는 흐림 확산을 적용함으로써, 표준 확산 모델에 비해 LSUN 침실 및 교회 데이터셋에서 더 낮은 FID 점수를 달성한다.
Recently, diffusion models have shown remarkable results in image synthesis by gradually removing noise and amplifying signals. Although the simple generative process surprisingly works well, is this the best way to generate image data? For instance, despite the fact that human perception is more sensitive to the low frequencies of an image, diffusion models themselves do not consider any relative importance of each frequency component. Therefore, to incorporate the inductive bias for image data, we propose a novel generative process that synthesizes images in a coarse-to-fine manner. First, we generalize the standard diffusion models by enabling diffusion in a rotated coordinate system with different velocities for each component of the vector. We further propose a blur diffusion as a special case, where each frequency component of an image is diffused at different speeds. Specifically, the proposed blur diffusion consists of a forward process that blurs an image and adds noise gradually, after which a corresponding reverse process deblurs an image and removes noise progressively. Experiments show that the proposed model outperforms the previous method in FID on LSUN bedroom and church datasets. Code is available at https://github.com/sangyun884/blur-diffusion.
연구 동기 및 목표
- 표준 확산 모델이 주파수 성분을 우선시하는 방식이 인간의 저주파 콘텐츠에 대한 인지 감도와 일치하지 않아 발생하는 한계를 해결하기 위해.
- 별도의 업샘플러나 사전 정의된 단계 없이도 자연스럽게 코어스 투 파인 이미지 합성을 지원하는 생성 과정을 개발하기 위해.
- 회전된 좌표계를 통해 주파수 적응형 방식으로 확산을 모델링하여 이미지 데이터에 대한 인덕티브 바이어스를 통합하기 위해.
- 생성 과정의 초반에 전체 구조와 저주파 성분을 강조하여 샘플 품질과 FID 성능을 향상시키기 위해.
제안 방법
- 직교 행렬 U를 사용하여 회전된 좌표계를 도입함으로써 표준 확산 모델을 일반화하여 각 주파수 성분에 대해 독립적인 확산 속도를 가능하게 한다.
- 각 주파수 성분이 함수 f(i)에 의해 제어되는 주파수 의존 스케일링 행렬 Df(i)를 통해 다른 속도로 확산되는 일반화된 전진 과정을 정의한다.
- 전진 과정이 점차적으로 이미지를 흐리게 하면서 노이즈를 추가하는 특수 케이스로 블러 확산을 제안하며, 이는 역방향 과정에서 점진적으로 흐림을 제거하고 노이즈를 제거하는 방식이다.
- SDE 이산화를 사용하여 역방향 확산 샘플러를 유도하며, 이는 탈락된 확산 과정을 안내하는 스코어 기반 보정 항목 sθ(xi, i)를 포함한다.
- 1000개의 확산 단계와 선형 노이즈 스케줄을 사용하는 UNet 아키텍처를 사용하며, 121M 개의 파라미터와 단일 V100 GPU를 사용해 LSUN 데이터셋에서 훈련한다.
- 푸리에 변환의 고유값에 의해 조절되는 주파수 인지 노이즈 스케줄을 활용하여, 조기에 거시적 구조를 복구할 수 있도록 한다.
실험 결과
연구 질문
- RQ1주파수 적응형 확산를 통해 저주파 성분을 우선시하는 확산 모델이 이미지 합성 품질을 향상시킬 수 있는가?
- RQ2회전된 주파수 공간에서의 점진적 흐림 해제 방식은 표준 확산 모델에 비해 FID 및 인지 품질 측면에서 어떻게 비교되는가?
- RQ3명시적인 업샘플링 헤드나 다단계 훈련 없이도 코어스 투 파인 이미지 생성을 달성할 수 있는가?
- RQ4주파수 의존적 확산은 확산 모델에서 고해상도 정밀 조정 단계의 필요성을 줄이는가?
- RQ5표준 기준 벤치마크인 LSUN 침실 및 교회 데이터셋에서 이 방법은 표준 확산 모델에 비해 얼마나 높은 성능 향상을 달성하는가?
주요 결과
- 제안된 블러 확산 모델은 표준 확산 모델에 비해 LSUN 침실 데이터셋에서 더 낮은 프레셰 이너셉션 디스턴스(Fréchet Inception Distance, FID) 점수를 기록하여 샘플 품질 향상을 입증한다.
- LSUN 교회 데이터셋에서도 모델은 베이스라인에 비해 더 낮은 FID 점수를 기록하여, 다양한 이미지 도메인에서 일관된 성능 향상을 확인한다.
- 이 방법은 별도의 업샘플러나 다단계 훈련 없이도 코어스 투 파인 이미지 합성을 성공적으로 구현하여 아키텍처를 단순화한다.
- 주파수 인지 확산 과정은 생성 과정의 초반에 전체 구조와 저주파 성분을 강조함으로써 더 높은 인지 품질을 제공한다.
- 제거 실험을 통해 주파수 의존적 확산 속도가 성능 향상에 필수적임을 확인하였으며, 무작위 또는 균일한 스케줄은 결과를 악화시킨다.
- 평가된 벤치마크에서 이 모델은 별도의 업샘플링 구성 요소에 의존하는 이전 방법들을 능가하는 단일 단계 확산 모델 중 최고 수준의 FID 성능을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.