[논문 리뷰] Stable Target Field for Reduced Variance Score Estimation in Diffusion Models
이 논문은 확산 모델에서 점수 추정의 분산을 줄이기 위해 기준 배치를 사용하여 자기정규화된 중요도 샘플링을 통해 가중 조건부 점수를 계산하는 안정된 목표 필드(STF) 목적함수를 제안한다. 이 방법은 특히 중간 노이즈 영역에서 훈련 목표의 분산을 감소시켜, CIFAR-10에서 EDM과 결합했을 때 FID가 1.90으로 향상되고 훈련 속도가 3.6배 빨라지는 결과를 얻는다.
Diffusion models generate samples by reversing a fixed forward diffusion process. Despite already providing impressive empirical results, these diffusion models algorithms can be further improved by reducing the variance of the training targets in their denoising score-matching objective. We argue that the source of such variance lies in the handling of intermediate noise-variance scales, where multiple modes in the data affect the direction of reverse paths. We propose to remedy the problem by incorporating a reference batch which we use to calculate weighted conditional scores as more stable training targets. We show that the procedure indeed helps in the challenging intermediate regime by reducing (the trace of) the covariance of training targets. The new stable targets can be seen as trading bias for reduced variance, where the bias vanishes with increasing reference batch size. Empirically, we show that the new objective improves the image quality, stability, and training speed of various popular diffusion models across datasets with both general ODE and SDE solvers. When used in combination with EDM, our method yields a current SOTA FID of 1.90 with 35 network evaluations on the unconditional CIFAR-10 generation task. The code is available at https://github.com/Newbeeer/stf
연구 동기 및 목표
- 확산 모델에서 노이즈 제거 점수 매칭(ДСМ)의 훈련 목표에서 발생하는 높은 분산을 해결하는 것, 특히 중간 노이즈 영역에서의 문제를 중심으로.
- 동일한 노이즈가 난 샘플에 여러 데이터 모드가 영향을 주는 경우 데이터 원천의 모호성이 분산의 원인임을 규명하는 것.
- 기준 배치와 중요도 샘플링을 활용해 훈련 목표를 안정화하는 일반화된 점수 매칭 목적함수를 제안하는 것.
- 기준 배치 크기가 증가함에 따라 渐진적으로 편향이 사라지며, 훈련 목표의 공분산의 추적(trace)를 감소시키는 것을 입증하는 것.
- 다양한 확산 모델 아키텍처와 데이터셋에서 훈련 효율성, 모델 안정성, 생성 성능 향상을 달성하는 것.
제안 방법
- 전방 확산 과정을 세 단계로 분해: 근접 영역(낮은 노이즈), 중간 영역(높은 분산), 원거리 영역(낮은 신호).
- 안정된 목표 필드(STF) 목적함수를 정의하며, 이는 기준 배치를 사용해 가중 조건부 점수를 계산하는 일반화된 DSM 목적함수이다.
- 정규화가 정확히 필요 없이도 목표 분산을 줄일 수 있도록 자기정규화된 중요도 샘플링을 적용한다.
- 기준 배치의 데이터 포인트들을 활용해 조건부 점수 필드를 추정하며, 각 기준 포인트는 변형된 분포 하에서의 가능성에 비례해 기여한다.
- STF 목적함수는 渐진적으로 편향이 사라지며, 기준 배치 크기에 따라 훈련 목표의 공분산의 추적을 감소시킨다.
- ODE 및 SDE 솔버 모두와 호환되며, 기존의 확산 모델(예: EDM, VE, VP SDE)에 쉽게 통합할 수 있다.

실험 결과
연구 질문
- RQ1확산 모델에서 노이즈 제거 점수 매칭의 훈련 목표에서 높은 분산이 발생하는 원인은 무엇인가?
- RQ2전방 확산 과정의 어느 영역에서 목표 분산이 가장 두드러지는가?
- RQ3기준 배치의 데이터 포인트들을 중요도 샘플링을 통해 점수 추정을 안정화하는 데 사용할 수 있는가?
- RQ4기준 배치 크기가 증가함에 따라 STF 목적함수의 편향-분산 트레이드오���은 어떻게 변화하는가?
- RQ5STF는 다양한 확산 모델 아키텍처에서 훈련 속도, FID, 모델 안정성 향상에 얼마나 기여하는가?
주요 결과
- STF 목적함수는 분산이 가장 높은 중간 노이즈 영역에서 훈련 목표의 공분산의 추적을 감소시킨다.
- EDM와 결합했을 때, 단지 35회의 네트워크 평가만으로도 무조건적 CIFAR-10 생성에서 최신 기록인 FID 1.90을 달성한다.
- VE 및 VP SDE를 포함한 여러 확산 모델에서 FID와 Inception 점수를 일관되게 향상시키며, CIFAR-10과 CelebA 64²에서 유사한 성능 향상을 보였다.
- VE 모델에서 다양한 랜덤 시드를 사용했을 때 이미지 품질 저하와 노이즈 생성을 줄이며 훈련 안정성을 향상시켰다.
- CIFAR-10에서 VE 모델의 훈련 속도를 최대 3.6배 빠르게 하였으며, FID는 유지하거나 향상시켰다. 이는 확산 모델 훈련 속도를 가속화한 최초의 방법이다.
- 기준 배치 크기가 증가함에 따라 STF에 의해 유도되는 편향이 渐진적으로 사라지며, 이는 방법의 일致성(consistency)을 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.