Skip to main content
QUICK REVIEW

[논문 리뷰] Refining Generative Process with Discriminator Guidance in Score-based Diffusion Models

Dongjun Kim, Yeongmin Kim|arXiv (Cornell University)|2022. 11. 28.
Generative Adversarial Networks and Image Synthesis인용 수 13
한 줄 요약

이 논문은 사전 훈련된 스코어 기반 확산 모델에서 노이즈 제거 스코어 경로에 디스criminator-감독 보정을 추가하여 샘플 생성을 개선하는 Discriminator Guidance를 제안한다. 스코어 모델 훈련 후 별도로 디스criminator를 훈련하고, 그 피드백을 스트레어링 항목으로 통합함으로써, ImageNet 256x256에서 FID 1.83과 리콜 0.64의 최신 기술 수준을 달성하였으며, 실제 데이터 통계(FID 1.68, 리콜 0.66)에 매우 가까이 맞춘다.

ABSTRACT

The proposed method, Discriminator Guidance, aims to improve sample generation of pre-trained diffusion models. The approach introduces a discriminator that gives explicit supervision to a denoising sample path whether it is realistic or not. Unlike GANs, our approach does not require joint training of score and discriminator networks. Instead, we train the discriminator after score training, making discriminator training stable and fast to converge. In sample generation, we add an auxiliary term to the pre-trained score to deceive the discriminator. This term corrects the model score to the data score at the optimal discriminator, which implies that the discriminator helps better score estimation in a complementary way. Using our algorithm, we achive state-of-the-art results on ImageNet 256x256 with FID 1.83 and recall 0.64, similar to the validation data's FID (1.68) and recall (0.66). We release the code at https://github.com/alsdudrla10/DG.

연구 동기 및 목표

  • 스코어 모델를 재학습하지 않고도 고해상도이고 다양한 샘플을 생성하는 데에 한계를 가진 사전 훈련된 확산 모델을 개선한다.
  • 생성 과정 중 보완적인 감독을 도입하여 분류기 유도 샘플링에서 발생하는 모드 붕괴와 품질 저하 문제를 해결한다.
  • 스코어 모델 사전 훈련 후 안정적이고 빠른 디스criminator 훈련을 가능하게 하여 GAN에서 흔히 발생하는 동시 최적화 문제를 피한다.
  • 경량의 사후 훈련 보정 메커니즘을 통해 샘플 품질(FID)과 클래스 내 다양성(리콜)을 동시에 향상시킨다.
  • 기존의 확산 모델에 쉽게 통합할 수 있는 플러그인 솔루션을 제공하여 스코어 모델 재학습 없이도 현실감 있는 성능 향상을 이룬다.

제안 방법

  • 모든 노이즈 스케일에서 실제 샘플과 생성 샘플을 분류할 수 있도록, 스코어 모델 사전 훈련 후 별도로 디스criminator를 훈련한다.
  • 디스criminator의 출력을 바탕으로 사전 훈련된 스코어 함수에 보정 항목을 도입하여, 노이즈 제거 경로가 더 현실적인 영역으로 향하도록 유도한다.
  • 정리 1에서 유도된 바와 같이, 최적의 디스criminator에서 모델 스코어와 진짜 데이터 스코어 간 격차를 근사하는 보정 항목을 사용한다.
  • 가이드된 노이즈 제거 과정을 통해 수정된 스코어를 샘플링에 적용함으로써, 스코어 함수를 현실감 있게 조정한다.
  • 이론적 기반을 확보하기 위해 연속 시간 SDE 프레임워크를 사용하지만, 이 방법은 이산 및 연속 설정 모두에 적용 가능하다.
  • 디스criminator의 기울기를 활용해 스코어 보정을 유도함으로써, 생성된 샘플이 실제 데이터와 구분되지 않도록 보장한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 스코어 기반 확산 모델이 스코어 네트워크를 재학습하지 않고도 더 높은 품질과 더 많은 다양성을 가진 샘플을 생성할 수 있는가?
  • RQ2생성 과정 중 디스criminator가 안정적이고 효과적이며 보완적인 감독을 제공하여 현실감과 다양성을 향상시킬 수 있는가?
  • RQ3스코어 모델 훈련 후 디스criminator를 별도로 훈련하는 것이 동시 최적화 문제를 피하면서도 생성 품질 향상에 기여하는가?
  • RQ4디스criminator의 피드백을 수학적으로 형식화하여 진짜 데이터 스코어와 일치하는 방식으로 스코어 함수를 보정할 수 있는가?
  • RQ5이 방법이 최소한의 계산 비용으로 ImageNet 256x256와 같은 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 제안된 Discriminator Guidance는 ImageNet 256x256에서 FID 1.83과 리콜 0.64의 새로운 최고 기록을 달성하였으며, 실제 데이터 통계(FID 1.68, 리콜 0.66)에 매우 가까이 접근하였다.
  • CIFAR-10에서 이 방법은 EDM-G++를 사용할 경우 FID 1.77, 조건부 생성을 사용할 경우 FID 1.64를 기록하여 다양한 설정에서 뛰어난 성능을 보였다.
  • CelebA/FFHQ 64x64에서 이 방법은 Soft Truncation-G++를 사용해 FID 1.34를 달성하였으며, 고해상도 얼굴 생성에서의 효과를 입증하였다.
  • 이 방법은 FID와 리콜을 동시에 향상시켜, 분류기 유도 샘플링에서 흔히 발생하는 모드 붕괴 문제를 피할 수 있었다.
  • 디스criminator 훈련은 안정적이고 신속하게 수렴하였으며, 계산 비용이 극히 적었으며, 표 6과 그림 3에서 이를 확인할 수 있었다.
  • 시각적 샘플(그림 32–51)은 Discriminator Guidance가 다양한 클래스와 데이터셋에서 현실적이고 다양하며 고해상도의 이미지를 생성함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.