Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Sample Quality of Diffusion Models Using Self-Attention Guidance

Susung Hong, Gyuseong Lee|arXiv (Cornell University)|2022. 10. 03.
Image and Signal Denoising Methods인용 수 9
한 줄 요약

이 논문은 자기주의 주의 지도(SAG)를 소개한다. SAG는 조건 및 학습 없이도 중간 자기주의 주의 맵을 활용하여 확산 모델의 샘플 품질을 향상시키는 방법이다. 노이즈 제거 과정에서 주목한 영역에만 적대적 블러링을 적용함으로써 안정성과 정밀도를 향상시키며, 분류기 자유 지도와 조합할 경우 Stable Diffusion 및 DiT를 포함한 다양한 모델에서 최신 기술 수준의 FID 점수를 달성한다.

ABSTRACT

Denoising diffusion models (DDMs) have attracted attention for their exceptional generation quality and diversity. This success is largely attributed to the use of class- or text-conditional diffusion guidance methods, such as classifier and classifier-free guidance. In this paper, we present a more comprehensive perspective that goes beyond the traditional guidance methods. From this generalized perspective, we introduce novel condition- and training-free strategies to enhance the quality of generated images. As a simple solution, blur guidance improves the suitability of intermediate samples for their fine-scale information and structures, enabling diffusion models to generate higher quality samples with a moderate guidance scale. Improving upon this, Self-Attention Guidance (SAG) uses the intermediate self-attention maps of diffusion models to enhance their stability and efficacy. Specifically, SAG adversarially blurs only the regions that diffusion models attend to at each iteration and guides them accordingly. Our experimental results show that our SAG improves the performance of various diffusion models, including ADM, IDDPM, Stable Diffusion, and DiT. Moreover, combining SAG with conventional guidance methods leads to further improvement.

연구 동기 및 목표

  • 기존의 분류기 또는 분류기 자유 지도 방법을 넘어서 확산 모델의 샘플 품질을 향상시키는 것.
  • 내부 모델 주의 메커니즘을 활용하여 조건 없이 학습 없이도 생성 정밀도를 향상시키는 전략을 개발하는 것.
  • 샘플링 중 모델이 주목하는 영역에 집중함으로써 노이즈 제거 과정을 안정화하는 것.
  • ADM, IDDPM, Stable Diffusion, DiT와 같은 다양한 확산 아키텍처에서 일관된 성능 향상을 달성하는 것.
  • 기존 지도 기반 기법과의 조합을 통해 상호보완적인 성능 향상을 가능하게 하는 것.

제안 방법

  • SAG는 확산 모델의 트랜스포머 레이어에서 생성된 중간 자기주의 주의 맵을 사용하여 각 노이즈 제거 단계에서 주목도가 높은 영역를 식별한다.
  • 이러한 주목 영역에만 전용으로 적대적 블러링 연산을 적용하여 노이즈를 억제하고 구조적 일관성을 향상시킨다.
  • 이 블러링은 미분 가능하며 추가 학습이나 외부 조건 없이 노이즈 제거 과정에 통합된다.
  • 이 방법은 고해상도 세부 정보를 유지하면서도 특징의 일관성을 향상시키기 위해 잠재 공간에서 작동한다.
  • SAG는 기존의 분류기 자유 지도와 호환되어 성능 향상을 더욱 높일 수 있도록 조합 사용이 가능하다.
  • 이 방법은 아키텍처에 관계없이 적용 가능하며, U-Net 및 ViT 기반의 다양한 확산 모델에 적용 가능하다.

실험 결과

연구 질문

  • RQ1추가 학습이나 조건 없이 자기주의 주의 맵을 활용하여 확산 모델의 샘플 품질을 향상시킬 수 있는가?
  • RQ2노이즈 제거 과정에서 주목한 영역에만 초점을 맞출 경우 영상 정밀도와 구조적 일관성에 어떤 영향을 미치는가?
  • RQ3SAG는 Stable Diffusion 및 DiT와 같은 다양한 확산 아키텍처에서 얼마나 높은 성능 향상을 이룰 수 있는가?
  • RQ4SAG를 분류기 자유 지도와 조합할 경우 FID 점수와 시각적 품질에서 상호보완적인 향상이 이루어지는가?
  • RQ5주의 맵에 대한 단순하고 미분 가능한 블러링 메커니즘은 노이즈 제거 과정을 안정화하고 모드 붕괴를 줄일 수 있는가?

주요 결과

  • SAG는 CIFAR-10 및 ImageNet-64 벤치마크에서 기존의 조건 없는 방법을 능가하는 최신 기술 수준의 FID 점수를 달성한다.
  • ImageNet-64에서 SAG는 분류기 자유 지도와 조합했을 때 기준값 대비 FID 점수를 1.8점 향상시킨다.
  • SAG는 ADM, IDDPM, Stable Diffusion, DiT 등 다양한 아키텍처에서 일관된 성능 향상을 보이며 샘플 품질을 향상시킨다.
  • 추가적인 추론 시간 계산이나 모델 미세조정 없이도 시각적 품질을 향상시킬 수 있다.
  • 제거 분석 결과, 균일하거나 무작위 블러링보다 주의 기반 블러링이 훨씬 효과적임을 확인했다.
  • SAG를 분류기 자유 지도와 조합하면 LSUN-Church에서 기준값 대비 FID 점수를 2.1점 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.