Skip to main content
QUICK REVIEW

[논문 리뷰] clip2latent: Text driven sampling of a pre-trained StyleGAN using denoising diffusion and CLIP

Justin N. M. Pinkney, Chuan Li|arXiv (Cornell University)|2022. 10. 05.
Generative Adversarial Networks and Image Synthesis인용 수 8
한 줄 요약

이 논문은 CLIP 임bedding을 가이드로 사용하여 사전 훈련된 StyleGAN의 잠재 벡터를 샘플링하는 조건부 확산 모델을 훈련시켜, 미세조정이나 외부 텍스트-이미지 데이터 없이 텍스트에서 이미지를 생성하는 방법인 clip2latent를 소개한다. 이 방법은 최소한의 훈련 계산 자원으로 1024×1024 해상도의 고해상도, 고정밀도 이미지 합성을 1초 이내에 달성하며, 텍스트 프롬프트에 강력한 일치성을 보인다.

ABSTRACT

We introduce a new method to efficiently create text-to-image models from a pre-trained CLIP and StyleGAN. It enables text driven sampling with an existing generative model without any external data or fine-tuning. This is achieved by training a diffusion model conditioned on CLIP embeddings to sample latent vectors of a pre-trained StyleGAN, which we call clip2latent. We leverage the alignment between CLIP's image and text embeddings to avoid the need for any text labelled data for training the conditional diffusion model. We demonstrate that clip2latent allows us to generate high-resolution (1024x1024 pixels) images based on text prompts with fast sampling, high image quality, and low training compute and data requirements. We also show that the use of the well studied StyleGAN architecture, without further fine-tuning, allows us to directly apply existing methods to control and modify the generated images adding a further layer of control to our text-to-image pipeline.

연구 동기 및 목표

  • 사전 훈련된 StyleGAN과 CLIP만을 사용하여, 미세조정이나 외부 데이터 없이 텍스트에서 이미지를 생성하는 것을 목표로 한다.
  • 텍스트 프롬프트에 기반해 CLIP 텍스트 임베딩을 StyleGAN 잠재 코드로 매핑하는 조건부 확산 모델을 개발하는 것.
  • 라벨이 부여된 이미지-텍스트 쌍이 필요 없이 최소한의 계산 비용으로 고해상도, 고정밀도 이미지 생성을 달성하는 것.
  • 후속 편집을 위한 StyleGAN의 계층적 잠재 공간의 제어 가능성을 유지하는 것.
  • 사전 훈련된 모델이 확산을 통해 연결되어 데이터가 없는 강력한 텍스트-이미지 파이프라인을 만들 수 있음을 보여주는 것.

제안 방법

  • CLIP의 이미지-텍스트 공간에서의 정렬 특성을 활용하여, CLIP 텍스트 임베딩을 조건으로 삼는 노이즈 제거 확산 모델을 훈련하여 StyleGAN 잠재 코드를 생성한다.
  • 쌍화된 훈련 데이터가 필요 없도록, 고정된(frozen) CLIP 이미지 및 텍스트 인코더를 사용하여 프롬프트를 임bedding하고 잠재 샘플링을 가이드한다.
  • CLIP의 텍스트 임베딩을 조건으로 삼아, 의미적으로 관련된 이미지에 대응하는 StyleGAN W-스페이스 잠재 벡터를 생성하는 확산 모델을 조건화한다.
  • 추론 시 확산 모델에서 샘플링하여 직접 StyleGAN 잠재 공간에서 고해상도(1024×1024) 이미지를 생성한다.
  • StyleGAN의 잠재 공간의 계층적 구조를 활용하여, 기존의 잠재 방향 방법을 통해 세밀한 편집을 가능하게 한다.
  • 최적화 기반 방법에서 흔히 발생하는 아티팩트를 방지하기 위해, 설계상으로 생성된 잠재 벡터가 StyleGAN의 유효한 다양체(manifold) 내부에 위치하도록 보장한다.

실험 결과

연구 질문

  • RQ1라벨이 부여된 이미지-텍스트 데이터가 전혀 없이, CLIP 텍스트 임베딩에서 StyleGAN 잠재 벡터를 생성하는 조건부 확산 모델을 훈련시킬 수 있는가?
  • RQ2이 방법은 고해상도(1024×1024) 이미지 생성을 고정밀도와 최소한의 아티팩트로 달성할 수 있는가?
  • RQ3사전 훈련된 고정된 StyleGAN을 사용하면 기존의 잠재 공간 방향을 통해 제어 가능한 이미지 편집이 가능한가?
  • RQ4이러한 데이터 없는 방법의 성능은 미세조정이나 쌍화된 데이터가 필요한 기존의 텍스트-이미지 모델과 비교해 어떻게 되는가?
  • RQ5이 방법은 얼굴 외의 생성 모델, 예를 들어 풍경 스타일 GAN과 같은 비얼굴 생성 모델로 일반화될 수 있는가?

주요 결과

  • 이 방법은 높은 CLIP 일치성과 최소한의 아티팩트로 텍스트 프롬프트에서 고해상도(1024×1024) 이미지를 생성하며, 강력한 인지적 품질을 달성한다.
  • 추론 속도가 매우 빠르며, 사전 훈련된 StyleGAN만으로 메가픽셀 수준의 이미지를 1초 이내에 생성한다.
  • 생성된 잠재 벡터는 CLIP의 사전 정렬된 이미지-텍스트 임베딩에 기반하여, 텍스트-이미지 쌍화된 데이터가 전혀 없이 훈련되었다.
  • 생성된 잠재 벡터는 자연스럽게 StyleGAN의 W-스페이스 유효 다각체 내부에 위치하여, InterfaceGAN과 같은 기존의 잠재 방향 방법을 통한 고품질 편집이 가능하다.
  • LHQ 데이터셋에 기반한 256×256 StyleGAN3 풍경 모델을 통해 비얼굴 모델로의 일반화가 가능함을 입증하였다.
  • 질적 비교를 통해 최적화 기반 잠재 역전환 기법에 비해 편집 가능성과 아티팩트 감소에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.