Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Text-Conditional Image Generation with CLIP Latents

Aditya Ramesh, Prafulla Dhariwal|arXiv (Cornell University)|2022. 04. 13.
Generative Adversarial Networks and Image Synthesis인용 수 2,265
한 줄 요약

논문은 먼저 자 사전(autoregressive 또는 diffusion)을 통해 자막으로부터 CLIP 이미지 임베딩을 생성하고, 그 임베딩으로부터 확산 모델을 사용해 이미지를 디코딩하는 두 단계 텍스트-이미지 시스템인 unCLIP을 제시한다. 이는 GLIDE와 비교해 포토리얼리스름은 비슷하게 유지하면서 다양성을 더 높이고, CLIP 잠재 공간에서 이미지 조작을 가능하게 하며 효율성을 위한 확산 사전을 시연한다.

ABSTRACT

Contrastive models like CLIP have been shown to learn robust representations of images that capture both semantics and style. To leverage these representations for image generation, we propose a two-stage model: a prior that generates a CLIP image embedding given a text caption, and a decoder that generates an image conditioned on the image embedding. We show that explicitly generating image representations improves image diversity with minimal loss in photorealism and caption similarity. Our decoders conditioned on image representations can also produce variations of an image that preserve both its semantics and style, while varying the non-essential details absent from the image representation. Moreover, the joint embedding space of CLIP enables language-guided image manipulations in a zero-shot fashion. We use diffusion models for the decoder and experiment with both autoregressive and diffusion models for the prior, finding that the latter are computationally more efficient and produce higher-quality samples.

연구 동기 및 목표

  • CLIP 표현을 활용하여 자막에서 임베딩으로의 prior를 분리하고 임베딩에서 이미지 디코딩으로 계층적 텍스트-이미지 생성기를 구축한다.
  • 다양성, 효율성, 고해상도 생성을 개선하기 위해 확산 기반 디코딩과 priors를 도입한다.
  • CLIP 공간에서 이미지 변형, 보간, 언어 가이드(text-diff) 이미지 조작과 같은 capabilities를 탐구한다.
  • 다양성, 현실성, 자막 정렬성 측면에서 기존 텍스트-이미지 모델과의 비교 평가를 수행하며 제로샷 MS-COCO 성능을 포함한다.

제안 방법

  • CLIP 이미지 인코더를 역으로 매핑하여 임베딩을 CLIP 이미지와(선택적으로 텍스트 임베딩에 conditioned) 이미지로 매핑하는 디코더 확산 모델을 학습한다.
  • 캡션 y로부터 CLIP 이미지 임베딩 z_i를 생성하는 prior 모델을 학습한다; 자동회귀(AR) 또는 분산(prior)으로 분류기-프리 가이던스로 수행한다.
  • AR prior의 경우 z_i를 PCA(319 구성요소)로 압축하고 1024 버킷으로 양자화한 뒤 y와 z_t에 조건화된 토큰 시퀀스를 예측하는 Transformer로 모델링한다.
  • diffusion prior의 경우 연속적 z_i를 y에 조건화된 확산 모델로 모델링하고(선택적으로 z_t를 포함), 노이즈 제거된 z_i를 직접 예측한다.
  • 두 개의 확산 업샘플러를 학습시켜 64→256→1024 해상도 이미지를 생성하되, 목적된 열화(저하)와 임의 자르기로 학습을 안정화한다.
  • 샘플링 시점에 가이던스를 가능하게 하여 분해(destroy) 없이 충실도를 향상시키고 다양성을 유지한다(클래스-프리 가이던스 및 조건 드롭아웃을 이용).

실험 결과

연구 질문

  • RQ1CLIP 잠재 공간을 확산 디코더를 위한 중간 표현으로 효과적으로 사용할 수 있는가?
  • RQ2CAPTION으로부터 CLIP 임베딩을 생성할 때 확산 priors가 AR priors보다 더 나은 효율성 및 샘플 품질을 제공하는가?
  • RQ3CLIP 임베딩에 조건화하는 것과 텍스트 프롬프트만 조건화하는 것의 차이가 포토리얼리즘, 자막 유사성, 다양성에 어떤 영향을 미치는가?
  • RQ4unCLIP 스택은 제로샷 MS-COCO FID 및 사람 평가에서 fidelity, 자막 정합성, 다양성 면에서 GLIDE와 어떻게 비교되는가?
  • RQ5CLIP 잠재 공간에서 발생하는 변형 능력(Variations, Interpolations, text-dacented edits)은 무엇인가?

주요 결과

  • 두 단계의 unCLIP 모델은 텍스트 프롬프트에 의해 구동되는 다양한 고다양성 이미지 생성을 가능하게 하며, 확산 priors가 AR priors보다 더 높은 품질과 더 낮은 계산 비용을 제공한다.
  • 확산 priors는 비교 가능한 모델 크기와 학습 계산에서 AR priors보다 텍스트-이미지 생성에 우수하다.
  • (diffusion prior를 사용할 때) 이 모델은 MS-COCO 256×256에서 제로샷 FID 10.39로 최첨단에 도달하며, 다수의 동료들보다 우월하다.
  • 사람 평가에서 unCLIP은 GLIDE와 포토리얼리즘 측면에서 넓은 대등함을 보이고 더 나은 다양성을 보이며, 자막 유사성은 때때로 GLIDE가 앞서는 편이다.
  • 디코딩 중 가이던스는 GLIDE와 unCLIP 모두 미적 품질을 향상시키지만,guided sampling 하에서 unCLIP이 GLIDE에 비해 다양성을 더 잘 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.