[논문 리뷰] GALIP: Generative Adversarial CLIPs for Text-to-Image Synthesis
GALIP는 생성기와 판별기 양쪽에서 CLIP 모델을 활용하여 고해상도, 빠르고 제어 가능한 이미지 합성 성능을 달성하는 텍스트-이미지 생성 프레임워크를 제안한다. CLIP 기반의 판별기와 CLIP 기반의 생성기를 통합함으로써, 대규모 순차적 및 확산 모델의 3%에 불과한 학습 데이터와 6%의 파라미터로도 최신 기술 수준의 성능을 달성하며, 추론 속도는 120배 빠르고 임베딩 공간의 제어가 원활하다.
Synthesizing high-fidelity complex images from text is challenging. Based on large pretraining, the autoregressive and diffusion models can synthesize photo-realistic images. Although these large models have shown notable progress, there remain three flaws. 1) These models require tremendous training data and parameters to achieve good performance. 2) The multi-step generation design slows the image synthesis process heavily. 3) The synthesized visual features are difficult to control and require delicately designed prompts. To enable high-quality, efficient, fast, and controllable text-to-image synthesis, we propose Generative Adversarial CLIPs, namely GALIP. GALIP leverages the powerful pretrained CLIP model both in the discriminator and generator. Specifically, we propose a CLIP-based discriminator. The complex scene understanding ability of CLIP enables the discriminator to accurately assess the image quality. Furthermore, we propose a CLIP-empowered generator that induces the visual concepts from CLIP through bridge features and prompts. The CLIP-integrated generator and discriminator boost training efficiency, and as a result, our model only requires about 3% training data and 6% learnable parameters, achieving comparable results to large pretrained autoregressive and diffusion models. Moreover, our model achieves 120 times faster synthesis speed and inherits the smooth latent space from GAN. The extensive experimental results demonstrate the excellent performance of our GALIP. Code is available at https://github.com/tobran/GALIP.
연구 동기 및 목표
- 텍스트-이미지 합성에서 대규모 순차적 및 확산 모델의 높은 계산 비용, 느린 추론 속도, 낮은 제어 가능성 문제를 해결하기 위해.
- CLIP의 사전 학습된 시각적 이해력과 도메인 일반화 능력을 활용하여 이미지 생성의 효율성과 품질을 향상시키기 위해.
- GAN 아키텍처에서 생성기와 판별기에 CLIP를 통합하여 빠르고 제어 가능하며 고해상도의 이미지 합성을 실현하기 위해.
- 성능을 유지하면서도 데이터와 파라미터 요구량을 줄이기 위해.
- CLIP의 제로샷 전이 및 복잡한 시나리오 이해 능력을 활용한 통합 생성 프레임워크를 구축하기 위해.
제안 방법
- 고정된 CLIP-ViT 이미지 인코더와 학습 가능한 메이트-판별기(Mate-D)를 사용하는 CLIP 기반의 판별기를 제안하여 다층 CLIP 특징을 기반으로 이미지 품질을 평가한다.
- 브릿지 특징과 프롬프트를 사용하여 CLIP의 시각적 개념을 유도함으로써 텍스트와의 특징 일치를 향상시키는 CLIP 기반의 생성기를 도입한다.
- 생성된 이미지의 CLIP 특징을 더 잘 이끌어내기 위해 동적으로 프롬프트를 생성하는 프롬프트 예측기(PP)를 도입하여 특징의 관련성을 향상시킨다.
- 세부적인 시각적 이해를 유지하기 위해 판별기에서 CLIP-ViT의 초기 및 중간 레이어(2번째, 5번째, 9번째)를 사용하며, 후기 레이어의 일반화를 피한다.
- 생성기와 판별기를 적대적 손실을 기반으로 엔드 투 엔드로 훈련하며, CLIP 특징을 두 구성 요소 모두의 지도 신호로 활용한다.
- 생성된 이미지를 CLIP 임bedded 텍스트 및 시각적 특징과 일치시키기 위해 브릿지 특징 예측(BFP)을 적용하여 정밀도와 일치도를 향상시킨다.

실험 결과
연구 질문
- RQ1생성기와 판별기에 CLIP를 통합함으로써, 자원 요구량을 줄이면서도 텍스트-이미지 합성 품질을 향상시킬 수 있는가?
- RQ2CLIP의 복잡한 시나리오 이해 능력이 실제 대 생성 이미지를 구분하는 판별기 성능을 어떻게 향상시키는가?
- RQ3CLIP의 도메인 일반화 능력이 이미지 생성에서 제로샷 전이와 제어 가능성 향상에 기여하는가?
- RQ4CLIP 특징을 중간 지도 신호로 사용함으로써, 엔드 투 엔드 GAN보다 더 빠르고 안정적인 훈련이 가능한가?
- RQ5판별기와 생성기 구성 요소에서 CLIP-ViT의 최적의 레이어 선택은 세부 정보와 일반화 사이의 균형을 어떻게 유지하는가?
주요 결과
- GALIP는 COCO 데이터셋에서 Fréchet Inception Distance(FID) 5.85를 달성하여 기준 GAN 모델(FID: 17.31)을 능가하고, 대규모 모델과 유사한 성능을 낮은 자원으로 달성한다.
- CLIP 기반의 판별기는 FID를 17.31에서 7.92로 감소시키며, CLIPSIM를 0.2996에서 0.3221로 상승시켜 이미지 품질과 일치도 향상을 입증한다.
- 브릿지-프롬프트(Bridge-FP)를 적용한 CLIP 기반의 생성기는 FID를 6.52로 추가로 감소시키며 CLIPSIM를 0.3301로 상승시켜 CLIP로부터의 효과적인 특징 유도를 입증한다.
- 프롬프트 예측기(PP)를 통해 FID는 5.85로 감소하고 CLIPSIM는 0.3338로 상승하여 동적 프롬프트 튜닝이 특징 관련성 향상에 기여함을 입증한다.
- Latent Diffusion Models(LDM) 대비 약 120배 빠른 추론(1장당 0.04초)을 달성하며, 1200만 장의 학습 이미지와 총 3.2억 개의 파라미터만을 사용한다.
- 대규모 모델의 학습 데이터의 3%와 학습 가능한 파라미터의 6%만을 사용하여도, 제로샷 FID 및 CLIPSIM 지표에서 그 성능을 따라하거나 초월한다.
![Figure 2: Comparing with Latent Diffusion Models (LDM) [ 35 ] , our GALIP achieves comparable zero-shot Fréchet Inception Distance (ZS-FID) with measly 320M parameters (0.08B trainable parameters + 0.24B frozen CLIP parameters) and 12M training data. Furthermore, our GALIP only requires 0.04s to syn](https://ar5iv.labs.arxiv.org/html/2301.12959/assets/a2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.