[논문 리뷰] Lafite2: Few-shot Text-to-Image Generation
Lafite2는 소수의 샘플로 텍스트-이미지 생성을 위한 새로운 비지도 사전학습 방법을 제안하며, 검색 보강된 구축과 대비 잠재 최적화를 통해 가짜 텍스트 특징을 합성함으로써, 완전히 지도 학습 설정에서 MS-COCO 데이터셋에서 FID 점수 6.78을 달성하고, 최소한의 데이터 및 계산 자원으로도 0-샷 및 소수 샘플 설정에서 경쟁력 있는 성능을 기록함.
Text-to-image generation models have progressed considerably in recent years, which can now generate impressive realistic images from arbitrary text. Most of such models are trained on web-scale image-text paired datasets, which may not be affordable for many researchers. In this paper, we propose a novel method for pre-training text-to-image generation model on image-only datasets. It considers a retrieval-then-optimization procedure to synthesize pseudo text features: for a given image, relevant pseudo text features are first retrieved, then optimized for better alignment. The low requirement of the proposed method yields high flexibility and usability: it can be beneficial to a wide range of settings, including the few-shot, semi-supervised and fully-supervised learning; it can be applied on different models including generative adversarial networks (GANs) and diffusion models. Extensive experiments illustrate the effectiveness of the proposed method. On MS-COCO dataset, our GAN model obtains Fréchet Inception Distance (FID) of 6.78 which is the new state-of-the-art (SoTA) of GANs under fully-supervised setting. Our diffusion model obtains FID of 8.42 and 4.28 on zero-shot and supervised setting respectively, which are competitive to SoTA diffusion models with a much smaller model size.
연구 동기 및 목표
- 대규모 이미지-텍스트 쌍 데이터셋에서 텍스트-이미지 모델을 학습하는 데 드는 높은 비용과 데이터 요구량을 해결하기 위해.
- 이미지 전용 데이터셋에서 효과적인 사전학습을 가능하게 함으로써 소수 샘플 및 준지도 학습 텍스트-이미지 생성을 향상시키기 위해.
- 다양한 아키텍처(예: GAN 및 확산 모델 포함)에 적용 가능한 유연하고 자원 소모가 적은 방법을 개발하기 위해.
- 완전히 지도 학습된 모델과 언어 없음(텍스트 없음) 텍스트-이미지 모델 간의 성능 격차를 줄이기 위해.
제안 방법
- Lafite2는 먼저 이미지 특징을 사용하여 CLIP의 다중모달 임베딩 공간에서 관련된 텍스트 특징을 검색함으로써 가짜 텍스트 특징을 합성함.
- 검색된 가짜 텍스트 특징이 이미지 특징과 더 잘 정렬되도록 대비 잠재 최적화(CLO)를 적용함.
- 사전 최적화 이전에 가짜 텍스트 특징의 품질과 관련성을 향상시키기 위해 검색 보강 방법을 사용함.
- 사전학습 중 정확도와 특징 품질을 향상시키기 위해 가우시안 편향과 잠재 최적화 구성 요소를 통합함.
- 이 프레임워크는 GAN 기반(Lafite2_GAN) 및 확산 모델 기반(Lafite2_LDM) 아키텍처에 모두 적용됨.
- 최소한의 실제 이미지-텍스트 쌍을 사용하여 사전학습 모델을 미세조정함으로써 강력한 소수 샘플 성능을 달성함.
실험 결과
연구 질문
- RQ1텍스트-이미지 모델이 텍스트 애너테이션 쌍이 전혀 없는 이미지 데이터만으로도 강력한 성능을 낼 수 있는가?
- RQ2실제 쌍이 없는 환경에서 이미지-텍스트 정렬을 향상시키기 위해 가짜 텍스트 특징을 어떻게 효과적으로 합성할 수 있는가?
- RQ3검색 보강된 가짜 텍스트 특징 합성 방식이 소수 샘플 설정에서 무작위 또는 변형된 초기화 방식보다 우수한가?
- RQ4제안된 방법이 최소한의 데이터로도 완전히 지도 학습 및 소수 샘플 설정에서 최신 기술 수준(SOTA) 성능을 달성할 수 있는가?
- RQ5대비 잠재 최적화(CLO)는 가짜 텍스트 특징의 품질과 정렬을 어떻게 향상시키는가?
주요 결과
- Lafite2_GAN은 완전히 지도 학습 설정에서 MS-COCO에서 Fréchet Inception Distance(FID) 점수 6.78을 기록하며, GAN 기반 모델 중 최신 기술 수준(SOTA)을 달성함.
- Lafite2_LDM은 0-샷 생성에서 FID 8.42, 지도 학습 설정에서 FID 4.28를 기록하며, 훨씬 작은 모델 크기로도 다른 언어 없는 모델보다 뛰어난 성능을 보임.
- 검색 보강 구성 요소는 특히 훈련 데이터의 0.1%에서 1%에 해당하는 저자원 환경에서 성능 향상에 크게 기여함.
- 대비 잠재 최적화(CLO)는 이미지-텍스트 대응을 향상시켜 완전히 지도 학습 설정에서 SOA-I를 기준 모델의 74.48에서 74.88로 향상시킴.
- 모든 구성 요소(검색, CLO, 가우시안 편향)를 조합하면 최고의 종합 성능을 기록하며, 과적합을 줄이고 일반화 능력을 향상시킴.
- Lafite2로 사전학습한 후 미세조정을 수행하면, 전체 데이터셋의 10%만으로도 완전히 새로 학습하는 것보다도 더 우수한 성능을 기록함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.