[논문 리뷰] Scaling up GANs for Text-to-Image Synthesis
이 논문은 대규모 텍스트-이미지 생성에서 훈련 안정성을 향상시킴으로써 최신 기준의 추론 속도와 고해상도 이미지 합성을 달성하는 확장 가능한 GAN 아키텍처인 GigaGAN을 소개한다. 512px 이미지를 0.13초 내에 생성하고, 16MP 이미지를 3.66초 내에 생성할 수 있으며, 고급 임베딩 공간 편집 기능을 지원하여 FID 점수는 약간 낮지만 추론 속도와 제어 가능성에서 디퓨전 모델을 능가한다.
The recent success of text-to-image synthesis has taken the world by storm and captured the general public's imagination. From a technical standpoint, it also marked a drastic change in the favored architecture to design generative image models. GANs used to be the de facto choice, with techniques like StyleGAN. With DALL-E 2, auto-regressive and diffusion models became the new standard for large-scale generative models overnight. This rapid shift raises a fundamental question: can we scale up GANs to benefit from large datasets like LAION? We find that naÏvely increasing the capacity of the StyleGAN architecture quickly becomes unstable. We introduce GigaGAN, a new GAN architecture that far exceeds this limit, demonstrating GANs as a viable option for text-to-image synthesis. GigaGAN offers three major advantages. First, it is orders of magnitude faster at inference time, taking only 0.13 seconds to synthesize a 512px image. Second, it can synthesize high-resolution images, for example, 16-megapixel pixels in 3.66 seconds. Finally, GigaGAN supports various latent space editing applications such as latent interpolation, style mixing, and vector arithmetic operations.
연구 동기 및 목표
- GAN이 디퓨전 및 순차적 모델과 비교해 성능이 유사한 대규모 텍스트-이미지 합성에 확장될 수 있는지 조사하기 위해.
- LAION2B-en과 같은 다양한 데이터셋에서 대규모 GAN의 훈련 불안정성을 극복하기 위해 아키텍처 및 훈련 기법의 혁신을 도입하기 위해.
- 고속, 고해상도 이미지 생성과 함께 스타일 혼합 및 프롬프트 보간과 같은 제어 가능한 임베딩 공간 편집을 가능하게 하기 위해.
- 디퓨전 파이프라인에서 이미지 품질과 정렬을 향상시키기 위해 플러그 앤 플레이 방식의 GAN 기반 업샘플러를 개발하기 위해.
- 디퓨전 및 순차적 모델의 지배적 영향에도 불구하고 GAN이 대규모 생성 모델링에 여전히 타당한지 입증하기 위해.
제안 방법
- 효율적인 용량 확장과 함께 훈련 안정성을 유지할 수 있도록 필터 백 기반 생성기 아키텍처를 도입한다.
- 컨볼루션 블록 내부에 교차 및 자기 어텐션 레이어를 번갈아 배치하여 이미지-텍스트 정렬 및 특징 표현을 향상시킨다.
- 다중 스케일 훈련 기법을 도입하여 저주파 수치 학습을 강화하고 이미지-텍스트 정렬을 향상시킨다.
- 두 단계 생성 파이프라인을 적용한다: 먼저 64×64 이미지를 생성한 후, 텍스트 조건부 GAN 기반 업샘플러를 사용해 512×512로 확대한다.
- 스킵 연결 및 정규화와 같은 디퓨전 모델의 기법을 활용하여 대규모 GAN 훈련의 안정성을 확보한다.
- 제어 가능한 이미지 조작을 위해 별도의 텍스트 임베딩(t)과 스타일 코드(w)를 갖춘 분리된 임베딩 공간을 활용한다.
실험 결과
연구 질문
- RQ1GAN이 훈련 안정성을 유지하면서도 빌리언 파ram터 모델로 확장되어 개방형 세계의 텍스트-이미지 합성에 성공적으로 적용될 수 있는가?
- RQ2LAION2B-en과 같은 다양한 데이터셋에서 대규모 GAN 훈련을 안정화하기 위해 필요한 아키텍처 및 훈련 수정 사항은 무엇인가?
- RQ3추론 속도, 이미지 품질, 제어 가능성 측면에서 확장된 GAN의 성능은 디퓨전 및 순차적 모델과 비교해 어떻게 되는가?
- RQ4GAN 기반 업샘플러는 디퓨전 기반 파이프라인에서 고품질, 텍스트 조건부 슈퍼레졸루션 모듈로 효과적으로 활용될 수 있는가?
- RQ5대규모 GAN에서 스타일 혼합 및 프롬프트 보간과 같은 임베딩 공간 편집 기법은 어느 정도 유지되고 향상될 수 있는가?
주요 결과
- GigaGAN은 COCO2014에서 제로샷 FID 9.09를 기록하여, 파rameter 수가 더 적음에도 불구하고 DALL·E 2와 Parti-750M를 초월한다.
- 모델은 512px 이미지를 단 0.13초 내에 생성하여 순차적 및 디퓨전 모델보다 수개의 주기 차이로 훨씬 빠른 추론 속도를 입증한다.
- GigaGAN은 16메가픽셀 이미지를 3.66초 내에 생성하여 초고해상도 생성 능력을 입증한다.
- GAN 기반 업샘플러는 8배 슈퍼레졸루션에서 FID, CLIP 점수, LPIPS 모두에서 텍스트 조건부(SD Upscaler) 및 무조건적(Real-ESRGAN) 기준보다 뛰어난 성능을 기록한다.
- 모델은 스타일 혼합, 프롬프트 보간, 벡터 산술과 같은 고급 임베딩 공간 연산을 지원하며, 분리된 W-스페이스에서 제어 가능성을 유지한다.
- 최신 기준 모델보다 FID 점수가 약간 낮지만, GigaGAN은 안정적인 훈련과 높은 추론 효율성을 갖춘 빌리언 파ram터 모델로 GAN을 확장할 수 있음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.