Skip to main content
QUICK REVIEW

[논문 리뷰] CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers

Ming Ding, Wendi Zheng|arXiv (Cornell University)|2022. 04. 28.
Multimodal Machine Learning Applications인용 수 121
한 줄 요약

CogView2는 계층적 트랜스포머를 사용하고 지역 병렬 자동회귀 생성과 교차 모달 일반 언어 모델(CogLM)을 활용하여 고해상도 텍스트-이미지 생성 속도를 높이고, DALL-E-2와 경쟁력 있는 결과를 달성하며 대화형 편집을 가능하게 한다.

ABSTRACT

The development of the transformer-based text-to-image models are impeded by its slow generation and complexity for high-resolution images. In this work, we put forward a solution based on hierarchical transformers and local parallel auto-regressive generation. We pretrain a 6B-parameter transformer with a simple and flexible self-supervised task, Cross-modal general language model (CogLM), and finetune it for fast super-resolution. The new text-to-image system, CogView2, shows very competitive generation compared to concurrent state-of-the-art DALL-E-2, and naturally supports interactive text-guided editing on images.

연구 동기 및 목표

  • 더 빠르고 확장 가능한 고해상도 텍스트-이미지 생성의 동기를 부여한다.
  • 텍스트와 이미지 토큰을 양방향으로 처리하는 통합 사전 학습 프레임워크(CogLM)를 개발한다.
  • 효율성을 위해 저해상도와 고해상도 처리를 분리하는 계층적 생성을 가능하게 한다.
  • 고해상도 이미지 합성을 가속화하기 위해 로컬 병렬 자기회귀 정제(LoPAR)를 도입한다.

제안 방법

  • CogLM을 제안한다: 텍스트 및 이미지 토큰과 마스크 기반 자기회귀 예측을 포함하는 6B 파라미터의 크로스모달 트랜스포머 사전 학습.
  • 두 가지 마스크 기반 사전 학습 작업 사용: 전체 이미지 토큰 마스킹(텍스트-투-이미지)과 텍스트 마스킹이 포함된 혼합 이미지 패치(인필링 및 캡셔닝).
  • 계층적 생성 파이프라인 채택: 1) 20x20 토큰의 저해상도 이미지 생성, 2) 직접 초해상도를 통해 60x60 토큰으로 매핑, 3) 반복적인 LoPAR 기반 초해상도로 정제.
  • 초해상도 및 정제 과정에서 지역 계산을 가속하기 위해 맞춤 CUDA 커널로 2D 지역 어텐션 구현.
  • 이미지 토큰의 클러스터 기반 샘플링과 텍스트 어텐션 상향 조정 기술을 통해 샘플링 및 학습 효율성 향상.

실험 결과

연구 질문

  • RQ1교차 모달 양방향 사전 학습 목표가 텍스트-이미지 모델의 생성 및 다운스트림 작업을 개선할 수 있는가?
  • RQ2지역 어텐션과 LoPAR와 결합된 계층적 생성 파이프라인이 품질을 손상시키지 않으면서 빠르고 고해상도 이미지 합성을 가능하게 하는가?
  • RQ3타깃 어텐션 메커니즘 및 샘플링 전략이 생성된 이미지의 충실도와 입력 텍스트와의 관련성을 개선할 수 있는가?

주요 결과

  • CogView2는 최첨단과 비교해 경쟁력 있는 Fréchet Inception Distance(FID)와 Inception Score(IS)를 달성하며, COCO 미세조정 없이 MS-COCO에서 FID-0 약 24.0, IS 약 22.4이다.
  • CogLM을 MS-COCO에서 미세조정하면 FID가 17.5(FID-0)로 개선되고 다른 스케일에서 FID가 감소하며(예: FID-4는 10.6, FID-8은 10.4), 다만 특정 장면에서는 인간 평가가 미세조정되지 않은 모델을 선호할 수 있다.
  • LoPAR를 이용한 계층적 생성은 고해상도 생성 속도를 크게 높여 CogView 스타일의 자기회귀 생성 대비 최대 600배 빠르면서도 이미지 품질을 유지하거나 향상시킨다.
  • 토큰 생성의 클러스터 샘플링은 대형 어휘에서의 불완전 절단 현상을 완화하고 샘플링 일관성을 향상시킨다.
  • 로컬 CUDA 기반 어텐션은 2D 지역 어텐션을 가속화하여 자기회귀 시나리오에서 전체 어텐션 대비 최대 40배의 속도 향상을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.