Skip to main content
QUICK REVIEW

[논문 리뷰] ERNIE-ViLG: Unified Generative Pre-training for Bidirectional Vision-Language Generation

Han Zhang, Weichong Yin|arXiv (Cornell University)|2021. 12. 31.
Multimodal Machine Learning Applications인용 수 30
한 줄 요약

ERNIE-ViLG는 이산적 이미지 표현을 사용하여 이미지-텍스트와 텍스트-이미지 생성을 모두 자동회귀적으로 모델링하는 통합된 10B-parameter 트랜스포머를 제시하며, 텍스트-이미지 합성을 위한 엔드 투 엔드 학습 옵션과 대규모 중국어 이미지-텍스트 사전훈련이 가능하다.

ABSTRACT

Conventional methods for the image-text generation tasks mainly tackle the naturally bidirectional generation tasks separately, focusing on designing task-specific frameworks to improve the quality and fidelity of the generated samples. Recently, Vision-Language Pre-training models have greatly improved the performance of the image-to-text generation tasks, but large-scale pre-training models for text-to-image synthesis task are still under-developed. In this paper, we propose ERNIE-ViLG, a unified generative pre-training framework for bidirectional image-text generation with transformer model. Based on the image quantization models, we formulate both image generation and text generation as autoregressive generative tasks conditioned on the text/image input. The bidirectional image-text generative modeling eases the semantic alignments across vision and language. For the text-to-image generation process, we further propose an end-to-end training method to jointly learn the visual sequence generator and the image reconstructor. To explore the landscape of large-scale pre-training for bidirectional text-image generation, we train a 10-billion parameter ERNIE-ViLG model on a large-scale dataset of 145 million (Chinese) image-text pairs which achieves state-of-the-art performance for both text-to-image and image-to-text tasks, obtaining an FID of 7.9 on MS-COCO for text-to-image synthesis and best results on COCO-CN and AIC-ICC for image captioning.

연구 동기 및 목표

  • 단일 자동회귀 트랜스포머 프레임워크 내에서 양방향 비전-언어 생성을 동기 부여하고 가능하게 한다.
  • VQVAE/VQGAN 기반 토크나이제이션으로 학습된 이산적 이미지 표현을 활용하여 이미지-텍스트와 텍스트-이미지 생성을 하나로 통합한다.
  • 생성기와 재구성기를 함께 최적화하기 위해 텍스트-이미지 합성을 위한 엔드투엔드 학습 방법을 제안한다.
  • 대규모 중국어 이미지-텍스트 데이터셋에서 10B 파라미터로 사전훈련을 확장하여 양방향 생성 방향 및 생성적 VQA에서의 SOTA 성능을 달성한다.
  • 정성적 및 정량적 실험을 통해 강한 교차모달 의미 정렬을 입증한다.

제안 방법

  • 이미지를 VQVAE/VQGAN 기반 토크나이제이션으로 이산 시퀀스로 표현하고 이를 텍스트 토큰과 함께 공유된 트랜스포머의 입력으로 매핑한다.
  • 이미지-텍스트와 텍스트-이미지 생성을 같은 모델 내에서 특정 자기-주의 마스크를 사용하여 자기회귀적 작업으로 형식화한다.
  • 텍스트-이미지의 경우 트랜스포머의 숨겨진 임베딩을 이미지 토큰으로 매핑하고 이미지 재구성기를 통해 역전파를 전파하는 엔드투엔드 학습 경로를 도입한다.
  • 훈련 및 추론 중 장기 시각 시퀀스(n ~ 1024)를 효율적으로 관리하기 위해 희소 주의(row/column/convolutional)을 활용한다.
  • 중국어 웹페이지, 이미지 검색 데이터, 공개 CC/CC12M에서 파생된 캡션으로 구성된 145M 개의 중국어 이미지-텍스트 쌍 데이터셋에서 10B 파라미터 모델을 사전훈련한다.
  • 확대된 규모의 GAN과 같은 구성요소를 안정적으로 학습시키기 위해 2단계 텍스트-이미지 학습을 채택하고 소규모 스케일에서 엔드투엔드 변형과 비교한다.

실험 결과

연구 질문

  • RQ1단일 자동회귀 트랜스포머 모델에서 양방향 이미지-텍스트 생성을 효과적으로 통합할 수 있는가?
  • RQ2대규모 중국어 이미지-텍스트 데이터셋에서의 공동 사전훈련이 텍스트-이미지 합성 및 이미지 자막생성 모두에서 최첨단 결과를 낳는가?
  • RQ3텍스트-이미지 합성을 위한 엔드투엔드 학습 접근법이 전통적인 2단계 파이프라인에 비해 생성기와 재구성기의 성능을 향상시키는가?
  • RQ4VQVAE/VQGAN을 통한 이산 시각 표현이 교차모달 생성 품질과 정렬에 어떤 영향을 주는가?
  • RQ5통합된 양방향 모델이 생성적 VQA의 의미 정렬 능력을 확장하는가?

주요 결과

  • ERNIE-ViLG는 MS-COCO에서 텍스트-이미지 합성을 위한 Fréchet Inception Distance(FID) 7.9의 최첨단 성능을 달성했다.
  • 제로샷 텍스트-이미지 생성에서 ERNIE-ViLG는 FID 14.7을 달성하여 DALL-E(27.5)보다 앞선 성능을 보인다.
  • 이미지 자막생성에서 COCO-CN 및 AIC-ICC 데이터셋에서 BLEU@4, METEOR, ROUGE-L, CIDERr 지표로 최상의 결과를 낸다.
  • 제로샷 이미지 생성에서 인간 평가가 ERNIE-ViLG가 CogView보다 이미지 선명도, 질감, 텍스트 관련성에서 우수함을 보이고, fine-tuning 시 COCO-CN에서 더 높은 자막 품질을 보인다.
  • 텍스트-이미지 합성을 위한 엔드투엔드 학습은 경량 모델에서 2단계 파이프라인 대비 FID를 약 1.5포인트 개선했고, 엔드투엔드 G와 엔드투엔드 R의 조합은 재구성 품질에서 가장 큰 향상을 보인다.
  • 모델은 FMIQA에서 78.5%의 투어링 테스트 합격률과 평균 품질 점수 1.495로 강력한 생성적 VQA 성능을 시연한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.