Skip to main content
QUICK REVIEW

[논문 리뷰] VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation

Jinguo Zhu, Xiaohan Ding|arXiv (Cornell University)|2023. 12. 14.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

VL-GPT는 단일 순차적 목적함수를 사용하여 종단간 다중모달 이해 및 생성을 가능하게 하는 통합형 생성 미리 훈련된 트랜스포머입니다. 학습 가능한 이미지 토크나이저-디토크나이저 프레임워크를 도입함으로써 원시 이미지를 연속적인 시각적 임베딩으로 매핑하고 다시 원래 픽셀 공간으로 복원할 수 있게 되어, 이미지와 텍스트가 번갈아 배치된 시퀀스를 통일적으로 처리하고 생성할 수 있게 되었으며, 이로 인해 다양한 시각-언어 작업에서 강력한 제로샷 및 패기샷 성능을 달성했습니다.

ABSTRACT

In this work, we introduce Vision-Language Generative Pre-trained Transformer (VL-GPT), a transformer model proficient at concurrently perceiving and generating visual and linguistic data. VL-GPT achieves a unified pre-training approach for both image and text modalities by employing a straightforward auto-regressive objective, thereby enabling the model to process image and text as seamlessly as a language model processes text. To accomplish this, we initially propose a novel image tokenizer-detokenizer framework for visual data, specifically designed to transform raw images into a sequence of continuous embeddings and reconstruct them accordingly. In combination with the existing text tokenizer and detokenizer, this framework allows for the encoding of interleaved image-text data into a multimodal sequence, which can subsequently be fed into the transformer model. Consequently, VL-GPT can perform large-scale pre-training on multimodal corpora utilizing a unified auto-regressive objective (i.e., next-token prediction). Upon completion of pre-training, VL-GPT exhibits remarkable zero-shot and few-shot performance across a diverse range of vision and language understanding and generation tasks, including image captioning, visual question answering, text-to-image generation, and more. Additionally, the pre-trained model retrains in-context learning capabilities when provided with multimodal prompts. We further conduct instruction tuning on our VL-GPT, highlighting its exceptional potential for multimodal assistance. The source code and model weights shall be released.

연구 동기 및 목표

  • 이미지 입력과 생성을 별도로 모델링할 필요 없이, 동일한 순차적 목적함수를 사용하여 시각과 언어의 미리 훈련을 통합하는 것.
  • 기존 다중모달 모델에서 입력과 출력 간 이미지 표현의 일관성 문제를 해결하기 위해 일관된 시각적 임베딩 모델링을 가능하게 하는 것.
  • 통합된 시퀀스 모델링 프레임워크를 통해 텍스트, 이미지, 번갈아 배치된 출력을 포함한 종단간 다중모달 생성을 가능하게 하는 것.
  • 다중모달 생성 모델에서 문맥 내 학습과 지시 fine-tuning의 잠재력을 탐색하여 일반 목적의 보조 기능을 제공하는 것.
  • CLIP 및 디퓨전 모델의 이중 감독을 통해 이미지의 세부 사항과 의미적 내용을 모두 유지하는 토크나이저-디토크나이저 프레임워크를 개발하는 것.

제안 방법

  • 원시 이미지를 연속적인 시각적 임베딩으로 변환하고 픽셀 공간에서 재구성하는 데 사용되는 새로운 이미지 토크나이저-디토크나이저 프레임워크를 제안하며, 이는 LLM에서의 텍스트 토크나이징과 유사합니다.
  • 토크나이저와 디토크나이저를 훈련하기 위해 사전 훈련된 CLIP의 이미지 및 캡션 임베딩을 감독으로 사용하여 풍부한 의미적 및 감각적 정확성을 확보합니다.
  • 사전 훈련된 이미지 인코더와 고품질 디퓨전 모델의 가중치 초기화를 활용하여 공동 훈련을 수행함으로써 효율성과 성능을 향상시킵니다.
  • 텍스트의 BPE 토크나이징과 시각적 임베딩 시퀀스를 사용하여 이미지-텍스트가 번갈아 배치된 데이터를 통합된 다중모달 시퀀스로 인코딩하여 순차적 모델링을 가능하게 합니다.
  • 혼합 손실을 적용: 시각적 임베딩에는 평균 제곱오차(MSE)를, 텍스트 토큰에는 교차 엔트로피를 사용하여 다양한 모odal 간의 공동 다음 토큰 예측을 가능하게 합니다.
  • 재구성 품질과 의미 일관성을 향상시키기 위해 디토크나이징 시 텍스트 및 이미지 조건 임베딩을 모두 활용합니다.

실험 결과

연구 질문

  • RQ1공유된 트랜스포머 아키텍처를 사용하여 동일한 순차적 목적함수를 통해 시각과 언어 모odal 간에 통합 적용이 가능한가?
  • RQ2학습 가능한 이미지 토크나이저-디토크나이저 프레임워크가 종단간 다중모달 생성을 위해 이미지의 세부 사항과 의미를 얼마나 잘 유지하는가?
  • RQ3텍스트와 이미지 조건 임베딩을 함께 추정함으로써 이미지 재구성 및 다중모달 태스크 성능이 향상되는가?
  • RQ4다중모달 예시를 포함한 문맥 내 학습을 통해 VL-GPT가 제로샷 및 패기샷 시각-언어 작업으로 일반화할 수 있는가?
  • RQ5지시 fine-tuning이 다양한 생성 및 이해 작업을 위한 다중모달 보조 기능으로서 VL-GPT의 능력을 얼마나 향상시키는가?

주요 결과

  • VL-GPT는 이미지 캡션 생성, 시각질의 질문 응답, 텍스트 기반 이미지 생성 작업에서 최신 기준 성능을 달성했습니다.
  • VQAv2 벤치마크에서 k=2의 패기샷 설정에서 57.2%의 정확도를 기록하여, 동일한 패기샷 조건 하에서 기존 방법들을 능가했습니다.
  • 모델은 강력한 문맥 내 학습 능력을 보였으며, 프롬프트에 포함된 패기샷 예시 수가 많아질수록 VQA 성능이 향상되어 양의 상관관계를 보였습니다.
  • 절단 실험 결과, 텍스트 및 이미지 조건 임베딩(eₜ + eᵥ)을 모두 사용할 경우 가장 우수한 이미지 재구성 품질과 후행 작업 성능을 달성함을 확인했습니다.
  • 정성적 결과에서는 VL-GPT가 긴 복잡한 텍스트 프롬프트에서 매우 현실적인 이미지를 생성하고, 다중 라운드 대화에서 다중모달 일관성을 유지함을 보여주었습니다.
  • 지시 fine-tuning을 통해 VL-GPT는 다양한 생성 및 이해 작업을 위한 다용도 다중모달 보조 기능으로서의 기능을 수행할 수 있음을 확인했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.