[논문 리뷰] Write and Paint: Generative Vision-Language Models are Unified Modal Learners
이 논문은 새로운 프리픽스 다중모달 모델링 프레임워크를 사용하여 동시에 이미지에서 텍스트를 생성하는(쓰기) 및 텍스트에서 이미지를 생성하는(그리기) 능력을 갖춘 통합 시각-언어 기초 모델 DaVinci를 제안한다. 대규모 이미지-캡션 쌍에 대해 두 모odal 모두에 프리픽스 언어 모델링을 적용함으로써 DaVinci는 27개의 다양한 시각, 언어 및 다중모달 작업에서 최신 기술 수준(SOTA) 성능을 달성하며, 통합 다중모달 학습을 위한 대칭적 생성 사전학습의 우수성을 입증한다.
Recent advances in vision-language pre-training have pushed the state-of-the-art on various vision-language tasks, making machines more capable of multi-modal writing (image-to-text generation) and painting (text-to-image generation). However, few studies investigate if these two essential capabilities can be learned together and boost each other, making a versatile and powerful multi-modal foundation model. In this work, we disclose the potential of symmetric generative vision-language pre-training in learning to write and paint concurrently, and propose a new unified modal model, named DaVinci, trained with prefix language modeling and prefix image modeling, a simple generative self-supervised objective on image-text pairs. Thanks to the proposed prefix multi-modal modeling framework, DaVinci is simple to train, scalable to huge data, adaptable to both writing and painting tasks, and also strong on other vision, text, and multi-modal understanding tasks. DaVinci achieves competitive performance on a wide range of 27 generation/understanding tasks and demonstrates the superiority of combining vision/language generative pre-training. Furthermore, we carefully benchmark the performance of different vision-language pre-training objectives on different scales of pre-training datasets on a heterogeneous and broad distribution coverage. Our results demonstrate the potential of exploiting self-supervision in both language and vision inputs, and establish new, stronger baselines for future comparisons at different data scales. The code and pre-trained models are available at https://github.com/shizhediao/DaVinci.
연구 동기 및 목표
- 시각과 언어의 생성 능력을 동시에 학습시켜 더 다재다능하고 강력한 다중모달 기초 모델을 구축할 수 있는지 탐구하기.
- 이미지-텍스트 및 텍스트-이미지 생성을 위한 대칭적 학습을 가능하게 하는 단순하고 확장 가능하며 통합된 사전학습 프레임워크 개발하기.
- 다양한 데이터 규모와 작업 분포에서 다양한 시각-언어 사전학습 목표의 효과를 평가하기.
- 향후 다중모달 기초 모델 연구를 위한 더 강력하고 일반화 능력이 뛰어난 기준 성능 설정하기.
제안 방법
- 프리픽스 다중모달 모델링을 제안하며, 이미지를 이산 토큰 시퀀스로 변환함으로써 시각 모달에 프리픽스 언어 모델링을 확장한다.
- 한 모달리티의 서픽스(후행부분)를 동일 모달리티의 프리픽스와 다른 모달리티의 전체 입력에 조건화된 채로 단일 모델을 훈련시켜 생성한다.
- 생성 작업에 인간 레이블이 없는 대규모 이미지-캡션 쌍을 대상으로 단순한 자기지도 생성 목표를 사용한다.
- 모두의 모달리티에서 공유 파라미터를 사용하는 표준 트랜스포머 기반 아키텍처를 활용하여 이미지 쓰기와 그리기 모두에 대한 엔드 투 엔드 훈련을 가능하게 한다.
- VQ-VAE 유사 방법을 통해 이산 이미지 토큰을 활용함으로써 이미지를 텍스트와 동일한 형식으로 시퀀스 모델링할 수 있도록 한다.
- 이러한 통합 목표를 사용해 대규모 이미지-캡션 쌍 데이터셋에서 DaVinci를 사전학습함으로써 다양한 작업에서 제로샷 및 피넷팅 성능을 달성한다.
실험 결과
연구 질문
- RQ1시각과 언어의 대칭적 생성 사전학습이 생성 및 이해 작업 전반에서 성능 향상에 기여하는가?
- RQ2이미지-텍스트 및 텍스트-이미지 생성을 위한 단일 목표로 훈련된 통합 다중모달 모델이 전용 모델보다 우수한가?
- RQ3다양한 데이터 크기와 작업 분포에서 다양한 사전학습 목표의 스케일링 특성은 어떻게 되는가?
- RQ4단일 기초 모델이 시각, 언어 및 다중모달 작업 전반에서 강력한 제로샷 및 피넷팅 성능을 달성할 수 있는가?
주요 결과
- DaVinci는 이미지-텍스트 생성, 텍스트-이미지 생성, 시각-언어 이해를 포함한 27개의 다양한 시각, 언어 및 다중모달 작업에서 최신 기술 수준 성능을 달성한다.
- CLEVR-Ref+ 및 GQA 벤치마크에서 DaVinci는 각각 83.92 및 78.81의 제로샷 정확도를 기록하며, FLAVA 및 SimVLM를 능가한다.
- 텍스트-이미지 생성 벤치마크에서 DaVinci는 FID 점수 17.44(피넷팅 후 22.41)를 기록하며, 동일한 벤치마크에서 DALL-E 및 OFA를 초월한다.
- 모델은 강력한 제로샷 일반화 능력을 보이며, CIDEr 최적화 없이도 COCO 이미지 캡션에서 83.13의 CIDEr 점수를 기록한다.
- 광범위한 아블레이션 실험을 통해 제안된 프리픽스 다중모달 모델링 목표가 다양한 데이터 규모에서 매우 효과적이고 확장 가능함을 입증한다.
- DaVinci는 평가된 모든 작업에서 FLAVA, SimVLM 및 OFA를 일관되게 능가하며, 통합 시각-언어 모델에 대해 새로운 SOTA 기준을 설정한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.