[논문 리뷰] PaLI: A Jointly-Scaled Multilingual Language-Image Model
PaLI는 다수의 언어에 걸친 다양한 이미지-언어 작업을 수행하기 위해 텍스트-투-텍스트 인터페이스를 사용하는 공동으로 스케일링된 다국어 비전-언어 모델이며, 대형 단일모듈 백본과 10B-image WebLI 사전학습 데이터 세트를 활용합니다.
Effective scaling and a flexible task interface enable large language models to excel at many tasks. We present PaLI (Pathways Language and Image model), a model that extends this approach to the joint modeling of language and vision. PaLI generates text based on visual and textual inputs, and with this interface performs many vision, language, and multimodal tasks, in many languages. To train PaLI, we make use of large pre-trained encoder-decoder language models and Vision Transformers (ViTs). This allows us to capitalize on their existing capabilities and leverage the substantial cost of training them. We find that joint scaling of the vision and language components is important. Since existing Transformers for language are much larger than their vision counterparts, we train a large, 4-billion parameter ViT (ViT-e) to quantify the benefits from even larger-capacity vision models. To train PaLI, we create a large multilingual mix of pretraining tasks, based on a new image-text training set containing 10B images and texts in over 100 languages. PaLI achieves state-of-the-art in multiple vision and language tasks (such as captioning, visual question-answering, scene-text understanding), while retaining a simple, modular, and scalable design.
연구 동기 및 목표
- 다양한 언어에 걸친 이미지-텍스트를 텍스트 생성으로 통합적으로 다루기.
- 비전과 언어 백본의 공동 확장이 편향된 확장보다 이점이 있음을 보이기.
- 다국어 기능을 보존하면서 훈련 비용을 줄이기 위해 재사용 가능한 단일모드 체크포인트를 활용.
- 100개 이상의 언어와 광범위한 태스크 커버리지를 지원하는 대규모 다국어 WebLI 데이터셋으로 학습하기.
제안 방법
- ViT를 이미지 인코더로 사용하는 인코더-디코더 트랜스포머와 사전 학습된 mT5 기반의 언어 구성요소를 사용합니다.
- ViT-e, 더 큰 비전 용량의 4B 매개변수 비전 백본을 도입하여 더 큰 비전 용량의 영향력을 연구합니다.
- OCR 주석이 포함된 100개국 이상 언어의 10B 이미지와 수십억 개의 이미지-텍스트 쌍으로 구성된 WebLI에서 사전 학습합니다.
- 다중 작업 사전 학습 혼합을 채택하여 분할 캡션, 캡션 생성, OCR, VQA, VQG 등을 포함한 다중 모달 이해를 촉진합니다.
- 고해상도(224–588)에서 영어 및 다국어 벤치마크에 대해 미세 조정하고 평가하여 교차 언어 및 교차 태스크 전이 성능을 평가합니다.
실험 결과
연구 질문
- RQ1비전과 언어 백본의 공동 확장이 편향된 확장보다 다중 모달 성능을 더 잘 끌어내는가?
- RQ2대규모 다국어 다중 모달 모델이 영어 및 비영어 V&L 태스크(캡션 생성 및 언어별 VQA)에서 어떻게 성능을 보이는가?
- RQ3다양한 사전 학습 태스크 혼합이 다국어 V&L 능력에 미치는 영향은 무엇인가?
- RQ4단일모드 체크포인트를 재사용하면 언어 성능을 보존하면서 다중 모달 태스크를 가능하게 할 수 있는가?
주요 결과
- PaLI-17B가 Karpathy 분할의 COCO 캡션에서 CIDEr 149.1로 최첨단 성능을 달성합니다.
- PaLI-17B가 오픈 어휘 생성에서 VQAv2 정확도 84.3으로 이전 SOTA 모델을 능가합니다.
- PaLI-17B가 OKVQA 정확도 64.5를 달성하여 선행 사전학습-미세조정 결과보다 10.1포인트 앞섭니다.
- 다국어 Crossmodal-3600 결과가 7개 언어에서 높은 성능과 35개 언어 평균을 보여주며, 이전 연구에 비해 상당한 이점을 제공합니다.
- 비전 백본(ViT-e)의 확장은 비전-언어 태스크에서 큰 이득을 가져오며, 때로는 언어 확장만 하는 것보다 효율적입니다.
- 고해상도 사전 학습을 이용한 PaLI-17B는 비전-언어 벤치마크에서 약 2포인트 추가 성능 향상을 달성합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.