Skip to main content
QUICK REVIEW

[논문 리뷰] Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks

Wenhui Wang, Hangbo Bao|arXiv (Cornell University)|2022. 08. 22.
Multimodal Machine Learning Applications인용 수 150
한 줄 요약

BEiT-3은 이미지, 텍스트, 이미지-텍스트 쌍에 걸친 마스킹 데이터 모델링을 Multiway Transformers로 수행하는 범용 다중모달 기초 모델로, 비전 및 비전-언어 과제 모두에 대해 최첨단 전이 성능을 달성한다.

ABSTRACT

A big convergence of language, vision, and multimodal pretraining is emerging. In this work, we introduce a general-purpose multimodal foundation model BEiT-3, which achieves state-of-the-art transfer performance on both vision and vision-language tasks. Specifically, we advance the big convergence from three aspects: backbone architecture, pretraining task, and model scaling up. We introduce Multiway Transformers for general-purpose modeling, where the modular architecture enables both deep fusion and modality-specific encoding. Based on the shared backbone, we perform masked "language" modeling on images (Imglish), texts (English), and image-text pairs ("parallel sentences") in a unified manner. Experimental results show that BEiT-3 obtains state-of-the-art performance on object detection (COCO), semantic segmentation (ADE20K), image classification (ImageNet), visual reasoning (NLVR2), visual question answering (VQAv2), image captioning (COCO), and cross-modal retrieval (Flickr30K, COCO).

연구 동기 및 목표

  • 단일 기초 모델 아래 비전과 언어 프리트레이닝의 통합 필요성 제시
  • 모달리티별 인코딩과 교차 모달 융합을 지원하는 범용 백본(Multiway Transformers) 제안
  • 이미지, 텍스트, 이미지-텍스트 쌍에 적용되는 마스킹 데이터 모델링이라는 단일 프리트레이닝 목표 주장
  • 모델 크기와 데이터 규모의 확장이 다양한 다운스트림 태스크로의 전이 성능을 향상시킴
  • 공공 자원 기반 프리트레이닝으로 SOTA에 근접하거나 경쟁하는 결과를 달성함

제안 방법

  • 모달리티별 익스퍼트와 공유 셀프 어텐션을 갖춘 Multiway Transformers를 채택하여 깊은 융합과 모달리티별 인코딩을 가능하게 함
  • 일원론적 프리트레이닝 작업 정의: 모노모달 및 다모달 데이터에 걸친 마스크-그다음 예측(mask-then-predict, 마스킹 데이터 모델링), 이미지를 외국어(Imglish)로 간주
  • 텍스트를 SentencePiece로 토큰화하고 이미지를 BEiT v2 시각 토큰으로 재구성의 대상으로 설정
  • 텍스트 토큰의 15%(모노모달)와 이미지-텍스트 쌍 텍스트 토큰의 50%를 마스킹; 이미지 패치의 40%를 블록 단위 마스킹
  • 공개 데이터 소스에서 40레이어 구조(약 19억 파라미터)로 BEiT-3를 프리트레이닝; 매 스텝마다 2048장의 이미지, 2048개의 텍스트, 2048개의 이미지-텍스트 쌍으로 배치 구성
  • 다양한 모드에서 다운스트림 전이 가능하게 함(비전 인코더, 검색용 듀얼 인코더, 멀티모달 태스크용 융합 인코더)

실험 결과

연구 질문

  • RQ1단일화된 아키텍처(Multiway Transformers)가 비전 및 비전-언어 태스크를 모두 효율적으로 지원할 수 있는가?
  • RQ2이미지, 텍스트, 이미지-텍스트 쌍에 대한 단일 마스킹 데이터 모델링 목표로 다중 모달 표현의 전이 가능성을 학습할 수 있는가?
  • RQ3모델 규모와 데이터 확장이 광범위한 비전 및 비전-언어 벤치마크에서 성능에 어떤 영향을 미치는가?

주요 결과

  • BEiT-3은 COCO 객체 탐지(AP), COCO 인스턴스 분할(AP), ADE20K 시맨틱 분할(mIoU), ImageNet 분류(Top-1), NLVR2 시각 추론, VQAv2 시각 질의 응답, COCO 이미지 캡션(CIDEr), 및 교차 모달 검색(Flickr30K, COCO) 등 다양한 태스크에서 최첨단 전이 성능을 달성합니다.
  • 비전 태스크에서 BEiT-3은 사전학습 및 미세조정에 공개 데이터 자원만을 사용하면서도 이전의 SOTA와 대등하거나 상회합니다.
  • 비전-언어 태스크에서 BEiT-3은 VQA, NLVR2, 캡션 작성, 검색 벤치마크에서 이전 SOTA를 상회하며 마스킹 기반 프리트레이닝을 통한 강력한 교차 모달 정렬을 입증합니다.
  • 제로샷 및 미세조정된 검색 결과에서 BEiT-3은 이전 모델과 경쟁력이 있거나 우수하며 COCO 및 Flickr30K 검색에서 주목할 만한 향상을 보입니다.
  • 시맨틱 세분화 및 이미지 분류 결과에서 단일 통합 모델로 최상위 정확도를 달성합니다

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.