Skip to main content
QUICK REVIEW

[논문 리뷰] BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

Junnan Li, Dongxu Li|arXiv (Cornell University)|2022. 01. 28.
Multimodal Machine Learning Applications인용 수 862
한 줄 요약

BLIP은 노이즈가 많은 웹 이미지-텍스트 쌍으로부터 학습하기 위한 캡션 생성-필터링 데이터 부트스트래핑(CapFilt) 전략과 함께 단일 비전-언어 사전 학습 프레임워크(MED)를 제시합니다. 이해 및 생성 과제에서 최첨단 성과를 달성하고 제로샷 비디오-언어 전이에서도 강력합니다.

ABSTRACT

Vision-Language Pre-training (VLP) has advanced the performance for many vision-language tasks. However, most existing pre-trained models only excel in either understanding-based tasks or generation-based tasks. Furthermore, performance improvement has been largely achieved by scaling up the dataset with noisy image-text pairs collected from the web, which is a suboptimal source of supervision. In this paper, we propose BLIP, a new VLP framework which transfers flexibly to both vision-language understanding and generation tasks. BLIP effectively utilizes the noisy web data by bootstrapping the captions, where a captioner generates synthetic captions and a filter removes the noisy ones. We achieve state-of-the-art results on a wide range of vision-language tasks, such as image-text retrieval (+2.7% in average recall@1), image captioning (+2.8% in CIDEr), and VQA (+1.6% in VQA score). BLIP also demonstrates strong generalization ability when directly transferred to video-language tasks in a zero-shot manner. Code, models, and datasets are released at https://github.com/salesforce/BLIP.

연구 동기 및 목표

  • 비전-언어 이해와 생성 과제에 모두 탁월한 단일 모델을 만드는 것을 목표로 한다.
  • 캡션 생성기와 필터를 통해 자막을 부트스트래핑하여 노이즈가 많은 웹 텍스트의 비최적성을 해결한다.
  • 여러 모달리티와 작업을 지원하는 유연한 모델 아키텍처를 개발한다.
  • 사전 학습 데이터 품질을 향상시키기 위해 데이터 증강 파이프라인(CapFilt)을 활용한다.
  • 제로샷 설정에서 비디오-언어 작업으로의 강력한 전이 성능을 입증한다

제안 방법

  • 단일 모델 내에서 단일 모달 인코더, 이미지-기반 텍스트 인코더, 이미지-기반 텍스트 디코더를 가능하게 하는 다중 모달 혼합 인코더-디코더(MED)를 도입한다.
  • 세 가지 목표로 사전 학습한다: 이미지-텍스트 대조(ITC), 이미지-텍스트 매칭(ITM), 자막 생성을 위한 언어 모델링(LM).
  • 자체 주의(self-attention) 계층(SA)을 제외한 텍스트 인코더와 디코더 간 매개변수를 공유하여 다중 작업 학습의 효율성을 높인다.
  • CapFilt는 웹 데이터를 부트스트래핑한다: (i) 캡션 생성기가 웹 이미지에 대한 합성 자막을 생성, (ii) ITM/ITC 신호를 통해 노이즈 자막 제거, (iii) 정제된 웹 데이터와 사람 주석 데이터의 결합으로 사전 학습.
  • 다양성과 모델 학습을 향상시키기 위해 합성 자막에 핵 샘플링(nucleus sampling)을 활용한다.
  • 데이터셋 크기, 백본, 매개변수 공유에 대한 광범위한 제거 실험으로 CapFilt의 효과를 최적화하여 평가한다

실험 결과

연구 질문

  • RQ1통합 비전-언어 모델(MED)이 이해 과제와 생성 과제 모두에서 잘 작동할 수 있는가?
  • RQ2합성 자막과 필터링 단계를 통해 노이즈가 많은 웹 데이터를 부트스트랩하는 것이 다운스트림 비전-언어 성능을 향상시키는가?
  • RQ3데이터 다양성과 매개변수 공유 전략이 사전 학습 효율성과 다운스트림 결과에 어떻게 영향을 미치는가?
  • RQ4CapFilt가 제로샷 및 미세 조정된 작업에 미치는 영향은 무엇이며, 검색, 자막생성, VQA, NLVR2, VisDial 등을 포함한가?
  • RQ5BLIP는 제로샷 전이에서 비디오-언어 작업으로 얼마나 잘 일반화되는가?

주요 결과

  • BLIP는 이미지-텍스트 검색, 이미지 캡션 생성, VQA, 시각적 추론, 시각적 대화 등 비전-언어 과제에서 최첨단 결과를 달성한다.
  • 제로샷 비디오-언어 과제(텍스트-비디오 검색 및 비디오 QA)로의 전이는 최첨단 성능에 도달한다.
  • CapFilt는 원래의 노이즈 웹 텍스트를 사용하는 것보다 일관되게 성능을 향상시키며, 더 큰 백본과 더 많은 데이터와 함께일 때 더 큰 이점을 보인다.
  • 합성 자막의 다양성(nucleus sampling)을 통해 결정적 빔 검색보다 이득이 있다.
  • 자체 어텐션 레이어를 제외한 텍스트 인코더-디코더 매개변수 공유는 성능과 효율성의 균형이 우수하며, 분리된 캡션 생성기와 필터가 일반적으로 완전히 공유된 설정보다 더 나은 성능을 보인다.
  • CapFilt로 부트스트랩된 데이터와 함께 ViT-L 백본은 강력한 결과를 달성하여 훨씬 더 큰 데이터 세트로 학습된 방법에 근접하거나 대등한 수준이다

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.