[논문 리뷰] GLIPv2: Unifying Localization and Vision-Language Understanding
GLIPv2는 로컬라이제이션(탐지/세그멘테이션)과 VL 이해(그 grounded VQA, grounding, 및 캡션 작성)를 하나의 언어-지향 시각 작업 모델로 통합하는 사전 학습된 grounded 비전-언어 모델이다. 이는 로컬라이제이션과 VL 이해가 서로에게 상호 이익이 됨을 다양한 데이터셋에 걸쳐 보여준다.
We present GLIPv2, a grounded VL understanding model, that serves both localization tasks (e.g., object detection, instance segmentation) and Vision-Language (VL) understanding tasks (e.g., VQA, image captioning). GLIPv2 elegantly unifies localization pre-training and Vision-Language Pre-training (VLP) with three pre-training tasks: phrase grounding as a VL reformulation of the detection task, region-word contrastive learning as a novel region-word level contrastive learning task, and the masked language modeling. This unification not only simplifies the previous multi-stage VLP procedure but also achieves mutual benefits between localization and understanding tasks. Experimental results show that a single GLIPv2 model (all model weights are shared) achieves near SoTA performance on various localization and understanding tasks. The model also shows (1) strong zero-shot and few-shot adaption performance on open-vocabulary object detection tasks and (2) superior grounding capability on VL understanding tasks. Code will be released at https://github.com/microsoft/GLIP.
연구 동기 및 목표
- 로컬라이제이션과 비전-언어 이해 작업을 모두 수행하는 단일 모델의 동기 부여.
- 언어 지시 탐지, 세그멘테이션, 그라운딩, VQA 및 캡션화를 가능하게 한다.
- joint 로컬라이제이션과 VL 이해를 위한 사전 학습 손실 및 데이터 규모를 조사한다.
- 다수의 데이터셋에 대한 상세한 훈련, 차등 실험, 추론 속도 분석을 제공한다.
제안 방법
- 세 가지 손실 구성요소: intra-image region-word contrastive, inter-image word-region contrastive, 및 MLM으로 탐지, 그라운딩, 캡션 데이터에 대해 GLIPv2 변형을 사전 학습한다.
- 시각 특징과 언어 특징을 연결하기 위해 Hourglass 기반 세그멘테이션 헤드와 VL 융합 모듈을 갖춘 통합 아키텍처를 사용한다.
- COCO/ODinW/LVIS에서 탐지 및 그라운딩, PhraseCut에서 참조 세그멘테이션, VQA2.0에서 VQA, COCO 자막 생성에서 다운스트림 작업을 미세조정한다.
- 훈련 및 추론 중 예측된 구를 이미지 영역에 연결하여 grounded VQA 및 grounded 이미지 캡션화를 평가한다.
실험 결과
연구 질문
- RQ1단일 사전 학습 모델이 로컬라이제이션과 비전-언어 이해 작업에서 공동으로 탁월할 수 있는가?
- RQ2추가 사전 학습 손실(inter-image word-region contrastive, MLM) 및 데이터 규모가 로컬라이제이션과 VL 이해 성능을 모두 향상시키는가?
- RQ3다양한 데이터셋과 작업에서 파인튜닝되었을 때 또는 제로샷 평가 시 GLIPv2의 성능은 어떤가?
- RQ4다운스트림 VL 작업에 대한 다양한 사전 학습 데이터 유형(탐지, 그라운딩, 캡션)의 상대적 기여도는 무엇인가?
주요 결과
- GLIPv2 변형은 탐지 및 그라운딩에서 COCO, ODinW, LVIS에 대해 제로샷 및 미세조정 성능을 향상시킨다.
- Inter-image word-region contrastive 손실의 추가가 로컬라이제이션 및 그라운딩 성능을 크게 향상시킨다.
- MLM 손실은 Flickr30K, VQA 및 캡션 작성과 같은 언어 이해 작업에 이익을 준다.
- Cap4M 및 CC/SBU로 pre-training 데이터를 확장하면 도메인 내 및 도메인 간 작업이 더욱 향상된다.
- Grounded 이미지 캡션화 결과는 Flick30K에서 grounding 정렬과 함께 경쟁력 있는 캡션 품질을 보인다.
- 추론 속도 비교에서 GLIPv2 변형은 COCO 및 관련 작업에서 MDETR 대비 경쟁력 있는 처리량을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.