[논문 리뷰] X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks
X$^2$-VLM는 유연한 모듈형 Transformer 아키텍처를 통해 객체, 영역, 전체 이미지에 이르기까지 다중 해상도의 시각-언어 정렬을 학습하는 통합형, 일체형 시각-언어 사전학습 프레임워크를 제안한다. 이미지-텍스트 및 영상-텍스트 쌍을 함께 최적화하여 다중 해상도 정렬과 정렬 위치를 동시에 학습함으로써, 이미지-텍스트 및 영상-텍스트 벤치마크에서 최신 기술 수준(SoTA) 성능을 달성하며, 단순한 텍스트 인코더 교체를 통해 다국어 및 도메인 외 작업으로의 제로샷 전이를 가능하게 한다.
Vision language pre-training aims to learn alignments between vision and language from a large amount of data. Most existing methods only learn image-text alignments. Some others utilize pre-trained object detectors to leverage vision language alignments at the object level. In this paper, we propose to learn multi-grained vision language alignments by a unified pre-training framework that learns multi-grained aligning and multi-grained localization simultaneously. Based on it, we present X$^2$-VLM, an all-in-one model with a flexible modular architecture, in which we further unify image-text pre-training and video-text pre-training in one model. X$^2$-VLM is able to learn unlimited visual concepts associated with diverse text descriptions. Experiment results show that X$^2$-VLM performs the best on base and large scale for both image-text and video-text tasks, making a good trade-off between performance and model scale. Moreover, we show that the modular design of X$^2$-VLM results in high transferability for it to be utilized in any language or domain. For example, by simply replacing the text encoder with XLM-R, X$^2$-VLM outperforms state-of-the-art multilingual multi-modal pre-trained models without any multilingual pre-training. The code and pre-trained models are available at https://github.com/zengyan-97/X2-VLM.
연구 동기 및 목표
- 기존 시각-언어 모델이 굵은 해상도 또는 객체 수준의 정렬에만 집중하는 한계를 해결하기 위해, 객체, 영역, 전체 이미지에 걸쳐 다중 해상도의 시각-언어 정렬을 학습한다.
- 단일 모델 아키텍처에서 이미지-텍스트 및 영상-텍스트 사전학습을 통합하여 더 넓은 다중모odal 이해를 가능하게 한다.
- 모듈형 설계를 활용해 추가 사전학습 없이도 다국어 또는 도메인 특화 작업으로의 제로샷 적응을 가능하게 하기 위해, 텍스트 인코더를 즉시 교체할 수 있도록 한다.
- 대규모이고 노이즈가 많은 이미지-텍스트 및 영상-텍스트 데이터에서 다중 해상도 사전학습을 효과적으로 스케일링한다.
- 세부 해상도의 정렬을 학습할수록 약한 상관관계를 가지는 이미지-텍스트 쌍과 복잡한 후행 작업에서 성능 향상이 이루어진다는 것을 입증한다.
제안 방법
- X$^2$-VLM는 시각 인코더, 텍스트 인코더, 그리고 교차 attention 융합 모듈로 구성된 세 모듈형 Transformer 기반 아키텍처를 사용한다.
- 시각 인코더는 비전 트랜스포머를 통해 이미지를 처리하고, 패치 특징을 추출하여 객체, 영역, 또는 전체 이미지와 같은 다중 해상도의 시각적 개념을 통합된 형태로 표현한다.
- 텍스트 특징과 대응하는 시각 특징을 정렬함으로써 다중 해상도 정렬을 공동 최적화하고, 텍스트 기반 설명이 주어졌을 때 시각적 개념에 대한 바운딩 박스를 예측함으로써 다중 해상도 정렬 위치를 동시에 최적화한다.
- 모델은 세 가지 유형의 데이터로 사전학습된다: 객체 레이블, 영역 애너테이션, 전체 이미지 캡션으로, 이는 다양한 텍스트 기반 설명과 연결된 다양한 시각적 개념을 학습할 수 있도록 한다.
- 영상-텍스트 사전학습은 영상 프레임을 샘플링하고 동일한 시각 인코더로 인코딩하며, 시간 차원을 따라 패치 특징을 평균화함으로써 이미지-텍스트 사전학습과 통합된다.
- 모듈형 설계 덕분에 텍스트 인코더를 쉽게 교체할 수 있으며(예: XLM-R로), 다국어 또는 도메인 특화 작업으로의 제로샷 적응이 가능하다.
실험 결과
연구 질문
- RQ1객체 검출기 의존 없이도, 객체, 영역, 전체 이미지에 걸쳐 다중 해상도의 시각-언어 정렬을 효과적으로 학습할 수 있는가?
- RQ2다중 해상도 정렬과 정렬 위치를 함께 최적화함으로써, 후행 시각-언어 작업에서 성능 향상이 어떻게 이루어지는가?
- RQ3공유된 인코더 매개변수를 사용할 때, 단일 사전학습 모델이 이미지-텍스트 및 영상-텍스트 작업 모두에 얼마나 잘 일반화되는가?
- RQ4X$^2$-VLM의 모듈형 아키텍처가 추가 사전학습 없이도 다국어 또는 도메인 외 작업으로의 제로샷 전이를 가능하게 하는가?
- RQ5객체 수준과 영역 수준의 감독이 검색, 정렬, 오픈 어휘 검출 작업에서 성능에 기여하는 비중은 각각 어느 정도인가?
주요 결과
- X$^2$-VLM는 기반 및 대규모 이미지-텍스트 및 영상-텍스트 벤치마크에서 최신 기술 수준 성능을 달성하며, 검색, VQA, 시각 정렬 작업에서 기존 방법을 능가한다.
- 제거 실험 결과, 다중 해상도 정렬 또는 정렬 위치 손실을 제거할 경우 성능 저하가 심각하게 발생함을 확인하여, 두 구성 요소가 모두 필수적임을 입증한다.
- 객체 데이터와 영역 데이터를 병합하면 모든 작업에서 최고의 성능를 기록하며, 이미지 검색에는 객체 데이터가 핵심이며, 시각 정렬에는 영역 데이터가 필수적임을 확인한다.
- 텍스트 인코더를 XLM-R로 교체함으로써 X$^2$-VLM는 다국어 작업으로의 강력한 제로샷 전이를 달성하며, 다국어 사전학습이 없는 전용 다국어 사전학습 모델을 초월한다.
- 정성적 결과는 X$^2$-VLM가 특정 브랜드, 캐릭터, 또는 부분적으로 가려진 객체와 같은 세부 해상도의 시각적 개념을 오픈 도메인 이미지에서 정확하게 정렬할 수 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.