[논문 리뷰] Bootstrapping Vision-Language Learning with Decoupled Language Pre-training
이 논문은 처음으로 단일 모odal 텍스트 데이터로 훈련된 P-Former 모델을 통해 최적의 언어 프롬프트를 학습한 후, 시각적 특징을 이러한 프롬프트에 맞추는 방식으로 시각-언어 사전훈련을 향상시키는 백워드 디커플드 훈련 프레임워크를 제안한다. 이 방법은 400만 개와 1억 2900만 개의 이미지-텍스트 쌍으로 훈련된 모델 간의 성능 격차를 크게 줄이며, 계산 자원을 최소로 사용해 BLIP-2의 성능을 향상시킨다.
We present a novel methodology aimed at optimizing the application of frozen large language models (LLMs) for resource-intensive vision-language (VL) pre-training. The current paradigm uses visual features as prompts to guide language models, with a focus on determining the most relevant visual features for corresponding text. Our approach diverges by concentrating on the language component, specifically identifying the optimal prompts to align with visual features. We introduce the Prompt-Transformer (P-Former), a model that predicts these ideal prompts, which is trained exclusively on linguistic data, bypassing the need for image-text pairings. This strategy subtly bifurcates the end-to-end VL training process into an additional, separate stage. Our experiments reveal that our framework significantly enhances the performance of a robust image-to-text baseline (BLIP-2), and effectively narrows the performance gap between models trained with either 4M or 129M image-text pairs. Importantly, our framework is modality-agnostic and flexible in terms of architectural design, as validated by its successful application in a video learning task using varied base modules. The code will be made available at https://github.com/yiren-jian/BLIText.
연구 동기 및 목표
- 고정된 대규모 언어 모델을 사용한 엔드 투 엔드 시각-언어 사전훈련에서, 시각적 특징과 언어 생성 간의 정렬을 최적화하기 어려운 문제를 해결하기 위해.
- 소규모(400만 개)와 대규모(1억 2900만 개) 이미지-텍스트 데이터셋으로 사전훈련된 모델 간의 성능 격차를 줄이기 위해 프롬프트 정렬을 향상시키기 위해.
- 시각적 특징 선택 단계에서의 분리(프론트워드 디커플링)가 아니라, 각 타겟 텍스트에 대한 이상적인 언어 프롬프트를 먼저 식별함으로써 훈련 과정을 분리하기 위해.
- 비디오와 같은 다양한 모odal에 적용 가능한 모달 간 독립적이고 아키텍처에 유연한 시각-언어 학습을 가능하게 하기 위해, 단일 모달 텍스트 데이터로만 훈련된 P-Former을 개발하기 위해.
- 접근 가능한 하드웨어에서 고성능 사전훈련을 가능하게 하여, 시각-언어 연구의 진입 장벽을 낮추기 위해.
제안 방법
- 새로운 백워드 디커플드 훈련 파라다임 도입: 먼저, 언어 데이터만을 사용하여 고정된 LLM이 타겟 텍스트 $ t $ 를 생성하도록 유도하는 최적의 연속형 프롬프트 $ p $ 를 결정한다.
- P-Former를 사용해 이러한 이상적인 프롬프트를 $ p = E_{ ext{P-Former}}(t) $ 로 예측하도록 훈련하며, 인코더-디코더 아키텍처에서 인코더로 사용되는 인과적 LLM을 활용한다.
- 재구성 손실 $ ext{L}_{ ext{recon}} $ 과 대비 손실을 함께 사용해 P-Former을 훈련하여, 의미적으로 유사한 문장이 유사한 프롬프트 임베딩을 생성하도록 유도하며, SimCSE와 유사한 방식으로 문장 임베딩 학습을 가능하게 한다.
- 새로운 정렬 손실 $ ext{L}_{ ext{alignment}} $ 를 도입하여, 시각적 특징(프롬프트로 사용됨)과 기준 프롬프트 $ E_{ ext{P-Former}}(t) $ 간의 거리를 최소화함으로써, 더 나은 시각-텍스트 정렬을 달성한다.
- BLIP-2에 이 프레임워크를 적용하기 위해, 시각 인코더나 LLM을 수정하지 않고 두 번째 단계 훈련에 $ ext{L}_{ ext{alignment}} $ 를 추가한다.
- 모달 간 독립성을 검증하기 위해, I3D 비디오 인코더와 트랜스포머 기반 어댑터를 사용한 비디오 캡션 생성에 이 프레임워크를 적용하여, 다양한 모달과 아키텍처에 일반화 가능함을 입증한다.
![Figure 1: left: End-to-end training of X-to-language models (where X can be images, videos, or audio), in which aligned input features are provided as prompts to LLMs. Examples include Frozen [ 29 ] and ClipCap [ 46 ] . middle: “Forward-decoupled training” as demonstrated in BLIP-2 [ 34 ] and X-LLM](https://ar5iv.labs.arxiv.org/html/2307.07063/assets/x1.png)
실험 결과
연구 질문
- RQ1프론트워드 디커플링 방식(즉, 시각적 특징 선택 단계에서의 분리)이 아니라, 언어 프롬프트 최적화 단계에서 훈련 과정을 분리함으로써 시각-언어 사전훈련을 향상시킬 수 있는가?
- RQ2단일 모달 텍스트 데이터로만 훈련된 언어 모델이, 후속 생성 작업에서 시각적 특징과 잘 정렬되는 의미적으로 풍부한 프롬프트를 학습할 수 있는가?
- RQ3시각 데이터와 별도로 이상적인 프롬프트를 학습하고, 그 후에 시각적 특징을 그 프롬프트에 정렬함으로써, 특히 훈련 데이터가 제한된 상황에서 성능 향상을 달성할 수 있는가?
- RQ4이 프레임워크는 아키텍처 재설계 없이도 다양한 모달(예: 비디오)과 다양한 시각-언어 아키텍처로 일반화될 수 있는가?
- RQ5이 방법은 소규모 대비 대규모 이미지-텍스트 데이터셋으로 훈련된 모델 간의 성능 격차를 어느 정도 줄일 수 있는가?
주요 결과
- P-Former은 텍스트 데이터에서 의미적으로 유의미한 프롬프트를 성공적으로 학습하여, 효과적인 문장 임베딩 학습이 가능한 대비 손실을 달성한다.
- $ ext{L}_{ ext{alignment}} $ 손실을 추가함으로써 BLIP-2의 성능이 크게 향상되었으며, 400만 개와 1억 2900만 개의 이미지-텍스트 쌍으로 훈련된 모델 간의 성능 격차가 크게 줄어들었다.
- COCO 이미지 캡션 벤치마크에서, 이 프레임워크는 BLIP-2의 CIDEr 점수를 120.8에서 123.5로 향상시켜 생성 품질 향상을 뚜렷이 보였다.
- 비디오 캡션 작업에서는, 최첨단 VideoCoCa가 1000만 개의 비디오를 사용한 것에 비해 단지 26,000개의 비디오로 훈련한 상태에서도 VATEX 벤치마크에서 CIDEr 점수를 56.6에서 60.9로 상승시켰다.
- 이 방법은 모달 간 독립적이다: 고정된 I3D 인코더와 단순한 트랜스포머 어댑터를 사용한 비디오 캡션 모델에서도 성능 향상을 성공적으로 달성하여, 광범위한 아키텍처 유연성을 보였다.
- 이 프레임워크는 접근 가능한 하드웨어(8 × RTX-A6000)에서 4일 이내로 고성능 시각-언어 사전훈련을 가능하게 하여, 연구의 자원 장벽을 크게 낮췄다.
![Figure 2: Overview of P-Former. left: The P-Former training resembles an autoencoder, with the bidirectional P-Former as the encoder and a causal LLM (frozen) as the decoder. The objective is to reconstruct input text auto-regressively. The [CLS] representation serves as sentence embeddings, which a](https://ar5iv.labs.arxiv.org/html/2307.07063/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.