Skip to main content
QUICK REVIEW

[논문 리뷰] ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models

Guiming Hardy Chen, Shunian Chen|arXiv (Cornell University)|2024. 02. 18.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 GPT-4V로 생성한 고품질 데이터를 훈련 데이터로 사용하여 12개 벤치마크에서 경쟁적인 성능을 달성하는 3B 파라미터 비전-언어 모델인 ALLaVA를 소개한다. GPT-4V로부터 유도된 합성 캡션, 복잡한 지시문, 상세한 답변을 활용함으로써 ALLaVA는 라이트형과 풀스케일 LVLM 간의 성능 격차를 좁히며, 크기가 작음에도 불구하고 핵심 과제에서 더 큰 모델을 능가한다.

ABSTRACT

Large vision-language models (LVLMs) have shown premise in a broad range of vision-language tasks with their strong reasoning and generalization capabilities. However, they require considerable computational resources for training and deployment. This study aims to bridge the performance gap between traditional-scale LVLMs and resource-friendly lite versions by adopting high-quality training data. To this end, we propose a comprehensive pipeline for generating a synthetic dataset. The key idea is to leverage strong proprietary models to generate (i) fine-grained image annotations for vision-language alignment and (ii) complex reasoning visual question-answering pairs for visual instruction fine-tuning, yielding 1.3M samples in total. We train a series of lite VLMs on the synthetic dataset and experimental results demonstrate the effectiveness of the proposed scheme, where they achieve competitive performance on 17 benchmarks among 4B LVLMs, and even perform on par with 7B/13B-scale models on various benchmarks. This work highlights the feasibility of adopting high-quality data in crafting more efficient LVLMs. We name our dataset extit{ALLaVA}, and open-source it to research community for developing better resource-efficient LVLMs for wider usage.

연구 동기 및 목표

  • 고품질 훈련 데이터를 통해 라이트형과 풀스케일 비전-언어 모델(LVLM) 간의 성능 격차를 해소하기 위해.
  • 인간 레이블링 데이터셋에 의존하지 않고도 고정밀도의 다중모态 훈련 데이터를 생성하는 확장 가능한 데이터 중심 접근법을 개발하기 위해.
  • GPT-4V로부터 생성된 합성 데이터가 라이트형 LVLM을 효과적으로 훈련시켜 더 큰 모델의 성능을 따라하거나 능가할 수 있는지 평가하기 위해.
  • 140만 개 샘플로 구성된 상세한 캡션과 지시문을 포함한 대규모 고품질 합성 데이터셋을 오픈소스화하여 향후 연구에 기여하기 위해.

제안 방법

  • GPT-4V를 활용해 140만 장의 이미지에 대해 세밀한 이미지 캡션, 복잡한 추론 지시문, 상세한 답변을 생성하였다.
  • 두 가지 별도의 합성 데이터셋을 구축: 시각-텍스트 정렬을 위한 ALLaVA-Caption-4V와 시각적 지시 테이닝을 위한 ALLaVA-Instruct-4V.
  • 두 단계 파이프라인을 사용해 3B 파라미터 언어 모델(Phi2)과 시각 인코더를 훈련: 정렬 데이터로의 사전 훈련 후 지시 데이터로의 미세조정.
  • 데이터 품질을 우선시하는 데이터 중심 프레임워크를 적용하여 저품질 캡션으로 인한 노이즈 신호를 최소화하였다.
  • MME, GQA, MM-Vet 등 12개의 벤치마크에서 모델 성능을 평가하였으며, LLaVA-v1.6-34B 및 GPT-4V와 같은 SOTA 모델들과 비교하였다.
  • 각 합성 데이터셋이 훈련의 다양한 단계에서 모델 성능에 미치는 영향을 분리 분석하기 위해 아블레이션 스터디를 수행하였다.
Figure 1: Pipeline for scaling up high-quality data. Prompts in the figure are shown for demonstration purpose. See the detailed prompt in Appendix A.1 and A.2 .
Figure 1: Pipeline for scaling up high-quality data. Prompts in the figure are shown for demonstration purpose. See the detailed prompt in Appendix A.1 and A.2 .

실험 결과

연구 질문

  • RQ1GPT-4V로부터 생성된 고품질 합성 데이터가 라이트형과 대규모 LVLM 간의 성능 격차를 메울 수 있는가?
  • RQ2GPT-4V가 복잡하고 세밀한 지시문과 답변을 생성함으로써 라이트형 비전-언어 모델의 추론 능력과 정렬 성능을 향상시킬 수 있는가?
  • RQ3합성 데이터를 사용할 때, 정렬 데이터로의 사전 훈련 후 지시 테이닝을 수행하는 두 단계 훈련 파이프라인의 효과는 어떠한가?
  • RQ4고품질 합성 데이터로 훈련된 3B 파라미터 모델이 13B~34B 모델과 비교해 유사한 성능을 낼 수 있는가?

주요 결과

  • ALLaVA는 MME 점수 1623.2와 GQA 점수 50.0을 기록하여 LLaVA-v1.5-13B를 모두 앞서는 성능을 보였다.
  • MM-Vet 점수 33.2를 기록하여 작고도 효율적인 크기에도 불구하고 강력한 다중모달 추론 능력을 입증하였다.
  • 아블레이션 스터디 결과, ALLaVA-Caption-4V와 ALLaVA-Instruct-4V를 함께 사용했을 때 성능이 가장 뛰어났으며, 이 경우 MM-Vet 점수는 32.2로 측정되었다.
  • Phi2-2.7B 기반 아키텍처가 Qwen-1.8B와 StableLM-2-1.6B와 같은 더 큰 LLM보다 모든 벤치마크에서 뛰어난 성능을 보였으며, 합성 데이터와의 뛰어난 호환성을 시사하였다.
  • qualitative 예시 두 개에서 ALLaVA는 GPT-4V의 추론 품질을 따라하거나 능가했으며, 특히 정서 인식과 유머 이해 분야에서 두각을 나타냈다.
  • 오픈소스화된 140만 개 샘플의 데이터셋은 현재까지 LVLM 훈련을 위한 가장 대규모의 GPT-4V 기반 합성 데이터셋이며, 향후 데이터 중심의 다중모달 학습 연구에 기여할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.