Skip to main content
QUICK REVIEW

[논문 리뷰] VILA: On Pre-training for Visual Language Models

Lin Ji, Hongxu Yin|arXiv (Cornell University)|2023. 12. 12.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 시각-언어 벤치마크 전반에서 최신 기술 수준의 성능을 달성하는 VILA라는 시각-언어 모델 패밀리를 제안한다. 이는 사전 훈련 단계를 최적화함으로써 달성된다. LLM을 사전 훈련 중에 미세조정하고, 번갈아가며 배치된 이미지-텍스트 데이터를 사용하며, 미세조정 중에 텍스트 전용 지시 데이터를 재혼합함으로써 VILA는 아키텍처적 추가 요소 없이도 문맥 내 학습, 다중 이미지 추론, 세계 지식 향상을 향상시킨다.

ABSTRACT

Visual language models (VLMs) rapidly progressed with the recent success of large language models. There have been growing efforts on visual instruction tuning to extend the LLM with visual inputs, but lacks an in-depth study of the visual language pre-training process, where the model learns to perform joint modeling on both modalities. In this work, we examine the design options for VLM pre-training by augmenting LLM towards VLM through step-by-step controllable comparisons. We introduce three main findings: (1) freezing LLMs during pre-training can achieve decent zero-shot performance, but lack in-context learning capability, which requires unfreezing the LLM; (2) interleaved pre-training data is beneficial whereas image-text pairs alone are not optimal; (3) re-blending text-only instruction data to image-text data during instruction fine-tuning not only remedies the degradation of text-only tasks, but also boosts VLM task accuracy. With an enhanced pre-training recipe we build VILA, a Visual Language model family that consistently outperforms the state-of-the-art models, e.g., LLaVA-1.5, across main benchmarks without bells and whistles. Multi-modal pre-training also helps unveil appealing properties of VILA, including multi-image reasoning, enhanced in-context learning, and better world knowledge.

연구 동기 및 목표

  • 시각-언어 사전 훈련에서의 설계 선택이 최종 성능에 미치는 영향을 조사하는 것.
  • 모odal 간 정렬에 매우 중요하지만 비용이 많이 드는 사전 훈련에 대한 깊이 있는 연구 부족을 해결하는 것.
  • 강력한 제로샷 및 피처샷 능력을 갖춘 효과적인 시각-언어 모델을 구축하기 위한 실용적 지침을 제공하는 것.
  • 더 나은 사전 훈련 레시피를 통해 텍스트 전용 기능을 유지하면서도 시각적 이해 능력을 향상시키는 것.
  • 더 나은 사전 훈련에서 유도되는 다중 이미지 추론 및 향상된 문맥 내 학습과 같은 잠재적 기능을 밝혀내는 것.

제안 방법

  • 문맥 내 학습에 필수적인 깊은 임bedding 정렬을 위해 시각-언어 사전 훈련 중에 LLM을 미세조정하는 것.
  • 격리된 이미지-텍스트 쌍 대신 번갈아가며 배치된 이미지-텍스트 코퍼스(예: MMC4)를 사용하여 기울기 업데이트 품질과 공동 모델링을 향상시키는 것.
  • 텍스트 전용 지시 데이터를 미세조정 중에 재혼합하여 텍스트 전용 작업에서의 성능 저하를 완화하는 것.
  • 프로젝터 설계의 다양한 변형을 평가하며, 시각 토큰 수를 줄이는 '다운샘플' 프로젝터가 성능을 유지하면서도 효과적인지 확인하는 것.
  • LLM을 미세조정하는 것과 LLM을 동결하고 시각 전문가를 추가하는 것을 비교하여, 더 높은 정확도와 더 작은 모델 크기를 위해 종단 간 미세조정을 선호하는 것.
  • 사전 훈련 + 감독된 미세조정 파이프라인을 사용하며, 지시 테이닝을 위해 데이터를 FLAN 스타일 프롬프트로 변환하는 것.

실험 결과

연구 질문

  • RQ1사전 훈련 중에 LLM을 동결하는 것과 미세조정하는 것의 차이가 문맥 내 학습 능력과 제로샷 성능에 어떤 영향을 미치는가?
  • RQ2격리된 이미지-텍스트 쌍 대비 번갈아가며 배치된 이미지-텍스트 데이터를 사용할 경우 사전 훈련의 효과성에 어떤 영향을 미치는가?
  • RQ3미세조정 중에 텍스트 전용 지시 데이터를 재혼합하면 텍스트 전용 작업에서의 성능 저하를 완화하면서도 시각-언어 정확도를 향상시킬 수 있는가?
  • RQ4사전 훈련이 다중 이미지 추론 및 강화된 세계 지식과 같은 잠재적 기능에 어떤 영향을 미치는가?
  • RQ5LLM을 미세조정하는 것과 시각 전문가를 추가하는 것의 성능 대비 모델 크기 간의 상충 관계는 어떠한가?

주요 결과

  • 사전 훈련 중에 LLM을 미세조정하는 것은 문맥 내 학습 능력을 크게 향상시키지만, LLM을 동결하면 제로샷 성능는 좋지만 이 능력은 제한된다.
  • 번갈아가며 배치된 사전 훈련 데이터(예: MMC4)는 격리된 이미지-텍스트 쌍(예: COYO, LAION)보다 더 나은 기울기 업데이트와 뛰어난 성능을 제공한다.
  • 미세조정 중에 텍스트 전용 지시 데이터를 재혼합하면 텍스트 전용 기능을 유지할 뿐 아니라 시각-언어 작업의 정확도도 향상시킨다.
  • VILA는 추가 구성 요소 없이도 LLaVA-1.5와 같은 최신 기술 수준의 모델들을 초월하여 다양한 벤치마크에서 최고 성능을 기록하며 더 단순한 레시피로도 최신 기술 수준에 도달한다.
  • 강화된 사전 훈련은 다중 이미지 추론 및 더 강력한 세계 지식과 같은 잠재적 기능을 해방시킨다. 이는 단일 이미지 데이터로만 미세조정한 경우에도 적용된다.
  • '다운샘플' 프로젝터는 시각 토큰 수를 336에서 144로 줄이며, TextVQA 정확도를 약 46%까지 향상시켜 표준 시각 토크나이제이션에서의 부족함을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.