Skip to main content
QUICK REVIEW

[논문 리뷰] To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning

Junke Wang, Lingchen Meng|arXiv (Cornell University)|2023. 11. 13.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 LVIS 데이터셋의 이미지와 바운딩 박스 애너테이션을 기반으로 GPT-4V를 프롬프팅하여 생성한 220K개 샘플의 시각적 지시 데이터셋인 LVIS-Instruct4V를 제안한다. GPT-4V의 직접적인 시각적 이해 능력을 활용해 세밀하고 맥락 인식이 가능한, 시각적으로 일치하는 지시-답변 쌍을 생성함으로써, LLaVA-1.5의 성능을 다양한 벤치마크에서 크게 향상시켰으며, MME(+43.6)와 MM-Vet(+5.6%)에서 최고 성능 기록을 달성했다.

ABSTRACT

Existing visual instruction tuning methods typically prompt large language models with textual descriptions to generate instruction-following data. Despite the promising performance achieved, these descriptions are derived from image annotations, which are oftentimes coarse-grained. Furthermore, the instructions might even contradict the visual content without observing the entire visual context. To address this challenge, we introduce a fine-grained visual instruction dataset, LVIS-Instruct4V, which contains 220K visually aligned and context-aware instructions produced by prompting the powerful GPT-4V with images from LVIS. Through experimental validation and case studies, we demonstrate that high-quality visual instructional data could improve the performance of LLaVA-1.5, a state-of-the-art large multimodal model, across a wide spectrum of benchmarks by clear margins. Notably, by simply replacing the LLaVA-Instruct with our LVIS-Instruct4V, we achieve better results than LLaVA on most challenging LMM benchmarks, e.g., LLaVA$^w$ (76.7 vs. 70.7) and MM-Vet (40.2 vs. 35.4). We release our data and model at https://github.com/X2FD/LVIS-INSTRUCT4V.

연구 동기 및 목표

  • 기존의 시각적 지시 테이닝 방법이 이미지 애너테이션의 근본적인 텍스트 기반 서술에 의존하는 한계를 해결하기 위해.
  • 대규모 다중모달 모델이 데이터 생성 중에 직접 이미지를 관찰할 수 있도록 함으로써 지시 수행 데이터의 정확성과 시각적 기반 성능을 향상시키기 위해.
  • 복잡한 벤치마크에서 다중모달 언어 모델의 성능을 향상시키기 위해 고품질의 세밀한 시각적 지시 데이터셋을 개발하기 위해.
  • GPT-4V가 텍스트 전용 프롬프팅보다 우수한 지시 데이터를 생성할 수 있음을 입증하고, 이로 인해 하류 다중모달 추론에서 측정 가능한 성과 향상을 이끌어내기 위해.
  • 표준 지시 데이터를 LVIS-Instruct4V로 교체할 경우 어려운 LMM 벤치마크에서 최고 성능을 달성할 수 있음을 검증하기 위해.

제안 방법

  • LVIS 데이터셋의 원본 이미지와 바운딩 박스 애너테이션을 기반으로 GPT-4V(직접 시각 입력 기능을 갖춘 시각-언어 모델)를 활용해 지시-답변 쌍을 생성한다.
  • 이중 단계 프롬프팅 파이프라인 설계: 첫 번째로 맥락 인식이 가능한 시각적 대화 생성, 두 번째로 시각적 세부 정보에 기반한 고품질 이미지 기술서 생성.
  • 이미지와 국소화된 애너테이션을 함께 프롬프팅하여 GPT-4V를 활용해 220,000개의 시각적으로 일치하고 세밀한 지시-답변 쌍을 정제한다.
  • 동일한 모델 아키텍처와 훈련 절차를 유지하면서, LVIS-Instruct4V 데이터셋을 유일한 지시 테이닝 데이터로 사용해 LLaVA-1.5를 미세조정한다.
  • LLaVA-Instruct와 LVIS-Instruct4V를 혼합하여 훈련함으로써 일반화 능력과 강건성을 향상시켜 성능을 추가로 향상시킨다.
  • 미세조정된 언어 모델, 훈련 스케줄 길이, 데이터 혼합 전략 등의 영향을 평가하기 위해 분석 실험(ablation studies)를 수행한다.

실험 결과

연구 질문

  • RQ1GPT-4V가 텍스트 전용 프롬프팅보다 직접 이미지를 접근할 수 있을 때, 더 정확하고 맥락 인식이 가능한 시각적 지시 데이터를 생성할 수 있는가?
  • RQ2GPT-4V가 생성한 지시 데이터를 사용할 경우, 세밀한 시각적 추론 벤치마크에서 다중모달 모델의 성능 향상 정도는 어느 정도인가?
  • RQ3LLaVA-Instruct와 같은 기존의 지시 테이닝 데이터셋과 비교했을 때, LVIS-Instruct4V는 시각적 기반 성능와 모델 일반화 능력 측면에서 어떻게 다른가?
  • RQ4LVIS-Instruct4V + LLaVA-Instruct의 데이터 혼합 전략이 다양한 다중모달 벤치마크에서 모델 성능에 어떤 영향을 미치는가?
  • RQ5지시 데이터의 품질이 MME나 MM-Vet와 같은 어려운 벤치마크에서의 성능 향상과 관련이 있는가?

주요 결과

  • LLaVA-1.5가 LVIS-Instruct4V만으로 미세조정된 결과, LLaVA w에서 76.7점, MM-Vet에서 40.2점 기록하여 원본 LLaVA 모델(70.7점, 35.4점)을 초월했다.
  • LVIS-Instruct4V로 훈련된 13B 모델은 VQAv2에서 80.7점 기록하여 LLaVA-1.5의 80.0점보다 뛰어났다.
  • LVIS-Instruct4V를 LLaVA-Instruct와 혼합하여 훈련한 결과, 11개 벤치마크 중 9개에서 최고 성능 기록을 달성했으며, MME에서는 1574.9점(43.6점 향상)을 기록했다.
  • LVIS-Instruct4V로 훈련된 모델는 장면 텍스트 인식 능력이 뛰어나, LLaVA-1.5가 한 개를 놓친 이미지에서 두 개의 텍스트를 정확히 식별했다.
  • LLaVA-1.5가 잘못된 할당을 내리던 세밀한 시각적 비교에서 객체 간 관계(예: Bowls의 위치)를 정확히 식별했다.
  • 분석 실험 결과, 언어 모델를 고정한 상태에서도 LVIS-Instruct4V는 MME에서 1544.3점(비교 기준 1531.3점)의 성능 향상을 이끌었으며, 모델을 추가로 미세조정하면 성능은 1581.3점까지 상승했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.