[논문 리뷰] An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models
이 논문은 LLaVA를 사용하여 7B에서 65B 파라미터로 확장된 지시 미세조정된 대규모 다중모달 모델(LMM)에 대한 실증적 연구를 제시하며, 모델 크기를 늘일수록 다중모달 및 언어 능력이 일관되게 향상됨을 보여준다. LoRA/QLoRA 미세조정은 전체 모델 미세조정과 비교해 유사한 성능을 달성하며, 더 높은 이미지 해상도와 다중모달-언어 데이터 혼합이 성능 향상에 기여하며, 시각적 지시 미세조정은 순수 언어 능력까지 향상시킴을 확인한다.
Visual instruction tuning has recently shown encouraging progress with open-source large multimodal models (LMM) such as LLaVA and MiniGPT-4. However, most existing studies of open-source LMM are performed using models with 13B parameters or smaller. In this paper we present an empirical study of scaling LLaVA up to 33B and 65B/70B, and share our findings from our explorations in image resolution, data mixing and parameter-efficient training methods such as LoRA/QLoRA. These are evaluated by their impact on the multi-modal and language capabilities when completing real-world tasks in the wild. We find that scaling LMM consistently enhances model performance and improves language capabilities, and performance of LoRA/QLoRA tuning of LMM are comparable to the performance of full-model fine-tuning. Additionally, the study highlights the importance of higher image resolutions and mixing multimodal-language data to improve LMM performance, and visual instruction tuning can sometimes improve LMM's pure language capability. We hope that this study makes state-of-the-art LMM research at a larger scale more accessible, thus helping establish stronger baselines for future research. Code and checkpoints will be made public.
연구 동기 및 목표
- 13B 파라미터를 초과하는 범위에서 대규모 언어 모델(LLM) 크기의 증가가 다중모달 모델(LMM) 성능에 미치는 영향을 조사하기 위해.
- 대규모 LMM에 대해 파rameter 효율적 미세조정 방법(예: LoRA 및 QLoRA)의 효과성을 평가하기 위해.
- 데이터 혼합(다중모달 대비 언어 전용 지시 데이터)과 이미지 해상도가 LMM 능력에 미치는 영향을 분석하기 위해.
- 시각적 지시 미세조정이 LMM의 다중모달 능력뿐 아니라 순수 언어 능력까지 향상시킬 수 있는지 탐색하기 위해.
- 더 큰 규모의 LLaVA 체크포인트를 사용한 향후 연구를 위한 더 강력하고 공개 가능한 기준 설정하기 위해.
제안 방법
- 두 단계 훈련 과정을 통해 Vicuna 기반 LLM을 LLaVA-80K 데이터셋을 사용해 시각적 지시 데이터로 미세조정함으로써 7B에서 65B로 LLaVA를 확장함: (1) 투영 헤드 훈련을 통한 시각적 특징 일치, (2) LLaVA-80K 데이터셋에서의 시각적 지시 미세조정.
- 전체 모델 미세조정과 파rameter 효율적 방법(LoRA 및 QLoRA)을 적용하여 훈련 비용과 성능의 상충 관계를 비교함.
- 2단계 훈련 동안 LLaVA-80K 다중모달 지시 데이터와 ShareGPT 언어 전용 지시 데이터를 혼합하여 데이터 혼합을 탐색함.
- 고해상도 이미지 입력(최대 336x336)을 사용하고, 그 영향을 시각적 이해 및 추론 능력에 대해 평가함.
- 효율적 훈련을 위해 DeepSpeed를 사용하고 ZeRO-3/ZeRO-2를 적용함. 시퀀스 길이를 2048 토큰으로 제한하고, 각 방법에 맞게 학습률 스케줄을 최적화함.
- 광범위한 초기화값 검색을 수행하였으며, 특히 LoRA의 경우 LoRA alpha = 2 × rank 이며 학습률 1×10⁻⁴일 때 최적의 성능를 기록함.
실험 결과
연구 질문
- RQ17B에서 65B로 LLM 크기를 확장할 경우 지시 미세조정된 LMM의 다중모달 및 언어 능력에 어떤 영향을 미치는가?
- RQ2LoRA 및 QLoRA와 같은 파rameter 효율적 미세조정 방법이 대규모 LMM에서 전체 모델 미세조정 성능을 어느 정도 충족하는가?
- RQ3훈련 중 언어 전용 지시 데이터를 다중모달 데이터와 혼합할 경우 다중모달 및 언어 능력 간 균형에 어떤 영향을 미치는가?
- RQ4시각적 지시 미세조정은 다중모달 성능을 넘어서 순수 언어 능력까지 향상시키는가?
- RQ5실제 작업에서 LMM 성능을 최대화하기 위해 최적의 이미지 해상도와 데이터 정제 전략은 무엇인가?
주요 결과
- LLaVA를 7B에서 65B로 확장함으로써 LLaVA-Bench 성능은 65.9에서 72.3으로 향상되었으며, 65B 모델은 최신 기준 성능을 달성함.
- LoRA 및 QLoRA 미세조정은 전체 모델 미세조정과 유사한 성능를 기록함. 65B LoRA 모델은 LLaVA-Bench에서 72.2점, MM-VET에서 74.2점 기록.
- 언어 전용 지시 데이터(예: ShareGPT)를 다중모달 데이터와 혼합하면 다중모달 능력은 향상되지만 언어 성능은 향상되지 않아 능력 균형에 상충 관계가 있음을 시사함.
- 시각적 지시 미세조정은 순수 언어 능력을 향상시킴: LLaVA-70B는 MMLU 점수 65.1을 기록하여 기존 LLaMA-2-70B-Chat 모델(63.1점)을 초월함. 이는 긍정적 전이 효과를 나타냄.
- 더 높은 이미지 해상도(예: 336x336)는 시각적 이해 능력을 크게 향상시킴. 모든 모델 크기에서 성능 향상이 관찰됨.
- 최적의 LoRA 설정은 LoRA alpha = 2 × rank 이며 학습률 1×10⁻⁴이며, 랭크 64 이상에서 더 높은 랭크(예: 512)를 사용해도 이득이 미미함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.