Skip to main content
QUICK REVIEW

[논문 리뷰] VPGTrans: Transfer Visual Prompt Generator across LLMs

Ao Zhang, Hao Fei|arXiv (Cornell University)|2023. 05. 02.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 다양한 대규모 언어 모델(Large Language Model, LLM)의 크기와 유형 간에 효율적인 시각적 프롬프트 생성기(Visual Prompt Generator, VPG)를 이식할 수 있는 이중 단계 전이 프레임워크인 VPGTrans를 제안한다. 이는 훈련 비용을 크게 절감한다. 고학습률을 사용한 프로젝터 웜업과 이후의 피넷팅을 통해 VPGTrans는 초기 훈련 단계를 안정화시키며, 전체적으로 훈련에서부터 시작하는 것에 비해 수렴 속도가 최대 10배 빨라지고 GPU 시간을 90% 이상 감소시킨다. 또한 여러 벤치마크에서 원본 모델를 뛰어넘는 성능을 기록한다.

ABSTRACT

While developing a new multimodal LLM (MLLM) by pre-training on tremendous image-text pairs from scratch can be exceedingly resource-consuming, connecting an existing LLM with a comparatively lightweight visual prompt generator (VPG) becomes a feasible paradigm. However, further tuning the VPG part of the MLLM still suffers from indispensable computational costs, i.e., requiring thousands of GPU hours and millions of training data. One alternative solution is to transfer an existing VPG from any existing MLLMs for the target MLLM. In this work, we for the first time investigate the VPG transferability across LLMs, and explore a solution to reduce the cost of VPG transfer. We first study the VPG transfer across different LLM sizes (e.g., small-to-large), and across different LLM types, through which we diagnose the key factors to maximize the transfer efficiency. Based on our observation, we design a two-stage transfer framework named VPGTrans, which is simple yet highly effective. Through extensive experiments, we demonstrate that VPGTrans helps significantly speed up the transfer learning process without compromising performance. Remarkably, it helps achieve the VPG transfer from BLIP-2 OPT$_ ext{2.7B}$ to BLIP-2 OPT$_ ext{6.7B}$ with over 10 times speed-up and 10.7% training data compared with connecting a VPG to OPT$_ ext{6.7B}$ from scratch. Further, a series of intriguing findings and potential rationales behind them are provided and discussed. Finally, we showcase the practical value of our VPGTrans approach, by customizing two novel MLLMs, including VL-LLaMA and VL-Vicuna, with recently released LLaMA and Vicuna LLMs.

연구 동기 및 목표

  • 다양한 크기와 아키텍처를 가진 LLM 간에 시각적 프롬프트 생성기(VPG)의 전이 가능성과 효율성을 탐구하는 것.
  • 특히 작은 LLM에서 큰 LLM으로 또는 서로 다른 LLM 유형 간에 VPG 적응을 최대화하는 핵심 요인을 규명하는 것.
  • 새로운 다중모달 LLM(Multimodal LLM, MLLM)을 위한 VPG의 피넷팅에 필요한 계산 및 데이터 오버헤드를 줄여, 비용이 많이 드는 전훈련을 피하는 것.
  • 기존 모델들(예: VL-LLaMA 및 VL-Vicuna)에서 유래한 VPG를 사용해 새로운 MLLM을 맞춤형으로 구축함으로써 실용적 유용성을 입증하는 것.
  • 사전 훈련된 VPG를 사용해 어떤 LLM 백본을 가진 고성능 MLLM도 확장 가능하고 저비용으로 구현할 수 있는 스케일러블한 솔루션을 제공하는 것.

제안 방법

  • 이중 단계 VPG 전이 프레임워크를 제안한다: (1) 매우 높은 학습률(기본값의 5배)을 사용한 프로젝터 웜업을 통해 초기 적응 단계를 안정화시키고, (2) VPG와 프로젝터를 표준적인 피넷팅 방식으로 최적화한다.
  • 기존의 MLLM(예: BLIP-2 OPT 2.7B)에서 사전 훈련된 VPG를 활용하고, 타겟 LLM(예: OPT 6.7B 또는 FlanT5)에 맞게 적응시키며, LLM은 고정하고 오직 VPG와 프로젝터만 훈련한다.
  • VPG 출력과 타겟 LLM의 입력 임bedding 공간 간의 차원 일치를 위해 선형 프로젝터를 사용하며, 이는 재초기화되고 웜업 단계에서 피넷팅된다.
  • 모든 전이 설정에서 동일한 훈련 데이터와 하이퍼파라미터를 사용하여 공정한 비교를 확보하고, VPGTrans 프레임워크의 영향을 독립적으로 분석한다.
  • 다양한 전이 시나리오를 검증한다: 소형 LLM에서 대형 LLM으로의 전이(TaS)와 서로 다른 LLM 유형 간 전이(TaT), 예를 들어 디코더 전용과 인코더-디코더 아키텍처 간 전이.
  • 표준 다중모달 벤치마크(예: COCO, VQAv2, GQA, VizWiz)를 사용해 전이 중 성능 및 수렴 속도를 평가한다.

실험 결과

연구 질문

  • RQ1다른 크기를 가진 LLM으로부터 시각적 프롬프트 생성기(VPG)를 효과적으로 전이할 수 있는가? 만약 가능하다면, 전이 효율성을 극대화하는 요인은 무엇인가?
  • RQ2다른 LLM 유형 간(VG-LLaMA, FlanT5 등) VPG 전이가 훈련에서부터 시작하는 것과 유사한 성능을 내며, 수렴 속도를 높일 수 있는가?
  • RQ3왜 VPG 전이의 속도 향상은 대규모 LLM에서만 관찰되고 소규모 LLM에서는 나타나지 않는가? 이 차이를 가능하게 하는 근본적인 메커니즘은 무엇인가?
  • RQ4VPGTrans 프레임워크를 통해 LLaMA나 Vicuna와 같은 어떤 LLM 백본을 사용하더라도 최소한의 훈련 비용으로 고성능 MLLM을 구축할 수 있는가?
  • RQ5프로젝터 초기화 및 학습률 스케줄링이 초기 훈련 단계에서 VPG 전이의 안정성과 수렴 속도 향상에 어떤 역할을 하는가?

주요 결과

  • BLIP-2 OPT 2.7B에서 OPT 6.7B로 VPG를 전이할 때, GPU 시간을 90% 이상 감소시키고 훈련 데이터도 10.7% 줄였으며, 훈련에서부터 시작하는 것과 유사하거나 더 뛰어난 성능을 달성한다.
  • 소형에서 대형 LLM으로의 전이(TaS)에서 프로젝터 웜업을 통해 5배 학습률을 사용함으로써 최대 10배 빠른 수렴 속도를 달성했으며, 성능 저하 없이 이루어진다.
  • 다른 LLM 유형 간 전이(TaT)에서는 대규모 모델에서 최소 2배의 수렴 속도 향상을 기록했으며, 기존 기준 방법보다 성능을 유지하거나 향상시켰다(예: FlanT5 XL → OPT 2.7B).
  • 기존의 BLIP-2 OPT 6.7B 모델보다 대부분의 벤치마크에서 성능이 뛰어나 평균적으로 2.9% 향상된 성과를 기록했다.
  • 속도 향상은 대규모 LLM에서만 관찰되며, 이는 더 큰 모델이 더 선형적이고 일반화 가능한 텍스트 임베딩을 학습하기 때문으로 보인다. 이는 VPG 전이가 더 쉽게 이뤄지게 한다.
  • VL-LLaMA와 VL-Vicuna는 VPGTrans를 활용해 개발되었으며, 다중모달 추론 및 대화 작업에서 최고 성능을 기록했으며, Multimodality Chatbot Arena에서 3위를 차지했고, Elo 점수 1012.1을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.