[논문 리뷰] A Good Prompt Is Worth Millions of Parameters: Low-resource Prompt-based Learning for Vision-Language Models
이 논문은 프롬프트 기반 학습을 사용하여 VQA 및 이미지 캡션 생성에서 최신 기술 수준의 소수 샘플 성능을 달성하는 컴act한 시각-언어 모델인 FewVLM을 제안한다. 이는 0-샷 VQA에서 크기가 31배 큰 모델보다 뛰어나고, 동일한 작업에서 크기가 246배 큰 모델과 유사한 성능을 기록한다. 효과적인 프롬프트 설계와 MaskedLM 및 PrefixLM와 같은 사전 훈련 목표 함수가 특히 자원이 제한된 환경에서 성능 향상에 크게 기여한다는 점을 입증한다.
Large pre-trained vision-language (VL) models can learn a new task with a handful of examples and generalize to a new task without fine-tuning. However, these VL models are hard to deploy for real-world applications due to their impractically huge sizes and slow inference speed. To solve this limitation, we study prompt-based low-resource learning of VL tasks with our proposed method, FewVLM, relatively smaller than recent few-shot learners. For FewVLM, we pre-train a sequence-to-sequence transformer model with prefix language modeling (PrefixLM) and masked language modeling (MaskedLM). Furthermore, we analyze the effect of diverse prompts for few-shot tasks. Experimental results on VQA show that FewVLM with prompt-based learning outperforms Frozen which is 31x larger than FewVLM by 18.2% point and achieves comparable results to a 246x larger model, PICa. In our analysis, we observe that (1) prompts significantly affect zero-shot performance but marginally affect few-shot performance, (2) models with noisy prompts learn as quickly as hand-crafted prompts given larger training data, and (3) MaskedLM helps VQA tasks while PrefixLM boosts captioning performance. Our code is publicly available at \url{https://github.com/woojeongjin/FewVLM}
연구 동기 및 목표
- 저자원 환경에서 소수 샘플 및 0-샷 학습을 위한 컴팩트하고 효율적인 시각-언어 모델 개발
- 소수 샘플 및 0-샷 시각-언어 작업에서 프롬프트 설계가 성능에 미치는 영향 조사
- 다양한 사전 훈련 목표 함수(MaskedLM 및 PrefixLM)가 최종 작업 일반화에 미치는 영향 평가
- 훈련 데이터가 증가함에 따라 노이즈가 있는 또는 수작업으로 만든 프롬프트가 학습 속도와 최종 성능에 미치는 영향 결정
- 모델 크기와 추론 비용을 줄여 시각-언어 모델의 실용적 구현 가능하게 만들기
제안 방법
- PrefixLM 및 MaskedLM 목표 함수를 모두 사용하여 시퀀스-투-시퀀스 트랜스포머 모델을 사전 훈련한다.
- 시각-언어 작업을 모델이 입력 이미지와 프롬프트를 기반으로 타겟 텍스트를 생성하는 생성 작업으로 변환한다.
- 프롬프트 템플릿(예: ' <text_1> [A] ')을 사용하여 모델의 생성을 이끌고 소수 샘플 적응을 향상시킨다.
- 수작업으로 만든, 노이즈가 있는, 임의의 프롬프트를 포함한 다양한 프롬프트 형식에 대해 성능을 평가한다.
- 소수 샘플(1~300개)만을 사용하여 FewVLM을 미세 조정하여 소수 샘플 일반화 성능를 평가한다.
- VQA, 캡션 생성, mini-ImageNet에서 큰 기준 모델인 Frozen(31배 크기) 및 PICa(246배 크기)와의 성능를 비교한다.
실험 결과
연구 질문
- RQ1프롬프트 설계는 시각-언어 작업에서 0-샷 및 소수 샘플 성능에 어떻게 영향을 미치는가?
- RQ2더 많은 훈련 예제가 제공될 경우 프롬프트 품질이 여전히 중요할까?
- RQ3다른 사전 훈련 목표 함수(MaskedLM 대비 PrefixLM)는 다양한 최종 작업에서 성능에 어떻게 영향을 미치는가?
- RQ4노이즈가 있는 프롬프트로 훈련된 모델가 수작업으로 만든 프롬프트로 훈련된 모델와 유사한 성능를 달성할 수 있는가?
- RQ5MaskedLM 및 PrefixLM 사전 훈련을 병합할 경우 다중 작업 일반화에 어떤 영향을 미치는가?
주요 결과
- FewVLM은 0-샷 VQAv2에서 크기가 31배 큰 모델인 Frozen보다 18.2%포인트 높은 성능을 기록하여 43.4%의 정확도를 달성한다.
- FewVLM은 소수 샘플 학습에서 크기가 246배 큰 모델인 PICa와 유사한 성능를 기록하며, VQAv2에서 48.2%의 정확도를 달성한다.
- 프롬프트는 0-샷 성능에 크게 영향을 미치지만, 소수 샘플 성능에는 영향이 미미하며, 특히 훈련 데이터가 많아질수록 그 영향이 줄어든다.
- 충분한 훈련 데이터가 제공될 경우, 노이즈가 있는 프롬프트(예: 임의의 문장)로 훈련된 모델가 수작업으로 만든 프롬프트로 훈련된 모델와 동일한 속도로 학습된다.
- MaskedLM 사전 훈련은 VQA 작업 성능 향상에 기여하지만, PrefixLM는 Flickr30k 및 GQA에서 캡션 생성 성능 향상에 기여한다.
- MaskedLM 및 PrefixLM 사전 훈련을 병합하면 상호보완적인 효과를 발휘하여 VQA 및 캡션 생성 작업 전반의 일반화 성능 향상에 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.