[논문 리뷰] Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
이 논문은 태스크별 미세조정 없이도 제로-샷 및 희소-샷 시각질문응답(VQA) 성능을 햖थ기 위한 프롬프팅 기법을 조사한다. 전략적 질문 템플릿, 이미지 캡션을 통한 시각적 단서 제공, 자기일관성 있는 사고의 사슬(Chain-of-Thought, CoT) 추론, 텍스트 전용 희소-샷 예시가 정확도를 크게 향상시키는 것으로 밝혀졌으며, LLM 가이드드 전처리는 특히 LLaVa와 같은 긴 답변을 생성하는 모델의 평가 지표를 안정화시킨다.
In this paper, we explore effective prompting techniques to enhance zero- and few-shot Visual Question Answering (VQA) performance in contemporary Vision-Language Models (VLMs). Central to our investigation is the role of question templates in guiding VLMs to generate accurate answers. We identify that specific templates significantly influence VQA outcomes, underscoring the need for strategic template selection. Another pivotal aspect of our study is augmenting VLMs with image captions, providing them with additional visual cues alongside direct image features in VQA tasks. Surprisingly, this augmentation significantly improves the VLMs' performance in many cases, even though VLMs "see" the image directly! We explore chain-of-thought (CoT) reasoning and find that while standard CoT reasoning causes drops in performance, advanced methods like self-consistency can help recover it. Furthermore, we find that text-only few-shot examples enhance VLMs' alignment with the task format, particularly benefiting models prone to verbose zero-shot answers. Lastly, to mitigate the challenges associated with evaluating free-form open-ended VQA responses using string-matching based VQA metrics, we introduce a straightforward LLM-guided pre-processing technique to adapt the model responses to the expected ground-truth answer distribution. In summary, our research sheds light on the intricacies of prompting strategies in VLMs for VQA, emphasizing the synergistic use of captions, templates, and pre-processing to enhance model efficacy.
연구 동기 및 목표
- 태스크별 미세조정 없이도 다양한 시각언어 모델(VLMs)에서 제로-샷 및 희소-샷 VQA 성능을 체계적으로 평가하는 것.
- 질문 템플릿, 이미지 캡션, 사고의 사슬 추론, 희소-샷 예시 등 프롬프팅 전략 중 어느 것이 VQA 정확도 향상에 가장 효과적인지 규명하는 것.
- 기존의 문자열 매칭 기반 VQA 평가 지표의 한계를 해결하기 위해 LLM 기반 전처리를 도입하여 모델 출력을 기준 답변과 일치시키는 것.
- VQAv2, GQA, OKVQA, AOKVQA, Winoground-VQA 등 다양한 벤치마크에서 최신 VLMs(예: LLaVa, BLIP2, OpenFlamingo, Kosmos2)를 평가하는 것.
- 모델 별 민감도, 예를 들어 템플릿 선호도 및 복합적 추론 작업에서의 성능 저하 등을 밝혀 효과적인 프롬프팅 전략을 안내하는 것.
제안 방법
- 다양한 어순과 문장 구조를 가진 질문 템플릿을 체계적으로 테스트하여 여러 VLMs에서 정답 정확도에 미치는 영향을 평가했다.
- 이미지 캡션을 다양한 세부 수준과 관련성으로 제공하여 원본 이미지 특징 외의 추가 시각적 맥락을 VLM 입력에 통합했다.
- 사고의 사슬(CoT) 프롬프팅을 적용하여 모델이 답변 이전에 단계별 추론을 생성하도록 유도하고, CoT-반복, CoT-맥락, CoT-일관성 등 변형을 평가했다.
- 모델의 제로-샷 출력이 과도하게 길어지는 경향이 있는 경우를 고려해 텍스트 전용 희소-샷 예시를 도입하여 작업 형식에 대한 일치도를 향상시켰다.
- 평가 이전에 모델 출력을 보정하기 위해 LLM 기반 전처리를 구현하여 기준 답변 스타일과 일치시키고 평가 지표의 신뢰도를 향상시켰다.
- VQAv2, Visual7w, GQA, OKVQA, AOKVQA, Winoground-VQA 등 6개의 벤치마크에서 표준 지표와 개선된 지표를 사용해 모델을 평가했다.

실험 결과
연구 질문
- RQ1다양한 시각언어 모델에서 다양한 질문 템플릿이 제로-샷 및 희소-샷 VQA 성능에 어떤 영향을 미치는가?
- RQ2직접 이미지가 제공됨에도 불구하고, 추가적인 시각적 맥락으로서 이미지 캡션을 사용할 경우 VQA 정확도는 어느 정도 향상되는가?
- RQ3사고의 사슬 추론은 VQA 성능 향상에 기여하는가? 특히 성능 저하를 완화하는 데 가장 효과적인 변형(예: 자기일관성)은 무엇인가?
- RQ4텍스트 전용 희소-샷 예시는 작업 형식에 대한 모델 일치도 향상에 얼마나 효과적인가? 특히 캡션 또는 CoT와 조합했을 경우의 효과는?
- RQ5LLM 기반 전처리가 기존 VQA 평가 지표의 안정성과 신뢰도를 어느 정도 향상시키는가?
주요 결과
- 다양한 VLMs는 질문 템플릿에 대해 서로 다른 선호도를 보이며, 모든 모델에 최적화된 유일한 템플릿은 존재하지 않는다.
- 이미지 캡션을 추가 맥락으로 통합함으로써 여러 모델과 벤치마크에서 VQA 성능이 유의미하게 향상되었으며, 이미지가 직접 제공됨에도 불구하고 효과가 있었다.
- 표준 CoT 프롬프팅은 성능을 저하시켰지만, 자기일관성 있는 CoT(30개 샘플, 다수결 투표)는 성능을 기준선 수준으로 복원시켰다.
- 텍스트 전용 희소-샷 예시는 특히 LLaVa 및 Kosmos2와 같은 모델에서 출력의 과도한 어조를 줄이는 데 효과적이었지만, LLM 전처리를 적용한 경우 효과가 감소했다.
- LLM 기반 전처리가 지표의 정확성을 수정하여 특히 LLaVa와 같은 긴 답변을 생성하는 모델의 경우 유의미하게 개선했으며, 모든 모델에서 평가의 안정성을 높였고, 기존 지표가 실제 성능을 잘못 반영할 수 있음을 드러냈다.
- Winoground-VQA 벤치마크는 대부분의 VLMs에게 심각한 과제를 제기하였으며, 시각-언어적 복합성 및 분포 이탈 조건 하에서의 추론 능력에 대한 한계를 드러냈다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.