[论文解读] Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
本文研究了提示工程技术,以在不进行微调的情况下提升视觉语言模型(VLMs)在零样本和少样本视觉问答(VQA)任务中的性能。结果表明,有针对性的问题模板、将图像字幕作为视觉提示、自洽的思维链推理以及仅文本的少样本示例可显著提高准确率,而大型语言模型(LLM)引导的预处理则稳定了评估指标,尤其对 LLaVa 等冗长模型效果显著。
In this paper, we explore effective prompting techniques to enhance zero- and few-shot Visual Question Answering (VQA) performance in contemporary Vision-Language Models (VLMs). Central to our investigation is the role of question templates in guiding VLMs to generate accurate answers. We identify that specific templates significantly influence VQA outcomes, underscoring the need for strategic template selection. Another pivotal aspect of our study is augmenting VLMs with image captions, providing them with additional visual cues alongside direct image features in VQA tasks. Surprisingly, this augmentation significantly improves the VLMs' performance in many cases, even though VLMs "see" the image directly! We explore chain-of-thought (CoT) reasoning and find that while standard CoT reasoning causes drops in performance, advanced methods like self-consistency can help recover it. Furthermore, we find that text-only few-shot examples enhance VLMs' alignment with the task format, particularly benefiting models prone to verbose zero-shot answers. Lastly, to mitigate the challenges associated with evaluating free-form open-ended VQA responses using string-matching based VQA metrics, we introduce a straightforward LLM-guided pre-processing technique to adapt the model responses to the expected ground-truth answer distribution. In summary, our research sheds light on the intricacies of prompting strategies in VLMs for VQA, emphasizing the synergistic use of captions, templates, and pre-processing to enhance model efficacy.
研究动机与目标
- 系统评估在不进行特定任务微调的情况下,视觉语言模型(VLMs)中零样本和少样本 VQA 的提示技术。
- 识别哪些提示策略(如问题模板、图像字幕、思维链推理和少样本范例)最有效地提升 VQA 准确率。
- 通过引入 LLM 引导的预处理,解决传统字符串匹配 VQA 评估指标的局限性,使模型输出与参考答案对齐。
- 在包括 VQAv2、GQA、OKVQA、AOKVQA 和 Winoground-VQA 在内的多个基准上,评估最先进 VLMs(如 LLaVa、BLIP2、OpenFlamingo、Kosmos2)的表现。
- 揭示模型特有的敏感性,如模板偏好和组合推理任务中的性能下降,以指导有效的提示设计。
提出的方法
- 系统测试了不同语义和结构的问题模板,以评估其对多种 VLMs 答案准确率的影响。
- 通过引入不同细节程度和相关性的图像字幕,增强 VLM 的输入,提供超越原始图像特征的额外视觉上下文。
- 应用思维链(CoT)提示,通过要求模型在生成答案前进行逐步推理,并评估 CoT-iterative、CoT-context 和 CoT-consistency 等变体。
- 引入仅文本的少样本示例,以改善模型与任务格式的对齐,尤其适用于容易产生冗长零样本输出的模型。
- 实施 LLM 引导的预处理,以在评估前优化模型生成的答案,使其与参考答案风格对齐,提升评估指标的可靠性。
- 在六个基准上评估模型,包括 VQAv2、Visual7w、GQA、OKVQA、AOKVQA 和 Winoground-VQA,使用标准和优化后的评估指标。

实验结果
研究问题
- RQ1不同问题模板如何影响多种视觉语言模型在零样本和少样本 VQA 任务中的表现?
- RQ2尽管图像已直接可见,将图像字幕作为额外视觉上下文在多大程度上能提升 VQA 准确率?
- RQ3思维链推理能否提升 VQA 性能?哪些变体(如自洽性)最有效地缓解性能下降?
- RQ4仅文本的少样本示例在提升模型与任务格式对齐方面有多有效,尤其是在与字幕或 CoT 结合时?
- RQ5LLM 引导的预处理在多大程度上稳定并提升了传统 VQA 评估指标的可靠性?
主要发现
- 不同 VLMs 对问题模板表现出不同的偏好,表明不存在适用于所有模型的通用最优模板。
- 将图像字幕作为额外上下文显著提升了多个模型和基准上的 VQA 性能,即使图像已直接可见。
- 标准思维链提示降低了性能,但自洽的 CoT(30 个样本,多数投票)使性能恢复至接近基线水平。
- 仅文本的少样本示例改善了模型与任务格式的对齐,尤其减少了 LLaVa 和 Kosmos2 等模型的冗长度,但当应用 LLM 预处理后,其优势减弱。
- LLM 引导的预处理纠正了评估指标的不准确,尤其对 LLaVa 等冗长模型效果显著,稳定了所有模型的评估,揭示了传统指标常无法真实反映模型性能。
- Winoground-VQA 基准暴露了大多数 VLM 在组合性推理和分布偏移下的显著挑战,凸显了视觉-语言组合能力的局限性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。