[论文解读] Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training
PnP-VQA 是一种即插即用的零样本视觉问答框架,结合了预训练的视觉-语言模型、基于问题的图像描述生成模块以及一个预训练的语言模型,无需任何额外训练。通过利用网络可解释性生成与答案相关的描述,并将这些描述融合到解码器中,该方法实现了最先进性能——在 VQAv2 上超越 Flamingo(80B)8.5%,在 GQA 上超越 FewVLM 9.1%,展示了模块化、零训练整合基础模型的强大能力。
Visual question answering (VQA) is a hallmark of vision and language reasoning and a challenging task under the zero-shot setting. We propose Plug-and-Play VQA (PNP-VQA), a modular framework for zero-shot VQA. In contrast to most existing works, which require substantial adaptation of pretrained language models (PLMs) for the vision modality, PNP-VQA requires no additional training of the PLMs. Instead, we propose to use natural language and network interpretation as an intermediate representation that glues pretrained models together. We first generate question-guided informative image captions, and pass the captions to a PLM as context for question answering. Surpassing end-to-end trained baselines, PNP-VQA achieves state-of-the-art results on zero-shot VQAv2 and GQA. With 11B parameters, it outperforms the 80B-parameter Flamingo model by 8.5% on VQAv2. With 738M PLM parameters, PNP-VQA achieves an improvement of 9.1% on GQA over FewVLM with 740M PLM parameters. Code is released at https://github.com/salesforce/LAVIS/tree/main/projects/pnp-vqa
研究动机与目标
- 在不进行微调或对预训练语言模型进行架构修改的情况下,实现零样本视觉问答。
- 解决在仅使用现成的、预训练组件的零样本设置下,视觉与语言模态之间的桥梁构建挑战。
- 开发一种模块化、灵活的框架,能够动态整合视觉与语言基础模型的最新进展,而无需重新训练。
- 通过利用与问题相关的、信息丰富的图像描述作为中间表示,提升视觉问答基准上的性能。
提出的方法
- 利用预训练的视觉-语言模型(BLIP)生成与输入问题相关的图像描述。
- 应用基于 Grad-CAM 的网络可解释性方法,识别与问题最相关的图像区域。
- 使用视觉编码器和解码器,从与问题相关的图像区域生成多样化、随机性的描述。
- 使用预训练语言模型(UnifiedQAv2)基于生成的描述回答问题。
- 采用解码器内融合机制,将多达 100 个基于问题的描述进行融合,以提升答案生成质量。
- 完全依赖预训练模型的推理过程,不进行任何额外训练或架构修改。
实验结果
研究问题
- RQ1是否可以仅使用现成的、未经修改的预训练模型,不进行微调或架构修改,构建一个零样本视觉问答系统?
- RQ2使用自然语言和网络可解释性作为接口,连接视觉与语言模型进行视觉问答,其有效性如何?
- RQ3与通用描述相比,基于问题引导的、信息丰富的图像描述在多大程度上能提升零样本视觉问答的性能?
- RQ4在即插即用设置下,生成的描述数量如何影响答案准确率和模型鲁棒性?
- RQ5模块化、零训练框架是否能在零样本视觉问答基准上超越端到端训练模型(如 Flamingo 和 FewVLM)?
主要发现
- PnP-VQA(11B 参数)在 VQAv2 上达到 63.3% 的准确率,比 80B 参数的 Flamingo 模型高出 8.5%。
- 在 GQA 基准上,PnP-VQA(738M 参数)达到 41.9% 的准确率,比 FewVLM(740M 参数)高出 9.1%。
- 随着生成描述数量从 20 增加到 100,答案幻觉率(AHR)从 71.8% 上升至 84.0%,表明答案相关性更高。
- 随机解码方法(如核采样)优于确定性的束搜索,后者会产生重复且多样性较低的描述。
- 问答模型的选择显著影响性能,专用任务模型(如 UnifiedQAv2)的表现优于通用模型(如 T0 或 GPT-J)。
- 该框架表明,通过模块化组合预训练模型,无需任何端到端训练,即可在零样本视觉问答中实现高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。