[论文解读] Improving Automatic VQA Evaluation Using Large Language Models
本文提出 LAVE,一种新颖的自动 VQA 评估指标,利用指令微调的大规模语言模型(LLMs)通过少样本学习将候选答案与参考答案进行比较,以评分答案的正确性。LAVE 在与人类判断的相关性方面显著优于 VQA 准确率和 BERTScore 等软性指标,尤其在分布外(OOD)和重 paraphrase 设置下表现更优,同时为其评分提供可解释的推理过程。
8 years after the visual question answering (VQA) task was proposed, accuracy remains the primary metric for automatic evaluation. VQA Accuracy has been effective so far in the IID evaluation setting. However, our community is undergoing a shift towards open-ended generative models and OOD evaluation. In this new paradigm, the existing VQA Accuracy metric is overly stringent and underestimates the performance of VQA systems. Thus, there is a need to develop more robust automatic VQA metrics that serve as a proxy for human judgment. In this work, we propose to leverage the in-context learning capabilities of instruction-tuned large language models (LLMs) to build a better VQA metric. We formulate VQA evaluation as an answer-rating task where the LLM is instructed to score the accuracy of a candidate answer given a set of reference answers. We demonstrate the proposed metric better correlates with human judgment compared to existing metrics across several VQA models and benchmarks. We hope wide adoption of our metric will contribute to better estimating the research progress on the VQA task. We plan to release the evaluation code and collected human judgments.
研究动机与目标
- 为解决 VQA 准确率在分布外(OOD)评估设置下的局限性,即模型生成正确但不匹配的答案时无法被正确识别的问题。
- 开发一种更具鲁棒性、与人类判断更对齐的自动评估指标,能够超越精确字符串匹配,考虑语义等价性。
- 利用指令微调 LLM 的推理与语言理解能力,提升视觉-语言任务中答案评估的性能。
- 系统性地评估并比较 LAVE 与现有指标(包括 VQA 准确率和 BERTScore 等软性指标)的表现。
- 为 VQA 模型基准测试提供一种可解释、可扩展且可靠的自动化评估替代方案,以替代人工评估。
提出的方法
- 将 VQA 评估形式化为答案评分任务,即使用指令微调的 LLM 在给定问题和一组参考答案的前提下,对候选答案的正确性进行评分。
- 通过少样本演示(正确/错误答案对)使用少样本学习提示 LLM,以引导其判断。
- 设计提示模板,包含问题、候选答案和参考答案,指示 LLM 在 0–1 的尺度上评分正确性。
- 采用多种 LLM(如 Flan-T5、GPT-3.5)进行评估,以检验其在不同模型类型上的鲁棒性与泛化能力。
- 在三个 VQA 基准上收集 22,100 个测试样本的人工判断,作为相关性分析的黄金标准。
- 使用皮尔逊相关系数(如斯皮尔曼等级相关系数 ρ)定量比较 LAVE 与基线指标的表现。
实验结果
研究问题
- RQ1LAVE 与人类判断的相关性相较于 VQA 准确率和 BERTScore 等软性指标,在多样化的 VQA 模型与基准上表现如何?
- RQ2在何种情况下,LAVE 能够恢复因 paraphrase、格式差异或词汇变化而被 VQA 准确率错误标记为错误的正确答案?
- RQ3LAVE 在不同 VQA 评估设置下,对答案冗长度、表达方式和语义等价性的变化有多强的鲁棒性?
- RQ4不同 LLM 架构(如 Flan-T5 与 GPT-3.5)对 LAVE 指标性能与可靠性有何影响?
- RQ5VQA 准确率的失败模式如何表现?LAVE 在多大程度上缓解了这些缺陷?
主要发现
- LAVE 与人类判断的相关性显著高于 VQA 准确率和 BERTScore 等软性指标,尤其在 OOD 和重 paraphrase 设置下表现更优。
- LAVE 恢复了 16.33% 的案例,其中 VQA 准确率因词汇或句法差异错误地将正确答案标记为错误。
- 在 8.25% 的案例中,LAVE 正确地将语义上正确的答案评分 1.0,而 VQA 准确率得分低于 0.5,表明其具备更强的鲁棒性。
- 在所有评估基准上,LAVE 在斯皮尔曼等级相关系数(Spearman’s ρ)方面均优于所有基线指标,包括 Soft VQA Accuracy 和 BERTScore。
- 消融实验证实,指令设计与参考答案的使用均为 LAVE 性能的关键组成部分,其中指令设计的影响更强。
- LAVE 为其评分提供了可解释的推理过程,增强了自动化评估的透明度与可信度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。