Skip to main content
QUICK REVIEW

[论文解读] On the General Value of Evidence, and Bilingual Scene-Text Visual Question Answering

Xinyu Wang, Yuliang Liu|arXiv (Cornell University)|Feb 24, 2020
Multimodal Machine Learning Applications参考文献 33被引用 13
一句话总结

本文提出STE-VQA,一个包含英文与中文问题-答案对的双语场景文本视觉问答数据集,并提出一种基于证据的评估指标,要求模型通过边界框定位与答案相关联的图像区域。通过惩罚缺乏视觉依据的答案,该方法促使模型进行推理而非记忆,显著提升了模型泛化能力,并揭示了传统VQA模型往往依赖虚假相关性而非真正理解。

ABSTRACT

Visual Question Answering (VQA) methods have made incredible progress, but suffer from a failure to generalize. This is visible in the fact that they are vulnerable to learning coincidental correlations in the data rather than deeper relations between image content and ideas expressed in language. We present a dataset that takes a step towards addressing this problem in that it contains questions expressed in two languages, and an evaluation process that co-opts a well understood image-based metric to reflect the method's ability to reason. Measuring reasoning directly encourages generalization by penalizing answers that are coincidentally correct. The dataset reflects the scene-text version of the VQA problem, and the reasoning evaluation can be seen as a text-based version of a referring expression challenge. Experiments and analysis are provided that show the value of the dataset.

研究动机与目标

  • 为解决现有视觉问答(VQA)模型泛化能力不足的问题,这些模型常利用训练数据中的虚假相关性而非学习深层推理。
  • 开发一种新评估协议,不仅衡量答案准确性,还检测视觉证据的存在,确保模型基于图像内容进行推理。
  • 创建一个包含英文与中文问答对的双语场景文本VQA数据集(STE-VQA),以测试跨语言推理与泛化能力。
  • 证明传统VQA评估协议不足,因为模型可在无视觉依据的情况下过度拟合答案池,导致准确率虚高。
  • 提出新指标Δr,量化具有充分视觉证据的答案比例,揭示那些产生正确但无依据答案的模型。

提出的方法

  • 本文提出一个新数据集STE-VQA,包含带英文与中文问题-答案对的场景文本图像,并对语言和视觉依据进行标注。
  • 提出一种新颖的评估协议,要求模型为每个答案输出一个边界框(证据),确保预测结果在图像中有视觉依据。
  • 基于证据的评估指标使用预测边界框与真实边界框之间的交并比(IoU)来评估视觉定位质量。
  • 引入新指标Δr = CLC_all / TC_all,用于衡量具有充分证据的正确答案占总正确答案的比例,识别那些过度拟合答案池的模型。
  • 在三个挑战上评估模型:跨语言(CL)、定位(LC)和传统(TC),其中CLC为主要评估任务,结合了推理与语言泛化能力。
  • 在传统与基于证据的协议下评估基线模型(如LoRRA和QA R-CNN),以比较性能并检测过拟合现象。

实验结果

研究问题

  • RQ1要求答案具备视觉证据是否能提升VQA模型的泛化能力,超越传统准确率指标?
  • RQ2当前VQA模型在多大程度上依赖记忆化的答案分布,而非基于图像内容进行推理?
  • RQ3双语场景文本VQA如何挑战模型在语言与视觉线索上的泛化能力?
  • RQ4基于证据的评估协议是否能有效检测出那些产生巧合正确答案但无真正理解的模型?
  • RQ5所提出的Δr指标是否能可靠识别出通过生成大量正确但无依据答案而过拟合答案空间的模型?

主要发现

  • 所提出的基于证据的评估协议揭示,传统VQA模型(包括LoRRA和QA R-CNN)常在无图像依据的情况下产生正确答案,表明其依赖虚假相关性。
  • 像'P+LV'和'L+LV'这样的模型频繁为要求数字答案的问题输出非数字答案(如'caffe'、'长'),显示其对问题类型的理解能力差。
  • 即使边界框预测正确,错误的文本识别(如'708'被误读为'8')仍会导致错误答案,凸显OCR错误在失败中的作用。
  • 采用启发式规则的QA R-CNN模型在传统准确率(TC)上表现最高,但Δr得分最低,表明其过度拟合答案空间并产生大量无依据答案。
  • 所有模型在长答案问题上的表现均较差,表明当前架构在整合多个文本线索进行复杂推理方面存在困难。
  • 与TC相比,所有模型的CLC得分(结合定位与正确性)显著下降,证明视觉依据是强有力的约束,能暴露模型的弱点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。