[论文解读] OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge
本文提出了 OK-VQA,一个视觉问答基准,要求模型在图像内容之外依赖外部知识,包含超过 14,000 个问题,这些问题需要利用维基百科等非结构化知识源进行推理。当前最先进(SOTA)的视觉问答模型在此数据集上的表现显著下降,凸显了该数据集的挑战性,也凸显了模型整合外部知识检索与推理的迫切需求。
Visual Question Answering (VQA) in its ideal form lets us study reasoning in the joint space of vision and language and serves as a proxy for the AI task of scene understanding. However, most VQA benchmarks to date are focused on questions such as simple counting, visual attributes, and object detection that do not require reasoning or knowledge beyond what is in the image. In this paper, we address the task of knowledge-based visual question answering and provide a benchmark, called OK-VQA, where the image content is not sufficient to answer the questions, encouraging methods that rely on external knowledge resources. Our new dataset includes more than 14,000 questions that require external knowledge to answer. We show that the performance of the state-of-the-art VQA models degrades drastically in this new setting. Our analysis shows that our knowledge-based VQA task is diverse, difficult, and large compared to previous knowledge-based VQA datasets. We hope that this dataset enables researchers to open up new avenues for research in this domain. See http://okvqa.allenai.org to download and browse the dataset.
研究动机与目标
- 解决现有视觉问答基准的局限性,即过度关注视觉识别而非推理或外部知识。
- 创建一个大规模、多样化且具有挑战性的基于知识的视觉问答基准。
- 评估视觉问答模型检索和利用外部知识源(如维基百科)进行推理的能力。
- 证明当前最先进(SOTA)的视觉问答模型在该新基准上表现失败,表明亟需提升推理能力和知识整合能力。
提出的方法
- OK-VQA 数据集包含超过 14,000 个问题-答案对,其答案无法仅从图像内容中推导得出。
- 问题由人工标注者收集,要求他们仅使用图像和外部知识来作答,以确保对知识的依赖性。
- 外部知识来源于维基百科文章,通过基于关键词的查询检索相关句子,以模拟现实世界中的知识检索。
- 基线模型 MUTAN+AN 将视觉特征与外部知识检索(ArticleNet)相结合,以提升答案预测性能。
- 通过 VQA 分数评估性能,比较包含和不包含视觉特征及外部知识的模型表现。
- 通过使用不同深度的 ResNet 架构以及不同规模的训练集,开展消融实验,以分析模型的鲁棒性与数据集的难度。
实验结果
研究问题
- RQ1当前最先进(SOTA)的视觉问答模型能否泛化到需要依赖图像内容之外的外部知识的问题?
- RQ2当回答问题需要外部知识时,视觉问答模型的性能会如何下降?
- RQ3非结构化知识源(如维基百科)在多大程度上能提升视觉问答模型在知识密集型问题上的表现?
- RQ4视觉特征在基于知识的视觉问答中扮演什么角色?其缺失会对性能产生何种影响?
- RQ5训练数据规模如何影响模型在该挑战性基准上的表现?
主要发现
- 最先进(SOTA)的视觉问答模型(包括 MUTAN)在 OK-VQA 上的表现出现显著下降,分数从标准基准上的 70% 以上骤降至 OK-VQA 上的 27% 以下。
- 仅使用问题特征(Q-Only)的基线模型,不依赖视觉输入,仅获得 14.93% 的 VQA 分数,证实视觉定位至关重要,且答案偏差已被有效消除。
- 使用 ResNet152 特征时,MUTAN 在 OK-VQA 上达到 26.41% 的分数,但更深网络带来的性能提升微乎其微,表明主要挑战在于知识检索,而非视觉特征质量。
- MUTAN+AN 模型(整合了外部知识检索)优于仅使用 MUTAN 的模型,表明外部知识能显著提升知识密集型问题的推理能力。
- 对训练集规模的消融分析表明,随着数据量增加,性能有所提升,但即使使用全部训练数据,模型仍远未达到人类水平表现,表明该数据集具有极高难度。
- 定性分析证实,ArticleNet 能够成功检索与科学、烹饪、品牌等类别问题相关的维基百科句子,验证了检索机制的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。