Skip to main content
QUICK REVIEW

[论文解读] Being Negative but Constructively: Lessons Learnt from Creating Better Visual Question Answering Datasets

Wei‐Lun Chao, Hexiang Hu|arXiv (Cornell University)|Apr 24, 2017
Multimodal Machine Learning Applications参考文献 33被引用 4
一句话总结

本文提出自动程序——IoU 和 QoU——以改进多项选择视觉问答(VQA)数据集中负样本(干扰项)的设计,确保模型无法利用统计捷径。通过生成在语义和视觉上均合理的干扰项,迫使模型整合图像、问题和答案信息,该方法创建了更忠实的评估基准,显著缩小了模型间的性能差距,并提升了泛化能力,已在 VQA、Visual7W 和来自 Visual Genome 的新 100 万样本数据集上得到验证。

ABSTRACT

Visual question answering (Visual QA) has attracted a lot of attention lately, seen essentially as a form of (visual) Turing test that artificial intelligence should strive to achieve. In this paper, we study a crucial component of this task: how can we design good datasets for the task? We focus on the design of multiple-choice based datasets where the learner has to select the right answer from a set of candidate ones including the target (\ie the correct one) and the decoys (\ie the incorrect ones). Through careful analysis of the results attained by state-of-the-art learning models and human annotators on existing datasets, we show that the design of the decoy answers has a significant impact on how and what the learning models learn from the datasets. In particular, the resulting learner can ignore the visual information, the question, or both while still doing well on the task. Inspired by this, we propose automatic procedures to remedy such design deficiencies. We apply the procedures to re-construct decoy answers for two popular Visual QA datasets as well as to create a new Visual QA dataset from the Visual Genome project, resulting in the largest dataset for this task. Extensive empirical studies show that the design deficiencies have been alleviated in the remedied datasets and the performance on them is likely a more faithful indicator of the difference among learning models. The datasets are released and publicly available via http://www.teds.usc.edu/website_vqa/.

研究动机与目标

  • 识别并解决现有多项选择 VQA 数据集中存在的设计缺陷,即模型利用统计捷径而非理解多模态内容。
  • 开发全自动、无需人工干预的程序,用于生成高质量、在语义和视觉上均合理的干扰项答案,迫使模型整合所有输入模态。
  • 从 Visual Genome 数据集构建一个新的大规模多项选择 VQA 数据集,包含超过一百万组图像-问题-答案三元组,以支持更稳健的模型评估。
  • 通过实证验证,改进后的数据集能更真实地反映模型的理解能力,消除虚假相关性,并减少模型间的性能差异。

提出的方法

  • 提出 IoU(交并比)程序,生成在视觉上与目标答案相似的干扰项,确保模型必须推理图像内容才能区分它们。
  • 引入 QoU(问题与话语的重叠)程序,基于问题-话语相似性生成在语义上与目标答案相似的干扰项,迫使模型考虑语言上下文。
  • 在两阶段过滤流程中应用上述两种程序:首先,利用图像和问题嵌入生成候选干扰项;其次,使用基于 WordNet 的相似性及经人工验证的阈值,过滤掉低相似度或模糊的候选项。
  • 结合图像描述嵌入、问题嵌入和词相似性度量(如 WUP),确保在孤立评估时,正确答案和干扰项均具有合理性。
  • 将该方法应用于重构现有数据集(VQA 和 Visual7W),并从 Visual Genome 构建一个新的大规模数据集(qaVG),生成超过一百万组图像-问题-答案三元组。
  • 在原始数据集与修复后数据集上评估模型性能,证明只有在使用改进的干扰项时,模型性能差异才变得有意义,并真实反映其理解能力。

实验结果

研究问题

  • RQ1多项选择 VQA 数据集中干扰项的设计是否可能无意中使模型在不理解视觉或语言内容的情况下获得高准确率?
  • RQ2如何通过自动程序生成在语义和视觉上均合理的干扰项,迫使模型整合所有输入模态?
  • RQ3所提出的程序在多大程度上减少了现有 VQA 数据集中模型对统计捷径的依赖?
  • RQ4当在干扰项设计改进的数据集上评估时,模型间的性能差距是否变得更加有意义,并更能反映真实理解能力?
  • RQ5能否在无需人工标注的情况下,从现有的图像和问题注释中自动构建大规模、高质量的多项选择 VQA 数据集?

主要发现

  • IoU 和 QoU 程序成功生成在视觉和语义上均合理的干扰项,使得模型无法在不整合图像、问题和答案信息的情况下正确作答。
  • 在结合 IoU+QoU 干扰项的数据集上,模型间的性能差距显著更具意义,注意力机制模型平均优于简单模型 3%。
  • MLP-IQA 模型在 VQA 数据集的 IoU+QoU 干扰项上的准确率为 58.5%,而人类标注者达到 82.5%,表明仍存在显著但非人类水平的性能差距。
  • 在大规模 qaVG 数据集(100 万三元组)上微调预训练模型,可在 Visual7W 和 VQA 上将性能提升最高达 10.5 个百分点,证明了迁移性和泛化优势。
  • 人工评估研究证实,新干扰项更具挑战性,需要完整的多模态理解,甚至人类在模糊情况下也难以应对。
  • 原始数据集(如 VQA 和 Visual7W)中存在显著的捷径偏差——例如,某些答案被过度用作正确答案——导致模型在缺乏视觉或语言推理的情况下表现良好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。