Skip to main content
QUICK REVIEW

[论文解读] Visual Question Answering with Prior Class Semantics

Violetta Shevchenko, Damien Teney|arXiv (Cornell University)|May 4, 2020
Multimodal Machine Learning Applications参考文献 26被引用 4
一句话总结

该论文提出了一种多任务VQA框架,通过在语义空间中使用回归目标,将词嵌入中的先验语义知识融入模型,以提升答案预测的一致性和准确性。该方法在GQA数据集上达到最先进性能,并能实现对未见答案的零样本预测,展现出在多样化问题类型上的鲁棒性。

ABSTRACT

We present a novel mechanism to embed prior knowledge in a model for visual question answering. The open-set nature of the task is at odds with the ubiquitous approach of training of a fixed classifier. We show how to exploit additional information pertaining to the semantics of candidate answers. We extend the answer prediction process with a regression objective in a semantic space, in which we project candidate answers using prior knowledge derived from word embeddings. We perform an extensive study of learned representations with the GQA dataset, revealing that important semantic information is captured in the relations between embeddings in the answer space. Our method brings improvements in consistency and accuracy over a range of question types. Experiments with novel answers, unseen during training, indicate the method's potential for open-set prediction.

研究动机与目标

  • 解决固定分类VQA模型忽略答案之间语义关系的局限性。
  • 通过引入关于答案语义的先验知识,提升模型的泛化能力和鲁棒性。
  • 实现在训练过程中未见过的新型、词汇外答案的开放集预测。
  • 探究学习到的答案语义表征如何提升不同问题类型下的VQA性能。

提出的方法

  • 该模型将VQA视为多任务学习问题,结合候选答案的分类任务与语义嵌入空间中的回归目标。
  • 使用预训练的GloVe词嵌入初始化答案表征,以注入先验语义知识。
  • 联合损失函数结合了交叉熵分类损失与答案嵌入上的均方误差回归损失。
  • 在推理阶段,模型可通过替换答案矩阵为新嵌入并禁用分类损失(λ = 0)来预测新答案。
  • 该方法利用了嵌入空间中通过最近邻分析揭示的答案之间的语义关系。
  • 该模型在GQA和VQA v2上进行评估,并通过消融研究隔离语义正则化的贡献。

实验结果

研究问题

  • RQ1在答案中引入语义知识在多大程度上提升了VQA模型的准确率和一致性?
  • RQ2VQA模型能否利用语义嵌入泛化到训练过程中未见过的答案?
  • RQ3答案词语之间的语义关系在多大程度上提升了模型性能?
  • RQ4与仅使用分类的基线模型相比,结合语义回归的多任务学习设置表现如何?
  • RQ5不同类型的预训练嵌入(如GloVe与ConceptNet)在多大程度上影响了零样本答案预测?

主要发现

  • 该模型在GQA数据集的所有问题类别中均实现了稳定的准确率提升,尤其在复杂和组合型问题中增益最大。
  • 消融研究显示,分类与回归损失之间平衡的权衡(λ = 0.5)可获得最佳性能,证实了两种目标的互补性。
  • 该模型将70%的答案候选的召回率提升,其中语义相关答案(如“basket”和“baskets”)的增益最为显著。
  • 在VQA v2数据集上,训练集与测试集答案互不重叠的情况下,该模型实现了27%的零样本预测准确率,优于fPMC基线(15%)。
  • 召回率下降的答案通常在GloVe空间中具有语义无关的最近邻,表明嵌入质量与语义一致性至关重要。
  • VQA模型端到端学习到的视觉共现模式表明,结合视觉与语言知识可进一步提升词汇外答案的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。