Skip to main content
QUICK REVIEW

[论文解读] Estimating semantic structure for the VQA answer space

Corentin Kervadec, Grigory Antipov|arXiv (Cornell University)|Jun 10, 2020
Multimodal Machine Learning Applications参考文献 31被引用 8
一句话总结

本文提出了一种用于视觉问答(VQA)的语义损失,通过建模答案类别之间的语义关系来减少语言偏见并提升泛化能力。通过利用词嵌入或人工标注统计信息估计语义接近度,该方法在无需降低在有偏见的 VQAv2 数据集上性能的前提下,提升了 VQAv2-CP 上的准确率,结合去偏技术后实现了最先进(SOTA)水平的结果。

ABSTRACT

Since its appearance, Visual Question Answering (VQA, i.e. answering a question posed over an image), has always been treated as a classification problem over a set of predefined answers. Despite its convenience, this classification approach poorly reflects the semantics of the problem limiting the answering to a choice between independent proposals, without taking into account the similarity between them (e.g. equally penalizing for answering cat or German shepherd instead of dog). We address this issue by proposing (1) two measures of proximity between VQA classes, and (2) a corresponding loss which takes into account the estimated proximity. This significantly improves the generalization of VQA models by reducing their language bias. In particular, we show that our approach is completely model-agnostic since it allows consistent improvements with three different VQA models. Finally, by combining our method with a language bias reduction approach, we report SOTA-level performance on the challenging VQAv2-CP dataset.

研究动机与目标

  • 解决标准 VQA 分类的局限性,即把答案类别视为独立的,忽略了语义关系。
  • 通过基于语义相似性的结构化答案空间,减少模型对语言偏见的依赖。
  • 设计一种与模型无关的损失函数,提升泛化能力,且无需修改网络架构。
  • 在多种 VQA 模型和数据集(包括 VQAv2-CP 和 VQAv2)上展示一致的性能提升。
  • 证明语义损失可与现有去偏方法互补,在 VQAv2-CP 上实现最先进性能。

提出的方法

  • 提出一种语义损失函数,通过在学习到的语义空间中最小化预测答案与真实答案之间的距离。
  • 利用预训练的词嵌入(如 Word2Vec、GloVe)估计答案类别之间的语义接近度,以衡量分布相似性。
  • 另一种接近度估计方法利用 VQA 数据集中多个人工标注的答案,推断语义模糊性和相似性。
  • 在训练过程中将语义损失与标准交叉熵损失结合,实现端到端优化。
  • 通过一个学习到的映射函数 γ(·) 将预测结果和真实答案投影到共享的语义空间中。
  • 该方法应用于三种不同的 VQA 架构(UpDn、MCAN、NSM),证明了其与模型无关的有效性。

实验结果

研究问题

  • RQ1建模 VQA 答案类别之间的语义关系是否能减少视觉-语言模型中的语言偏见?
  • RQ2基于答案的语义空间是否能在标准分类损失之外提升泛化能力?
  • RQ3基于语义接近度的与模型无关损失函数是否能在不同 VQA 架构上持续提升性能?
  • RQ4所提出的方法是否在保持有偏数据集(如 VQAv2)性能的同时,提升无偏基准(如 VQAv2-CP)上的表现?
  • RQ5与最先进去偏技术相比,语义损失在准确率和鲁棒性方面表现如何?

主要发现

  • 语义损失通过更严厉惩罚语义上相距较远的错误答案(如将 'boy' 视为比 'girl' 更差的错误)来减少语言偏见,尤其当正确答案为 'woman' 时。
  • 在 VQAv2-CP 数据集上,该方法与 RUBi 结合后达到 47.5% 的准确率,匹配最先进性能,且无需额外标注。
  • 与 DLR 和 SCR(VQA-X) 不同,后者在原始 VQAv2 数据集上性能下降最高达 -4.9 分,该语义损失在有偏 VQAv2 数据集上保持或略微提升准确率。
  • 该方法在三种不同 VQA 模型(UpDn、MCAN、NSM)上均表现出一致的性能提升,证实其与模型无关的特性。
  • 尽管统计覆盖范围较低,但基于人工标注的语义接近度估计在有效性上优于词嵌入。
  • 语义损失与 RUBi 结合后,在 VQAv2-CP 上相较基线 UpDn 模型提升了 3.3 分,证明了性能的互补性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。