Skip to main content
QUICK REVIEW

[论文解读] VQABQ: Visual Question Answering by Basic Questions

Jia-Hong Huang, Modar Alfadly|arXiv (Cornell University)|Mar 19, 2017
Multimodal Machine Learning Applications参考文献 10被引用 15
一句话总结

本文提出 VQABQ,一种视觉问答框架,通过 LASSO 优化将复杂问题分解为基本问题,并利用协同注意力机制提升答案准确率。该方法通过有效利用生成的基本问题来增强视觉与文本特征的推理能力,在 VQA 数据集上实现了 60.34% 的最先进开放型 VQA 准确率。

ABSTRACT

Taking an image and question as the input of our method, it can output the text-based answer of the query question about the given image, so called Visual Question Answering (VQA). There are two main modules in our algorithm. Given a natural language question about an image, the first module takes the question as input and then outputs the basic questions of the main given question. The second module takes the main question, image and these basic questions as input and then outputs the text-based answer of the main question. We formulate the basic questions generation problem as a LASSO optimization problem, and also propose a criterion about how to exploit these basic questions to help answer main question. Our method is evaluated on the challenging VQA dataset and yields state-of-the-art accuracy, 60.34% in open-ended task.

研究动机与目标

  • 通过更有效地整合视觉特征与文本问题特征,解决 VQA 研究中偏重视觉特征而忽视文本问题特征的不平衡问题。
  • 通过将复杂问题分解为更简单、可回答的子问题(即基本问题),提升 VQA 中的整体场景理解能力。
  • 开发一种方法,利用学习到的表征和优化技术,从主问题生成语义相关的基本问题。
  • 评估基本问题对 VQA 准确率的影响,并证明其在提升基于协同注意力模型中的实用性。
  • 从 VQA 数据集衍生出一个新的基本问题数据集,以支持未来在问题分解方面的研究。

提出的方法

  • 基本问题生成模块使用 Skip-Thought Vectors 将主问题以及所有训练/验证集问题编码到稠密向量空间。
  • 将基本问题生成建模为 LASSO 优化问题,从预先构建的 4800×215623 基本身问题矩阵中找出最相关的三个基本问题。
  • 协同注意力 VQA 模块将主问题、图像和生成的基本问题作为输入,利用协同注意力机制联合关注视觉与文本特征。
  • 通过设定阈值(s1=0.43,s2=0.82,s3=0.53)来判断测试问题是否能从基本问题中获益,依据是相似度得分。
  • 最终答案通过层次注意力机制将协同关注后的视觉与文本特征进行融合后预测。
  • 该方法使用一种准则,通过聚焦图像中与基本问题最相关的区域以及问题中最相关的词语,来有效利用基本问题。

实验结果

研究问题

  • RQ1将复杂视觉问题分解为基本问题是否能提升 VQA 准确率?
  • RQ2如何自动生成支持准确答案预测的基本问题?
  • RQ3基本问题在多大程度上提升了基于协同注意力的 VQA 模型性能?
  • RQ4问题类型(如计数、属性、存在性)对基本问题有效性有何影响?
  • RQ5基本问题数据集的质量与多样性如何影响整体 VQA 性能?

主要发现

  • VQABQ 模型在 VQA 数据集上实现了 60.34% 的最先进开放型 VQA 准确率,超越了先前方法。
  • 该方法在基线基础上实现了 142,093 个测试样本中正确答案增加 28 个的提升,表明性能有显著改善。
  • 仅有 57% 的测试问题能在训练与验证集中找到相关的基本问题,表明数据集多样性与覆盖度存在局限。
  • 协同注意力机制在计数类问题上表现尤为突出,表明其与局部视觉推理具有强关联性。
  • 尽管基本问题的覆盖范围有限,该方法仍提升了准确率,表明即使部分使用基本问题也能增强推理能力。
  • 在相同条件下对最先进方法 [14] 的复现结果低于其报告值,验证了所提方法的公平性与竞争力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。