Skip to main content
QUICK REVIEW

[论文解读] Bilinear Graph Networks for Visual Question Answering

Dalu Guo, Chang Xu|arXiv (Cornell University)|Jul 23, 2019
Multimodal Machine Learning Applications参考文献 35被引用 6
一句话总结

本文提出双线性图网络(Bilinear Graph Networks, BGNs)用于视觉问答任务,通过两种专用图结构建模问题中的词语与视觉对象之间的相互依赖关系:一种是将问题词语与图像对象融合的图像图(image-graph),另一种是在联合嵌入表示间传播上下文信息的问题图(question-graph)。该方法在VQA v2.0测试-标准集上实现了72.41%的准确率,达到当前最先进水平,通过增强的跨模态与模内注意力机制,显著提升了对复杂、多步骤问题的推理能力。

ABSTRACT

This paper revisits the bilinear attention networks in the visual question answering task from a graph perspective. The classical bilinear attention networks build a bilinear attention map to extract the joint representation of words in the question and objects in the image but lack fully exploring the relationship between words for complex reasoning. In contrast, we develop bilinear graph networks to model the context of the joint embeddings of words and objects. Two kinds of graphs are investigated, namely image-graph and question-graph. The image-graph transfers features of the detected objects to their related query words, enabling the output nodes to have both semantic and factual information. The question-graph exchanges information between these output nodes from image-graph to amplify the implicit yet important relationship between objects. These two kinds of graphs cooperate with each other, and thus our resulting model can model the relationship and dependency between objects, which leads to the realization of multi-step reasoning. Experimental results on the VQA v2.0 validation dataset demonstrate the ability of our method to handle the complex questions. On the test-std set, our best single model achieves state-of-the-art performance, boosting the overall accuracy to 72.41%.

研究动机与目标

  • 解决双线性注意力网络在捕捉复杂、组合性推理时的局限性,因其未能建模问题词语之间的内部关系。
  • 克服问题词语与视觉对象之间缺乏上下文建模的问题,该问题限制了视觉问答中的多步推理能力。
  • 开发一种基于图的机制,显式建模问题词语与图像对象联合嵌入之间的依赖关系,以提升推理性能。
  • 实现对需要关系理解的长句、复杂问题(如计数、空间推理与抽象场景理解)的更好性能。
  • 证明图机制在多模态表示学习中用于视觉问答任务的有效性。

提出的方法

  • 构建图像图,将问题中的每个词语与图像中相关检测到的对象相连,生成融合了语义与视觉事实信息的联合嵌入表示。
  • 设计问题图,基于问题词语的联合嵌入执行消息传递,通过迭代式上下文交换增强对象之间的隐含关系。
  • 使用双线性注意力图作为问题标记与图像区域之间的初始特征交互机制,作为图模块的输入。
  • 以堆叠方式应用多层图像图与问题图,实现更深层次的推理,并逐层优化表示。
  • 集成预训练语言模型(如BERT)以进一步增强问题编码,提升复杂语言推理性能。
  • 采用交叉熵损失端到端训练模型进行答案预测,图层实现动态注意力与上下文传播。

实验结果

研究问题

  • RQ1基于图的消息传递是否能超越标准双线性注意力机制,在视觉问答推理中带来性能提升?
  • RQ2图像图与问题图组件在建模视觉对象与问题词语之间复杂关系方面分别起到何种作用?
  • RQ3多层图网络在需要多步推理的长句与组合性问题上,能在多大程度上提升性能?
  • RQ4集成如BERT等预训练语言模型是否能进一步提升双线性图网络的推理能力?
  • RQ5所提出的图架构是否能有效捕捉图像中远距离或重叠对象之间的隐含关系?

主要发现

  • 在VQA v2.0验证集上,单层BGNs模型相比双线性注意力网络(BAN)准确率提升0.62%,而更深的模型在复杂问题上实现1.4%的准确率提升。
  • 引入BERT后,模型获得额外1.5%的准确率增益,表明预训练语言模型与图推理机制之间存在显著协同效应。
  • 在VQA v2.0测试-标准集上,最佳单模型(BGNs+BERT)达到72.41%的最先进整体准确率,优于此前方法(如MCAN、MLIN与DFAF)。
  • 消融实验表明,问题图显著提升了对空间、计数与关系类问题的推理能力,例如准确识别边缘位置的物体或计数相似物体。
  • 定性分析显示,模型在图层间逐步优化预测结果,例如仅在深层才正确识别出位于左侧边缘的“apple”,表明具备有效的多步推理能力。
  • 模型能有效区分高度重叠的对象(如两只绵羊)与抽象场景(如五个圆圈代表奥运会),在复杂视觉上下文中表现出强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。