Skip to main content
QUICK REVIEW

[论文解读] Learning Visual Knowledge Memory Networks for Visual Question Answering

Su Zhou, Chen Zhu|arXiv (Cornell University)|Jun 13, 2018
Multimodal Machine Learning Applications参考文献 46被引用 14
一句话总结

本文提出视觉知识记忆网络(VKMN),一种端到端框架,通过记忆网络将外部知识库中的结构化视觉知识与深度视觉特征相结合,以提升视觉问答性能。VKMN将知识三元组与视觉特征联合嵌入到键值记忆结构中,在需要知识推理的问题上显著优于先前方法,在VQA v2.0数据集上达到64.36%的整体准确率,在'其他'答案类型上达到57.79%。

ABSTRACT

Visual question answering (VQA) requires joint comprehension of images and natural language questions, where many questions can't be directly or clearly answered from visual content but require reasoning from structured human knowledge with confirmation from visual content. This paper proposes visual knowledge memory network (VKMN) to address this issue, which seamlessly incorporates structured human knowledge and deep visual features into memory networks in an end-to-end learning framework. Comparing to existing methods for leveraging external knowledge for supporting VQA, this paper stresses more on two missing mechanisms. First is the mechanism for integrating visual contents with knowledge facts. VKMN handles this issue by embedding knowledge triples (subject, relation, target) and deep visual features jointly into the visual knowledge features. Second is the mechanism for handling multiple knowledge facts expanding from question and answer pairs. VKMN stores joint embedding using key-value pair structure in the memory networks so that it is easy to handle multiple facts. Experiments show that the proposed method achieves promising results on both VQA v1.0 and v2.0 benchmarks, while outperforms state-of-the-art methods on the knowledge-reasoning related questions.

研究动机与目标

  • 解决视觉问答(VQA)中需要超越视觉识别的外部知识的问题挑战。
  • 通过支持视觉与知识模态的联合推理,弥合VQA中视觉感知与常识或百科知识之间的差距。
  • 开发一种记忆网络架构,以高效存储和检索与给定问题相关的多个知识事实。
  • 提升对'不可见目标'问题的性能——即需要从外部知识进行推理而非直接视觉观察的问题。

提出的方法

  • VKMN通过将知识三元组(主体、关系、目标)与图像的深度卷积特征联合嵌入到共享表示空间中,构建视觉知识特征。
  • 它采用键值记忆网络来存储和检索多个知识事实,其中键由问题和图像条件下的表示生成,值为联合的视觉-知识嵌入。
  • 该模型使用双注意力机制:视觉注意力聚焦于图像中的相关区域,问题注意力强调输入问题中的相关词汇。
  • 知识事实基于问题从预构建的视觉知识库(如Visual Genome)中提取,并投影到与视觉特征相同的嵌入空间。
  • 最终答案通过关注记忆内容进行预测,使模型能够在统一且可微的框架中对视觉和外部知识进行推理。
  • 整个网络通过答案类别上的交叉熵损失进行端到端训练,实现视觉特征提取、知识检索与答案预测的联合优化。

实验结果

研究问题

  • RQ1如何有效整合结构化的外部知识与深度视觉特征,以提升视觉问答中的推理能力?
  • RQ2哪些机制使模型能够以支持复杂、依赖知识的问题的方式,联合推理视觉内容与知识事实?
  • RQ3记忆网络架构能否高效存储和检索与给定图像-问题对相关的多个知识事实?
  • RQ4所提出方法在需要超越视觉识别进行推理的'不可见目标'问题上的表现如何?
  • RQ5视觉与知识特征的融合在开放性、非事实性VQA问题上的性能提升程度如何?

主要发现

  • VKMN在VQA v2.0测试标准集上达到64.36%的整体准确率,优于MCB和MLB等当前最先进模型在同一基准上的表现。
  • 在'其他'答案类型——代表知识推理问题——上,VKMN达到57.79%的准确率,显著高于MCB(53.36%)和MLB(52.95%)在同一数据集上的表现。
  • 单模型VKMN性能超过VQA v2.0挑战赛前三名解决方案的最佳单模型结果(62.27%),尤其在'其他'类型上表现更优,表明其在无需依赖大规模集成的情况下仍具有强大泛化能力。
  • VKMN与SVA模型的集成达到66.67%的整体准确率,表明两者在不同答案类型上具有互补优势。
  • 在不同目标尺寸分组中,VKMN在所有尺寸范围内对'其他'答案类型的性能均持续优于MLB,表明其对目标对象尺度具有鲁棒性。
  • 消融实验确认,VKMN的性能提升主要源于通过记忆机制实现的知识与视觉特征的有效融合,而非仅因特征提取能力的提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。