Skip to main content
QUICK REVIEW

[论文解读] Visual Question Answering with Memory-Augmented Networks

Chao Ma, Chunhua Shen|arXiv (Cornell University)|Jul 17, 2017
Multimodal Machine Learning Applications参考文献 45被引用 15
一句话总结

本文提出了一种用于视觉问答(VQA)的内存增强神经网络,通过结合内部和外部记忆来保留稀有训练样本的长期知识,从而提升对罕见答案类型的性能。通过将图像与文本的协同注意力机制与注意力门控记忆访问相结合,该模型在VQA v1.0和VQA v2.0上均优于当前最先进方法,尤其在需要细致入微、罕见概念理解的问题上表现更优。

ABSTRACT

In this paper, we exploit a memory-augmented neural network to predict accurate answers to visual questions, even when those answers occur rarely in the training set. The memory network incorporates both internal and external memory blocks and selectively pays attention to each training exemplar. We show that memory-augmented neural networks are able to maintain a relatively long-term memory of scarce training exemplars, which is important for visual question answering due to the heavy-tailed distribution of answers in a general VQA setting. Experimental results on two large-scale benchmark datasets show the favorable performance of the proposed algorithm with a comparison to state of the art.

研究动机与目标

  • 为解决由于答案的长尾分布导致的视觉问答中低频或罕见答案预测挑战。
  • 提升因频率过低而常被排除在训练数据之外的罕见概念上的VQA性能。
  • 开发一种内存增强架构,以选择性地保留和检索稀少的训练样本,从而实现更好的泛化能力。
  • 将图像与文本之间的协同注意力机制与外部记忆相结合,以增强对罕见视觉和语言概念的推理能力。
  • 证明显式记忆机制在长尾VQA场景下可超越标准端到端深度学习模型。

提出的方法

  • 采用协同注意力机制,通过关注相关图像区域和问题中的关键词汇,联合嵌入图像和问题特征。
  • 模型使用基于LSTM的控制器,管理内部记忆(LSTM内部)和外部记忆块,以长期存储训练样本。
  • 通过注意力机制访问外部记忆,基于与当前输入的相似性优先选择相关训练样本。
  • 记忆网络可选择性地从外部记忆中读取或写入,从而即使在训练中出现频率极低,也能保留罕见答案模式。
  • 最终的记忆增强LSTM隐藏状态被用作图像-问题的联合表示,以训练多标签分类器进行答案预测。
  • 模型通过答案分类的交叉熵损失进行端到端训练,不依赖预训练词嵌入。

实验结果

研究问题

  • RQ1记忆增强网络能否提升在训练数据中代表性不足的罕见答案类型上的VQA性能?
  • RQ2同时引入内部和外部记忆在VQA中如何增强对稀少训练样本的长期保留能力?
  • RQ3图像与文本特征的协同注意力在提升对细微、罕见视觉概念的推理能力方面能发挥多大作用?
  • RQ4所提出的架构在长尾VQA场景下是否优于标准深度学习模型?
  • RQ5该模型能否在无需显式微调的情况下泛化到包含罕见概念的分布外问题?

主要发现

  • 所提模型在VQA v1.0测试-std划分上达到62.3%的top-1准确率,优于以往最先进方法。
  • 在VQA v2.0基准上,模型达到62.1%的整体准确率,超过MCB模型,并与更复杂的模型性能相当。
  • 在Visual 7W Telling数据集上,模型从零开始训练时达到59.4%的整体准确率,优于Visual 7W基线模型。
  • 在额外VQA v1.0数据上微调后,模型在Visual 7W上达到62.8%的整体准确率,展现出强大的泛化能力。
  • 定性结果表明,模型能正确关注罕见概念如“cucumber”和“fire hydrant”,而基线模型在这些罕见答案上失败。
  • 模型能成功回答需要细致推理的问题,例如识别鸟类所站立的物体,即使正确区域在视觉上存在歧义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。