Skip to main content
QUICK REVIEW

[论文解读] Textually Enriched Neural Module Networks for Visual Question Answering

Khyathi Raghavi Chandu, Mary Arpita Pyreddy|arXiv (Cornell University)|Sep 23, 2018
Multimodal Machine Learning Applications参考文献 26被引用 7
一句话总结

本文通过整合图像字幕和外部知识,提出了一种文本增强的神经模块网络(NMN),以缓解问题解析过程中的信息丢失问题,从而提升视觉问答(VQA)性能。通过关注相关字幕内容并利用外部知识库,该模型在VQA 1.0测试开发集上的准确率提升至57.1%,尤其在需要上下文或常识推理的问题上表现显著。

ABSTRACT

Problems at the intersection of language and vision, like visual question answering, have recently been gaining a lot of attention in the field of multi-modal machine learning as computer vision research moves beyond traditional recognition tasks. There has been recent success in visual question answering using deep neural network models which use the linguistic structure of the questions to dynamically instantiate network layouts. In the process of converting the question to a network layout, the question is simplified, which results in loss of information in the model. In this paper, we enrich the image information with textual data using image captions and external knowledge bases to generate more coherent answers. We achieve 57.1% overall accuracy on the test-dev open-ended questions from the visual question answering (VQA 1.0) real image dataset.

研究动机与目标

  • 解决在将问题简化为解析树时,神经模块网络(NMNs)因信息丢失而带来的问题。
  • 通过引入图像字幕作为补充文本上下文,提升视觉-语言推理能力,从而改善VQA性能。
  • 通过引入注意力机制,聚焦显著的字幕片段,减少无关字幕内容带来的噪声。
  • 通过整合外部知识库,增强对需要常识或事实知识的问题的回答能力,超越图像和字幕数据的限制。
  • 评估基于字幕的注意力机制与知识融合对开放型VQA基准的影响,尤其针对复杂或模糊的问题。

提出的方法

  • 使用LSTM编码字幕文本,并通过软注意力机制对字幕标记进行关注,将图像字幕整合到NMN框架中。
  • 应用软注意力机制,将问题中的词语与相关字幕短语对齐,过滤无关字幕内容以减少噪声。
  • 在NMN架构中扩展出一个Measure模块用于计数问题,替代原有的Describe模块,以提升数值推理能力。
  • 利用外部知识库,为需要常识或事实知识的问题增强视觉特征,超越图像本身的信息。
  • 采用晚期融合机制,通过逐元素相乘的方式融合图像特征(来自CNN)、问题特征(来自LSTM)和字幕特征(来自带注意力的LSTM),随后通过Softmax层进行答案预测。
  • 使用反向传播端到端训练整个模型,联合优化注意力权重与知识检索参数。

实验结果

研究问题

  • RQ1通过保留问题解析简化过程中丢失的语言信息,将图像字幕整合到NMN中,能否提升视觉问答的性能?
  • RQ2与使用完整字幕相比,选择性地关注字幕中相关部分是否能减少噪声并提高答案准确率?
  • RQ3整合外部知识库在多大程度上能增强对需要事实性或常识性知识的问题的推理能力?
  • RQ4所提出的基于字幕的注意力机制与标准NMN相比,在处理模糊或复杂问题时表现如何?
  • RQ5模型中仍存在哪些类型的错误?这些错误在多大程度上受字幕中通用术语的影响,从而导致虚假关联?

主要发现

  • 所提出的字幕注意力机制使VQA 1.0基准测试开发集的准确率提升了1.2个百分点(从55.9%提升至57.1%)。
  • 在训练集上,模型准确率提升了1.9%,表明通过增强的文本监督,泛化能力得到改善。
  • 当字幕与问题相关时(如‘两架飞机在飞行’或‘一个比萨’),模型能正确预测‘2’和‘比萨’等答案,优于标准NMN。
  • 当字幕包含通用或误导性术语时,模型偶尔会出错——例如,由于训练数据偏差,将‘group’错误关联为5(而非6)的高计数。
  • 当字幕与问题无关时,字幕注意力并未提升性能,凸显了低质量字幕带来的噪声风险。
  • Measure模块在性能上未优于Describe模块,可能由于注意力图中的信息丢失或图像特征利用不足。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。