Skip to main content
QUICK REVIEW

[论文解读] Survey of Recent Advances in Visual Question Answering

Supriya Pandhre, Shagun Sodhani|arXiv (Cornell University)|Sep 24, 2017
Multimodal Machine Learning Applications参考文献 19被引用 9
一句话总结

本综述回顾了视觉问答(VQA)领域的最新进展,重点聚焦于利用注意力机制和外部知识库融合视觉与文本特征的深度学习模型。其突出成果包括:Show, Ask, Attend, and Answer 模型在 VQA2.0 验证集上达到 59.67% 的准确率,代表了当时最先进水平;同时强调注意力机制在提升模型可解释性与性能方面发挥着关键作用。

ABSTRACT

Visual Question Answering (VQA) presents a unique challenge as it requires the ability to understand and encode the multi-modal inputs - in terms of image processing and natural language processing. The algorithm further needs to learn how to perform reasoning over this multi-modal representation so it can answer the questions correctly. This paper presents a survey of different approaches proposed to solve the problem of Visual Question Answering. We also describe the current state of the art model in later part of paper. In particular, the paper describes the approaches taken by various algorithms to extract image features, text features and the way these are employed to predict answers. We also briefly discuss the experiments performed to evaluate the VQA models and report their performances on diverse datasets including newly released VQA2.0[8].

研究动机与目标

  • 提供对 CVPR 2016 及相关研究中近期 VQA 方法的全面综述。
  • 分析多模态 VQA 模型中视觉与文本特征提取及融合的方法。
  • 在包括 VQA1.0、VQA2.0、COCO-QA 和 DAQUAR 在内的多样化数据集上评估模型性能。
  • 识别出如注意力机制和外部知识融合等趋势,这些趋势有助于提升 VQA 中的推理能力。
  • 在标准化数据集上对最先进模型进行基准测试,并突出架构创新带来的性能提升。

提出的方法

  • 采用三部分图像表征:基于属性的(通过微调的 VGG16)、基于字幕的(通过 MSCOCO 字幕上的 LSTM)以及基于知识的(通过 DBpedia 和 Doc2Vec)。
  • 采用编码器-解码器 LSTM 架构,从图像属性、字幕和外部知识的融合表征中生成答案。
  • 应用软注意力机制,聚焦于相关图像区域和问题词汇,提升特征相关性与模型可解释性。
  • 使用残差网络(ResNet-152)进行高层图像特征提取,随后进行 L2 归一化,并与 LSTM 编码的问题特征拼接。
  • 实施多模态池化与门控机制(如 MCB 和 DAN 中的机制),以有效融合视觉与文本特征。
  • 采用端到端训练,使用 Adam 优化器、Dropout(0.5)和 L2 归一化,以减少过拟合并提升泛化能力。

实验结果

研究问题

  • RQ1不同的特征提取策略(属性、字幕、知识库)对 VQA 性能有何影响?
  • RQ2注意力机制在多大程度上提升了 VQA 模型的推理能力与可解释性?
  • RQ3从结构化数据库(如 DBpedia)中引入外部知识,如何提升开放性、自由形式问题上的性能?
  • RQ4残差网络、L2 归一化和 Dropout 等架构组件对模型泛化能力有何影响?
  • RQ5与早期数据集相比,模型在 VQA2.0 上的表现如何?新的数据分布带来了哪些改进?

主要发现

  • Show, Ask, Attend, and Answer 模型在 VQA2.0 验证集上达到 59.67% 的准确率,代表了当时最先进的性能。
  • 注意力机制显著提升了性能,未使用注意力机制的模型在 VQA1.0 上准确率仅为 57.72%。
  • L2 归一化和 Dropout 对泛化至关重要,若省略,准确率分别下降 5.86% 和 3.27%。
  • 堆叠注意力相较于单层注意力带来的性能增益微乎其微,表明存在收益递减现象。
  • MCB 模型在 VQA1.0 上达到最高准确率 66.7%,优于其他早期基准模型。
  • VQA2.0 的设计——将问题数量翻倍,并确保图像-问题-答案三元组唯一——降低了偏差,提升了模型鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。