Skip to main content
QUICK REVIEW

[论文解读] Survey of Visual Question Answering: Datasets and Techniques

Akshay Gupta|arXiv (Cornell University)|May 10, 2017
Multimodal Machine Learning Applications参考文献 29被引用 22
一句话总结

本综述全面概述了视觉问答(VQA)数据集与模型,将方法分类为非深度学习、无注意力机制的深度学习、带注意力机制的深度学习以及混合模型。研究发现注意力机制与知识融合显著提升了性能,其中如分层交叉注意力(Hierarchical Co-Attention)和Ask Me Anything(AMA)等模型在需要推理与依赖知识的任务中取得了最先进性能。

ABSTRACT

Visual question answering (or VQA) is a new and exciting problem that combines natural language processing and computer vision techniques. We present a survey of the various datasets and models that have been used to tackle this task. The first part of the survey details the various datasets for VQA and compares them along some common factors. The second part of this survey details the different approaches for VQA, classified into four types: non-deep learning models, deep learning models without attention, deep learning models with attention, and other models which do not fit into the first three. Finally, we compare the performances of these approaches and provide some directions for future work.

研究动机与目标

  • 系统性地回顾并比较主要VQA数据集在规模、标注方法以及问题-答案多样性方面的特征。
  • 将VQA模型分类并分析为四类:非深度学习、无注意力机制的深度学习、带注意力机制的深度学习,以及融合外部知识的混合模型。
  • 在标准VQA基准上评估不同模型架构的性能,并识别推动准确率提升的关键因素。
  • 探讨外部知识库在提升VQA性能中的作用,特别是针对需要世界知识的问题。
  • 识别开放挑战与未来研究方向,包括答案生成、推理复杂度以及性能上限问题。

提出的方法

  • 根据图像来源、标注方法(人工 vs. 自动)、问题类型和答案格式对VQA数据集进行分类。
  • 将VQA模型划分为四类:非深度学习、无注意力机制的深度学习、带注意力机制的深度学习(如注意力机制),以及融合外部知识的混合模型。
  • 使用标准指标(如准确率、WUPS分数、top-1/top-5准确率)在VQA、COCO-QA和DAQUAR等数据集上评估模型性能。
  • 分析注意力机制,如分层交叉注意力(Hierarchical Co-Attention),该机制同时关注图像与问题特征,显著提升复杂问题上的性能。
  • 通过属性生成与文档摘要(使用Doc2Vec)将外部知识库(如DBpedia)集成到AMA模型中,以增强答案生成能力。
  • 提出结合注意力机制与知识库访问的混合建模策略,具备实现端到端可微决策(即何时使用外部知识)的潜力。

实验结果

研究问题

  • RQ1不同VQA数据集在规模、标注方法以及问题-答案多样性方面如何比较?
  • RQ2在标准VQA基准上,非深度学习、无注意力机制的深度学习与带注意力机制的深度学习模型的相对性能如何?
  • RQ3在需要世界知识的问题上,整合外部知识库在多大程度上提升了VQA性能?
  • RQ4注意力机制,特别是图像与问题之间的交叉注意力,如何提升模型在复杂或长句问题上的性能?
  • RQ5VQA领域中的关键开放挑战是什么,特别是在答案生成、推理复杂度以及性能上限方面?

主要发现

  • 采用注意力机制的深度学习模型,特别是分层交叉注意力网络(CoAtt),优于无注意力机制模型,并在需要推理的任务中达到最先进性能。
  • Ask Me Anything(AMA)模型通过基于属性的查询与Doc2Vec摘要技术集成DBpedia知识库,在COCO-QA上取得最佳性能,表明外部知识能显著提升依赖世界知识的答案质量。
  • ATP模型在生成答案前预测答案类型,其性能优于无注意力机制模型,表明即使无显式注意力机制,结构化推理也能提升性能。
  • 如神经模块网络(NMN)等模型在合成的、推理密集型数据集上表现优异,表明自动程序生成是应对复杂VQA的有前途路径。
  • 在COCO-QA上性能显著偏低,该数据集为自动生成,表明自动数据生成可能限制推理深度,需更优的评估基准。
  • 开放式答案生成的有效评估方法仍存在关键空白,凸显该领域亟需改进的指标与数据集整理工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。