Skip to main content
QUICK REVIEW

[论文解读] Visual Question Answering: A Survey on Techniques and Common Trends in Recent Literature

Ana Cláudia Akemi Matsuki de Faria, Felype de Castro Bastos|arXiv (Cornell University)|May 18, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

本综述对2020–2022年视觉问答(VQA)研究进行了全面且最新的分析,评估了29篇近期论文、6个数据集以及最先进模型。其突出重点包括偏见缓解、通过知识图谱整合外部知识,以及基于Transformer的多模态建模,提供了VQA技术进展与未来研究方向的新型、开放获取且可复现的概述。

ABSTRACT

Visual Question Answering (VQA) is an emerging area of interest for researches, being a recent problem in natural language processing and image prediction. In this area, an algorithm needs to answer questions about certain images. As of the writing of this survey, 25 recent studies were analyzed. Besides, 6 datasets were analyzed and provided their link to download. In this work, several recent pieces of research in this area were investigated and a deeper analysis and comparison among them were provided, including results, the state-of-the-art, common errors, and possible points of improvement for future researchers.

研究动机与目标

  • 提供2020–2022年VQA研究的全面、最新综述,重点关注新技术与趋势。
  • 分析并比较29篇近期论文、6个数据集以及VQA中的最先进模型,强调方法多样性与性能表现。
  • 识别并讨论常见问题,如数据集偏见、缺乏标准化以及VQA模型训练的高计算成本。
  • 突出新兴趋势,如外部知识注入、知识图谱集成以及注意力机制建模,以提升模型鲁棒性与泛化能力。
  • 通过包含开放获取论文与开源数据集(附可下载链接)支持可复现性与未来研究。

提出的方法

  • 对2020至2022年间发表的29篇高质量VQA论文进行系统性分析,筛选标准包括内容质量、开放获取与开源可用性。
  • 评估六个主要VQA数据集,涵盖其结构、标注风格,以及在泛化能力与偏见缓解基准测试中的适用性。
  • 按模型架构(CNN、RNN、Transformer)对VQA模型进行分类,重点关注注意力机制与多模态融合策略。
  • 研究偏见缓解技术,包括数据再分配、架构分支(如内容与上下文分支)以及训练协议重构,以减少对虚假相关性的依赖。
  • 考察知识注入方法,特别是利用外部知识图谱增强VQA模型推理与上下文理解能力。
  • 应用一种新型数字框架用于模型与数据集评估,实现跨研究的性能与鲁棒性系统性比较。
Figure 1: Example of how a VQA system works
Figure 1: Example of how a VQA system works

实验结果

研究问题

  • RQ12020至2022年间,VQA研究中最显著的趋势与方法创新是什么?
  • RQ2近期VQA模型如何应对训练数据中虚假相关性带来的偏见挑战?
  • RQ3外部知识源(如知识图谱)在多大程度上提升了VQA模型的推理与泛化能力?
  • RQ4当前VQA研究中的关键局限与反复出现的弱点是什么,特别是关于数据集标准化与计算成本方面?
  • RQ5VQA模型中的注意力机制与人类视觉注意力相比如何?已做出哪些改进以实现更紧密对齐?

主要发现

  • 在使用准确率作为评估指标时,LXMERT与UpDn主干网络在VQA v2.0数据集上表现最佳。
  • 七项近期研究通过数据再分配、架构分支(如内容与上下文分支)以及训练协议重构,专门针对偏见缓解,以减少对虚假相关性的依赖。
  • 通过知识图谱实现的外部知识注入显著提升了模型的鲁棒性与上下文推理能力,尤其在分布外泛化任务中表现突出。
  • Transformer与多模态注意力机制被广泛采用,多项研究将注意力建模为特征函数,以更好地模拟人类视觉注意力。
  • 尽管已有进展,大多数模型仍严重依赖准确率作为主要评估指标,对更精细或与人类对齐的指标使用有限。
  • 一个主要挑战仍是数据集创建缺乏标准化,许多作者开发自定义数据集,这阻碍了可复现性与跨研究比较。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。