Skip to main content
QUICK REVIEW

[论文解读] A Thousand Words Are Worth More Than a Picture: Natural Language-Centric Outside-Knowledge Visual Question Answering

Feng Gao, Ping Qing|arXiv (Cornell University)|Jan 14, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

该论文提出了一种以自然语言为中心的新框架 TRiG,用于开放域知识视觉问答(OK-VQA),通过将视觉输入转化为文本,以利用大规模语言模型和知识库。通过解耦视觉到文本的转换、检索和生成式问答三个阶段,TRiG 在 OK-V-VQA 基准测试中相比最先进方法实现了 11.1% 的绝对性能提升。

ABSTRACT

Outside-knowledge visual question answering (OK-VQA) requires the agent to comprehend the image, make use of relevant knowledge from the entire web, and digest all the information to answer the question. Most previous works address the problem by first fusing the image and question in the multi-modal space, which is inflexible for further fusion with a vast amount of external knowledge. In this paper, we call for a paradigm shift for the OK-VQA task, which transforms the image into plain text, so that we can enable knowledge passage retrieval, and generative question-answering in the natural language space. This paradigm takes advantage of the sheer volume of gigantic knowledge bases and the richness of pre-trained language models. A Transform-Retrieve-Generate framework (TRiG) framework is proposed, which can be plug-and-played with alternative image-to-text models and textual knowledge bases. Experimental results show that our TRiG framework outperforms all state-of-the-art supervised methods by at least 11.1% absolute margin.

研究动机与目标

  • 解决在 OK-VQA 中多模态融合的局限性,即外部知识受限于视觉-语言嵌入的维度。
  • 克服现有方法将海量文本知识压缩到紧凑多模态空间所带来的僵化性。
  • 通过在自然语言空间中统一所有输入,实现端到端、可解释且可扩展的 OK-VQA。
  • 通过使用束搜索和生成式模型而非抽取式跨度预测,提升答案生成的鲁棒性。
  • 通过语言空间中的透明注意力机制诊断模型失败原因,提升可解释性。

提出的方法

  • 提出三阶段 TRiG 框架:转换(通过字幕、密集标签和 OCR 实现图像到文本)、检索(使用在 Natural Questions 数据集上预训练的 DPR 进行密集段落检索)和生成(使用束搜索的生成式问答)。
  • 采用多级图像到文本转换方法,结合图像字幕、目标检测标签和 OCR,以最小化视觉信息损失。
  • 利用在 Natural Questions 数据集上预训练的密集段落检索(DPR)模型,实现高覆盖率的相关知识段落检索。
  • 应用带有交叉注意力机制的生成式问答模型,以同时关注视觉上下文和检索到的段落,实现自由形式的答案生成。
  • 在推理阶段使用束搜索以提升答案质量和鲁棒性,并通过注意力可视化增强可解释性。
  • 设计框架为即插即用,支持与替代的图像到文本模型及文本知识库的集成。

实验结果

研究问题

  • RQ1与传统的多模态融合相比,将视觉输入转化为自然语言是否能提升开放域知识视觉问答的性能?
  • RQ2多级图像到文本转换(字幕、密集标签、OCR)在保留视觉上下文以支持下游问答任务方面的有效性如何?
  • RQ3在无真实事实标注的情况下,密集段落检索(DPR)是否优于传统方法(如 BM25)在 OK-VQA 中检索相关知识?
  • RQ4在答案跨度未被标注的 OK-VQA 任务中,使用束搜索和交叉注意力的生成式问答模型是否能超越抽取式方法?
  • RQ5在语言空间中基于注意力机制的可解释性在多大程度上有助于诊断 OK-VQA 模型的错误?

主要发现

  • TRiG 框架在 OK-VQA 测试集上使用束搜索实现了 67.4 的 VQA 得分和 71.8% 的精确匹配(EM),显著优于以往的监督方法。
  • 与最强的现有监督基线相比,该模型在绝对性能上提升了 11.1%,证明了以语言为中心范式的有效性。
  • 随着检索段落数量(k)的增加,性能持续提升,在 k=25 时趋于平稳,但覆盖率(Hit@k)仍持续增长,表明存在长尾检索效应。
  • 错误分析显示,50% 的失败源于图像到文本转换过程中的信息损失,24% 源于检索质量差,22% 源于生成式问答错误。
  • 数值答案和较长答案的预测难度显著更高,随着答案长度增加,性能明显下降。
  • 模型的注意力机制通过突出显示相关的视觉和文本证据,提供可解释的说明,从而实现对错误的根本原因诊断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。