Skip to main content
QUICK REVIEW

[论文解读] MultiModalQA: Complex Question Answering over Text, Tables and Images

Alon Talmor, Ori Yoran|arXiv (Cornell University)|Apr 13, 2021
Multimodal Machine Learning Applications参考文献 21被引用 12
一句话总结

本文介绍了 MultiModalQA(MMQA),这是一个大规模数据集,包含 29,918 个复杂的多模态问题,需要在文本、表格和图像之间进行联合推理,其中 35.7% 的问题需要跨模态推理。作者提出了 ImplicitDecomp 模型,该模型隐式分解多模态问题,在 F1 分数上达到 51.7,显著优于单跳基线模型(38.2 F1),但仍低于人类表现(90.1 F1)。

ABSTRACT

When answering complex questions, people can seamlessly combine information from visual, textual and tabular sources. While interest in models that reason over multiple pieces of evidence has surged in recent years, there has been relatively little work on question answering models that reason across multiple modalities. In this paper, we present MultiModalQA(MMQA): a challenging question answering dataset that requires joint reasoning over text, tables and images. We create MMQA using a new framework for generating complex multi-modal questions at scale, harvesting tables from Wikipedia, and attaching images and text paragraphs using entities that appear in each table. We then define a formal language that allows us to take questions that can be answered from a single modality, and combine them to generate cross-modal questions. Last, crowdsourcing workers take these automatically-generated questions and rephrase them into more fluent language. We create 29,918 questions through this procedure, and empirically demonstrate the necessity of a multi-modal multi-hop approach to solve our task: our multi-hop model, ImplicitDecomp, achieves an average F1of 51.7 over cross-modal questions, substantially outperforming a strong baseline that achieves 38.2 F1, but still lags significantly behind human performance, which is at 90.1 F1

研究动机与目标

  • 创建一个大规模、复杂的问答数据集,要求在文本、表格和图像之间进行推理。
  • 解决现有数据集中缺乏真正跨模态推理需求的问题,特别是涉及视觉证据的情况。
  • 开发一个可扩展的框架,用于大规模生成多样化、多跳、多模态的问题。
  • 评估多模态、多跳推理模型的有效性,并与强基线模型和人类表现进行基准测试。
  • 通过 MMQA 数据集实现在维基百科上的开放域问答。

提出的方法

  • 从维基百科收集表格,并通过共享实体将其与图像和文本段落关联,形成统一的多模态上下文。
  • 定义一种形式化语言,使用逻辑操作(组合、比较、交集)从更简单的单模态问题中构造复杂问题。
  • 通过众包将自动生成的、语言不够流畅的伪语言问题改写为流畅自然的英文。
  • 提出 ImplicitDecomp 模型,该模型隐式地将多模态问题分解为推理步骤,而无需显式的问题分解。
  • 在统一的程序化框架中,使用专门针对文本(RoBERTa)、表格(神经模块网络)和图像(VQA 风格模型)的模型执行推理。
  • 端到端训练模型,以预测一个协调跨模态推理的程序,并执行该程序以生成最终答案。

实验结果

研究问题

  • RQ1可扩展的框架能否生成需要在文本、表格和图像之间进行联合推理的复杂、多跳、多模态问题?
  • RQ2与人类表现相比,现有模型在跨模态推理任务上的失败程度如何?
  • RQ3隐式分解多模态问题是否能在不进行显式问题解析的情况下提升推理性能?
  • RQ4与单跳或模态特定的基线模型相比,统一的多模态推理模型效果如何?
  • RQ5当前最先进模型与人类在复杂多模态问答任务上的性能差距有多大?

主要发现

  • MMQA 包含 29,918 个问题,其中 35.7% 需要跨模态推理,使其成为首个要求在文本、表格和图像之间进行联合推理的大规模数据集。
  • ImplicitDecomp 模型在跨模态问题上的 F1 分数达到 51.7,相比强大的单跳基线模型(38.2 F1)提升了 13.5 个绝对 F1 分数。
  • 人类在该数据集上的表现达到 90.1 F1,表明当前模型仍存在显著差距。
  • 定性分析确认,采样的问题中有 92% 真正需要多跳推理,验证了数据集的复杂性。
  • 在维基百科的开放域设置下,人类 F1 降至 84.8,表明即使拥有完整访问权限,挑战依然很高。
  • 模型在组合、比较和交集操作的第一跳 F1 分数在 33.5 到 61.1 之间,最终 F1 最高达到 61.1,表明其能有效串联推理步骤。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。