Skip to main content
QUICK REVIEW

[论文解读] VisualMRC: Machine Reading Comprehension on Document Images

Ryota Tanaka, Kyosuke Nishida|arXiv (Cornell University)|Jan 27, 2021
Multimodal Machine Learning Applications参考文献 47被引用 4
一句话总结

本文提出 VisualMRC,一个用于文档图像视觉机器阅读理解的新数据集与模型,要求模型理解布局、文本和视觉内容,以生成摘要式答案。所提出的 LayoutT5 模型在 T5 基础上引入视觉布局与显著性特征进行微调,其性能优于基础序列到序列模型及当前最先进的 VQA 模型,尽管人类表现仍更优。

ABSTRACT

Recent studies on machine reading comprehension have focused on text-level understanding but have not yet reached the level of human understanding of the visual layout and content of real-world documents. In this study, we introduce a new visual machine reading comprehension dataset, named VisualMRC, wherein given a question and a document image, a machine reads and comprehends texts in the image to answer the question in natural language. Compared with existing visual question answering (VQA) datasets that contain texts in images, VisualMRC focuses more on developing natural language understanding and generation abilities. It contains 30,000+ pairs of a question and an abstractive answer for 10,000+ document images sourced from multiple domains of webpages. We also introduce a new model that extends existing sequence-to-sequence models, pre-trained with large-scale text corpora, to take into account the visual layout and content of documents. Experiments with VisualMRC show that this model outperformed the base sequence-to-sequence models and a state-of-the-art VQA model. However, its performance is still below that of humans on most automatic evaluation metrics. The dataset will facilitate research aimed at connecting vision and language understanding.

研究动机与目标

  • 解决真实世界文档图像中复杂布局与视觉内容导致的机器阅读理解空白。
  • 开发一个强调文档图像上自然语言理解与生成的数据集,而非简单的视觉定位。
  • 使模型能够对文档图像中的多个文本与视觉元素进行推理,以生成摘要式答案。
  • 在不造成灾难性遗忘的前提下,将预训练序列到序列模型的语言生成能力迁移至视觉阅读理解任务。
  • 推动视觉-语言模型向人类水平理解真实世界数字文档的能力迈进。

提出的方法

  • 作者构建了 VisualMRC,一个包含 10,000 余张来自多样化网络领域的文档图像的数据集,每张图像均配有 30,000 多组需要摘要式推理的问答对。
  • 该数据集包含标注了语义类别的感兴趣区域(ROIs,如列表、表格、图表),支持布局感知理解。
  • 提出一种新型模型 LayoutT5,通过在 T5 编码器-解码器架构中引入视觉布局嵌入与辅助显著性检测头进行扩展。
  • 该模型在大规模文本语料上进行预训练,并在 VisualMRC 上使用问答对与视觉布局特征进行微调。
  • 通过 Faster R-CNN 检测器从文档图像中提取视觉特征,以定位和分类 ROIs,随后使用位置嵌入与布局嵌入进行编码。
  • 模型采用多任务学习目标,结合答案生成与显著性预测,以在整合视觉信息的同时保持语言生成能力。

实验结果

研究问题

  • RQ1预训练的序列到序列模型能否在保留其自然语言生成能力的前提下,有效适应于文档图像的视觉机器阅读理解?
  • RQ2与纯文本模型相比,整合视觉布局与内容信息在文档级问答任务中能多大程度提升性能?
  • RQ3在复杂布局与混合视觉元素的文档图像上,基于文本到文本任务训练的视觉-语言模型在多大程度上能泛化?
  • RQ4与当前最先进的 VQA 模型相比,所提出的 LayoutT5 模型在理解与生成文档图像答案方面表现如何?
  • RQ5视觉文档理解中的关键失败模式是什么,特别是针对图表与视觉对象的理解?

主要发现

  • LayoutT5 模型在性能上优于仅在文本输入上微调的基线 T5 与 BART 模型,证明了视觉布局信息整合的优势。
  • 在 VisualMRC 数据集上,LayoutT5 的表现优于 M4C(一种最先进的视觉-语言 VQA 模型),表明其在摘要式文档问答任务中的优越性。
  • 模型在涉及图表或视觉属性(如物体颜色)的问题上表现依然有限,揭示了其在视觉对象理解方面的关键失败模式。
  • VisualMRC 中的摘要式答案生成任务所需推理复杂度高于现有 VQA 数据集,这一点从自动指标上的人类性能差距中得到证实。
  • 辅助显著性检测任务在视觉微调过程中有效防止了灾难性遗忘,保持了预训练模型的语言生成质量。
  • 数据集在文档类型上的多样性以及对长篇摘要式答案的包含,使其适用于评估真实世界文档上的先进自然语言理解与生成能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。