Skip to main content
QUICK REVIEW

[论文解读] DocVQA: A Dataset for VQA on Document Images

Minesh Mathew, Dìmosthenis Karatzas|arXiv (Cornell University)|Jul 1, 2020
Multimodal Machine Learning Applications参考文献 37被引用 8
一句话总结

本文提出了DocVQA,一个包含50,000个问题-答案对的大规模数据集,涵盖12,767张文档图像,旨在通过要求模型同时理解文本内容和文档布局,推动文档图像视觉问答任务的发展。表现最佳的模型——在SQuAD和DocVQA上微调的BERT-Large——在测试集上达到55.77%的精确匹配准确率,远低于人类水平(94.36%),凸显了在文档理解中更优整合视觉与结构线索的必要性。

ABSTRACT

We present a new dataset for Visual Question Answering (VQA) on document images called DocVQA. The dataset consists of 50,000 questions defined on 12,000+ document images. Detailed analysis of the dataset in comparison with similar datasets for VQA and reading comprehension is presented. We report several baseline results by adopting existing VQA and reading comprehension models. Although the existing models perform reasonably well on certain types of questions, there is large performance gap compared to human performance (94.36% accuracy). The models need to improve specifically on questions where understanding structure of the document is crucial. The dataset, code and leaderboard are available at docvqa.org

研究动机与目标

  • 通过引入需要超越简单文本提取的视觉问答任务,弥合对文档图像整体理解的差距。
  • 推动文档分析中的‘以任务为导向’方法,使模型根据用户查询而非孤立的提取任务进行驱动。
  • 提供一个大规模、多样化的现实世界文档图像数据集,包含复杂、开放式的问答,要求多模态理解。
  • 在文档图像上对现有的视觉问答和阅读理解模型进行基准测试,并识别关键失败模式,尤其在布局与结构推理方面。

提出的方法

  • 该数据集包含来自5个行业和多个年代的12,767张真实文档图像,标注了50,000个自然语言问题,按推理类型分类。
  • 问题设计旨在要求理解布局、结构、表格、表单以及非文本视觉线索(如复选框和图表)。
  • 基线模型包括启发式方法(如OCR子串匹配)、视觉问答模型(LoRRA、M4C)以及在DocVQA和SQuAD上微调的基于BERT的问答模型。
  • M4C模型被调整为同时使用视觉特征和OCR提取的文本,对动态词汇表和物体特征进行了消融实验。
  • 基于BERT的模型使用问题-答案对在DocVQA上进行微调,对预训练数据(SQuAD vs. 无SQuAD预训练)进行了消融分析。
  • 性能评估采用精确匹配(Acc.)和平均归一化L2距离(ANLS),人类表现作为上限基准。

实验结果

研究问题

  • RQ1现有视觉问答和阅读理解模型在具有复杂布局和多模态线索的真实文档图像上泛化能力如何?
  • RQ2当前模型在哪些类型的问题上表现最差,与人类表现相比在何处失败?
  • RQ3在SQuAD上预训练在多大程度上提升了文档视觉问答的性能?仅在DocVQA上微调的效果如何?
  • RQ4在需要文档级推理的问题中,布局与结构信息的整合有多关键?
  • RQ5在通用视觉问答或文本问答数据集上训练的模型,能否有效处理DocVQA中所需的开放式、文档特定的推理任务?

主要发现

  • 表现最佳的模型——在SQuAD和DocVQA上均微调的BERT-Large——在测试集上达到55.77%的精确匹配准确率,远低于人类水平的94.36%。
  • 在SQuAD上预训练并在DocVQA上微调的模型优于仅在DocVQA上训练的模型,表明大规模阅读理解预训练具有显著优势。
  • 在视觉问答基线模型中,M4C表现最佳,测试集ANLS达0.665,但仍落后于基于BERT的模型。
  • OCR子串匹配基线模型准确率超过85%,但因偶然匹配(如‘2020’中的‘2’被误认为答案‘2’)导致大量误报。
  • 不同问题类型的表现差异显著:模型在基于布局的问题上(如识别表格结构或图表位置)表现最差,而在直接文本提取任务上表现更好。
  • 人类表现各类问题上保持一致,而模型表现差异极大,表明当前模型在推理类型之间缺乏泛化能力,尤其在需要结构理解的任务上。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。