Skip to main content
QUICK REVIEW

[论文解读] Document Visual Question Answering Challenge 2020

Minesh Mathew, Rubèn Tito|arXiv (Cornell University)|Aug 20, 2020
Multimodal Machine Learning Applications参考文献 6被引用 10
一句话总结

本文介绍了2020年文档视觉问答(DocVQA)挑战赛,提出两项任务:单文档图像上的视觉问答(任务1)以及文档图像集合上的视觉问答(任务2)。该研究提出了一项新基准,任务1包含12,767张文档图像中的50,000组问题-答案对,任务2包含14,362份模板匹配的美国候选人登记表,顶级提交结果在ANLS评分上达到0.85,在MAP上达到0.8090,达到当前最先进水平。

ABSTRACT

This paper presents results of Document Visual Question Answering Challenge organized as part of "Text and Documents in the Deep Learning Era" workshop, in CVPR 2020. The challenge introduces a new problem - Visual Question Answering on document images. The challenge comprised two tasks. The first task concerns with asking questions on a single document image. On the other hand, the second task is set as a retrieval task where the question is posed over a collection of images. For the task 1 a new dataset is introduced comprising 50,000 questions-answer(s) pairs defined over 12,767 document images. For task 2 another dataset has been created comprising 20 questions over 14,362 document images which share the same document template.

研究动机与目标

  • 建立一个大规模文档图像视觉问答基准,填补文档特定视觉问答研究的空白。
  • 评估模型在单文档图像上的抽取式问答与文档集合上的检索式视觉问答中的表现。
  • 通过在统一的视觉问答框架中整合场景文本识别与视觉推理,推动文档理解研究。
  • 提供标准化的评估协议,采用ANLS与MAP指标,实现方法间的一致性比较。

提出的方法

  • 对于任务1,方法涉及训练模型直接从单个文档图像中的可见文本中提取答案,采用问题-答案对格式。
  • 挑战赛使用平均归一化莱文施泰因相似度(ANLS)作为主要评估指标,以衡量答案准确性。
  • 对于任务2,方法基于问题相关性从大规模文档图像集合中检索相关文档图像,性能通过平均平均精度(MAP)衡量。
  • 系统通过确保得分相同的正样本文档被置于排序末尾,避免默认排序带来的偏差。
  • 数据集包含9种问题类型(例如:表格/列表、布局、手写体等),以评估模型在不同文档结构上的泛化能力。
  • 所有文档均提供商业OCR转录结果,以支持模型训练与评估。

实验结果

研究问题

  • RQ1当答案严格源自可见文本时,模型在单文档图像上的抽取式视觉问答表现如何?
  • RQ2在回答问题时,视觉问答模型从大规模文档集合中检索相关文档的表现如何?
  • RQ3不同问题类型(如表格、手写体等)如何影响文档视觉问答模型的性能?
  • RQ4OCR转录结果在多大程度上提升了文档图像视觉问答的性能?
  • RQ5当同一表格以不同方式填写(如打印体与手写体)时,模型能否在文档模板间实现泛化?

主要发现

  • 任务1中表现最佳的方法ANLS得分为0.85,显著优于基线模型。
  • 任务2中获胜方法(平安集团的DQA)MAP得分为0.8090,展现出优异的检索性能。
  • 所有提交方法均未为任务2的问题提供答案,表明尽管检索性能强劲,但在答案生成方面仍存在明显差距。
  • 表现最佳的模型在各类问题类型上均展现出良好泛化能力,最佳方法在“表格/列表”和“布局”类问题上均取得高ANLS得分。
  • 顶尖模型与基线模型之间的性能差距显著,最佳模型在ANLS上比最弱模型高出0.5以上。
  • 尽管使用了商业OCR转录结果,性能差距仍未完全弥合,表明视觉推理与版面理解仍是关键挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。