Skip to main content
QUICK REVIEW

[论文解读] DocTr: Document Transformer for Structured Information Extraction in Documents

Haofu Liao, Aruni RoyChowdhury|arXiv (Cornell University)|Jul 16, 2023
Natural Language Processing Techniques被引用 4
一句话总结

本文提出DocTr,一种文档转换器模型,将结构化信息抽取(SIE)建模为基于锚点的物体检测任务,通过锚点词和边界框表示实体,以减少对文本顺序的依赖并简化实体链接。该方法在三个SIE基准上优于现有的IOB和图神经网络方法,在使用新型掩码检测建模预训练任务的CORD收据解析任务中达到94.4%的F1分数。

ABSTRACT

We present a new formulation for structured information extraction (SIE) from visually rich documents. It aims to address the limitations of existing IOB tagging or graph-based formulations, which are either overly reliant on the correct ordering of input text or struggle with decoding a complex graph. Instead, motivated by anchor-based object detectors in vision, we represent an entity as an anchor word and a bounding box, and represent entity linking as the association between anchor words. This is more robust to text ordering, and maintains a compact graph for entity linking. The formulation motivates us to introduce 1) a DOCument TRansformer (DocTr) that aims at detecting and associating entity bounding boxes in visually rich documents, and 2) a simple pre-training strategy that helps learn entity detection in the context of language. Evaluations on three SIE benchmarks show the effectiveness of the proposed formulation, and the overall approach outperforms existing solutions.

研究动机与目标

  • 解决IOB标注和图神经网络方法在视觉丰富文档中进行结构化信息抽取时的局限性。
  • 通过将实体建模为锚点词和边界框,减少对正确文本阅读顺序的依赖。
  • 通过锚点词关联的紧凑图结构简化实体链接。
  • 通过针对边界框和文本预测量身定制的新预训练任务,提升文档理解能力。
  • 开发一种统一的视觉-语言模型,通过语言条件查询联合检测实体并完成链接。

提出的方法

  • 将SIE建模为基于锚点的检测问题:每个实体由一个锚点词和一个边界框表示,实体链接则建模为锚点词之间的关联。
  • 提出DocTr,一种视觉-语言Transformer模型,结合视觉编码器、语言编码器和视觉-语言解码器,采用语言条件查询(LCQ)实现从OCR到输出的一对一映射。
  • 提出掩码检测建模(MDM),一种预训练任务,同时对OCR文本和边界框进行掩码,要求模型预测被掩码的词及其位置。
  • 在预训练和微调过程中使用多任务损失,结合检测损失(用于边界框)和语言建模损失(用于文本)。
  • 在交叉注意力层中应用语言条件查询(LCQ),以引导模型将OCR标记与预测的实体框对齐。
  • 在下游SIE任务上使用标准的检测头和分类头对模型进行微调。

实验结果

研究问题

  • RQ1与IOB标注相比,基于检测的SIE建模是否能显著降低对输入文本顺序的依赖?
  • RQ2与复杂的图神经网络方法相比,通过锚点词关联建模实体链接是否能提升解码的鲁棒性?
  • RQ3一种同时掩码文本和边界框的预训练任务(MDM)是否能提升文档中实体检测与定位的性能?
  • RQ4在统一的Transformer架构中,视觉与语言建模的融合在文档理解任务中有多高效?
  • RQ5使用语言条件查询在多大程度上增强了OCR标记与预测实体框之间的对齐能力?

主要发现

  • 所提出的基于锚点的建模方法在所有三个SIE基准上均优于IOB标注和图神经网络方法,在CORD收据解析任务中达到94.4%的F1分数。
  • 掩码检测建模(MDM)预训练任务显著提升了性能,优于无预训练和MVLM预训练,尤其在边界框预测方面表现突出。
  • 包含视觉编码器、语言编码器和视觉-语言解码器的完整DocTr模型在CORD上达到94.4%的F1分数,较MVLM预训练提升4.1%。
  • 消融实验证明,视觉编码器和语言条件查询(LCQ)至关重要,LCQ在ELB上提升1.3%,在ELK上提升1.1%。
  • 该模型在不同文档类型上泛化能力良好,在FUNSD(ELB上84.0% F1)和CORD(解析任务上94.4% F1)上表现优异,即使锚点词按实体类型变化也保持稳定。
  • 示例预测显示,模型能有效利用视觉上下文准确预测被掩码的词和边界框,包括价格等非文本值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。