Skip to main content
QUICK REVIEW

[论文解读] Robust Layout-aware IE for Visually Rich Documents with Pre-trained Language Models

Mengxi Wei, Yifan He|arXiv (Cornell University)|May 22, 2020
Multimodal Machine Learning Applications参考文献 36被引用 4
一句话总结

该论文提出了一种图神经网络增强的 RoBERTa 模型,用于从视觉丰富的文档(VRDs)中进行鲁棒、布局感知的信息抽取(IE),整合了文本、布局、字体和结构特征。在发票和简历数据集上,分别实现了 6.3% 和 4.7% 的绝对 F1 提升,并通过新颖的领域内微调目标,在少样本设置下将标注需求减少了最多 30 倍。

ABSTRACT

Many business documents processed in modern NLP and IR pipelines are visually rich: in addition to text, their semantics can also be captured by visual traits such as layout, format, and fonts. We study the problem of information extraction from visually rich documents (VRDs) and present a model that combines the power of large pre-trained language models and graph neural networks to efficiently encode both textual and visual information in business documents. We further introduce new fine-tuning objectives to improve in-domain unsupervised fine-tuning to better utilize large amount of unlabeled in-domain data. We experiment on real world invoice and resume data sets and show that the proposed method outperforms strong text-based RoBERTa baselines by 6.3% absolute F1 on invoices and 4.7% absolute F1 on resumes. When evaluated in a few-shot setting, our method requires up to 30x less annotation data than the baseline to achieve the same level of performance at ~90% F1.

研究动机与目标

  • 通过利用文本之外的视觉布局、字体和结构线索,提升在发票和简历等视觉丰富的文档(VRDs)中的信息抽取(IE)性能。
  • 解决仅依赖文本的模型忽略布局语义的问题,从而在领域特定、视觉复杂的文档上提升性能。
  • 通过使用未标注的领域内数据引入布局感知的领域内微调目标,减少对大规模标注数据的依赖。
  • 通过更优的布局编码和无监督预训练,提升模型泛化能力,实现鲁棒的少样本学习。
  • 使用多关系图神经网络建模多样的布局语义,如章节标题、邻近关系和字体变化。

提出的方法

  • 使用 RoBERTa 作为文本编码器,从文档文本中捕获深层上下文表征。
  • 构建异构图,其中节点代表文本框,边编码多种布局关系,包括邻接关系和章节标题连接。
  • 将边界框坐标、字体大小和字体类型等视觉特征融入节点嵌入,以增强布局语义。
  • 采用支持多种边类型的 GCN 消息传递机制,使模型能够从多样的布局模式中学习。
  • 引入两种领域内微调目标:序列位置关系分类(SPRC)用于学习布局关系,掩码语言建模(MLM)用于保持语义理解。
  • 通过类别平衡采样应用 SPRC,以应对简历中布局关系分布不均的问题,提升泛化能力。

实验结果

研究问题

  • RQ1将丰富的布局语义(超越边界框)整合进来,是否能提升在视觉丰富文档上的信息抽取性能?
  • RQ2图神经网络在建模文档中复杂的布局关系(如章节标题和基于字体的格式)方面有多有效?
  • RQ3在少样本 IE 设置中,布局感知的领域内微调能在多大程度上减少对标注数据的需求?
  • RQ4将预训练语言模型与布局感知图编码器结合,是否能优于仅依赖文本的基线模型,在真实业务文档上取得更好性能?
  • RQ5在提升实体抽取准确率方面,哪些布局特征——位置、字体、章节结构——贡献最为显著?

主要发现

  • 在发票数据集上,所提模型相比 RoBERTa 基线实现了 6.3% 的绝对 F1 提升,在简历数据集上提升了 4.7%。
  • 在简历数据集上,当同时使用 MLM 和 SPRC 微调目标时,模型达到 72.13 的 F1,优于单一目标或基线方法。
  • 消融实验表明,移除章节标题边会使 F1 下降 0.8 分,凸显其在建模文档结构中的重要性。
  • 将字体特征融入节点嵌入可使性能提升 0.5 F1 分,证明其在区分内容类型方面的价值。
  • 移除 GCN 层之间的跳跃连接会导致 F1 下降 0.4 分,表明深层图学习受益于残差连接。
  • 在少样本设置下,模型在仅需 RoBERTa 基线 1/30 标注数据的情况下,F1 达到约 90%,证明其具有强大的数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。