Skip to main content
QUICK REVIEW

[论文解读] End-to-End Information Extraction by Character-Level Embedding and Multi-Stage Attentional U-Net

Tuan Anh Dang, Dat Nguyen|arXiv (Cornell University)|Jun 2, 2021
Handwritten Text Recognition Techniques被引用 11
一句话总结

本文提出了一种新型端到端深度学习架构——多阶段注意力U-Net(MSAU),用于使用2D字符网格嵌入进行文档图像信息抽取。通过整合多阶段编码器-解码器、自注意力机制和框卷积,MSAU在日文发票数据集上实现了87.2%的mIOU,较基线U-Net高出6.5%,同时参数量减少40%,并在低数据和高OCR错误条件下表现出强鲁棒性。

ABSTRACT

Information extraction from document images has received a lot of attention recently, due to the need for digitizing a large volume of unstructured documents such as invoices, receipts, bank transfers, etc. In this paper, we propose a novel deep learning architecture for end-to-end information extraction on the 2D character-grid embedding of the document, namely the extit{Multi-Stage Attentional U-Net}. To effectively capture the textual and spatial relations between 2D elements, our model leverages a specialized multi-stage encoder-decoders design, in conjunction with efficient uses of the self-attention mechanism and the box convolution. Experimental results on different datasets show that our model outperforms the baseline U-Net architecture by a large margin while using 40\% fewer parameters. Moreover, it also significantly improved the baseline in erroneous OCR and limited training data scenario, thus becomes practical for real-world applications.

研究动机与目标

  • 为解决模板化方法和启发式方法在处理具有复杂布局的可变格式文档时的局限性。
  • 通过利用编码文本与空间特征的2D字符网格表示,提升从文档图像中进行端到端信息抽取的性能。
  • 设计一种对OCR错误和有限训练数据具有鲁棒性的深度学习模型,以满足真实场景部署的关键需求。
  • 通过多阶段训练范式分离文本与空间推理,增强特征学习能力。
  • 验证自注意力机制、框卷积和多阶段学习在建模复杂文档布局方面的有效性。

提出的方法

  • 模型使用文档图像的2D字符网格表示,以编码局部纹理与全局空间结构。
  • 采用多阶段编码器-解码器架构,将早期阶段的文本特征学习与后期阶段的空间关系建模相分离。
  • 在字符网格的跨空间位置上应用自注意力机制,以捕捉长距离依赖关系。
  • 通过学习具有空间结构的滤波器,框卷积层扩展了感受野,提升了对布局模式的空间推理能力。
  • 采用多任务训练方案并引入辅助损失,以监督中间层特征,增强特征学习与泛化能力。
  • 通过数据增强与端到端可微训练,实现所有组件在标注文档数据监督下的联合优化。

实验结果

研究问题

  • RQ1与标准U-Net相比,多阶段编码器-解码器架构是否能提升文档级信息抽取的性能?
  • RQ2自注意力机制与框卷积在2D字符网格中建模长距离空间与文本依赖关系方面有多有效?
  • RQ3在低数据与高OCR错误条件下,采用辅助监督的多阶段训练是否能增强模型泛化能力?
  • RQ4组件消融实验(如注意力机制、框卷积)在复杂布局上的性能提升中贡献程度如何?
  • RQ5在真实世界的文档信息抽取场景中,参数更少的模型是否能超越更大的基线模型(如U-Net)?

主要发现

  • 所提出的MSAU模型在日文发票数据集上实现了87.2%的mIOU,较基线U-Net高出6.5%。
  • MSAU在F1-score上比基线U-Net高出8.2%(96.0 vs. 87.3),同时参数量减少40%。
  • 引入多阶段训练后,mIOU相比CUNet+NL+BC配置提升了3%,证明其在特征解耦方面的有效性。
  • 框卷积显著提升了性能,尤其在与多阶段学习结合时,较基线U-Net的mIOU提升了3%。
  • 在低数据场景下,模型表现出强鲁棒性,辅助损失在低数据条件下带来了更大的性能增益。
  • 消融实验确认,自注意力机制、框卷积与多阶段设计均对最终性能提升有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。