[论文解读] PICK: Processing Key Information Extraction from Documents using Improved Graph Learning-Convolutional Networks
PICK 提出了一种基于图的新型框架,用于从文档中进行关键信息抽取(KIE),通过将改进的图学习与图卷积网络(GCN)相结合,自动利用文本、视觉和布局特征建模文本段落之间的关系。该方法在真实世界数据集(如 SROIE 和医疗发票)上实现了最先进性能,mEF 分数分别达到 96.1 和 87.0。
Computer vision with state-of-the-art deep learning models has achieved huge success in the field of Optical Character Recognition (OCR) including text detection and recognition tasks recently. However, Key Information Extraction (KIE) from documents as the downstream task of OCR, having a large number of use scenarios in real-world, remains a challenge because documents not only have textual features extracting from OCR systems but also have semantic visual features that are not fully exploited and play a critical role in KIE. Too little work has been devoted to efficiently make full use of both textual and visual features of the documents. In this paper, we introduce PICK, a framework that is effective and robust in handling complex documents layout for KIE by combining graph learning with graph convolution operation, yielding a richer semantic representation containing the textual and visual features and global layout without ambiguity. Extensive experiments on real-world datasets have been conducted to show that our method outperforms baselines methods by significant margins. Our code is available at https://github.com/wenwenyu/PICK-pytorch.
研究动机与目标
- 通过利用文本和视觉特征,解决从具有复杂布局的文档中提取关键信息的挑战。
- 克服现有 KIE 方法将文档视为线性序列或依赖手工设计图结构的局限性。
- 开发一种稳健的端到端框架,无需事先了解边类型或邻接矩阵,自动学习文档结构。
- 通过自适应图构建和更丰富的语义表示,提升在固定布局和可变布局文档上的性能。
- 证明视觉特征和图学习在减少关键信息抽取过程中的歧义性方面的作用。
提出的方法
- 受 [11] 启发,引入一个图学习模块,自动学习一个软邻接矩阵,基于视觉和文本特征捕捉文本节点之间的动态关系。
- 将文本、图像和位置特征融合为文档中每个检测到的文本段的统一节点表示。
- 在动态学习的图结构上应用图卷积网络(GCN),以在整个文档中传播和优化节点表示。
- 使用解码器头进行字符级序列标注,以预测关键字段实体,支持端到端训练。
- 采用可学习的图结构,避免了手动预定义边或全连接图的需求,从而减少噪声和冗余。
- 通过序列标注的交叉熵损失进行模型优化,并通过消融研究验证各组件的贡献。
实验结果
研究问题
- RQ1端到端的 KIE 框架是否能够在不依赖手工设计图结构的情况下,自动学习文档中文本段之间的有意义关系?
- RQ2所提出的图学习模块在可变布局和固定布局文档上的 KIE 性能提升方面有多有效?
- RQ3视觉特征(例如字体颜色、背景)在减少关键信息抽取中的歧义性方面发挥了多大作用?
- RQ4KIE 任务中图卷积层的最佳深度是多少?更深层次的架构是否会引发过拟合?
- RQ5与现有最先进模型(如 LayoutLM)相比,所提出方法在性能和效率方面表现如何?
主要发现
- 与基线相比,PICK 在医疗发票数据集上的 mEF 提升了 14.7%,其中发票号码提取的增益最大,凸显了视觉特征的价值。
- 在火车票数据集上,PICK 实现了接近满分的 mEF 得分(98.6),表明其在固定布局文档上表现强劲,归因于有效的图结构学习。
- 移除图像段落后,医疗发票的 mEF 下降 0.9 分,火车票数据集下降 0.4 分,证实视觉特征在消歧过程中的重要性。
- 移除图学习模块后,医疗发票的 mEF 下降 1.6 分,火车票数据集下降 0.7 分,证明其在处理复杂布局中的关键作用。
- 对 GCN 深度的消融实验表明,1 层或 2 层模型优于更深的模型(3–4 层),表明深度增加会带来过拟合风险。
- 完整模型仅使用官方训练数据,在 SROIE 上达到 96.1 的 mEF,优于使用额外预训练数据和类别监督的 LayoutLM。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。