Skip to main content
QUICK REVIEW

[论文解读] Kleister: Key Information Extraction Datasets Involving Long Documents with Complex Layouts

Tomasz Stanisławek, Filip Graliński|arXiv (Cornell University)|May 12, 2021
Advanced Text Analysis Techniques参考文献 22被引用 63
一句话总结

本文介绍了 Kleister NDA 和 Kleister Charity 两个新数据集,用于从长篇、布局复杂的正式结构化文档中进行关键信息抽取(KIE)。这两个数据集包含 540 份 NDA 合同和 2,788 份慈善机构报告,共计 64,872 页和 23,772 个实体。表现最佳的模型在两个数据集上的 F1 分数分别达到 81.77% 和 83.57%,凸显了在布局感知、文档级信息抽取方面超越标准命名实体识别(NER)任务的挑战。

ABSTRACT

The relevance of the Key Information Extraction (KIE) task is increasingly important in natural language processing problems. But there are still only a few well-defined problems that serve as benchmarks for solutions in this area. To bridge this gap, we introduce two new datasets (Kleister NDA and Kleister Charity). They involve a mix of scanned and born-digital long formal English-language documents. In these datasets, an NLP system is expected to find or infer various types of entities by employing both textual and structural layout features. The Kleister Charity dataset consists of 2,788 annual financial reports of charity organizations, with 61,643 unique pages and 21,612 entities to extract. The Kleister NDA dataset has 540 Non-disclosure Agreements, with 3,229 unique pages and 2,160 entities to extract. We provide several state-of-the-art baseline systems from the KIE domain (Flair, BERT, RoBERTa, LayoutLM, LAMBERT), which show that our datasets pose a strong challenge to existing models. The best model achieved an 81.77% and an 83.57% F1-score on respectively the Kleister NDA and the Kleister Charity datasets. We share the datasets to encourage progress on more in-depth and complex information extraction tasks.

研究动机与目标

  • 为长篇、布局复杂的正式结构化文档中的关键信息抽取(KIE)提供大规模、真实的基准数据集,以弥补现有研究的不足。
  • 弥合现有公开 KIE 数据集与真实世界商业文档处理需求之间的差距,特别是针对合同和财务报告的处理。
  • 在包含 OCR 噪声和文档长度等现实条件下的文档级、布局感知信息抽取任务中,评估最先进 NLP 模型的性能。
  • 提供一种半监督数据收集方法,以减少人工标注工作量,同时保持高质量的实体标注。

提出的方法

  • 采用半监督方法收集数据集,结合从公开存储库自动获取文档与针对关键实体的定向人工标注。
  • 对于 Kleister NDA 数据集,使用专用工具(如 pdf2djvu)处理原生数字 PDF 文件,以保留布局结构;而慈善机构数据集因输入为扫描件,需依赖 OCR 处理。
  • 评估了多种 PDF 处理工具——Azure Cognitive Services、Tesseract、Textract 和 pdf2djvu——每种工具对模型性能均有显著影响。
  • 在两个数据集上训练并评估了多种基线模型,包括 Flair、BERT、RoBERTa、LayoutLM 和 LAMBERT,分别使用纯文本特征和布局感知特征。
  • 采用基于正则表达式的自动标注机制生成训练数据,随后通过人工标注的实体跨度对模型进行微调。
  • 显式建模了归一化任务,例如根据上下文推断货币单位(如千分位、百万分位),该任务被证明对金融类实体至关重要。

实验结果

研究问题

  • RQ1文档长度和布局复杂度在多大程度上影响最先进 KIE 模型的性能?
  • RQ2OCR 质量和 PDF 处理管道的选择在多大程度上影响真实世界 KIE 任务中的模型性能?
  • RQ3布局感知模型(如 LayoutLM 和 LAMBERT)是否能在复杂文档理解任务中超越标准序列模型?
  • RQ4归一化任务(如推断货币单位)如何影响 KIE 性能?其对模型设计有何影响?
  • RQ5在从长篇、正式结构化文档中抽取关键实体时,文本特征、结构特征和布局特征的相对贡献是什么?

主要发现

  • 表现最佳的模型 LAMBERT 在 Kleister Charity 数据集上取得 83.57% 的 F1 分数,在 Kleister NDA 数据集上取得 81.77% 的 F1 分数,显著低于其在 SROIE 等更简单数据集上的表现。
  • 布局感知模型(如 LAMBERT、LayoutLM)优于标准序列模型(Flair、BERT、RoBERTa),证明了二维布局特征的重要性。
  • OCR 质量具有显著影响:商业工具(如 Azure Cognitive Services 和 Textract)优于 Tesseract,尤其对未在 Tesseract 输出上进行训练的 1D 模型影响更大。
  • 所有模型在更长文档上均表现出更低的 F1 分数,表明随着文档长度增加,性能持续下降。
  • 归一化任务(如推断货币规模)至关重要,且通常需要上下文感知推理,即使表现最佳的模型也难以处理。
  • 自动标注机制虽不如人工标注准确,但可有效用于预训练,且表明仅靠基于规则的启发式方法不足以处理如缩写组织名称等复杂实体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。