[论文解读] Kleister: A novel task for Information Extraction involving Long Documents with Complex Layout
本文提出了Kleister,一项专为长篇、复杂版式文档(如合同和慈善报告)设计的新信息抽取任务,结合了文本与版式结构特征。研究构建了两个新数据集(Kleister-NDA 和 Kleister-Charity),使用NLP模型(Flair、BERT、RoBERTa)评估了纯文本基线模型的性能,并表明OCR噪声和版式复杂性会显著降低模型表现,凸显了超越纯文本处理的多模态方法的必要性。
State-of-the-art solutions for Natural Language Processing (NLP) are able to capture a broad range of contexts, like the sentence-level context or document-level context for short documents. But these solutions are still struggling when it comes to longer, real-world documents with the information encoded in the spatial structure of the document, such as page elements like tables, forms, headers, openings or footers; complex page layout or presence of multiple pages. To encourage progress on deeper and more complex Information Extraction (IE) we introduce a new task (named Kleister) with two new datasets. Utilizing both textual and structural layout features, an NLP system must find the most important information, about various types of entities, in long formal documents. We propose Pipeline method as a text-only baseline with different Named Entity Recognition architectures (Flair, BERT, RoBERTa). Moreover, we checked the most popular PDF processing tools for text extraction (pdf2djvu, Tesseract and Textract) in order to analyze behavior of IE system in presence of errors introduced by these tools.
研究动机与目标
- 为解决现有NLP系统在从具有复杂版式的实际长文档(如合同和报告)中提取结构化信息方面的不足。
- 提出一项新的基准任务——Kleister,以捕捉真实世界中的挑战,包括版式复杂性、OCR噪声、文档级推理和标准化问题。
- 评估纯文本NLP模型在处理版式感知和OCR鲁棒性信息抽取任务时的局限性。
- 提供公开可获取的数据集(Kleister-NDA 和 Kleister-Charity),包含详细标注,用于训练和评估鲁棒的信息抽取系统。
- 证明即使采用先进的模型架构(如BERT和RoBERTa),当前最先进NLP模型在面对版式和OCR伪影时仍无法泛化。
提出的方法
- 提出一项新任务Kleister,专注于从具有复杂版式的长文档(如表格、表单、页眉页脚)中提取结构化实体(如日期、地址、组织名称)。
- 构建两个新数据集:Kleister-NDA(200份法律合同)和Kleister-Charity(200份慈善报告),标注了实体类型和归一化值。
- 采用Pipeline方法作为纯文本基线,对通过PDF工具(Tesseract、Textract、pdf2djvu)提取的文本应用命名实体识别模型(Flair、BERT、RoBERTa)。
- 评估不同PDF提取工具对性能的影响,以分析OCR错误对下游信息抽取任务的影响。
- 在标注和评估过程中整合文档级上下文、业务逻辑(如解析模糊的实体引用)和归一化规则(如日期格式、'Ltd'与'Limited'的转换)。
- 通过将文档分类为简单、双栏、邮件、纯文本以及含图形和表格的表单/报告版式,分析版式复杂性。
实验结果
研究问题
- RQ1最先进的纯文本NLP模型在处理带有OCR伪影和版式依赖实体关系的长篇复杂版式文档时表现如何?
- RQ2常见PDF提取工具(Tesseract、Textract、pdf2djvu)在多大程度上降低了文本输入质量,并影响下游信息抽取性能?
- RQ3版式复杂性和OCR噪声在多大程度上影响真实业务文档中命名实体识别和归一化的准确性?
- RQ4在文档级推理中存在哪些关键挑战,例如在多个地址中识别正确地址(如注册地址与主要办公地址),或解释合同中同时出现的时间段?
- RQ5纯文本基线模型能否在需要空间和结构理解、超越句子级上下文的任务中实现鲁棒性能?
主要发现
- 纯文本NLP模型(Flair、BERT、RoBERTa)在Kleister任务上的表现有限,表明仅依赖纯文本输入不足以实现复杂文档的理解。
- OCR质量显著降低性能,尤其在手写体、扫描质量差或页面倒置的文档中,Kleister-Charity数据集中的表现尤为明显。
- 版式复杂性(如多栏布局、表格和表单)引入了显著挑战,即使使用先进的上下文编码器,纯文本模型也难以解决。
- 归一化问题(如日期格式差异,例如'October 24, 2012' 与 '10/24/12';组织名称变体,如'Limited'与'Limited')会降低模型准确率,需显式处理。
- Pipeline基线方法表明,性能显著受PDF提取工具影响,Tesseract和Textract在版式敏感场景下引入的错误多于pdf2djvu。
- 文档级推理(如在多个选项中识别正确地址,如注册地址与主要办公地址)在纯文本模型中处理效果极差,凸显了对版式感知建模的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。