[论文解读] LAMBERT: Layout-Aware (Language) Modeling for information extraction
LAMBERT 是一种布局感知的语言模型,通过将标记的边界框坐标注入输入嵌入,增强了 RoBERTa 模型,从而在不使用原始图像的情况下实现对文档布局的上下文理解。它在关键信息抽取任务中达到最先进性能,在 SROIE 排行榜上以 98.17 的 F1 分数排名第一,并在 Kleister NDA 数据集上将基线 RoBERTa 的 F1 分数提升了 1.92 个百分点。
We introduce a simple new approach to the problem of understanding documents where non-trivial layout influences the local semantics. To this end, we modify the Transformer encoder architecture in a way that allows it to use layout features obtained from an OCR system, without the need to re-learn language semantics from scratch. We only augment the input of the model with the coordinates of token bounding boxes, avoiding, in this way, the use of raw images. This leads to a layout-aware language model which can then be fine-tuned on downstream tasks. The model is evaluated on an end-to-end information extraction task using four publicly available datasets: Kleister NDA, Kleister Charity, SROIE and CORD. We show that our model achieves superior performance on datasets consisting of visually rich documents, while also outperforming the baseline RoBERTa on documents with flat layout (NDA \(F_{1}\) increase from 78.50 to 80.42). Our solution ranked first on the public leaderboard for the Key Information Extraction from the SROIE dataset, improving the SOTA \(F_{1}\)-score from 97.81 to 98.17.
研究动机与目标
- 解决标准 NLP 模型在捕捉视觉丰富文档中布局语义方面的局限性。
- 开发一种简单且高效的方法,将布局特征整合到预训练语言模型中,而无需从头开始训练。
- 提升在复杂布局文档(如表格、表单和法律文本)上的端到端信息抽取性能。
- 在大规模文档集合上实现无监督预训练,同时保持在平面文本文档上的性能。
- 提供一种即插即用的解决方案,通过仅使用边界框坐标,与现有 OCR 流程兼容。
提出的方法
- 将标记的 2D 边界框坐标注入 RoBERTa 的输入嵌入,同时保留原始模型架构。
- 在自注意力机制中引入相对 2D 位置偏置,以建模标记之间的空间关系。
- 使用适配器层将布局嵌入投影到模型的隐藏维度,实现对布局与语义特征的可控融合。
- 在包含 200 万页视觉丰富文档的高质量且多样化的数据集上,以无监督方式训练模型。
- 在下游信息抽取任务上对布局增强模型进行微调,而无需布局标注。
- 通过消融研究评估布局嵌入类型、维度以及训练数据规模的影响,以隔离布局特征的作用。
实验结果
研究问题
- RQ1将边界框坐标注入预训练的 RoBERTa 模型,是否能显著提升在视觉复杂文档上的信息抽取性能?
- RQ2布局特征的引入对具有平面线性布局的文档性能有何影响?
- RQ3在基于 Transformer 的架构中,通过绝对布局嵌入、相对注意力偏置或两者结合的方式,哪种布局信息整合方式最为理想?
- RQ4布局增强模型的性能是否会随着更大规模、高质量的无监督预训练数据集而提升?
- RQ5适配器层如何影响模型在平衡语义与布局表征方面的能力?
主要发现
- LAMBERT 在 SROIE 数据集上实现了 98.17 的最先进 F1 分数,超越了此前的 SOTA 水平(97.81)。
- 在 Kleister NDA 数据集上,LAMBERT 将 F1 分数从基线 RoBERTa 的 78.50 提升至 80.42,提升了 1.92 个百分点。
- 该模型在所有四个评估数据集上均优于 RoBERTa,包括表单和法律合同等视觉丰富的文档。
- 消融研究显示,结合序列嵌入与布局嵌入,并采用相对 2D 注意力偏置可获得最佳结果,在 SROIE* 和 CORD 上具有统计显著性。
- 使用更大规模(7500 万页)且经过筛选的预训练数据集,在 Kleister Charity 和 SROIE* 上带来了显著的性能提升,表明数据质量和规模至关重要。
- 在 Kleister Charity 上,使用 768 维布局嵌入且无适配器层的模型优于其他配置,表明当无需适配器时,直接注入布局信号可能更具有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。