[论文解读] StructuralLM: Structural Pre-training for Form Understanding
StructuralLM 通过将单元格建模为语义单元,结合单元级 2D 位置嵌入和一种新型的单元位置分类预训练目标,提出了一种用于表格和文档理解的新型预训练方法。该方法在表格理解(85.14 F1)、文档 VQA(83.94 F1)和文档图像分类(96.08 准确率)任务中均取得了最先进性能,通过联合建模单元和布局表征,无需依赖图像特征,超越了 LayoutLM 等基线模型。
Large pre-trained language models achieve state-of-the-art results when fine-tuned on downstream NLP tasks. However, they almost exclusively focus on text-only representation, while neglecting cell-level layout information that is important for form image understanding. In this paper, we propose a new pre-training approach, StructuralLM, to jointly leverage cell and layout information from scanned documents. Specifically, we pre-train StructuralLM with two new designs to make the most of the interactions of cell and layout information: 1) each cell as a semantic unit; 2) classification of cell positions. The pre-trained StructuralLM achieves new state-of-the-art results in different types of downstream tasks, including form understanding (from 78.95 to 85.14), document visual question answering (from 72.59 to 83.94) and document image classification (from 94.43 to 96.08).
研究动机与目标
- 为解决现有预训练模型仅关注文本、忽略扫描文档中单元格级布局结构的局限性。
- 通过将同一单元格内的词语视为语义单元而非孤立标记,提升表格理解性能。
- 通过引入单元级 2D 位置嵌入和一种新型的单元位置分类预训练目标,增强单元格与布局之间的交互。
- 在不依赖图像特征的前提下,实现在下游文档理解任务中的最先进性能。
提出的方法
- StructuralLM 使用基于 BERT 的 Transformer 编码器,引入单元级 2D 位置嵌入,同一单元格内的所有标记共享相同的 2D 位置嵌入。
- 在每个单元格内部保留 1D 位置嵌入,以保持单元格内标记的顺序关系。
- 提出一种新型预训练目标——单元位置分类:对部分单元格的 2D 位置进行掩码,并训练模型预测这些被掩码的单元格属于 N 个大小相等的区域中的哪一个。
- 模型在大规模未标注文档图像上进行预训练,采用掩码视觉-语言建模目标和单元位置分类目标。
- 与 LayoutLM 不同,StructuralLM 在编码器中省略了图像嵌入,从而提升效率并更直接适用于现实世界文档任务。
- 模型在下游任务(如表格理解、文档 VQA 和文档图像分类)上进行微调。
实验结果
研究问题
- RQ1与基于词的建模相比,将单元格作为语义单元进行建模是否能提升表格和文档理解任务的性能?
- RQ2单元位置分类目标在捕捉单元格与布局结构之间空间关系方面的有效性如何?
- RQ3联合建模单元级语义与 2D 布局信息是否能提升在表格、表单等多样化文档类型上的泛化能力?
- RQ4一个不依赖图像特征的预训练模型是否仍能在文档理解任务中达到最先进性能?
主要发现
- StructuralLM 在表格理解任务上取得了 85.14 的新最先进 F1 分数,相较于 LayoutLM 的 78.95 显著提升。
- 文档视觉问答性能提升至 83.94 F1,高于 LayoutLM 的 72.59。
- 在文档图像分类任务中,StructuralLM 达到 96.08 的准确率,显著优于 LayoutLM 的 94.43。
- 在所有三个基准数据集上,该模型均超越了强基线模型,证明了单元级布局建模的有效性。
- 定性分析表明,StructuralLM 能够将同一单元格中的完整实体(如“Call Connie Drath or Carol Musgrave at 800/424-9876”)正确预测为单一单位,而 LayoutLM 则会将其拆分。
- 消融实验确认,单元级 2D 位置嵌入和单元位置分类目标对性能提升均有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。