[论文解读] MarkupLM: Pre-training of Text and Markup Language for Visually-rich Document Understanding
本文提出MarkupLM,一种多模态预训练框架,通过Transformer架构和XPath嵌入联合学习文本与标记语言表征,用于动态布局文档(如HTML/XML)的视觉丰富文档理解。通过新颖的预训练目标——掩码标记语言建模(MMLM)、节点关系预测(NRP)和标题-页面匹配(TPM)——在WebSRC和SWDE基准上超越强基线模型。
Multimodal pre-training with text, layout, and image has made significant progress for Visually Rich Document Understanding (VRDU), especially the fixed-layout documents such as scanned document images. While, there are still a large number of digital documents where the layout information is not fixed and needs to be interactively and dynamically rendered for visualization, making existing layout-based pre-training approaches not easy to apply. In this paper, we propose MarkupLM for document understanding tasks with markup languages as the backbone, such as HTML/XML-based documents, where text and markup information is jointly pre-trained. Experiment results show that the pre-trained MarkupLM significantly outperforms the existing strong baseline models on several document understanding tasks. The pre-trained model and code will be publicly available at https://aka.ms/markuplm.
研究动机与目标
- 解决基于标记的文档(如HTML/XML)中布局动态渲染且非固定的文档表征学习挑战。
- 克服现有基于布局的预训练模型(如LayoutLM)依赖显式2D布局或图像特征的局限,而这些特征在标记文档中不可用。
- 开发统一的预训练框架,整合文本、通过XPath表示的标记结构以及序列顺序,以有效建模文档语义。
- 设计针对文档中标记语言结构和语义关系的新型自监督预训练目标。
- 在下游文档理解任务(如阅读理解与数据抽取)中展示MarkupLM的有效性。
提出的方法
- 引入XPath嵌入层,表示从文档DOM树根节点到每个标记的层次路径,替代LayoutLM中使用的2D布局嵌入。
- 采用多流输入嵌入方法,结合文本嵌入、1D位置嵌入、片段嵌入和XPath嵌入,以编码文档结构。
- 提出三种预训练目标:掩码标记语言建模(MMLM),用于联合掩码和预测文本与标记标记;节点关系预测(NRP),用于预测DOM树中的父子或兄弟关系;标题-页面匹配(TPM),用于预测页面标题是否与内容匹配。
- 使用标准分类头或序列标注头对预训练的MarkupLM进行微调,以适应下游任务。
- 利用大规模未标注网页(如100万至2400万页)进行预训练,模型初始化采用BERT或RoBERTa。
- 使用标准Transformer编码器,结合多头自注意力机制和前馈网络处理输入嵌入。
实验结果
研究问题
- RQ1在动态渲染的文档(如HTML/XML)中,联合预训练文本与标记语言是否能提升文档表征学习?
- RQ2与2D布局嵌入相比,基于XPath的嵌入在捕捉标记文档中的结构关系方面效果如何?
- RQ3所提出的预训练目标(MMLM、NRP和TPM)在文档理解任务下游性能中的贡献程度如何?
- RQ4在大规模未标注网页上进行预训练是否能显著提升下游任务(如阅读理解与数据抽取)的性能?
- RQ5MarkupLM能否在不同文档类型上泛化,包括在不同设备上渲染方式多变的文档?
主要发现
- MarkupLM在WebSRC数据集上显著优于强基线模型,当结合全部三个预训练目标时,精确匹配(EM)得分提升5.3个百分点。
- 标题-页面匹配(TPM)目标对性能贡献最大,相比基线提升EM 4.6个百分点;节点关系预测(NRP)提升EM 2.4个百分点。
- 使用更强的初始化模型(RoBERTa-base而非BERT-base)带来1.9个百分点的EM提升,表明初始化质量的重要性。
- 在2400万网页上使用RoBERTa-base和全部三个目标进行训练,取得最佳性能:WebSRC开发集上EM为68.39%,F1为74.47%,POS为87.93%。
- 消融研究证实,所有三个预训练目标均有效且具有互补性,组合使用时性能最高。
- 预训练的MarkupLM模型与代码已公开发布于 https://aka.ms/markuplm,供社区使用与进一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。