[论文解读] LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding
LayoutXLM 是一个多模态的预训练模型,用于多语言的视觉丰富文档理解,介绍 XFUND 用于表单理解,并在多语言基准上达到先进水平。
Multimodal pre-training with text, layout, and image has achieved SOTA performance for visually-rich document understanding tasks recently, which demonstrates the great potential for joint learning across different modalities. In this paper, we present LayoutXLM, a multimodal pre-trained model for multilingual document understanding, which aims to bridge the language barriers for visually-rich document understanding. To accurately evaluate LayoutXLM, we also introduce a multilingual form understanding benchmark dataset named XFUND, which includes form understanding samples in 7 languages (Chinese, Japanese, Spanish, French, Italian, German, Portuguese), and key-value pairs are manually labeled for each language. Experiment results show that the LayoutXLM model has significantly outperformed the existing SOTA cross-lingual pre-trained models on the XFUND dataset. The pre-trained LayoutXLM model and the XFUND dataset are publicly available at https://aka.ms/layoutxlm.
研究动机与目标
- 通过利用文本、布局和图像模态来架起 Visually-rich Document Understanding (VrDU) 的语言桥梁。
- 在大规模真实世界文档上预训练一个多语言模型,以捕捉跨语言和跨模态信号。
- 创建并发布 XFUND,一个在 7 种语言中具有键值注释的多语言表单理解数据集。
- 证明多模态预训练能够提升表单理解任务的跨语言迁移和多任务性能。
提出的方法
- 采用多模态 Transformer 架构,使用文本、布局和视觉嵌入来编码文本、布局和图像特征。
- 在 LayoutLMv2 的基础上扩展,采用来自 InfoXLM 的多语言预训练初始化以及一个视觉骨干网络(ResNeXt101-FPN)。
- 使用三个预训练目标:Multilingual Masked Visual-Language Modeling (MMVLM)、Text-Image Alignment (TIA) 和 Text-Image Matching (TIM)。
- 对于 MMVLM,令牌边界在字符级别使用 SentencePiece 定义,通过边界框聚合来统一多语言输入。
- 训练数据包含 30 million 文档(总计 30M:22M 多语言数字原生 PDF 和 8M 扫描的英文 IIT-CDIP 文档)。
实验结果
研究问题
- RQ1一个多模态多语言模型能否有效地学习用于视觉丰富文档的跨语言和跨领域表示?
- RQ2将布局和图像信息结合是否能在跨语言的表单理解中超过仅文本模型?
- RQ3在零-shot 和多任务设置下,跨语言迁移在多语言表单理解中的效果如何?
主要发现
- LayoutXLM LARGE 在 XFUND 上的 SER 和 RE 上达到最高的 F1,相较于 XLM-RoBERTa 和 InfoXLM 基线。
- 在语言特定微调中,LayoutXLM LARGE 在所有八种语言设置的 SER 和 RE 上都优于基线。
- 在零-shot 迁移(在英文 FUNSD 上训练,在其他语言测试)中,LayoutXLM 通过利用布局不变性显著优于基于文本的模型。
- 跨八种语言的多任务微调相较于语言特定微调进一步提高了性能,证明了多语言学习的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。