[论文解读] LAMPRET: Layout-Aware Multimodal PreTraining for Document Understanding
LAMPRET 是一种分层的、布局感知的多模态预训练框架,通过使用两个级联的 Transformer 将文档建模为空间有序的内容块(文本、图像、表格)。它通过联合预训练掩码语言建模、图文匹配以及新颖的布局感知目标(块顺序预测、掩码块预测、图像适配)在文档补全任务上实现了最先进性能,展示了在文本块填充和图像建议任务中的卓越表现。
Document layout comprises both structural and visual (eg. font-sizes) information that is vital but often ignored by machine learning models. The few existing models which do use layout information only consider textual contents, and overlook the existence of contents in other modalities such as images. Additionally, spatial interactions of presented contents in a layout were never really fully exploited. To bridge this gap, we parse a document into content blocks (eg. text, table, image) and propose a novel layout-aware multimodal hierarchical framework, LAMPreT, to model the blocks and the whole document. Our LAMPreT encodes each block with a multimodal transformer in the lower-level and aggregates the block-level representations and connections utilizing a specifically designed transformer at the higher-level. We design hierarchical pretraining objectives where the lower-level model is trained similarly to multimodal grounding models, and the higher-level model is trained with our proposed novel layout-aware objectives. We evaluate the proposed model on two layout-aware tasks -- text block filling and image suggestion and show the effectiveness of our proposed hierarchical architecture as well as pretraining techniques.
研究动机与目标
- 解决现有模型在文档表示学习中忽略布局结构和多模态内容(如图像)的问题。
- 开发一种分层框架,以建模局部块级交互和全局文档级布局结构。
- 设计新颖的预训练目标,利用空间排序、块级掩码和图像适配来提升布局感知能力。
- 在真实下游任务(文本块填充和图像建议)中评估该框架,采用基于检索的设置。
- 建立一个超越单模态或模板化文档的新基准,用于多模态、布局感知的文档表示学习。
提出的方法
- 将 HTML 格式的文档解析为具有空间顺序的内容块,每个块均标注位置、语义类型和布局属性(如字体大小)。
- 使用低层级多模态 Transformer 编码单个块,结合文本和视觉特征,通过掩码语言建模(MLM)和图文匹配(ITM)进行训练。
- 使用高层级 Transformer 聚合块表示,并通过三种新颖目标建模全局布局结构:块顺序预测、掩码块预测和图像适配预测。
- 通过结合标准 NLP 目标(MLM、ITM)和布局特定目标,端到端训练分层框架,以增强结构和多模态感知能力。
- 使用对比学习目标在下游基于检索的任务上微调最终模型。
- 基于空间位置对块进行二维序列化,以在输入序列中保留布局几何信息。
实验结果
研究问题
- RQ1分层 Transformer 框架能否有效建模多模态文档中的局部块级和全局文档级布局结构?
- RQ2布局感知的预训练目标(块顺序预测、掩码块预测、图像适配)在下游文档理解任务中的贡献如何?
- RQ3与单模态或仅文本模型相比,整合多模态内容(文本、图像、表格)在多大程度上提升了文档表示能力?
- RQ4布局属性(如字体大小、空间位置)的引入在布局敏感任务上的性能影响如何?
- RQ5所提出的框架能否超越模板化文档(如收据)的限制,泛化到像维基百科页面一样内容灵活、丰富的文档?
主要发现
- 在图像建议任务中,LAMPRET 在 MRR 上达到 99.98%,在 Recall@5 上达到 98.55%,表明其在从候选集中选择正确图像方面近乎完美。
- 在文本块填充任务中,LAMPRET 的 F1 得分为 52.09,优于所有基线模型,包括单层 LayoutLM 和 CNN-Grid 模型。
- 消融研究显示,若排除块顺序预测目标,性能下降最大(F1:50.19),表明该目标在学习布局结构方面具有关键作用。
- 若排除布局属性(如字体大小、位置),性能仅出现轻微下降,表明通过分层 Transformer 建模结构比仅依赖属性特征更具影响力。
- LAMPRET 的多模态版本在图像建议任务中优于其单模态版本(MRR:99.98%),但在文本块填充任务中表现略差,表明多模态融合仍有改进空间。
- 在图像建议任务的预训练过程中,仅当包含图像适配目标时模型才能收敛,凸显其在实现有效多模态对齐中的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。