Skip to main content
QUICK REVIEW

[论文解读] Towards a Multi-modal, Multi-task Learning based Pre-training Framework for Document Representation Learning

Subhojeet Pramanik, Shashank Mujumdar|arXiv (Cornell University)|Sep 30, 2020
Handwritten Text Recognition Techniques被引用 9
一句话总结

本文提出了一种用于文档表示学习的多模态、多任务预训练框架,通过使用Longformer主干网络联合编码文本、布局和图像特征,以处理多页文档。通过引入新型自监督任务——文档主题建模(Document Topic Modeling)和文档顺序预测(Document Shuffle Prediction),该框架学习到丰富的跨模态表示,在多个基准测试中实现了文档分类、信息抽取和检索任务的最先进性能。

ABSTRACT

Recent approaches in literature have exploited the multi-modal information in documents (text, layout, image) to serve specific downstream document tasks. However, they are limited by their - (i) inability to learn cross-modal representations across text, layout and image dimensions for documents and (ii) inability to process multi-page documents. Pre-training techniques have been shown in Natural Language Processing (NLP) domain to learn generic textual representations from large unlabelled datasets, applicable to various downstream NLP tasks. In this paper, we propose a multi-task learning-based framework that utilizes a combination of self-supervised and supervised pre-training tasks to learn a generic document representation applicable to various downstream document tasks. Specifically, we introduce Document Topic Modelling and Document Shuffle Prediction as novel pre-training tasks to learn rich image representations along with the text and layout representations for documents. We utilize the Longformer network architecture as the backbone to encode the multi-modal information from multi-page documents in an end-to-end fashion. We showcase the applicability of our pre-training framework on a variety of different real-world document tasks such as document classification, document information extraction, and document retrieval. We evaluate our framework on different standard document datasets and conduct exhaustive experiments to compare performance against various ablations of our framework and state-of-the-art baselines.

研究动机与目标

  • 解决现有框架在学习文档中文本、布局和图像模态之间跨模态表示方面的局限性。
  • 实现在多页文档上的端到端文档表示学习,这些文档在现实应用中很常见。
  • 通过引入利用视觉和结构信息的新自监督预训练任务,改进通用文档表示学习。
  • 展示预训练框架在多样化下游文档任务(如分类、信息抽取和检索)中的泛化能力。
  • 通过在统一的预训练范式中结合多模态输入和多任务学习,超越现有最先进模型。

提出的方法

  • 使用Longformer架构作为主干网络,通过线性注意力扩展高效处理来自多页文档的长序列。
  • 通过四种嵌入编码文档信息:文本标记、用于布局的2D位置、用于外观的文本标记图像特征,以及页面级图像嵌入。
  • 引入两项新型自监督预训练任务:文档主题建模(DTM)和文档顺序预测(DSP),以增强视觉和结构表示学习。
  • 在多任务学习设置中,将这些任务与现有的预训练目标(掩码视觉语言建模,MVLM,和文档分类,CLF)结合。
  • 采用端到端训练,以实现文本、布局和图像模态之间的跨模态交互和共享表示学习。
  • 在标准基准上,使用下游任务(如文档分类、信息抽取和文档检索)对预训练模型进行微调。

实验结果

研究问题

  • RQ1多模态、多任务预训练框架能否有效学习文档中文本、布局和图像模态之间的共享表示?
  • RQ2与现有方法相比,像文档主题建模(DTM)和文档顺序预测(DSP)这样的新型自监督预训练任务在多大程度上改善了文档表示学习?
  • RQ3该框架在多样化下游文档任务(如分类、信息抽取和检索)中的泛化能力如何?
  • RQ4当推理过程中缺少文本信息时,图像和布局特征的引入在多大程度上影响性能?
  • RQ5该框架能否有效处理现实文档处理中常见的多页文档?

主要发现

  • 所提出的框架在多个标准数据集上的文档分类、信息抽取和文档检索任务中均优于最先进模型。
  • 消融研究显示,当仅使用图像特征时,完整框架(Our All)的性能下降约37%,显著低于基线模型(Our MC)的约43%下降,表明其具有更好的图像表示学习能力。
  • 引入文档顺序预测(DSP)和文档主题建模(DTM)任务可带来更鲁棒的图像表示,表现为在推理过程中移除文本时性能下降更小。
  • 即使在缺少文本信息的情况下,该框架仍能保持强劲性能,表明通过新型预训练任务有效利用了视觉和布局特征。
  • Longformer主干网络能够有效处理来自多页文档的长文档序列,支持所有页面的端到端学习。
  • 在多任务设置中结合MVLM、CLF、DSP和DTM任务,相比消融版本和现有基线,能实现更好的泛化能力和更高的下游性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。