Skip to main content
QUICK REVIEW

[论文解读] SelfDoc: Self-Supervised Document Representation Learning

Peizhao Li, Jiuxiang Gu|arXiv (Cornell University)|Jun 7, 2021
Multimodal Machine Learning Applications参考文献 21被引用 7
一句话总结

SelfDoc 提出了一种任务无关的自监督预训练框架,用于文档图像理解,其通过建模语义上具有意义的组件(如文本块、标题、图表)而非单个单词,实现更高效的表示学习。通过在预训练阶段引入多模态交叉注意力机制,并在下游任务中采用模态自适应注意力机制进行特征融合,SelfDoc 在使用远少于先前方法的预训练图像的情况下,实现了文档实体识别、分类与聚类任务的最先进性能。

ABSTRACT

We propose SelfDoc, a task-agnostic pre-training framework for document image understanding. Because documents are multimodal and are intended for sequential reading, our framework exploits the positional, textual, and visual information of every semantically meaningful component in a document, and it models the contextualization between each block of content. Unlike existing document pre-training models, our model is coarse-grained instead of treating individual words as input, therefore avoiding an overly fine-grained with excessive contextualization. Beyond that, we introduce cross-modal learning in the model pre-training phase to fully leverage multimodal information from unlabeled documents. For downstream usage, we propose a novel modality-adaptive attention mechanism for multimodal feature fusion by adaptively emphasizing language and vision signals. Our framework benefits from self-supervised pre-training on documents without requiring annotations by a feature masking training strategy. It achieves superior performance on multiple downstream tasks with significantly fewer document images used in the pre-training stage compared to previous works.

研究动机与目标

  • 开发一种任务无关的文档图像理解预训练框架,以减少对标注数据的依赖。
  • 通过在组件层面而非单词层面建模上下文关系,提升文档表征能力。
  • 通过在预训练阶段集成跨模态注意力机制,而非仅在微调阶段,增强多模态学习效果。
  • 利用模态自适应注意力机制,在下游任务中实现高效的模态融合。
  • 在显著减少预训练文档数量的前提下,实现更优性能,缓解数据稀缺与隐私问题。

提出的方法

  • 模型输入为语义上有意义的组件(如文本块、图表),而非单个单词,从而实现粗粒度的上下文建模。
  • 采用独立的文本与视觉编码器,结合二维位置编码,分别学习语言与视觉表征,以捕捉布局结构。
  • 引入跨模态编码器,使语言与视觉特征在预训练阶段即可实现交互。
  • 设计模态自适应注意力机制,根据输入内容动态强调语言或视觉特征,以实现下游任务中的有效融合。
  • 通过在无标注文档上实施特征掩码策略进行自监督预训练,无需任何标注数据。
  • 在下游任务(如实体识别、分类与聚类)上对框架进行微调。

实验结果

研究问题

  • RQ1在文档理解中,若将内容建模层级从单词提升至组件层级,是否能改善表征学习效果?
  • RQ2与模态特定的预训练相比,在预训练阶段集成跨模态学习对下游性能有何影响?
  • RQ3模态自适应注意力机制是否能提升文档分析任务中的多模态融合效果?
  • RQ4自监督框架在多大程度上可减少文档表征学习中对大规模标注数据的需求?
  • RQ5在使用更少的预训练文档时,是否仍能保持最先进性能,相较于现有方法?

主要发现

  • SelfDoc 在文档实体识别、分类与聚类任务上均优于 LayoutLM 及其他基线模型,即使预训练图像数量显著减少。
  • 在 RVL-CDIP 数据集上,当仅使用 1/8 的训练数据进行微调时,SelfDoc 的文档分类准确率达到 91.50%,较 LayoutLM 的提升幅度甚至超过全量数据设置下的表现。
  • 消融实验表明,若移除文本或视觉输入,性能均出现显著下降,证实了多模态学习的必要性。
  • 交叉注意力机制对性能贡献显著,两个交叉注意力头均对最优结果至关重要。
  • 引入来自 VGG-16 的全局视觉特征可使分类准确率提升约 1%,尤其在低质量或遮挡严重的文档中效果更明显。
  • 文档聚类结果表明,SelfDoc 的预训练嵌入在未微调的情况下,其判别性也优于 BERT 与 LayoutLM,这得益于更丰富的组件级表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。