Skip to main content
QUICK REVIEW

[论文解读] Learning to Extract Semantic Structure from Documents Using Multimodal Fully Convolutional Neural Network

Xiao Yang, Ersin Yumer|arXiv (Cornell University)|Jun 7, 2017
Handwritten Text Recognition Techniques被引用 58
一句话总结

这篇论文提出了一种多模态全卷积网络(MFCN),它同时使用视觉特征和文本嵌入来对文档图像进行像素级语义结构提取,借助合成数据预训练和无监督训练任务。

ABSTRACT

We present an end-to-end, multimodal, fully convolutional network for extracting semantic structures from document images. We consider document semantic structure extraction as a pixel-wise segmentation task, and propose a unified model that classifies pixels based not only on their visual appearance, as in the traditional page segmentation task, but also on the content of underlying text. Moreover, we propose an efficient synthetic document generation process that we use to generate pretraining data for our network. Once the network is trained on a large set of synthetic documents, we fine-tune the network on unlabeled real documents using a semi-supervised approach. We systematically study the optimum network architecture and show that both our multimodal approach and the synthetic data pretraining significantly boost the performance.

研究动机与目标

  • 开发一个端到端模型,在像素级同时识别基于外观的(布局)和基于语义的(文档角色)类别。
  • 通过文本嵌入映射引入文本信息以改进分割,尤其是对小区域或具有语义特征的区域。
  • 利用合成数据扩大监督范围,并提出无监督辅助任务以提升表征学习。
  • 通过在合成带标签数据和真实未标注文档之间交替实现半监督训练。

提出的方法

  • 提出一个多模态全卷积网络,包含一个编码器、一个分割解码器、一个辅助重建解码器(仅用于训练)以及一个将视觉和文本表示融合的桥接模块。
  • 通过对词嵌入取平均来构造文本嵌入映射,生成句子级向量并分配到相应的句子区域,然后与视觉特征拼接。
  • 引入扩张卷积模块以扩大对小物体的感受野,同时通过基于反池化的跳连保留空间精度。
  • 在维基百科上使用skip-gram模型训练文本嵌入,得到128维的单词向量以构建嵌入映射。
  • 训练阶段使用两种无监督损失:一种是通过辅助解码器进行的重建损失,另一种是一致性损失(利用边界框强制同一区域内特征相似性)。
  • 开发一个大规模的合成文档生成器(135,000页)以提供像素级的监督前训练的Ground Truth,然后再在真实文档上进行半监督微调。

实验结果

研究问题

  • RQ1一个统一的多模态网络能否通过利用底层文本内容来超越仅依赖外观的文档分割方法?
  • RQ2在像素级文档语义分割中,加入文本嵌入映射对结果有何影响?
  • RQ3无监督辅助任务(重建和一致性)是否提升对真实文档的表征学习和分割精度?
  • RQ4合成数据预训练在使真实数据上实现高性能文档语義结构提取方面有多有效?

主要发现

  • 带有多模态融合的MFCN在DSSE-200、ICDAR2015和SectLabel数据集上显著提升了与外观基础方法的分割性能。
  • 引入文本嵌入映射提高了对语义类别如节标题、说明、列表和段落的准确性。
  • 无监督任务带来收益,一致性损失在与重建损失结合时带来显著改进。
  • 在嵌入映射中使用真实(Ground-truth)文本比使用OCR提取文本或无文本信息有显著的性能提升,显示准确文本上下文的价值。
  • 在ICDAR2015数据集上,该模型在二值化变体中非文本IoU为94.5,文本IoU为91.0,图figure区域IoU为77.1,超过了此前方法在这些类别上的表现。
  • 在SectLabel上,该模型在节标题(0.919)、说明(0.893)和列表(0.793)的F1分数表现竞争力,同时还能识别图 Figure 和表格。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。