Skip to main content
QUICK REVIEW

[论文解读] DocParser: Hierarchical Structure Parsing of Document Renderings

Johannes Rausch, Octavio Martínez|arXiv (Cornell University)|Nov 5, 2019
Topic Modeling参考文献 38被引用 4
一句话总结

DocParser 是一个端到端系统,通过结合深度学习与基于反向 LaTeX 渲染的新型弱监督框架,从渲染文档(如 PDF)中推断出完整的分层文档结构。与弱监督基线相比,其在分层关系分类任务中的平均平均精度提升了 39.1%,F1 分数提升了 35.8%。

ABSTRACT

Translating renderings (e. g. PDFs, scans) into hierarchical document structures is extensively demanded in the daily routines of many real-world applications. However, a holistic, principled approach to inferring the complete hierarchical structure of documents is missing. As a remedy, we developed "DocParser": an end-to-end system for parsing the complete document structure - including all text elements, nested figures, tables, and table cell structures. Our second contribution is to provide a dataset for evaluating hierarchical document structure parsing. Our third contribution is to propose a scalable learning framework for settings where domain-specific data are scarce, which we address by a novel approach to weak supervision that significantly improves the document structure parsing performance. Our experiments confirm the effectiveness of our proposed weak supervision: Compared to the baseline without weak supervision, it improves the mean average precision for detecting document entities by 39.1 % and improves the F1 score of classifying hierarchical relations by 35.8 %.

研究动机与目标

  • 解决从 PDF 等渲染文档中推断完整分层文档结构的缺乏整体性、原则性方法的问题。
  • 通过开发基于反向 LaTeX 渲染的可扩展弱监督框架,缓解文档结构解析中的数据稀缺问题,实现实验室自动标注。
  • 通过引入 arXivdocs 数据集,提供全面的评估基准,涵盖多样化的文档实体及其分层关系。
  • 通过恢复 PDF 等渲染格式中丢失的结构信息(如表格、图表、公式),支持下游 NLP 任务。
  • 开发一种在标注训练数据有限的情况下,准确率和鲁棒性均优于标准 OCR 和现有解析方法的系统。

提出的方法

  • 使用基于 Mask R-CNN 的实例分割模型,检测并定位渲染文档图像中的文档实体(文本、表格、图表、公式)。
  • 应用两阶段关系检测流程:首先预测检测到的实体之间的分层关系,然后通过图神经网络或类似结构感知模块优化预测结果。
  • 通过反向 LaTeX 渲染生成弱标签,即使存在不精确或噪声,也能从源 LaTeX 文件中提取边界框和实体类别。
  • 通过微调(WS+FT)方式,联合使用弱监督标签和少量高质量标注样本,训练多任务学习模型。
  • 利用 LaTeX 源文件的结构一致性,构建可扩展的自动化标注流水线,支持多种文档类型。
  • 在后续扩展中整合布局特征和文本特征(如词嵌入),以提升关系分类和结构推理能力。

实验结果

研究问题

  • RQ1基于反向 LaTeX 渲染的弱监督学习框架是否能有效减少文档结构解析中对昂贵人工标注的依赖?
  • RQ2与完全监督或无监督基线相比,弱监督在检测文档实体和分类其分层关系方面的性能提升程度如何?
  • RQ3所提出的系统在恢复深层嵌套结构(如表格中的表格或文本区域中的图表)方面的有效性如何?
  • RQ4arXivdocs 数据集是否能作为评估完整文档结构解析的稳健基准,而不仅限于孤立组件(如表格)?
  • RQ5在保留对下游 NLP 任务(如信息抽取)至关重要的结构语义方面,该系统是否优于标准 OCR 流程?

主要发现

  • 所提出的弱监督框架使文档实体检测的平均平均精度相比无弱监督基线提升了 39.1%。
  • 在使用弱监督与微调时,文档实体之间分层关系分类的 F1 分数提升了 35.8%。
  • DocParser 在单张 GPU 上的推理速度约为每篇文档 340 ms,关系检测在 CPU 上仅增加每篇文档 5.67 ms。
  • 即使 F1 分数低于 0.5,定性评估显示最终文档结构仍高度准确,表明对轻微检测误差具有鲁棒性。
  • 尽管采用严格评估指标(对微小不匹配予以惩罚),该系统在保留结构语义方面仍优于最先进 OCR 系统。
  • arXivdocs 数据集源自 127,472 篇科学论文,提供了丰富多样的基准,涵盖所有主要文档实体及其分层关系,支持全面评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。