[论文解读] PubLayNet: largest dataset ever for document layout analysis
PubLayNet 自动标注超过 1 million 篇 PubMed Central 的 PDF,以创建大规模文档布局数据集;在 PubLayNet 上训练的最先进目标检测器实现高的布局 MAP,并实现对其他领域的有效迁移学习。
Recognizing the layout of unstructured digital documents is an important step when parsing the documents into structured machine-readable format for downstream applications. Deep neural networks that are developed for computer vision have been proven to be an effective method to analyze layout of document images. However, document layout datasets that are currently publicly available are several magnitudes smaller than established computing vision datasets. Models have to be trained by transfer learning from a base model that is pre-trained on a traditional computer vision dataset. In this paper, we develop the PubLayNet dataset for document layout analysis by automatically matching the XML representations and the content of over 1 million PDF articles that are publicly available on PubMed Central. The size of the dataset is comparable to established computer vision datasets, containing over 360 thousand document images, where typical document layout elements are annotated. The experiments demonstrate that deep neural networks trained on PubLayNet accurately recognize the layout of scientific articles. The pre-trained models are also a more effective base mode for transfer learning on a different document domain. We release the dataset (https://github.com/ibm-aur-nlp/PubLayNet) to support development and evaluation of more advanced models for document layout analysis.
研究动机与目标
- 自动从 PubMed Central 的 PDF 及其 XML 表示中生成大规模高质量的文档布局注释数据集。
- 在 PubLayNet 上评估深度对象检测方法以进行科学文章的布局理解。
- 评估从 PubLayNet 到其他文档领域的迁移学习收益,并与 ImageNet/COCO 预训练进行比较。
提出的方法
- 自动将 PDF 布局元素与 PubMed Central Open Access 的 XML 注释对齐,以创建逐元素的布局标签。
- 使用基于 PDFMiner 的提取和 XML 指导标注,对 PDF 中的文本、标题、列表、表格、图 figure 进行分割。
- 在 PubLayNet 上使用 Detectron 对 Faster-RCNN 和 Mask-RCNN 模型进行训练,骨干网络为 ResNeXt-101;使用 MAP@IOU [0.50:0.95] 进行评估。
- 将数据按期刊层级划分为训练/开发/测试,以最大化模板多样性并评估泛化能力。
实验结果
研究问题
- RQ1标准对象检测器(Faster-RCNN、Mask-RCNN)在 PubLayNet 上学习文档布局类别的能力如何?
- RQ2在 PubLayNet 上的预训练是否为迁移到其他领域(如 SPD 健康保险文档)提供比 ImageNet/COCO 预训练更好的初始化?
- RQ3在有限微调数据下,PubLayNet 能否在表格检测任务及相关布局挑战上实现具有竞争力的性能?
主要发现
- Faster-RCNN 与 Mask-RCNN 在 PubLayNet 上实现了高布局检测性能,在开发集和测试集的 MAP@IOU [0.50:0.95] 平均超过 0.90。
- Mask-RCNN 在各类别(Text、Title、List、Table、Figure)上通常略优于 Faster-RCNN。
- 表格和图形的检测比文本、标题和列表的检测更为准确,这可能由于规律性形状和显著性所致。
- 在 PubLayNet 上预训练并进行微调的模型在 ICDAR 2013 表格识别任务上获得了最先进的结果,即使微调数据非常少(少至 170 页)。
- 零-shot PubLayNet 预训练在 SPD 文档布局任务上的表现不如微调后的 PubLayNet 或 COCO/ImageNet 预训练,凸显 PubLayNet 的域迁移优势。
- PubLayNet 能实现对非生物医学领域的有效迁移学习,尽管收益因领域而异(表格迁移更具挑战性)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。