[论文解读] IIIT-AR-13K: A New Dataset for Graphical Object Detection in Documents
本文介绍了 iiit-ar-13k,这是目前规模最大的用于业务文档中图形对象检测的手动标注数据集,包含来自多语言年度报告的 13,000 页手动标注页面。使用 Faster R-CNN 和 Mask R-CNN 训练的模型在 iiit-ar-13k 上的表现优于在更大规模、自动标注数据集上训练的模型,表明高质量、精心筛选的数据在表格检测和微调任务中比数据量更具有效性。
We introduce a new dataset for graphical object detection in business documents, more specifically annual reports. This dataset, IIIT-AR-13k, is created by manually annotating the bounding boxes of graphical or page objects in publicly available annual reports. This dataset contains a total of 13k annotated page images with objects in five different popular categories - table, figure, natural image, logo, and signature. It is the largest manually annotated dataset for graphical object detection. Annual reports created in multiple languages for several years from various companies bring high diversity into this dataset. We benchmark IIIT-AR-13K dataset with two state of the art graphical object detection techniques using Faster R-CNN [20] and Mask R-CNN [11] and establish high baselines for further research. Our dataset is highly effective as training data for developing practical solutions for graphical object detection in both business documents and technical articles. By training with IIIT-AR-13K, we demonstrate the feasibility of a single solution that can report superior performance compared to the equivalent ones trained with a much larger amount of data, for table detection. We hope that our dataset helps in advancing the research for detecting various types of graphical objects in business documents.
研究动机与目标
- 为解决业务文档(尤其是年度报告)中缺乏大规模、多样化、手动标注数据集的问题。
- 在一项新且高多样性的数据集上,对最先进的目标检测模型(Faster R-CNN、Mask R-CNN)进行基准测试,以推动业务文档理解的发展。
- 评估经过精心筛选的小规模手动标注数据是否能在检测准确率上超越更大规模、自动生成的数据集。
- 利用一项新创建的大规模、多语言数据集,建立业务文档中图形对象检测的强基准。
提出的方法
- 通过在 13,000 页公开可获取的年度报告中,手动标注五类图形对象(表格、图表、自然图像、标志和签名)的边界框,构建了该数据集。
- 这些报告涵盖超过十年的时间跨度,来自 29 家不同公司,涉及多种语言,包括英语、法语、日语和俄语,确保了布局和视觉上的高度多样性。
- 作者在 iiit-ar-13k 数据集上评估了 Faster R-CNN 和 Mask R-CNN,以建立未来研究的高性能基线。
- 通过在大型自动数据集(如 PubLayNet、TableBank)上训练模型,并进一步使用 iiit-ar-13k 中随机选取的 1,000 张图像进行微调,开展了微调实验,以评估模型的可迁移性与有效性。
- 使用标准指标(mAP、精确率、召回率和 F1 值)在验证集和测试集上评估性能。
实验结果
研究问题
- RQ1像 iiit-ar-13k 这样规模较小但经过精心筛选的数据集,是否能在业务文档的图形对象检测任务中超越更大规模、自动标注的数据集?
- RQ2iiit-ar-13k 作为预训练于大规模合成数据集上的模型的微调数据集,其有效性如何?
- RQ3iiit-ar-13k 中注释的多样性和质量是否能带来在检测表格及其他图形对象方面更优的泛化能力与性能?
- RQ4仅使用 iiit-ar-13k 中的 1,000 张图像对在大规模数据集上预训练的模型进行微调,性能提升有多大?
主要发现
- 仅在 iiit-ar-13k 上训练的模型在表格检测任务中取得了 0.9555 的 mAP,优于在更大规模数据集(如 PubLayNet 的 0.9886 mAP 和 TableBank 的 0.9863 mAP)上训练的模型,表明精心筛选的数据在性能上更具优势。
- 使用 iiit-ar-13k 中仅 1,000 张图像对在大型数据集(如 PubLayNet)上预训练的模型进行微调,显著提升了性能,mAP 达到 0.9882(f-trs)和 0.9869(p-trs),接近或超过仅在大型数据集上训练的模型性能。
- 当使用 PubLayNet 的完整训练集对 iiit-ar-13k 训练的模型进行微调时,其在测试集上达到了 0.9891 的 mAP,证明了该新数据集具有强大的可迁移性与有效性。
- 即使仅使用 iiit-ar-13k 中的 1,000 张图像进行微调,预训练于大规模数据集的模型也达到了相近的性能(mAP ≈ 0.988),表明新注释数据具有极高的数据效率与质量。
- 在表格检测的 mAP 指标上,iiit-ar-13k 数据集的表现优于在更大规模、自动标注数据集(如 TableBank 和 PubLayNet)上训练的模型,验证了假设:精心筛选的数据比单纯的数据量更具价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。