[论文解读] ScanSSD: Scanning Single Shot Detector for Mathematical Formulas in PDF Document Images
ScanSSD 是一种基于深度学习的、仅使用视觉信息的检测器,用于在 PDF 文档图像中检测数学公式,采用带滑动窗口和基于投票的池化机制的单次检测器(SSD),以在多尺度下检测公式。其在字符级别的数学检测中达到 0.925 的 F 分数,在公式检测中达到 0.796 的 F 分数(IOU ≥ 0.5),在 TFD-ICDAR2019v2 基准测试中表现优异,且无需依赖布局、字体或 OCR 数据。
We introduce the Scanning Single Shot Detector (ScanSSD) for locating math formulas offset from text and embedded in textlines. ScanSSD uses only visual features for detection: no formatting or typesetting information such as layout, font, or character labels are employed. Given a 600 dpi document page image, a Single Shot Detector (SSD) locates formulas at multiple scales using sliding windows, after which candidate detections are pooled to obtain page-level results. For our experiments we use the TFD-ICDAR2019v2 dataset, a modification of the GTDB scanned math article collection. ScanSSD detects characters in formulas with high accuracy, obtaining a 0.926 f-score, and detects formulas with high recall overall. Detection errors are largely minor, such as splitting formulas at large whitespace gaps (e.g., for variable constraints) and merging formulas on adjacent textlines. Formula detection f-scores of 0.796 (IOU $\\geq0.5$) and 0.733 (IOU $\\ge 0.75$) are obtained. Our data, evaluation tools, and code are publicly available.
研究动机与目标
- 开发一种适用于原始数字和扫描 PDF 的公式检测系统,无需依赖结构化或格式化元数据(如布局、字体或字符标签)。
- 构建一个强大且端到端的视觉检测流程,用于文档图像中的数学表达式检测,适用于显示公式和内嵌公式。
- 提出一个新的基准数据集(TFD-ICDAR2019v2)和评估工具,基于 GTDB 数据集构建,改进了尺度和位移的标注。
- 仅使用图像级特征实现数学符号和公式区域的高精度检测,支持未来数学内容的索引与检索。
提出的方法
- 在 600 dpi 的文档页面图像上应用单次检测器(SSD),通过滑动窗口在多尺度下检测公式区域。
- 使用 1×5 的默认框以更好地适配具有大长宽比的宽数学表达式,并减少方形感受野带来的噪声。
- 通过投票和阈值处理程序对来自多尺度和多窗口的候选检测结果进行池化,生成页面级的公式检测结果。
- 该方法完全依赖视觉特征——检测过程中不使用 OCR、字体信息或布局元数据。
- 对 GTDB 数据集的修改版本进行创建,新增边界框标注以解决原始数据集中存在的尺度和位移差异问题。
- 在 TFD-ICDAR2019v2 数据集上训练和评估模型,采用 IOU 阈值 0.5 和 0.75 评估公式检测性能。
实验结果
研究问题
- RQ1仅使用视觉特征,不依赖布局、字体或 OCR 数据,深度学习检测器能否在文档图像中实现高精度的公式检测?
- RQ2采用自定义默认框的滑动窗口 SSD 方法在检测不同尺寸和长宽比的数学公式方面效果如何?
- RQ3基于投票和阈值的池化策略在多大程度上减少了公式检测中的误报和漏报?
- RQ4检测错误(如公式分裂或合并)与空白间隙或相邻关系等视觉特征之间存在何种关联?
- RQ5仅使用视觉信息的检测器能否在新的数学公式检测基准数据集中实现具有竞争力的性能?
主要发现
- ScanSSD 在数学符号的字符级别检测中达到 0.925 的 F 分数,表明在检测到的区域内对数学内容的识别具有高精度和高召回率。
- 在 IOU ≥ 0.5 时,公式检测的 F 分数达到 0.796;在 IOU ≥ 0.75 时,F 分数为 0.733,表明其在 TFD-ICDAR2019v2 基准测试中表现强劲。
- 检测错误主要源于在大段空白间隙处(如约束条件处)将公式错误分裂,或相邻公式被错误合并,而非虚假检测或漏检。
- 使用 1×5 的默认框显著提升了对宽数学表达式的检测效果,相比方形感受野,减少了噪声并更好地匹配公式几何结构。
- 该方法能够成功检测矩阵结构,并有效排除非数学内容(如公式编号和页码),表明对常见文档伪影具有鲁棒性。
- 作者发布了 TFD-ICDAR2019v2 数据集、评估工具和代码,支持可复现性,并为未来数学公式检测的基准测试提供支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。