Skip to main content
QUICK REVIEW

[论文解读] CDeC-Net: Composite Deformable Cascade Network for Table Detection in Document Images

Madhav Agarwal, Ajoy Mondal|arXiv (Cornell University)|Aug 25, 2020
Handwritten Text Recognition Techniques参考文献 50被引用 5
一句话总结

CDeC-Net 是一种新颖的端到端可训练级联 Mask R-CNN 架构,采用双主干网络和可变形卷积,用于在文档图像中实现高精度的表格检测。它在多个基准测试中达到最先进性能,包括在严格 IoU 阈值下的高 mAP,并提出了一种单一、微调后的模型(CDeC-Net‡),无需针对每个数据集重新训练即可在多样化数据集上实现良好泛化能力。

ABSTRACT

Localizing page elements/objects such as tables, figures, equations, etc. is the primary step in extracting information from document images. We propose a novel end-to-end trainable deep network, (CDeC-Net) for detecting tables present in the documents. The proposed network consists of a multistage extension of Mask R-CNN with a dual backbone having deformable convolution for detecting tables varying in scale with high detection accuracy at higher IoU threshold. We empirically evaluate CDeC-Net on all the publicly available benchmark datasets - ICDAR-2013, ICDAR-2017, ICDAR-2019,UNLV, Marmot, PubLayNet, and TableBank - with extensive experiments. Our solution has three important properties: (i) a single trained model CDeC-Net‡ performs well across all the popular benchmark datasets; (ii) we report excellent performances across multiple, including higher, thresholds of IoU; (iii) by following the same protocol of the recent papers for each of the benchmarks, we consistently demonstrate the superior quantitative performance. Our code and models will be publicly released for enabling the reproducibility of the results.

研究动机与目标

  • 开发一种单一、可泛化的深度学习模型,使其在多种文档图像数据集上均能实现优异的表格检测性能。
  • 提升在高 IoU 阈值下的检测精度,减少复杂版面中的误报。
  • 解决现有模型需要针对特定数据集重新训练或微调的局限性。
  • 将可变形卷积和双主干网络整合到级联 Mask R-CNN 框架中,以提升在可变表格版面中的特征学习能力。
  • 通过在一致评估协议下于多个公开数据集上展示卓越性能,建立表格检测的新基准。

提出的方法

  • 该方法采用多阶段级联 Mask R-CNN 架构,以优化目标提议并提高定位精度。
  • 其双主干结构由 ResNeXt-101 和另一条带有可变形卷积的分支组成,以增强对不同尺度表格的特征表示能力。
  • 将可变形卷积集成到主干网络中,以自适应地聚焦于相关空间区域,提升对版面变化和缺失划线的鲁棒性。
  • 模型在 IIIT-AR-13K 数据集上进行训练,并在每个基准数据集的训练集上进行微调,以生成单一可泛化的模型(CDeC-Net‡)。
  • 评估遵循近期最先进论文中的标准协议,确保在不同数据集间进行公平且一致的比较。
  • 该框架为端到端可训练,并针对高 IoU 阈值(如 0.8)进行了优化,这对目标检测器更具挑战性。
Figure 1: Illustration of the proposed cd e c-n et which is compose of cascade Mask r-cnn with composite backbone having deformable convolution instead of conventional convolution.
Figure 1: Illustration of the proposed cd e c-n et which is compose of cascade Mask r-cnn with composite backbone having deformable convolution instead of conventional convolution.

实验结果

研究问题

  • RQ1单一深度学习模型是否能在无需针对特定数据集重新训练的情况下,在多个多样化表格检测基准上实现最先进性能?
  • RQ2将可变形卷积与双主干网络结合,如何提升检测精度,尤其是在高 IoU 阈值下?
  • RQ3级联 Mask R-CNN 架构在具有视觉相似对象的复杂文档版面中,能在多大程度上减少误报?
  • RQ4在大规模、多样化数据集(IIIT-AR-13K)上预训练的模型,经微调后是否能在未见基准上实现更优泛化能力?
  • RQ5统一模型是否能超越或匹配为每个基准专门训练的专用模型的性能?

主要发现

  • CDeC-Net‡(单一微调模型)在 PublayNet 上达到 mAP 0.978,优于之前最先进方法(m-RCNN)的 0.960。
  • 在 ICDAR-2019 数据集上,CDeC-Net‡ 在 IoU=0.8 时达到 F1 分数 0.950,展现出在高 IoU 阈值下的强劲性能。
  • 在 ICDAR-2013 数据集上,CDeC-Net‡ 达到 F1 分数 0.968,尽管是单一模型,仍与最佳性能模型(dCnt)的 0.996 非常接近。
  • 在 UNLV 数据集上,CDeC-Net‡ 达到 mAP 0.912,略高于之前最先进方法(God)的 0.910。
  • 在 TableBank 数据集上,CDeC-Net‡ 达到 mAP 0.965,与之前最先进方法(Li et al.)的 0.981 非常接近,同时保持单一模型适用于所有数据集。
  • 消融实验表明,在级联 Mask R-CNN 框架中结合双主干网络与可变形卷积,可在 IoU=0.5 时于 ICDAR-2013 上实现最高 F1 分数 1.000。
Figure 2: Illustration of the deformable convolution.
Figure 2: Illustration of the deformable convolution.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。