[论文解读] TSRFormer: Table Structure Recognition with Transformers
TSRFormer 提出了一种新颖的表格结构识别方法,通过基于两阶段 DETR 的框架 SepRETR,将分隔线预测建模为线性回归问题,从而在扭曲、无边框及复杂表格上提升了准确率与鲁棒性。该方法在 SciTSR、PubTabNet 和 WTW 基准测试中均取得了最先进性能,并在一项具有挑战性的内部数据集上展现出强大的泛化能力。
We present a new table structure recognition (TSR) approach, called TSRFormer, to robustly recognizing the structures of complex tables with geometrical distortions from various table images. Unlike previous methods, we formulate table separation line prediction as a line regression problem instead of an image segmentation problem and propose a new two-stage DETR based separator prediction approach, dubbed extbf{Sep}arator extbf{RE}gression extbf{TR}ansformer (SepRETR), to predict separation lines from table images directly. To make the two-stage DETR framework work efficiently and effectively for the separation line prediction task, we propose two improvements: 1) A prior-enhanced matching strategy to solve the slow convergence issue of DETR; 2) A new cross attention module to sample features from a high-resolution convolutional feature map directly so that high localization accuracy is achieved with low computational cost. After separation line prediction, a simple relation network based cell merging module is used to recover spanning cells. With these new techniques, our TSRFormer achieves state-of-the-art performance on several benchmark datasets, including SciTSR, PubTabNet and WTW. Furthermore, we have validated the robustness of our approach to tables with complex structures, borderless cells, large blank spaces, empty or spanning cells as well as distorted or even curved shapes on a more challenging real-world in-house dataset.
研究动机与目标
- 为解决在真实图像中识别复杂、几何扭曲且无边框表格的挑战。
- 克服基于分割的方法在掩码到线转换过程中依赖启发式后处理的局限性。
- 提升两阶段 DETR 在分隔线预测任务中的收敛速度与定位精度。
- 开发一种端到端的鲁棒框架,直接回归分隔线并恢复跨行列单元。
- 在包括曲线、空单元及大空白区域表格在内的多样化真实世界表格场景中验证性能。
提出的方法
- 将表格分隔线预测建模为线性回归问题,而非图像分割,避免了启发式掩码到线转换过程。
- 提出一种基于两阶段 DETR 的分隔线回归模块(SepRETR),先预测参考点,再通过 Transformer 解码器回归完整分隔线。
- 引入先验增强匹配策略,加速 DETR 框架在分隔线预测任务中的收敛。
- 设计一种新型交叉注意力模块,直接从高分辨率卷积特征图中采样特征,以低计算成本提升定位精度。
- 采用基于关系网络的单元合并模块,从相交分隔线中恢复行或列合并单元。
- 在 Transformer 解码器中使用集合预测损失,消除对启发式标签分配和非极大值抑制(NMS)的依赖。
实验结果
研究问题
- RQ1在线性回归方法与分割方法之间,前者在预测扭曲和无边框表格的分隔线时是否更具有效性?
- RQ2如何改进两阶段 DETR 框架,以实现高精度、低成本的分隔线回归?
- RQ3先验增强匹配策略是否能显著加速基于 DETR 的 TSR 模型的收敛?
- RQ4直接从高分辨率特征图中采样特征是否能在不增加计算成本的前提下提升定位精度?
- RQ5所提方法对复杂真实世界表格变化(如曲线、大空白区域和合并单元)的鲁棒性如何?
主要发现
- TSRFormer 在 WTW 基准测试中取得了 95.2% 的 F1 分数,超越了先前方法。
- 在 SciTSR 数据集上,模型达到 92.6% 的 F1 分数,展现出在科学表格上的强大泛化能力。
- 消融实验证实,所提出的 SepRETR 模块结合集合预测与高分辨率特征采样,相比基线设计使 F1 提升 0.5%。
- 先验增强匹配策略使模型在 20 个周期内完成收敛,性能达到标准 DETR 训练 40 个周期的水平。
- 定性结果表明,该方法对曲线、无边框及严重扭曲的表格具有鲁棒性,在具有挑战性的内部评估中优于基于分割的基线方法。
- 该模型在具有大空白区域、空单元及合并单元的表格上仍保持高精度,证实了其实际应用中的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。