[论文解读] PingAn-VCGroup's Solution for ICDAR 2021 Competition on Scientific Table Image Recognition to Latex
本文介绍了平安-vcgroup在ICDAR 2021科学表格图像转LaTeX竞赛中的解决方案,采用优化版MASTER模型,将表格结构与内容重建视为图像到序列的任务。该方法在表格结构重建任务中取得0.7444精确匹配和0.8765精确匹配@95%的性能,在表格内容重建任务中取得0.5586精确匹配和0.7386精确匹配@95%的性能,通过引入Ranger优化器、数据增强、分辨率缩放、SyncBN、特征拼接及集成学习等模型改进措施实现。
This paper presents our solution for the ICDAR 2021 Competition on Scientific Table Image Recognition to LaTeX. This competition has two sub-tasks: Table Structure Reconstruction (TSR) and Table Content Reconstruction (TCR). We treat both sub-tasks as two individual image-to-sequence recognition problems. We leverage our previously proposed algorithm MASTER \cite{lu2019master}, which is originally proposed for scene text recognition. We optimize the MASTER model from several perspectives: network structure, optimizer, normalization method, pre-trained model, resolution of input image, data augmentation, and model ensemble. Our method achieves 0.7444 Exact Match and 0.8765 Exact Match @95\% on the TSR task, and obtains 0.5586 Exact Match and 0.7386 Exact Match 95\% on the TCR task.
研究动机与目标
- 为解决将科学表格图像转换为语义准确的LaTeX代码的挑战,特别是针对复杂多样的表格结构。
- 提升两个子任务的性能:表格结构重建(TSR)与表格内容重建(TCR),二者均被建模为图像到序列的识别问题。
- 通过调整网络架构、训练策略与数据处理技术,对MASTER模型进行表格识别优化。
- 通过数据增强、模型集成与预训练微调,缓解小样本数据集与不一致标注带来的问题。
提出的方法
- 该方法将TSR与TCR均建模为使用MASTER模型的图像到序列识别任务,该模型最初专为场景文本识别而设计。
- 关键的模型优化包括使用Ranger优化器,其结合了RAdam、LookAhead与梯度中心化,以提升收敛性能。
- 采用同步批量归一化(SyncBN),以应对大输入分辨率与小批量大小下的多GPU训练。
- 引入Transformer解码器层的特征拼接(FeaC),以增强长序列解码的特征表示学习能力。
- 评估了从300×200到800×400的多种输入图像分辨率,以确定结构与内容识别的最佳尺度。
- 应用广泛的图像增强技术,包括剪切、仿射、透视、亮度、对比度与饱和度变换,以提升模型鲁棒性与泛化能力。
实验结果
研究问题
- RQ1如何有效将现有场景文本识别模型(如MASTER)适配于科学表格图像转LaTeX的任务?
- RQ2哪些训练优化策略与架构修改组合能在表格结构与内容重建任务中取得最佳性能?
- RQ3不同输入分辨率与数据增强策略如何影响模型在未见测试数据上的泛化能力与准确率?
- RQ4模型集成与在大规模数据集上预训练微调在小样本、领域特定的表格识别基准上能带来多大性能提升?
主要发现
- 最终模型在表格结构重建(TSR)任务中达到0.7444精确匹配与0.8765精确匹配@95%的性能。
- 在表格内容重建(TCR)任务中,模型在测试集上取得0.5586精确匹配与0.7386精确匹配@95%的性能。
- 模型集成显著提升了性能,最佳TSR结果(0.8765 EM@95%)仅在结合使用不同数据增强与分辨率训练的模型时实现。
- Transformer解码器层的特征拼接使TSR性能提升约0.7%。
- 数据增强使性能提升约0.5%,尽管存在领域差异,但在更大规模预训练数据集(TABLE2LATEX-450K)上微调仍带来显著性能增益。
- 更大的输入分辨率提升了TCR性能,但较小分辨率在TSR任务中表现更优,表明内容细节与结构关注之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。