Skip to main content
QUICK REVIEW

[论文解读] Handwritten Mathematical Expression Recognition with Bidirectionally Trained Transformer

Wenqi Zhao, Liangcai Gao|arXiv (Cornell University)|May 6, 2021
Handwritten Text Recognition Techniques参考文献 44被引用 7
一句话总结

本文提出了一种双向训练的Transformer(BTTR)模型用于手写数学表达式识别,用Transformer解码器替代基于RNN的解码器,并引入一种新颖的训练策略以实现双向语言建模。该方法在CROHME 2014上提升准确率2.23%,在CROHME 2016上提升1.92%,在CROHME 2019上提升2.28%,在不使用数据增强的情况下实现了最先进性能。

ABSTRACT

Encoder-decoder models have made great progress on handwritten mathematical expression recognition recently. However, it is still a challenge for existing methods to assign attention to image features accurately. Moreover, those encoder-decoder models usually adopt RNN-based models in their decoder part, which makes them inefficient in processing long $\LaTeX{}$ sequences. In this paper, a transformer-based decoder is employed to replace RNN-based ones, which makes the whole model architecture very concise. Furthermore, a novel training strategy is introduced to fully exploit the potential of the transformer in bidirectional language modeling. Compared to several methods that do not use data augmentation, experiments demonstrate that our model improves the ExpRate of current state-of-the-art methods on CROHME 2014 by 2.23%. Similarly, on CROHME 2016 and CROHME 2019, we improve the ExpRate by 1.92% and 2.28% respectively.

研究动机与目标

  • 解决HMER中因长距离依赖建模不足而导致的覆盖不全问题,即模型对符号的预测存在遗漏或过度预测。
  • 克服基于RNN的解码器在处理长LaTeX序列时效率低下且具有顺序性的缺陷。
  • 使单个Transformer解码器能够同时执行从左到右和从右到左的解码,以提升句法感知能力。
  • 通过联合使用图像和词的位置编码,提升模型的泛化能力和准确率。
  • 在不依赖数据增强技术的前提下,实现在CROHME基准上的最先进性能。

提出的方法

  • 用Transformer解码器替代基于RNN的解码器,以支持并行训练并更好地建模长距离依赖。
  • 引入图像位置编码(IPE)以引导注意力关注输入特征图的特定区域,提升空间定位能力。
  • 提出一种双向训练策略,使单个Transformer解码器在一次前向传播中联合优化从左到右和从右到左的解码过程。
  • 采用近似联合搜索(AJS)对双向预测结果进行重打分,提升输出的平衡性与句法正确性。
  • 通过平均五个独立初始化模型的预测结果,应用模型集成技术进一步提升性能。
  • 采用学习率调度的课程学习策略,端到端训练模型,损失函数为交叉熵损失,并利用自注意力机制的置换不变性实现双向学习。

实验结果

研究问题

  • RQ1单个Transformer解码器是否能在不增加模型复杂度的前提下,有效学习HMER中的双向语言建模?
  • RQ2图像位置编码的引入是否能改善注意力对齐效果,并减少HMER中的过度解析与解析不足现象?
  • RQ3与单向训练相比,双向训练在识别准确率和句法正确性方面表现如何?
  • RQ4近似联合搜索在多长LaTeX序列中能多大程度上提升预测结果的平衡性与准确性?
  • RQ5所提出的BTTR模型是否能在标准CROHME基准上实现最先进性能,且无需依赖数据增强?

主要发现

  • BTTR模型在CROHME 2014测试集上达到57.91%的ExpRate,相比最先进方法提升2.23%,且未使用数据增强。
  • 在CROHME 2016上,模型达到54.49%的ExpRate,较先前方法提升1.92%。
  • 在CROHME 2019上,模型达到56.88%的ExpRate,相比当前最先进方法相对提升2.28%。
  • 消融实验证实,图像位置编码能提升泛化能力,尤其在多尺度场景下表现更优。
  • 与仅使用从左到右解码的单向训练相比,双向训练策略使性能提升2.52%。
  • 使用近似联合搜索和模型集成技术,分别使ExpRate进一步提升4.68%和3.35%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。