Skip to main content
QUICK REVIEW

[论文解读] Syntax-Aware Network for Handwritten Mathematical Expression Recognition

Ye Yuan, Xiao Liu|arXiv (Cornell University)|Mar 3, 2022
Handwritten Text Recognition Techniques被引用 5
一句话总结

本文提出一种语法感知网络(SAN),用于手写数学表达式识别(HMER),将语法规则与语法感知注意力机制整合到编码器-解码器框架中。通过将LaTeX序列生成建模为树遍历过程,SAN提升了结构准确性,减少了复杂版式或潦草手写导致的预测错误,在CROHME和新提出的大型数据集HME100K上实现了最先进性能。

ABSTRACT

Handwritten mathematical expression recognition (HMER) is a challenging task that has many potential applications. Recent methods for HMER have achieved outstanding performance with an encoder-decoder architecture. However, these methods adhere to the paradigm that the prediction is made "from one character to another", which inevitably yields prediction errors due to the complicated structures of mathematical expressions or crabbed handwritings. In this paper, we propose a simple and efficient method for HMER, which is the first to incorporate syntax information into an encoder-decoder network. Specifically, we present a set of grammar rules for converting the LaTeX markup sequence of each expression into a parsing tree; then, we model the markup sequence prediction as a tree traverse process with a deep neural network. In this way, the proposed method can effectively describe the syntax context of expressions, alleviating the structure prediction errors of HMER. Experiments on three benchmark datasets demonstrate that our method achieves better recognition performance than prior arts. To further validate the effectiveness of our method, we create a large-scale dataset consisting of 100k handwritten mathematical expression images acquired from ten thousand writers. The source code, new dataset, and pre-trained models of this work will be publicly available.

研究动机与目标

  • 解决因复杂二维版式和难以辨认的手写导致的手写数学表达式识别(HMER)中结构预测错误的问题。
  • 克服标准图像到序列模型仅按顺序预测符号而忽略句法关系的局限性。
  • 开发一种方法,通过语法规则与神经注意力机制显式建模数学表达式的层次句法结构。
  • 构建一个大规模、多样化的HME100K数据集,以支持对真实世界HMER应用的稳健评估与未来研究。
  • 通过将句法约束整合到深度学习架构中,同时提升识别准确率与推理效率。

提出的方法

  • 定义一种自定义语法,将LaTeX标记序列分解为句法树,实现数学表达式的结构化表示。
  • 设计一种语法感知解码器,按组件而非逐符号的方式遍历语法树,以保持句法上下文。
  • 引入语法感知注意力机制,根据树结构聚焦于相关组件,减少对无关或错误符号的关注。
  • 使用全卷积编码器从手写表达式图像中提取视觉特征,随后通过带有语法感知注意力的解码器生成序列。
  • 使用LaTeX序列上的交叉熵损失进行端到端训练,并在推理时采用束搜索以提升生成质量。
  • 将覆盖注意力(coverage attention)作为基线进行对比,证明语法感知注意力在聚焦正确结构组件方面的优越性。

实验结果

研究问题

  • RQ1在神经编码器-解码器框架中显式集成语法规则,是否能提升HMER模型的结构准确性?
  • RQ2将序列生成建模为树遍历过程(而非逐字符预测),是否能在复杂数学表达式上带来更好的性能?
  • RQ3在HMER推理过程中,语法感知注意力与标准覆盖注意力相比,是否更有效地聚焦于正确组件?
  • RQ4所提出方法在不同规模与复杂度的数据集(包括真实世界手写数据)上的泛化能力如何?
  • RQ5像HME100K这样大规模、多样化的数据集,能否作为超越现有基准的更稳健HMER系统评估基准?

主要发现

  • 所提出的语法感知网络(SAN)在CROHME 2014数据集上达到56.2%的表达式识别准确率,优于先前最先进方法。
  • 在更具挑战性的CROHME 2016数据集上,SAN达到53.6%的准确率,当使用语法感知注意力时,相比基线提升5.1%。
  • 在新引入的HME100K数据集上,SAN实现67.1%的识别准确率,表明其在更大、更复杂数据上的强大泛化能力。
  • 消融实验表明,语法规则集成使CROHME 2014上的准确率提升6.2%,而语法感知注意力额外带来7.1%的增益。
  • 在HME100K测试集上,SAN的推理速度比DWAP-TD快3.5倍,且比DWAP快2.6%,表明其具有高推理效率。
  • 定性分析显示,语法感知注意力能正确聚焦于结构化组件,而覆盖注意力常错误预测冗余或错误的子树。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。