[论文解读] Improving Attention-Based Handwritten Mathematical Expression Recognition with Scale Augmentation and Drop Attention
该论文提出了一种基于注意力机制的新型编码器-解码器模型,用于手写数学表达式识别(HMER),通过尺度增强和注意力丢弃技术提升性能。尺度增强在训练过程中随机缩放ME图像,同时保持纵横比,从而增强对可变符号尺寸的鲁棒性;注意力丢弃通过抑制不可靠的注意力权重,提升注意力机制的可靠性,在不使用集成方法的情况下,于CROHME 2014和2016数据集上达到最先进性能。
Handwritten mathematical expression recognition (HMER) is an important research direction in handwriting recognition. The performance of HMER suffers from the two-dimensional structure of mathematical expressions (MEs). To address this issue, in this paper, we propose a high-performance HMER model with scale augmentation and drop attention. Specifically, tackling ME with unstable scale in both horizontal and vertical directions, scale augmentation improves the performance of the model on MEs of various scales. An attention-based encoder-decoder network is used for extracting features and generating predictions. In addition, drop attention is proposed to further improve performance when the attention distribution of the decoder is not precise. Compared with previous methods, our method achieves state-of-the-art performance on two public datasets of CROHME 2014 and CROHME 2016.
研究动机与目标
- 为解决手写数学表达式(MEs)中因二维结构导致的非均匀缩放所引发的符号尺寸不一致问题,该问题会降低模型性能。
- 提升序列生成中注意力机制的可靠性,尤其是在注意力聚焦于无关或噪声特征时。
- 开发一种训练阶段技术,提升模型在不同尺度ME上的泛化能力,而无需进行尺度归一化。
- 仅使用标准离线图像数据且不依赖集成方法,在公开HMER基准上实现最先进性能。
提出的方法
- 在训练过程中,尺度增强技术对ME图像进行随机缩放,同时保持纵横比,随后通过零填充调整至固定尺寸,使模型能够学习尺度不变特征。
- 采用基于注意力机制的编码器-解码器网络,其中编码器处理图像,解码器通过上下文感知注意力逐步生成LaTeX标记。
- 在训练过程中应用注意力丢弃,随机抑制或放弃注意力权重,迫使模型在注意力不精确时仍依赖稳健特征。
- 模型使用基于CNN的编码器和基于RNN的解码器,注意力机制通过计算解码器状态与编码器特征之间的对齐得分。
- 损失函数为真实LaTeX序列与预测序列之间的交叉熵,通过反向传播进行优化。
- 该方法在仅使用LaTeX级别标签的离线ME图像上进行端到端训练,避免依赖轨迹数据或私有训练集。
实验结果
研究问题
- RQ1尺度增强是否能通过缓解二维结构复杂性导致的符号尺寸不一致问题,提升HMER在ME上的性能?
- RQ2在注意力分布不准确或不稳定时,训练阶段引入注意力丢弃机制是否能增强模型鲁棒性?
- RQ3与最先进HMER模型相比,该方法在不使用模型集成的情况下,其准确率与泛化能力如何?
- RQ4结合尺度增强与注意力丢弃是否能仅使用官方训练数据,在CROHME 2014和2016等标准基准上实现最先进结果?
主要发现
- 在CROHME 2014测试集上,所提方法在不使用集成时达到56.59%的准确率,使用集成后达到60.45%,分别优于先前最先进方法PAL-v2的5.58%和7.71%。
- 在CROHME 2016测试集上,该方法在不使用集成时达到54.58%的准确率,使用集成后达到58.06%,分别优于先前最先进方法PAL-v2的4.97%和0.17%。
- 在CROHME 2016上,该模型显著优于第一名的Wiris系统,准确率54.58% vs. Wiris的49.61%,且未使用任何私有数据。
- 消融实验证实,尺度增强与注意力丢弃均独立贡献性能提升,其中尺度增强增强了对尺寸变化的鲁棒性,注意力丢弃提升了注意力可靠性。
- 该模型在不同书写风格和复杂二维结构上泛化良好,能正确识别下标、上标及嵌套表达式。
- 可视化结果表明,模型能聚焦于具有判别性的符号特征,并在注意力被括号等语法符号(如“{”)干扰时,仍能生成正确的LaTeX序列。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。