[论文解读] When Counting Meets HMER: Counting-Aware Network for Handwritten Mathematical Expression Recognition
本文提出计数感知网络(CAN),一种端到端框架,通过弱监督计数模块联合优化手写数学表达式识别(HMER)与符号计数。借助无需额外标注的LaTeX注释,CAN提升了注意力机制的准确性并减少了识别错误,在CROHME数据集上实现了最先进性能,且计算开销微乎其微。
Recently, most handwritten mathematical expression recognition (HMER) methods adopt the encoder-decoder networks, which directly predict the markup sequences from formula images with the attention mechanism. However, such methods may fail to accurately read formulas with complicated structure or generate long markup sequences, as the attention results are often inaccurate due to the large variance of writing styles or spatial layouts. To alleviate this problem, we propose an unconventional network for HMER named Counting-Aware Network (CAN), which jointly optimizes two tasks: HMER and symbol counting. Specifically, we design a weakly-supervised counting module that can predict the number of each symbol class without the symbol-level position annotations, and then plug it into a typical attention-based encoder-decoder model for HMER. Experiments on the benchmark datasets for HMER validate that both joint optimization and counting results are beneficial for correcting the prediction errors of encoder-decoder models, and CAN consistently outperforms the state-of-the-art methods. In particular, compared with an encoder-decoder model for HMER, the extra time cost caused by the proposed counting module is marginal. The source code is available at https://github.com/LBH1024/CAN.
研究动机与目标
- 为解决编码器-解码器模型在HMER任务中注意力机制的不稳定性,尤其是在复杂或长公式场景下的问题。
- 探索符号计数与HMER之间的互补关系,提出计数可改善注意力定位与识别准确性。
- 设计一种仅使用标准HMER标注(LaTeX序列)的弱监督计数模块,避免昂贵的符号级边界框标注。
- 构建一个统一的、可端到端训练的网络,联合优化HMER与计数任务,以提升模型鲁棒性与泛化能力。
提出的方法
- 提出一种弱监督计数模块(MSCM),仅使用LaTeX序列作为监督信号,预测各类符号的数量,无需位置标注。
- 将MSCM集成到基于注意力的编码器-解码器模型(如DWAP)中,形成计数感知网络(CAN),实现HMER与计数任务的联合优化。
- 利用预测的计数图作为空间感知信号,引导解码器注意力机制,提升对下标、上标等符号的定位能力。
- 采用上下文感知解码器(CCAD),结合HMER与计数信号,在序列解码过程中提升注意力准确性。
- 通过联合多任务损失端到端训练整个网络,HMER与计数目标分别采用平均绝对误差(MAE)与均方误差(MSE)进行监督。
- 在CROHME 2014、2016与2019基准上验证方法,与DWAP和ABM等强基线模型进行对比。
实验结果
研究问题
- RQ1符号计数能否提升编码器-解码器模型在HMER任务中的注意力准确性,尤其是在复杂排版或长序列场景下?
- RQ2仅使用LaTeX序列的弱监督计数与完全标注的计数相比,在HMER性能上表现如何?
- RQ3HMER与计数任务的联合优化在多大程度上同时提升了识别准确率与计数可靠性?
- RQ4HMER任务本身是否可通过共享表征学习提升计数模块的性能?
- RQ5所提出的计数模块是否引入显著推理开销,是否适用于实际部署?
主要发现
- 在CROHME 2014、2016与2019数据集上,CAN实现了最先进性能,当以ABM为基线时,精确匹配率分别达到57.26%、56.15%与55.96%。
- 当以DWAP为基线时,CAN在CROHME 2014、2016与2019上的精确匹配率分别为57.00%、56.06%与54.88%,优于原始模型。
- 使用真实计数向量作为监督时,CROHME 2014上的精确匹配率提升至62.44%,表明准确计数监督具有显著影响。
- 在联合优化HMER时,计数模块使MAE与MSE分别降低31.25%与15.91%,表明HMER性能提升也反向改善了计数准确性。
- 计数模块的额外推理时间开销微乎其微,证实其在实时应用中的实用性。
- 可视化结果表明,CAN能正确识别基线模型遗漏或误判的符号(如'dy'、'∑'、'i'),验证了注意力定位能力的显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。